Canonical сообщила, что новая модель NVIDIA Nemotron 3.5 Lightning AI, гибридная Mixture-of-Experts с 30 миллиардами параметров, теперь доступна на Ubuntu. Пользователи могут легко установить её с помощью готового Snap-пакета для инференса, выполнив всего одну команду.

Для тех, кто не отслеживает каждую новинку: Nemotron 3.5 Lightning представляет собой компактную и открытую модель NVIDIA, ориентированную на повторяющиеся задачи, с которыми сталкиваются автономные ИИ-агенты.

Вместо того чтобы использовать громоздкие модели для каждой мелкой задачи, она управляет вызовами инструментов, проверкой результатов, форматированием вывода и другими частыми операциями, где важнее скорость и эффективность, а не глубокая логика.

Canonical значительно упростила развёртывание модели на Ubuntu. Вместо самостоятельной настройки и конфигурирования ПО для инференса достаточно установить предварительно упакованную среду выполнения от Canonical с помощью команды sudo snap install nemotron-3-5-lightning.

По словам Canonical, inference-снапы, предварительно собранные среды выполнения ИИ, распространяются через экосистему Snap и предоставляют пользователям единообразное окружение на поддерживаемых системах. Пакет Nemotron доступен с самого запуска и работает на совместимых рабочих станциях, серверах и периферийных устройствах с NVIDIA.

Модель поддерживает контекстное окно размером до одного миллиона токенов, что помогает долго работающим ИИ-агентам сохранять информацию в ходе сложных многоэтапных задач. Canonical также отмечает, что Snap-пакет предлагает стандартизированную среду выполнения, безопасное исполнение, проверенную дистрибуцию, автоматические обновления и снижение затрат на обслуживание.

Nemotron 3.5 Lightning полностью настраиваема. NVIDIA предоставляет разработчикам веса модели, обучающие данные и рецепты, что позволяет дообучать её под конкретные задачи, а не только использовать как удалённый сервис. По заявлению NVIDIA, модель способна работать локально, в облаке или в дата-центрах.

Кроме того, для определённых задач модель может быть до четырёх раз быстрее аналогов: она создавалась для постоянно активных агентов, поэтому простые операции не нужно пропускать через гораздо более крупную модель, что замедляло бы работу и потребляло больше ресурсов.

Дополнительные подробности можно найти в официальном анонсе Canonical.