HD HoReCa Digest AI ИИ в общепите, в бизнесе и вокруг отрасли — по вторникам и пятницам

Digest by kirillsitnikov.ru

← Выпуск за 12 августа 2026 ·ИИ в общепите

NVIDIA выпустила лёгкую модель Nemotron 3.5 Lightning для ИИ-агентов

Пересказ материала «NVIDIA AI Releases Nemotron 3.5 Lightning: A 30B Open MoE with 3B Active Parameters, and NeMo Switchyard Model Router» — MarkTechPost, 12.08 06:59

68 MarkTechPost · ИИ-модельагентNVIDIA

Что это значитЛёгкие специализированные модели снижают затраты на ИИ-агентов для общепита: голосовые ассистенты для заказов, анализ отзывов и управление операциями становятся доступнее.

NVIDIA выпустила две взаимосвязанные технологии для построения ИИ-агентов на основе сетей специализированных моделей. Nemotron 3.5 Lightning — это лёгкая модель с 30 миллиардами параметров, из которых активны только 3 миллиарда (смесь экспертов на архитектуре Mamba-2 + MoE + Attention), а NeMo Switchyard — библиотека для маршрутизации запросов между моделями. Вместе они решают одну практическую проблему: длительно работающие агенты большую часть времени тратят на вспомогательные операции — обращение к инструментам, проверку результатов, делегирование подзадачам — и отправлять каждый такой шаг к мощной рассуждающей модели обходится дорого и медленно.

Lightning предлагает сразу несколько преимуществ в скорости и стоимости. Контекстное окно достигает миллиона токенов, модель обучена на более чем 20 триллионах токенов и показывает на бенчмарке PinchBench 86% точности, при этом выполняя 10 000 задач на 30% быстрее, чем Qwen 3.6 35B с сравнимой точностью. NVIDIA заявляет об общем ускорении вывода в четыре раза относительно моделей сопоставимого размера. Модель открыта под лицензией OpenMDW-1.1 с доступными весами, данными обучения и рецептами — готова к коммерческому использованию.

NeMo Switchyard работает как интеллектуальный диспетчер, автоматически выбирая, какую модель использовать для каждого шага. Библиотека предлагает несколько стратегий маршрутизации: классификатор на основе ИИ с учётом истории сессии, роутер на основе недавней активности инструментов, и «эскалационный» маршрутизатор, который начинает с дешёвой модели и переходит на более мощную при возникновении сложностей. Есть и продвинутый вариант — роутер, учащийся из внутреннего состояния модели и предсказывающий, какой из кандидатов справится с задачей.

На практике эффективность проиллюстрирована двумя кейсами. LangChain протестировал маршрутизацию между Lightning и Claude 3.5 Opus на 145 многошаговых задачах: эскалационный маршрутизатор сократил стоимость на 74% по сравнению с базовым вариантом (использование одной мощной модели), отправляя лишь 7% запросов на Opus, с небольшой потерей точности в 6 пунктов. Cognition встроил аналогичный подход в Devin Desktop, достигнув на бенчмарке FrontierCode 50.6% точности при среднейстоимости $3.11 — это примерно на 28% дешевле, чем использование одного Opus 5 при незначительной разнице в результатах.

Для тестирования модель доступна через build.nvidia.com и OpenRouter, веса можно скачать с Hugging Face или ModelScope. Решение актуально для операторов call-центров, автоматизации внутренних процессов и сложных multi-step сценариев в туризме, финансах и логистике — везде, где агент должен работать долго, но не все операции требуют сложного анализа. Однако в материале не раскрыт один важный вопрос: как Switchyard справляется с ситуациями, когда неправильная маршрутизация может привести к критической ошибке, и есть ли встроенные механизмы обратного хода или валидации при переходе от лёгкой модели к тяжёлой.

Читать оригинал в источнике «MarkTechPost» →

Это пересказ: изложение сделано автоматически по материалу издания «MarkTechPost» и может содержать неточности. Оригинальный текст принадлежит изданию — важные детали сверяйте с первоисточником. Если вы правообладатель и хотите, чтобы пересказ был снят, напишите на hello@maitreai.ru — уберём.