← Выпуск за 1 сентября 2026 ·ИИ в общепите
Gradium представила новую TTS-модель с точностью 81% и ускоренным ответом
Пересказ материала «Gradium AI Releases New Default TTS Model: 81.0% Hard-Case Pass Rate at 216 ms Time-to-First-Audio» — MarkTechPost, 01.09 03:39
Что это значитБолее точный и быстрый синтез речи улучшит работу голосовых ассистентов и обслуживание гостей.
Компания Gradium AI объявила о запуске новой модели для преобразования текста в речь (TTS), которая теперь установлена по умолчанию во всех её сервисах, включая API и Gradium Studio. Главной особенностью новой версии стала высокая надёжность в сложных сценариях — так называемых «hard cases», которые особенно критичны в работе голосовых агентов: например, чёткое воспроизведение номеров заказов, телефонов или email-адресов, где недопустима ошибка. По внутренним тестам компании, новая модель достигает «проходимости» в 81% на наборе из 500 сложных фраз на пяти языках, что выше Cartesia Sonic 3.6 (75,1%) и ElevenLabs v3 Conversational (65,4%).
Методика тестирования строится на специально собранном и выложенном в открытый доступ корпусе: это 100 примеров по 10 категориям, каждая из которых фокусируется на реальных задачах клиентских сервисов — правильное произношение алфавитно-цифровых кодов, дат, адресов электронной почты и комплексных конструкций вроде тикетов или заказов. Все тесты проходили с человеческой оценкой, причём подход был максимально строгим: если хоть одна деталь в фразе озвучена с ошибкой, задание считается проваленным.
По скорости отклика модель тоже показывает заметный прогресс: медианное «время до первого звука» на бенчмарке Coval TTS составляет 216 миллисекунд, что на 170 мс быстрее предыдущей версии Gradium. При этом разброс между разными записями минимален — различия между 25-м и 75-м процентилем всего 30 мс на почти 500 тестов. Для сравнения, у Cartesia Sonic 3.6 медиана — 454 мс, а разброс (interquartile range) достигает 165 мс, что значительно больше.
В смене модели для пользователей Gradium никаких дополнительных действий не требуется: обновление включено автоматически, все ранее созданные голоса и кастомные клоны работают как и раньше. Для новых команд предлагается SDK на Python, подключение к тому же API и сохранение прежних ID голосов — инфраструктурных изменений не нужно.
Для сферы HoReCa практический смысл такой: новая TTS-модель способна повысить точность голосовых помощников и автоответов для заказов, бронирования, повторения контактных данных гостей — а это критично для автоматизации в ресторанах, отелях, службах доставки. Быстрая генерация без длинных ожиданий снижает фрустрацию клиентов, а низкая вероятность ошибок — риск проблем из-за неправильно услышанных деталей. Однако даже самая надёжная ИИ-озвучка достигает только 81% прохождения в строгих условиях, и если необходима стопроцентная точность на ключевых блоках диалога, понадобится дополнительная валидация. Кроме того, пока что компания анонсировала интеграцию только через свой API и SDK, — если используются сторонние платформы, совместимость и опыт интеграции стоит проверить заранее.
Читать оригинал в источнике «MarkTechPost» →
Это пересказ: изложение сделано автоматически по материалу издания «MarkTechPost» и может содержать неточности. Оригинальный текст принадлежит изданию — важные детали сверяйте с первоисточником. Если вы правообладатель и хотите, чтобы пересказ был снят, напишите на hello@maitreai.ru — уберём.