HD HoReCa Digest AI ИИ в общепите, в бизнесе и вокруг отрасли — по вторникам и пятницам

Digest by kirillsitnikov.ru

← Выпуск за 28 августа 2026 ·ИИ в бизнесе

Google запустила Gemini 3.5 Transcribe: модель преобразования речи в текст для 85 языков

Пересказ материала «Google AI Releases Gemini 3.5 Transcribe: A Speech-to-Text Model Reporting 2.6% Average WER Across 85+ Languages» — MarkTechPost, 28.08 05:00

68 MarkTechPost · распознавание речиассистентымногоязычие

Что это значитГолосовые ИИ-ассистенты и переводчики становятся точнее и удобнее для ресторанов и отелей.

Google представила новую модель преобразования речи в текст Gemini 3.5 Transcribe, ориентированную на работу с 85 языками. Разработчики заявляют среднюю точность перевода в 2,6% ошибок (word error rate, WER) для заранее записанных аудиофайлов и 4,0% для потоковой расшифровки — это измерено независимым сервисом Artificial Analysis. Для сравнения с предыдущим поколением (Chirp 3), время до получения финального текста улучшилось на 70%, что заметно ускоряет рабочие процессы. Модель автоматически определяет язык и корректно обрабатывает ситуации, когда говорящий переключается между несколькими языками в одном предложении.

Gemini 3.5 Transcribe работает через два разных интерфейса API: один для расшифровки готовых аудиофайлов (gemini-3.5-transcribe), второй — для потоковой трансляции и мгновенной расшифровки (gemini-3.5-transcribe-live). Возможности и ограничения двух версий различаются: в режиме потоковой обработки (Live API) модель обеспечивает почти мгновенную транскрипцию с задержкой менее секунды, но длительность одной сессии ограничена 10 минутами, а дополнительные функции вроде определения отдельных говорящих и отметок времени для каждого слова не поддерживаются. Для этих целей используется основной API, там можно работать с файлами до часа продолжительностью (или до 30 минут, если включены расширенные функции), поддерживается до 1000 пользовательских терминов для улучшения распознавания (лучший результат — с короткими списками).

Для обеих моделей доступны два режима работы: verbatim («дословный») возвращает весь текст с оговорками и повторениями, smart избавляет результат от слов-паразитов и ошибочных самопоправок, придаёт оформленность записи. Например, из фразы «Эм, ну… для встречи, думаю, стоит, э… позвать Алису и… стоп, нет, Боба и Каролину» режим smart сразу выдаст: «Для встречи, думаю, стоит позвать Боба и Каролину». Однако smart нельзя одновременно сочетать с разбивкой по говорящим и отметками времени для слов — необходимости выбирать между читаемостью и возможностью точного аудита записей остаются.

Запуск Gemini 3.5 Transcribe связан с растущей потребностью автоматизировать обработку речи на многих языках для разных сценариев: звонки в реальном времени, видео- и аудиозаписи, мультиязычные команды и диалоги даже с переключениями языков на лету. По масштабности и гибкости это прямой конкурент решений от Microsoft, OpenAI и стартапов, однако Google заявляет более широкую языковую палитру и улучшенные показатели скорости и точности. Уже сейчас API интегрирован в крупные коммуникационные платформы и приложения вроде LiveKit, Vercel, Rambler, Gemini для macOS, а скоро появится поддержка и в Google Chrome.

Для заведений индустрии гостеприимства, общепита и туризма привлекательность Gemini 3.5 Transcribe в первую очередь в автоматизации звонков, интерактивных голосовых меню, быстрой расшифровке многозадачных переговоров и обслуживании не только на английском, но и на других востребованных языках. Особенно заметен выигрыш там, где транскрипция ведётся в реальном времени с частым переключением языков или с необходимостью быстро выдавать итоги переговоров в структуре, пригодной для отчетов и контроля качества. Основной риск — сервис сейчас доступен только через облачный API Google, без возможности размещения у себя или открытого кода; ограничения по продолжительности сессий и несовместимость некоторых функций требуют точного проектирования бизнес-логики. Пока не поддерживаются функция разделения по голосам в живом режиме и привязка панелей или приложения к своим особенностям в инфраструктуре — эти моменты важно учитывать при планировании интеграции.

Читать оригинал в источнике «MarkTechPost» →

Это пересказ: изложение сделано автоматически по материалу издания «MarkTechPost» и может содержать неточности. Оригинальный текст принадлежит изданию — важные детали сверяйте с первоисточником. Если вы правообладатель и хотите, чтобы пересказ был снят, напишите на hello@maitreai.ru — уберём.