← Выпуск за 28 августа 2026 ·ИИ в бизнесе
Cohere выпустила Parse 5 — модель для перевода корпоративных документов в Markdown
Пересказ материала «Cohere Releases Parse 5 (parse-v5.0): A 2.3B Vision Language Model That Turns Enterprise Documents Into Markdown» — MarkTechPost, 27.08 20:05
Что это значитРынку общепита Parse даёт дешевую автоматизацию работы с отсканированными меню, закупочными актами и отчётами.
Cohere представила Parse 5 — специализированную модель для распознавания корпоративных документов, в первую очередь рассчитанную на большие объёмы и интеграцию с ИИ-системами крупных компаний. Это мультиязычная vision-language модель с 2,3 миллиарда параметров и возможностью обрабатывать контекст объёмом до 8192 токенов за раз, размер модели — примерно 4,6 ГБ. Parse может работать напрямую с файлами в форматах PDF, PPT и JPEG (их надо подавать закодированными в base64), а на выходе возвращает содержимое в формате Markdown — с сохранением порядка чтения текста, переработкой таблиц в HTML, разметкой списков, форм, изображений с описаниями и координатами их расположения на странице. Для отрасли важно, что отдельного этапа OCR больше не требуется: модель сама «видит» и текст, и визуальные элементы в одном проходе.
Этот продукт уже доступен для коммерческого использования: Parse можно подключить через Cohere Parse API, Microsoft Foundry, AWS SageMaker и Model Vault, при этом нет ни ограничений по лицензии, ни какой-либо очереди ожидания. Заявленная цена — $1,50 за 1000 страниц при оплате по API, для постоянной аренды сервера действуют тарифы: $4,00/час или $2 500/месяц за Medium-инстанс и $7,00/час или $4 300/месяц за XL. Чем больше страниц в месяц, тем выгоднее выделенный сервер: окупаемость по цене начинается примерно с 1,67 млн страниц на Medium и 2,87 млн на XL.
Parse поддерживает 9 стабильных языков (включая английский, французский, немецкий, японский, корейский, испанский и другие), остальные — с частичной поддержкой и меньшей точностью. Система умеет возвращать результаты в двух режимах: обычной Markdown-строкой или в виде набора специализированных блоков со структурированной разметкой (например, таблица приходит сразу с HTML, координатами и описанием), что позволяет реализовать строгую трассируемость вывода — например, для задач поиска по архиву контрактов или сложных форм.
Cohere подчёркивает преимущество Parse именно по цене и производительности, а не по абсолютной точности. На внутреннем тесте ParseBench, который берёт в расчёт три из пяти параметров (корректность работы с таблицами, полнота содержания и семантическая разметка), Parse набрала 79,2 балла — выше Mistral OCR 4, Azure Document Intelligence и Databricks AI Parse на том же трёхметричном срезе. При этом Parse не представлен на публичной доске лидеров этого бенчмарка — и результаты компании не учитывают две сложнейшие для всех моделей категории: диаграммы и визуальную привязку элементов.
Для заведений общепита, гостиниц, туристических компаний и операторов, регулярно оцифровывающих документы (меню, афиши, договоры, лицевые счета, квитанции, заявки), Parse 5 может серьёзно упростить массовую обработку исторических и текущих данных: экономия времени на разметку и унификацию форм, прозрачный формат, удобный для собственных ИИ-ассистентов и поиска. Однако ключевым ограничением может быть точность вне основных языков и видов разметки; взрослым бизнесам с критическими требованиями к визуальным чертежам и диаграммам стоит протестировать модель на своих типовых задачах перед внедрением. Также отсутствие общедоступных независимых результатов по полному бенчмарку от LlamaIndex означает, что реальная точность Parse для сложных и визуально насыщенных документов остаётся открытым вопросом.
Читать оригинал в источнике «MarkTechPost» →
Это пересказ: изложение сделано автоматически по материалу издания «MarkTechPost» и может содержать неточности. Оригинальный текст принадлежит изданию — важные детали сверяйте с первоисточником. Если вы правообладатель и хотите, чтобы пересказ был снят, напишите на hello@maitreai.ru — уберём.