Компания Cohere выпустила коммерческую мультимодальную модель Parse 5 (parse-v5.0), которая помогает разработчикам извлекать структурированные данные из сложных корпоративных документов. Модель содержит 2,4 млрд параметров и конвертирует PDF-документы, включая финансовые отчеты и научные статьи, в Markdown. Одновременно Parse 5 определяет координаты ограничивающих рамок (bounding boxes) для каждого элемента, чтобы распознанный текст можно было сопоставить с исходным файлом.
Архитектура модели
Разработчики оптимизировали Parse 5 для работы под высокой нагрузкой. Модель поддерживает контекстное окно в 8K токенов и обрабатывает текст и изображения одновременно. В основе решения лежит открытая архитектура North-Micro-Vision-Instruct от Cohere Labs.
Конвейер обработки состоит из нескольких компонентов:
- Визуальный кодер (Vision Encoder) на 400 млн параметров, созданный на базе SigLIP 2 SO400M. Чтобы сохранить структуру документа, кодер использует двумерные поворотные (RoPE) и обученные одномерные позиционные эмбеддинги.
- Проектор (Projector) — модуль, который переносит извлеченные визуальные признаки напрямую в пространство эмбеддингов языковой модели.
- North Micro LLM — основная языковая модель на 2 млрд параметров на базе архитектуры Cohere Command A+.
- Метод интеграции DeepStack — решение заключается во внедрении патч-эмбеддингов (эмбеддингов фрагментов изображения) из визуального кодера в начальные слои языковой модели. Это дает LLM доступ к визуальным представлениям на разных уровнях абстракции..
Благодаря прямому выводу в Markdown разработчики предполагают устранить необходимость в использовании OCR-систем на основе правил.
Тесты на бенчмарке ParseBench
Чтобы оценить точность распознавания, Cohere протестировала Parse 5 на бенчмарке ParseBench. В этот набор входят более 2 000 страниц реальных документов из финансовой, страховой и государственной сфер, проверенных людьми вручную. Тесты оценивают извлечение таблиц, точность передачи контекста и семантическое форматирование.
В бенчмарке Parse 5 показала вполне конкурентный результат в 79.2 балла. Лидером рейтинга стала GPT-5.5 с результатом 84.4 балла, LlamaParse набрала 78.3, а Mistral OCR — 75.05 балла.

Интеграция
Координаты ограничивающих рамок помогают приложениям сопоставлять данные с оригинальным документом. Это критично для регулируемых отраслей, требующих строгого аудита и проверки информации.
Python:
import cohere
# Инициализируем клиент Cohere V2
co = cohere.ClientV2("YOUR_COHERE_API_KEY")
# Открываем сложный корпоративный PDF-файл
with open("quarterly_earnings_report.pdf", "rb") as file:
document_content = file.read()
# Вызываем Parse API для извлечения Markdown
response = co.models.parse(
model="parse-v5.0",
document=document_content,
output_format="markdown"
)
# Выводим структурированный результат
print("Extracted Markdown:\n", response.text)
# Ограничивающие рамки для визуальной привязки элементов
print("Layout Elements:\n", response.bounding_boxes)
cURL:
curl --request POST \
--url https://api.cohere.com/v2/parse \
--header 'Authorization: Bearer YOUR_COHERE_API_KEY' \
--header 'Content-Type: multipart/form-data' \
--form 'model=parse-v5.0' \
--form 'document=@quarterly_earnings_report.pdf' \
--form 'output_format=markdown'
Где протестировать и что говорит сообщество
Инструмент доступен на платформе Cohere, в Microsoft Azure AI Foundry и Amazon SageMaker на AWS. Оценить модель без интеграции в код можно в панели управления Cohere, на Hugging Face Space или локально, запустив открытую базовую модель North-Micro-Vision-Instruct.
На Reddit разработчики активно обсуждают технические характеристики и реализацию Parse 5. В сообществе r/Rag отмечают высокое качество распознавания таблиц, верный порядок чтения и низкую цену. Из минусов называют отсутствие встроенной поддержки PDF в текущей версии: перед отправкой в API приходится рендерить каждую страницу отдельно. Также пользователи ждут интеграции с OpenRouter. В r/LocalLLaMA тепло встретили модель North-Micro-Vision-Instruct с открытыми весами, отметив, что версия на 2,4 млрд параметров подходит для прототипирования и дообучения под конкретные задачи. В сообществе r/AIDeveloperNews модель хвалят за качественный перевод сложных файлов со встроенными таблицами и графикой в чистый Markdown.
С выходом Parse 5 компания Cohere выходит за пределы обработки исключительно текста, переходя на мультимодальные IT-решения. Уделяя приоритетное внимание надежному форматированию материала при минимальной задержке, компания ориентируется на разработчиков, работающих с неструктурированными данными из реального мира.