Как Parse 5 от Cohere конвертирует сложные PDF в Markdown

Как Parse 5 конвертирует сложные PDF в Markdown

Екатерина Иванова
Екатерина Иванова Стажер технический редактор
4 сентября 2026

Cohere представила мультимодальную модель Parse 5 (2,4 млрд параметров) для преобразования сложных PDF-документов в Markdown с поддержкой Bounding Boxes. Разбираем архитектуру модели, интеграцию через API и результаты в ParseBench.

Изображение записи

Компания Cohere выпустила коммерческую мультимодальную модель Parse 5 (parse-v5.0), которая помогает разработчикам извлекать структурированные данные из сложных корпоративных документов. Модель содержит 2,4 млрд параметров и конвертирует PDF-документы, включая финансовые отчеты и научные статьи, в Markdown. Одновременно Parse 5 определяет координаты ограничивающих рамок (bounding boxes) для каждого элемента, чтобы распознанный текст можно было сопоставить с исходным файлом.

Архитектура модели

Разработчики оптимизировали Parse 5 для работы под высокой нагрузкой. Модель поддерживает контекстное окно в 8K токенов и обрабатывает текст и изображения одновременно. В основе решения лежит открытая архитектура North-Micro-Vision-Instruct от Cohere Labs.

Конвейер обработки состоит из нескольких компонентов:

  • Визуальный кодер (Vision Encoder) на 400 млн параметров, созданный на базе SigLIP 2 SO400M. Чтобы сохранить структуру документа, кодер использует двумерные поворотные (RoPE) и обученные одномерные позиционные эмбеддинги.
  • Проектор (Projector) — модуль, который переносит извлеченные визуальные признаки напрямую в пространство эмбеддингов языковой модели.
  • North Micro LLM — основная языковая модель на 2 млрд параметров на базе архитектуры Cohere Command A+.
  • Метод интеграции DeepStack — решение заключается во внедрении патч-эмбеддингов (эмбеддингов фрагментов изображения) из визуального кодера в начальные слои языковой модели. Это дает LLM доступ к визуальным представлениям на разных уровнях абстракции..

Благодаря прямому выводу в Markdown разработчики предполагают устранить необходимость в использовании OCR-систем на основе правил.

Тесты на бенчмарке ParseBench

Чтобы оценить точность распознавания, Cohere протестировала Parse 5 на бенчмарке ParseBench. В этот набор входят более 2 000 страниц реальных документов из финансовой, страховой и государственной сфер, проверенных людьми вручную. Тесты оценивают извлечение таблиц, точность передачи контекста и семантическое форматирование.

В бенчмарке Parse 5 показала вполне конкурентный результат в 79.2 балла. Лидером рейтинга стала GPT-5.5 с результатом 84.4 балла, LlamaParse набрала 78.3, а Mistral OCR — 75.05 балла.

График сравнения моделей по качеству ParseBench и стоимости обработки.
Источник.

Интеграция

Координаты ограничивающих рамок помогают приложениям сопоставлять данные с оригинальным документом. Это критично для регулируемых отраслей, требующих строгого аудита и проверки информации.

Python:


      import cohere

# Инициализируем клиент Cohere V2
co = cohere.ClientV2("YOUR_COHERE_API_KEY")

# Открываем сложный корпоративный PDF-файл
with open("quarterly_earnings_report.pdf", "rb") as file:
    document_content = file.read()

# Вызываем Parse API для извлечения Markdown
response = co.models.parse(
    model="parse-v5.0",
    document=document_content,
    output_format="markdown"
)

# Выводим структурированный результат
print("Extracted Markdown:\n", response.text)
# Ограничивающие рамки для визуальной привязки элементов
print("Layout Elements:\n", response.bounding_boxes)

cURL:


      curl --request POST \
  --url https://api.cohere.com/v2/parse \
  --header 'Authorization: Bearer YOUR_COHERE_API_KEY' \
  --header 'Content-Type: multipart/form-data' \
  --form 'model=parse-v5.0' \
  --form 'document=@quarterly_earnings_report.pdf' \
  --form 'output_format=markdown'

Где протестировать и что говорит сообщество

Инструмент доступен на платформе Cohere, в Microsoft Azure AI Foundry и Amazon SageMaker на AWS. Оценить модель без интеграции в код можно в панели управления Cohere, на Hugging Face Space или локально, запустив открытую базовую модель North-Micro-Vision-Instruct.

На Reddit разработчики активно обсуждают технические характеристики и реализацию Parse 5. В сообществе r/Rag отмечают высокое качество распознавания таблиц, верный порядок чтения и низкую цену. Из минусов называют отсутствие встроенной поддержки PDF в текущей версии: перед отправкой в API приходится рендерить каждую страницу отдельно. Также пользователи ждут интеграции с OpenRouter. В r/LocalLLaMA тепло встретили модель North-Micro-Vision-Instruct с открытыми весами, отметив, что версия на 2,4 млрд параметров подходит для прототипирования и дообучения под конкретные задачи. В сообществе r/AIDeveloperNews модель хвалят за качественный перевод сложных файлов со встроенными таблицами и графикой в чистый Markdown.

С выходом Parse 5 компания Cohere выходит за пределы обработки исключительно текста, переходя на мультимодальные IT-решения. Уделяя приоритетное внимание надежному форматированию материала при минимальной задержке, компания ориентируется на разработчиков, работающих с неструктурированными данными из реального мира.