Компанія Cohere представила модель Parse 5, призначену для перетворення PDF-файлів, слайдів і відсканованих документів у структурований Markdown. Нова модель позиціонується не як лідер за точністю, а як оптимальне рішення за співвідношенням ціни та продуктивності для корпоративних масштабів. Вартість обробки становить 1,50 долара за 1000 сторінок через API компанії.
Parse 5 — це vision-language модель з 2,3 мільярда параметрів, побудована на архітектурі North-Micro-Vision-Instruct від Cohere Labs. Вона має контекстне вікно на 8192 токени та займає приблизно 4,6 гігабайта пам'яті. Модель приймає сторінку PDF, PowerPoint або JPEG як зображення у форматі base64 і повертає Markdown у порядку читання, з таблицями у вигляді HTML, описом зображень та координатами обмежувальних рамок.
За даними власного бенчмарку Cohere, Parse 5 набирає 79,2 бала за трьома вимірами ParseBench: таблиці, точність змісту та семантичне форматування. Це нижче за показники GPT-5.5 (84,4), Opus 4.8 (84,3) та Gemini 3.5 Flash (81,8), але вище за спеціалізовані рішення, зокрема LlamaParse (78,3), Mistral OCR 4 (74,5) та Azure Document Intelligence (69,3). Компанія не претендує на першість у рейтингу, натомість наголошує на економічній ефективності.
Віце-президент Cohere з напрямку AI Search Нільс Раймерс пояснив, що складність парсингу документів полягає не в зчитуванні тексту, а у збереженні структури та значення. За його словами, корпоративні документи поєднують таблиці, діаграми та форматування, які змінюють інтерпретацію даних, а більшість інструментів втрачають структуру або генерують недостовірний контент. Parse 5 використовує однопрохідну архітектуру: сторінка обробляється як зображення через єдиний прохід моделі, що усуває потребу в окремому етапі OCR.
Модель стабільно працює з арабською, англійською, французькою, німецькою, італійською, японською, корейською, португальською та іспанською мовами. Для інших мов підтримка доступна в режимі zero-shot з нижчою точністю. За замовчуванням модель повертає Markdown-рядок для кожної сторінки, а в режимі blocks — типізовані елементи, де кожна таблиця має власний HTML, координати та опис, що забезпечує трасування до джерела для агентних систем.
Cohere наводить розрахунки для великої фінансової компанії, яка обробляє 750 мільйонів документів на рік. За оцінками компанії, використання Parse 5 замість GPT-5.5 дозволить скоротити витрати більш ніж на 98 відсотків. Ці цифри є власною оцінкою Cohere для змодельованого робочого процесу, а не результатом незалежного аудиту.
На ринку представлено чимало альтернатив: універсальні фронтирні моделі, спеціалізовані парсери на кшталт Mistral OCR 4 та LlamaParse, а також сервіси хмарних гіперскейлерів. Кевін Петрі з BARC US зазначив, що аналіз документів є найпоширенішим сценарієм використання штучного інтелекту, з рівнем впровадження 62 відсотки серед опитаних організацій. На його думку, документи та інші неструктуровані об'єкти містять унікальний контекст, необхідний для диференціації агентних ініціатив.
Parse 5 доступний через API Cohere, платформу Model Vault, Microsoft Foundry та AWS SageMaker. Компанія планує додати вилучення даних із діаграм у майбутніх версіях, натомість зараз модель надає загальний опис діаграми з індикатором для візуального перегляду агентним ШІ.