
По данным MarkTechPost, Jina AI выпустила jina-ocr-v1 — визуальный парсер документов, который преобразует PDF-файлы, сканы, таблицы, графики и счета в Markdown. Модель использует архитектуру MoE с 3,4 млрд параметров, из которых около 570 млн активны на каждом токене.
Встроенный механизм FastMTP формирует по три черновых токена за шаг, сохраняя заявленную без потерь выдачу. В синопсисе также указаны результаты 91,14 балла в OmniDocBench v1.6 и 83,4 в olmOCR-Bench, а также скорость 2,57 страницы в секунду на одном A100.
Весы модели размещены на Hugging Face по лицензии CC BY-NC 4.0; доступ к размещённой версии предоставляется через Jina Reader. Значимость релиза связана с попыткой совместить обработку сложных документов и более экономное использование вычислений, но независимое подтверждение показателей в предоставленных материалах отсутствует.
комментарий редакции
Что это значит
Вероятное практическое последствие — интерес к jina-ocr-v1 со стороны команд, которым нужен разбор документов без максимально крупной модели. Следующим наблюдаемым сигналом станет появление первичной документации или независимых тестов, подтверждающих заявленные бенчмарки и скорость. Существенная неопределённость связана с тем, что сейчас доступен только один метаданный синопсис без первичного источника.