Признайтесь, было такое, что вам необходимо вытащить текст из сканированного отчёта на 50 страниц, разгадать рукописные записи коллеги или перенести таблицу из PDF в табличку Excel, а вместо этого вы тратите полвечера на перепечатывание вручную Египетских иероглифов от коллеги или сложных научных формул.

С развитием нейросетей про этот круг ада можно смело забыть! Современные модели научились полноценно понимать верстку страницы, распознавать таблицы, считывать формулы и аккуратно форматировать результат. Сегодня я протестирую не только нейросети, но и некоторые популярные бесплатные сервисы. Может быть они смогут доказать, что еще не везде стоит использовать ИИ. 

Чтобы не гадать, я решил провести честный тест моделей прямо внутри платформы BotHub – сервис, в котором собраны разные модели, где не нужно, искать иностранные карты или заводить десятки аккаунтов. Все данные защищены шифрованием, а переключаться между моделями можно в одном окне!

?При регистрации по этой ссылке BotHub дарит 300 000 CAPS ?, что за глаза хватит и для освобождения вашего свободного времени от переписывания формул,  и для расшифровки текста от коллеги. Забирайте бонус и протестируйте все сами!


Как буду тестировать?

Чтобы проверка была максимально честной и наглядной, дадим моделям два сложных задания:

  1. Тест №1: Сложный документ с таблицами и формулами (скриншот PDF страницы из исследования)

Источник - https://arxiv.org/abs/2511.13975
  1. Тест №2: Рукописный текст (снимок конспекта или документа на смартфон при среднем освещении). 

Писал я сам
Писал я сам

Здесь профессионально сымитирована кривая съемка, плохой почерк и ужасное освещение.

Основной целью будет оценить не только точность распознавания отдельных слов, а еще и насколько правильно модель или сервис сохраняет структуру документа (заголовки, таблицы, списки и форматирование и т.п.)


Универсальным промпт для BotHub будет:

“Проанализируй загруженное изображение документа. Извлеки весь текст, сохрани иерархию заголовков и переведи все таблицы в формат Markdown без потери данных.”

1. GPT-5.6 Sol (OpenAI)

Флагманская модель от OpenAI, специально созданная для сложных профессиональных задач, рассуждений, работы с кодом и тяжелыми документами. GPT-5.6 Sol поддерживает гигантский контекст до 1,05 млн токенов и обладает актуальной базой знаний. Модель отличается глубоким пониманием верстки, умеет наглядно восстанавливать структуру таблиц и переводить формулы в формат Markdown или LaTeX.

  • Главная фишка: Контекст 1,05 млн токенов, высочайшая точность анализа мультимодальных данных и схем.

Тестируем!

Результат? Оба изображения идеально распознаны, текст разделён по источникам, английский текст также не запутал модель. Здесь не допущено ни единой ошибки, это идеальная работа.

Ставлю ⭐⭐⭐⭐⭐.


2. Claude Opus 5 

Флагман от компании Anthropic, славящийся своей высокой точностью и честностью ответов, а также идеальной работой со сложными инструкциями.

  • Главная фишка: Идеальное следование длинным промптам и структурный анализ текста без отсебятины.

Тестируем!

А здесь какой результат? С первым текстом нареканий нету, а вот на втором есть небольшая проблема с формулой. Конечно, ее можно попросить написать и в другом виде, но это займет чуть больше времени, и все же задание было дано чуть другое. Также и цена значительно отличается, так что эту модель можно оценить не более чем на 3 балла. ⭐⭐⭐


3. DeepSeek V4 Pro

В задачах оцифровки фото модель мгновенно считывает текстовые блоки и корректно форматирует списки и таблицы, расходуя при этом минимальное количество капсов.

  • Главная фишка: Достаточно быстрая скорость генерации и экономный расход ресурсов.

Тестируем!

Самая дешевая модель на данный момент. С первым текстом, как обычно, все отлично. Однако на втором также присутствует проблема с формулой. Однако учитывая стоимость, эту модель можно оценить минимум на 4 балла (а то и плюсом). ⭐⭐⭐⭐


4. Gemini 3 Pro (Google)

Изначально обученный на обработку разных типов данных (текст, фото, видео, аудио) в едином пространстве. Модель обладает хорошим блоком компьютерного зрения, что позволяет нейросети уверенно распознавать текст даже на поврежденных сканах, смазанных фотографиях со смартфона или снимках с неровным освещением.

  • Главная фишка: Нативная мультимодальность и устойчивость к шумам/бликам на фото.

Тестируем!

И здесь результат тоже удовлетворительный. Все тоже самое, что у Claude и Deepseek, но цена тоже кусается. Чуть менее уверенные 4 балла ⭐⭐⭐⭐


5. Grok 4.6 (xAI)

Известная своим прямым и быстрым стилем работы. В версии Grok 4.6 разработчики существенно улучшили считывание визуальных деталей, схем и чертежей. Модель мгновенно выделяет ключевые данные из таблиц и счетов, превращая их в структурированный текст.

  • Главная фишка: Быстрое извлечение фактов, ключевых пар “ключ-значение” и сведений из документов.

Тестируем!

Таблица есть, текст распознан, уверенные 4 балла ⭐⭐⭐⭐


По итогу все нейросети справились со своей задачей. Да, с небольшими огрехами, но весь текст они с легкостью (а самое главное относительно дешево) смогли распознать. 

Давайте проверим несколько веб-сервисов, чтобы понять, а имеет ли смысл вообще платить за такую работу?


Веб-сервис OCR.space – один из самых популярных онлайн-инструментов в интернете. Работает прямо в браузере, вы просто загружаете фото или PDF-файл, выбираете язык оригинала и получаете распознанный текст.

Предоставляет до 25 000 бесплатных распознаваний в месяц, поддерживает более 30 языков (включая русский) и умеет отдавать результат как обычным текстом, так и в формате JSON.

Тестируем!

Да, а вот тут начинаются проблемы. Форматирование полетело, рукописный текст не был распознан, а также работать можно только с одним файлом за раз. Ну тут никак нельзя поставить более двух баллов, и то, это за быстроту ответа (распознавание в лучшем режиме заняло не более 5 секунд). ⭐⭐


Классический веб-конвертер OnlineOCR.net, которым пользуются миллионы людей по всему миру для быстрой оцифровки сканов. Сервис позволяет бесплатно за пару кликов перевести фото или PDF-документ в любой популярный редактируемый формат.

Тестируем!

Эээ ну.. даже комментировать ничего не хочется. Кое-как справился с текстом статьи, однако на рукописный текст стало страшно смотреть. Это претендент на последнее место, заслуженный один балл. ⭐


Convertio – популярный онлайн-сервис, который чаще всего используют для конвертации файлов, но у него есть и встроенный OCR-инструмент. С его помощью можно быстро распознать текст с фото или PDF и получить редактируемый документ. 

Тестируем!

Загрузка файла
Загрузка файла
Результат
Результат

Как вы уже наверное поняли, информацию на сайте нельзя посмотреть сразу, нужно именно скачивать файл (формат кстати можно выбрать, уже небольшой плюс). А что с результатами? На самом деле тоже плачевно… С английским текстом он более-менее справился, но все же ошибки в формулах портят картину, поэтому придется перепечатывать их вручную. А вот что он мне с русским текстом сделал… просто выдал ту же картинку. Уверенные два балла. ⭐⭐

Сервис выдал мою же картинку...
Сервис выдал мою же картинку...

Общий рейтинг

GPT-5.6 Sol

⭐⭐⭐⭐⭐

DeepSeek V4 Pro

⭐⭐⭐⭐

Grok 4.6 (xAI)

⭐⭐⭐⭐

Gemini 3 Pro

⭐⭐⭐⭐

Claude Opus 5

⭐⭐⭐

Convertio

⭐⭐

OCR.space

⭐⭐

OnlineOCR.net


Что по итогу? Сегодня каждая современная модель легко справиться с распознаванием текста, пользователю остается только сравнивать цену на за работу.  Отличился только GPT-5.6 Sol, у которого была уже готовая к вставке формула. И он же является заслуженным победителем сегодняшнего рейтинга. Соотношение цена/качество у данной модели лидирует. Второе место я бы отдал  DeepSeek V4 Pro, который за меньшую стоимость также неплохо справился с задачей. Ну и сильно разочаровал Claude Opus 5, который съел в несколько раз больше токенов, чем все остальные модели, при этом результат был на уровне всех остальных (ну все же у него чуть другие задачи, понять можно).

Бесплатные сервисы к сожалению сегодня полноценно не справились с задачей, их эпоха уже уходит. Может лет 5-10 назад они и пользовались спросом, но теперь даже самая дешевая модель намного лучше оцифрует каракули вашего коллеги.

Наш блог

В нашем блоге есть много других интересных статей:

Комментарии (0)