Atlorium
Распознавание текста (OCR) · Atlorium

Распознавание текста с изображения по API

Отправьте скан или фотографию страницы — получите распознанный текст одним HTTP-запросом. Сервис читает не только строки, но и таблицы с формулами, сохраняет структуру страницы и понимает русский язык. За неуспешное распознавание плата не взимается.

Документ → текст
Таблицы и формулы
REST API

Бесплатный лимит и честная цена

Бесплатный лимит на распознавание — чтобы проверить качество на своих документах до интеграции. Дальше — оплата по факту (pay-as-you-go) по прозрачной цене, без подписок. Платится только успешное распознавание: если текст распознать не удалось — списания нет.

Плата только за результат

Преимущества сервиса

Оцифровка документов без своей инфраструктуры и своих мощностей

Документ → текст

Сканы и фотографии страниц превращаются в готовый текст.

Таблицы и формулы

Табличные данные и математика распознаются вместе с текстом.

Русский язык

Русский поддерживается наравне с английским и ещё шестью языками.

REST API

Простой HTTP POST с JSON — встраивается в любой стек.

Что умеет распознавание

Не просто «буквы с картинки», а разбор страницы целиком

Текст страницы

Печатный текст со сканов, фотографий и экранных снимков — абзацы, заголовки, списки, колонтитулы.

Таблицы

Табличные данные восстанавливаются со строками и столбцами, а не как «каша» из чисел в одну строку.

Формулы

Математические выражения распознаются как формулы — удобно для учебных материалов, статей и научной документации.

Режим под задачу

Явно укажите, что на изображении — страница, таблица, формула или короткая строка (в т.ч. только цифры) — и получите результат в подходящем формате, без лишней разметки.

Markdown, LaTeX или строка

Результат отдаётся в формате, который соответствует режиму: Markdown для страницы и таблицы, LaTeX для формулы, простая строка для короткого кода.

Страница до 10 МБ

На вход — растровое изображение (PNG, JPEG и др.) до 10 МБ: скан A4 в 300 dpi проходит с запасом. PDF рендерите в страницы у себя и отправляйте постранично.

Языки: китайский, английский, французский, испанский, русский, немецкий, японский, корейский.

Как это работает

Два способа получить текст из документа

Графический интерфейс

Загрузите изображение — получите распознанный текст в одном окне. Удобно проверить качество на своих документах перед интеграцией.

  • Загрузка изображения и предпросмотр
  • Опция «только цифры»
  • Распознанный текст и время ответа
Открыть GUI

REST API

Встройте распознавание в свои скрипты и приложения через простой HTTP POST с изображением в Base64.

  • POST /api/ocr/image-to-text
  • image — изображение в Base64 (или data-URL)
  • mode — режим распознавания (по умолчанию определяется автоматически)
Открыть документацию

Что сервис не делает

Честнее сказать заранее, чем разочаровать после интеграции.

  • рукописный текст мы не заявляем — рассчитывайте на печатные документы;
  • оценки уверенности (confidence) по символам или словам в ответе нет;
  • результат распознавания не имеет юридической значимости;
  • это распознавание, а не проверка подлинности документа: сверять данные с оригиналом нужно вам.
PDF на вход не принимается. Метод работает с растровым изображением страницы, поэтому многостраничный файл нужно отрендерить в картинки на своей стороне и отправить постранично. Для тяжёлых PDF — юридически значимых документов, файлов с электронными подписями и сложной вёрсткой — планируется отдельный сервис. Сейчас он в планах, а не в работе.

Для чего предназначен сервис

Это инструмент оптического распознавания текста и документов (OCR). Мы просим использовать его законно и добросовестно.

Подходящие сценарии
  • оцифровка документов: договоры, счета, чеки, бланки, акты, отчёты;
  • перенос таблиц со сканов в рабочие данные;
  • распознавание коротких кодов и номеров (режим line/digits);
  • автоматизация ввода данных из ваших собственных изображений;
  • наполнение архивов и поиск по отсканированным материалам;
  • подготовка и разметка обучающих датасетов, обучение ML- и OCR-моделей;
  • доступность (accessibility): извлечение текста с изображений для незрячих пользователей;
  • исследовательские и образовательные задачи.
Недопустимое использование
  • обход систем защиты от автоматизации на чужих ресурсах;
  • получение несанкционированного доступа к сторонним сервисам;
  • нарушение правил и условий использования сторонних сайтов;
  • обработка чужих персональных данных без законного основания;
  • массовая регистрация, спам, мошенничество и иные злоупотребления.

Ответственность за законность использования результатов несёт пользователь. Подробнее — в Условиях использования (в частности, раздел «Запрещённые действия Пользователя»).

Часто задаваемые вопросы

Короткие ответы про распознавание текста

Примеры использования

Где помогает распознавание текста

Оцифровка документов

Договоры, счета, акты и бланки со сканов превращаются в текст, готовый к обработке.

Перенос таблиц

Табличные данные из отчётов и выписок переносятся в рабочие системы без ручного ввода.

Поиск по архиву

Отсканированные материалы становятся текстом — по ним работает полнотекстовый поиск.

Коды и номера

Короткие строки и цифровые коды с изображений считываются режимами line и digits.

Готовы начать?

Откройте GUI для быстрой проверки или используйте API для автоматизации.

Документ → текст

Скан или фото до 10 МБ

Таблицы и формулы

Не только строки

Плата за результат

Неуспех — бесплатно

REST API

JSON + Swagger

Восстанавливаем соединение…

Похоже, связь с сервером ненадолго прервалась. Переподключаемся автоматически — пожалуйста, подождите несколько секунд.

Не удалось переподключиться

Проверьте интернет-соединение. Можно повторить попытку или обновить страницу.

Сессия устарела

Соединение восстановлено, но сессию нужно перезагрузить. Обновите страницу, чтобы продолжить.