
Распознавание текста OCR
Распознайте текст из PDF, скана или фотографии. Серверный OCR SmirnovLab поддерживает русский и английский языки, пакетную обработку и выдаёт TXT, Word, PDF с текстовым слоем, Markdown, HTML, JSON или общий ZIP.
Распознавание текста
Загрузите PDF, сканы или фотографии и получите текст, Word либо PDF с поиском. Документы обрабатываются на сервере SmirnovLab, не во внешнем OCR-сервисе.
Что получает пользователь
PDF и семь форматов изображений
До 20 файлов за запуск
TXT, DOCX и PDF с поиском
Tesseract или анализ структуры PaddleOCR
Модули и готовность
Загрузка
PDF / изображения · одиночно или пакетом · поддерживается ZIP.
Обработка
Обработка с безопасными ограничениями.
Результат
TXT / DOCX / PDF / ZIP с понятным скачиванием результата.
Подходит тем, кому нужен измеримый результат
Частые вопросы
Какие файлы можно распознать?
PDF, PNG, JPG/JPEG, TIFF, BMP и WEBP. За один запуск можно выбрать до 20 файлов размером до 100 МБ каждый.
Куда загружаются документы?
В отличие от лёгких браузерных конвертеров, OCR выполняется на защищённом сервере SmirnovLab. Документы не передаются внешним OCR-сервисам и автоматически удаляются не позднее чем через 24 часа.
Какие результаты можно скачать?
TXT, DOCX, PDF с текстовым слоем, Markdown, HTML, JSON и ZIP со всеми результатами и предпросмотрами.
Чем отличаются режимы?
Быстрый режим использует Tesseract и OCRmyPDF. Режим структуры использует PaddleOCR для блоков и порядка чтения; он медленнее и доступен, когда установлен на OCR-сервере.
Сохранятся ли таблицы и исходная вёрстка?
PDF с текстовым слоем сохраняет внешний вид исходных страниц. DOCX первой версии ориентирован на текст: сложные таблицы, колонки и точная вёрстка могут не восстановиться.
Получите уведомление и помогите сформировать продукт
Опишите задачу своими словами. Мы не продаём лишние модули — сначала определяем полезный результат и самый короткий путь к нему.

