Price: 50000
Number of applications: 0
29.09.26 (inclusive)
Оплата
Finished product
ICT tasks
Robotics
Information processing and transformation
Software/ IS
О чём речь В нашем сервисе (проверка пакетов документов для гос. услуг РК) из загруженных PDF извлекается текст для дальнейшего анализа. Большинство файлов имеют текстовый слой и парсятся локально. Но часть приходит сканами без текстового слоя — их сейчас распознаёт облачный Google Gemini 2.5 Flash. Хотим уйти от облака и делать это локально, на своём хостинге.
Увеличение независимости продукта от сторонних сервисов
Жантас Асылбек
Purpose and description of task (project)
🧩 Задача для комьюнити: локальный OCR PDF-сканов (RU/KK) вместо Gemini О чём речь В нашем сервисе (проверка пакетов документов для гос. услуг РК) из загруженных PDF извлекается текст для дальнейшего анализа. Большинство файлов имеют текстовый слой и парсятся локально. Но часть приходит сканами без текстового слоя — их сейчас распознаёт облачный Google Gemini 2.5 Flash. Хотим уйти от облака и делать это локально, на своём хостинге. Что нужно сделать Модуль, который принимает PDF-скан и возвращает извлечённый текст (plain text, UTF-8), дословно и в правильном порядке чтения. Должен работать офлайн, без внешних API. ⚠️ Важная оговорка по типу документов Это не распознавание паспортов, удостоверений, сложных бланков или рукописей. Сканы — это обычные печатные текстовые документы: уставы, справки, договоры, бизнес-планы, письма. То есть: преимущественно сплошной печатный текст, 1 колонка; машинный шрифт (не рукопись); могут встречаться простые таблицы, печать/подпись внизу — но это не основное содержание. Это сильно упрощает задачу: не нужен «интеллект» уровня мультимодальной LLM для сложной вёрстки — нужен надёжный OCR печатного RU/KK текста. Специфика Языки: русский + казахский (ә ғ қ ң ө ұ ү һ і), иногда в одном документе. Качество: сканы разного качества (перекос, шум, DPI 150–300). Критично: числа, суммы, БИН/ИИН (12 цифр), даты — ошибка в цифре недопустима. Вход: PDF до 15 МБ, 1–30 страниц. Выход: UTF-8 текст, порядок сверху вниз / слева направо; таблицы — построчно. Интеграция: PHP-модуль или локальный CLI/HTTP-сервис, вызываемый из PHP (стек — CodeIgniter 4 / PHP 8.2). Разрешённый стек Всё, что ставится на хостинг: Tesseract 5 (rus + kaz LSTM), PaddleOCR / EasyOCR, docTR; растеризация PDF→изображение (pdftoppm / Ghostscript); препроцессинг (OpenCV / ImageMagick: deskew, denoise, binarize). Комбинации приветствуются. Критерии приёмки Бенчмарк: предоставим набор из ~150–200 реальных обезличенных PDF (RU/KK) с эталонным текстом. Метрики: CER / WER против эталона; Field-accuracy по критичным полям (БИН, суммы, даты). Цель: точность не хуже Gemini 2.5 Flash на том же наборе (его результаты опубликуем как baseline). Производительность: ≤ N секунд на документ (уточним по железу), полностью локально. Формат сабмита Репозиторий с кодом + README (установка, зависимости, запуск). Скрипт прогона по бенчмарку, выдающий CER/WER и field-accuracy. Краткое описание пайплайна. Дедлайн: 01.10.26