Тек ҚР

Ақша сомасы: 50000

Өтінімдер саны: 0

Тапсырыс беруші
Шешімдерді қабылдау мерзімі

29.09.26 (қоса алғанда)

Марапаттау нысаны

Оплата

Өнім күйі

Дайын өнім

Тапсырма түрі

Акт міндеттері

Сфера применения

Робототехника

Область задачи

Ақпаратты өңдеу және түрлендіру

Өнім түрі

БҚ/АЖ

Мәселенің сипаттамасы

О чём речь В нашем сервисе (проверка пакетов документов для гос. услуг РК) из загруженных PDF извлекается текст для дальнейшего анализа. Большинство файлов имеют текстовый слой и парсятся локально. Но часть приходит сканами без текстового слоя — их сейчас распознаёт облачный Google Gemini 2.5 Flash. Хотим уйти от облака и делать это локально, на своём хостинге.

Күтілетін әсер

Увеличение независимости продукта от сторонних сервисов

Жауапты тұлғаның ТАӘ

Жантас Асылбек

Тапсырманың (жобаның) мақсаты мен сипаттамасы

🧩 Задача для комьюнити: локальный OCR PDF-сканов (RU/KK) вместо Gemini О чём речь В нашем сервисе (проверка пакетов документов для гос. услуг РК) из загруженных PDF извлекается текст для дальнейшего анализа. Большинство файлов имеют текстовый слой и парсятся локально. Но часть приходит сканами без текстового слоя — их сейчас распознаёт облачный Google Gemini 2.5 Flash. Хотим уйти от облака и делать это локально, на своём хостинге. Что нужно сделать Модуль, который принимает PDF-скан и возвращает извлечённый текст (plain text, UTF-8), дословно и в правильном порядке чтения. Должен работать офлайн, без внешних API. ⚠️ Важная оговорка по типу документов Это не распознавание паспортов, удостоверений, сложных бланков или рукописей. Сканы — это обычные печатные текстовые документы: уставы, справки, договоры, бизнес-планы, письма. То есть: преимущественно сплошной печатный текст, 1 колонка; машинный шрифт (не рукопись); могут встречаться простые таблицы, печать/подпись внизу — но это не основное содержание. Это сильно упрощает задачу: не нужен «интеллект» уровня мультимодальной LLM для сложной вёрстки — нужен надёжный OCR печатного RU/KK текста. Специфика Языки: русский + казахский (ә ғ қ ң ө ұ ү һ і), иногда в одном документе. Качество: сканы разного качества (перекос, шум, DPI 150–300). Критично: числа, суммы, БИН/ИИН (12 цифр), даты — ошибка в цифре недопустима. Вход: PDF до 15 МБ, 1–30 страниц. Выход: UTF-8 текст, порядок сверху вниз / слева направо; таблицы — построчно. Интеграция: PHP-модуль или локальный CLI/HTTP-сервис, вызываемый из PHP (стек — CodeIgniter 4 / PHP 8.2). Разрешённый стек Всё, что ставится на хостинг: Tesseract 5 (rus + kaz LSTM), PaddleOCR / EasyOCR, docTR; растеризация PDF→изображение (pdftoppm / Ghostscript); препроцессинг (OpenCV / ImageMagick: deskew, denoise, binarize). Комбинации приветствуются. Критерии приёмки Бенчмарк: предоставим набор из ~150–200 реальных обезличенных PDF (RU/KK) с эталонным текстом. Метрики: CER / WER против эталона; Field-accuracy по критичным полям (БИН, суммы, даты). Цель: точность не хуже Gemini 2.5 Flash на том же наборе (его результаты опубликуем как baseline). Производительность: ≤ N секунд на документ (уточним по железу), полностью локально. Формат сабмита Репозиторий с кодом + README (установка, зависимости, запуск). Скрипт прогона по бенчмарку, выдающий CER/WER и field-accuracy. Краткое описание пайплайна. Дедлайн: 01.10.26

Ескерту