Сумма: 0
Количество заявок: 1
07.09.26 (включительно)
договорная
Готовый продукт
Задачи ИКТ
Робототехника
Нейротехнологии и искусственный интеллект
ПО/ИС
При практическом применении технологий распознавания и офлайн-анализа речи одной из ключевых проблем является недостаточное качество исходных аудиоданных и ограниченные возможности их автоматической обработки. В частности, при записи диалогов двух и более участников часто используется один аудиоканал, что существенно усложняет автоматическое определение и разделение реплик по спикерам и, как следствие, снижает качество последующей транскрибации и анализа. Дополнительную сложность представляет обработка русско-казахской смешанной речи (code-switching). Существующие решения ASR не всегда обеспечивают стабильное распознавание и диаризацию в таких условиях, что приводит к ошибкам в определении спикеров, снижению точности расшифровки и ухудшению ее читаемости. Таким образом, требуется решение, способное обеспечить более точное разделение речи по спикерам и качественную транскрибацию русско-казахских диалогов, в том числе при использовании одноканальных аудиозаписей
Результатом разработки - программный модуль для автоматической обработки и анализа аудиозаписей диалогов двух спикеров, обеспечивающий повышение качества и эффективности последующей транскрибации и анализа речи. Модуль должен обеспечивать: 1. Автоматическую диаризацию аудиозаписи — определение речевых фрагментов и их распределение между двумя спикерами с целевой точностью не ниже 90%, в том числе при одноканальной записи. 2. Распознавание речи на русском и казахском языках с целевой точностью не ниже 85%, включая обработку смешанной русско-казахской речи (code-switching). 3. Формирование структурированной стенограммыс сохранением последовательности диалога, временных меток начала и окончания реплик и идентификаторов спикеров (Speaker 1, Speaker 2). 4. Гибкую архитектуру распознавания, позволяющую использовать различные STT/ASR-сервисы — как внешние облачные, так и локальные/офлайн-решения — в зависимости от требований к качеству, безопасности, производительности и размещению данных. 5. Интеграцию с существующими информационными системами посредством API и стандартных форматов обмена данными. 6. Возможность автономной работы в закрытом или ограниченном информационном контуре при использовании локального STT/ASR-сервиса, без обязательной передачи аудиоданных во внешние облачные системы. 7. Стандартизацию результата обработки — формирование единого структурированного представления данных, пригодного для последующего поиска, анализа, хранения, автоматической обработки и передачи в другие информационные системы. 8. Снижение объема ручной обработки аудиозаписей за счет автоматического определения спикеров, распознавания речи и подготовки готовой стенограммы. Таким образом, разработка позволит создать независимый от конкретного поставщика механизм диаризации и подготовки структурированной стенограммы, который может использовать различные технологии распознавания речи и адаптироваться к требованиям конкретной информационной системы.
Торчик В.В.
Цель и описание задачи (проекта)
В рамках проекта необходимо разработать программный механизм, обеспечивающий автоматическую обработку аудиофайлов без необходимости ручной предварительной разметки. Решение должно принимать на вход аудиозапись диалога двух спикеров, в том числе записанную в одном аудиоканале, и формировать структурированный текстовый результат. Функциональность модуля должна включать: 1 Обработку входного аудиофайла — прием и предварительную обработку аудиозаписи, включая нормализацию и выделение речевых фрагментов. 2 Детектирование речи — автоматическое определение участков аудиозаписи, содержащих речь, с исключением или минимизацией влияния пауз, фоновых шумов и неречевых фрагментов. 3 Диаризацию двух спикеров — автоматическое определение и разделение реплик двух участников диалога даже при использовании одноканальной записи. 4 Распознавание речи (ASR) — преобразование речи в текст с поддержкой русского и казахского языков. 5 Обработку смешанной речи (code-switching) — корректное распознавание фрагментов, в которых говорящий переходит с русского на казахский язык и обратно. 6 Формирование стенограммы — создание текстового файла с последовательной разметкой реплик по спикерам, временными метками начала и окончания каждого речевого фрагмента и, при необходимости, указанием определенного языка. 7 Сохранение структуры диалога — обеспечение соответствия порядка текстовых реплик их фактической последовательности в аудиозаписи. 8 Контроль качества результата — достижение целевых показателей: точность диаризации — не менее 90%; точность распознавания речи — не менее 85%. 9 Форматирование результата — предоставление стенограммы в структурированном формате, пригодном для дальнейшего анализа, хранения, обработки и интеграции с другими информационными системами. 10 Возможность интеграции — реализация программного интерфейса или иного стандартного механизма передачи результатов в сторонние системы и приложения.