Шешімдерді қабылдау мерзімі

07.09.26 (қоса алғанда)

Марапаттау нысаны

шарттық

Өнім күйі

Дайын өнім

Тапсырма түрі

Акт міндеттері

Сфера применения

Робототехника

Область задачи

Нейротехнология және жасанды интеллект

Өнім түрі

БҚ/АЖ

Мәселенің сипаттамасы

Сөйлеуді тану және офлайн талдау технологияларын практикалық қолдану кезінде негізгі мәселелердің бірі-бастапқы аудио деректердің жеткіліксіз сапасы және оларды автоматты түрде өңдеудің шектеулі мүмкіндіктері. Атап айтқанда, екі немесе одан да көп қатысушылардың диалогтарын жазу кезінде бір аудио арна жиі пайдаланылады, бұл репликаларды спикерлер бойынша автоматты түрде анықтау мен бөлуді айтарлықтай қиындатады және нәтижесінде кейінгі транскрипция мен талдау сапасын төмендетеді. Қосымша күрделілік-орыс-қазақ аралас сөйлеуді өңдеу (code-switching). Қолданыстағы ASR шешімдері әрдайым осындай жағдайларда тұрақты тану мен диаризацияны қамтамасыз ете бермейді, бұл спикерлерді анықтауда қателіктерге, декодтау дәлдігінің төмендеуіне және оның оқылуының нашарлауына әкеледі. Осылайша, спикерлер бойынша сөйлеуді неғұрлым дәл бөлуді және орыс-қазақ диалогтарын, оның ішінде бір арналы аудиожазбаларды пайдалану кезінде сапалы транскрипциялауды қамтамасыз етуге қабілетті шешім талап етіледі

Күтілетін әсер

Әзірлеудің нәтижесі-кейінгі транскрипция мен сөйлеуді талдаудың сапасы мен тиімділігін арттыруды қамтамасыз ететін екі спикердің диалогтық жазбаларын автоматты түрде өңдеуге және талдауға арналған бағдарламалық модуль. Модуль қамтамасыз етуі керек: 1. Аудиожазбаны автоматты түрде диаризациялау-сөйлеу фрагменттерін анықтау және оларды 90% - дан төмен емес мақсатты дәлдікпен, оның ішінде бір арналы жазу кезінде екі спикер арасында бөлу. 2. Аралас орыс-қазақ тілдерін өңдеуді қоса алғанда, 85% - дан төмен емес нысаналы дәлдікпен орыс және қазақ тілдерінде сөйлеуді тану (code-switching). 3. Диалог тізбегін, репликалардың басталу және аяқталу уақыт белгілерін және спикерлердің идентификаторларын сақтай отырып, құрылымдық транскриптті қалыптастыру (Speaker 1, speaker 2). 4. Сапа, қауіпсіздік, өнімділік және деректерді орналастыру талаптарына байланысты әртүрлі STT/ASR қызметтерін-сыртқы бұлттық және жергілікті/офлайн шешімдерді пайдалануға мүмкіндік беретін икемді тану архитектурасы. 5. API және стандартты деректер алмасу форматтары арқылы қолданыстағы ақпараттық жүйелермен интеграциялау. 6. Жергілікті STT/ASR қызметін пайдаланған кезде жабық немесе шектеулі ақпараттық контурда автономды жұмыс істеу мүмкіндігі, аудио деректерді сыртқы бұлттық жүйелерге міндетті түрде жіберместен. 7. Өңдеу нәтижесін стандарттау-кейіннен іздеуге, талдауға, сақтауға, автоматты өңдеуге және басқа ақпараттық жүйелерге беруге жарамды деректердің бірыңғай құрылымдық көрінісін қалыптастыру. 8. Спикерлерді автоматты түрде анықтау, сөйлеуді тану және дайын транскрипт дайындау арқылы аудио жазбаларды қолмен өңдеу көлемін азайту. Осылайша, әзірлеу сөйлеуді танудың әртүрлі технологияларын қолдана алатын және белгілі бір ақпараттық жүйенің талаптарына бейімделе алатын нақты жеткізушіге тәуелсіз диаризация және құрылымдық транскрипт дайындау механизмін құруға мүмкіндік береді.

Жауапты тұлғаның ТАӘ

Торчик В. В.

Тапсырманың (жобаның) мақсаты мен сипаттамасы

Жоба аясында аудио файлдарды қолмен алдын-ала белгілеуді қажет етпестен автоматты түрде өңдеуді қамтамасыз ететін бағдарламалық жасақтама жасау қажет. Шешім екі спикердің, оның ішінде бір аудио арнада жазылған диалогтың аудиожазбасын кіруге қабылдауы және құрылымдық мәтіндік нәтижені қалыптастыруы тиіс. Модульдің функционалдығы мыналарды қамтуы керек: 1 кіріс аудио файлын өңдеу-сөйлеу фрагменттерін қалыпқа келтіруді және бөлектеуді қоса, аудио жазбаны қабылдау және алдын ала өңдеу. 2 сөйлеуді анықтау-кідірістердің, фондық шулардың және сөйлеу емес фрагменттердің әсерін қоспағанда немесе азайта отырып, сөйлеуді қамтитын аудиожазба учаскелерін автоматты түрде анықтау. 3 екі спикердің Диаризациясы-бір арналы жазбаны пайдаланған кезде де диалогтың екі қатысушысының көшірмелерін автоматты түрде анықтау және бөлу. 4 сөйлеуді тану (ASR) — орыс және қазақ тілдерін қолдай отырып, сөйлеуді мәтінге айналдыру. 5 аралас сөйлеуді өңдеу (code — switching) - сөйлеуші орыс тілінен қазақ тіліне және кері ауысатын фрагменттерді дұрыс тану. 6 транскриптті қалыптастыру-спикерлер бойынша көшірмелерді дәйекті белгілеу, әр сөйлеу фрагментінің басталуы мен аяқталуының уақыт белгілері және қажет болған жағдайда белгілі бір тілді көрсету арқылы мәтіндік файл жасау. 7 диалог құрылымын сақтау - мәтіндік көшірмелер тәртібінің олардың аудиожазбадағы нақты реттілігіне сәйкестігін қамтамасыз ету. 8 нәтиженің сапасын бақылау-нысаналы көрсеткіштерге қол жеткізу: диаризация дәлдігі-кем дегенде 90%; сөйлеуді тану дәлдігі кем дегенде 85% құрайды. 9 нәтижені форматтау-басқа ақпараттық жүйелермен әрі қарай талдауға, сақтауға, өңдеуге және интеграциялауға жарамды құрылымдық форматта транскрипт ұсыну. 10 интеграциялау мүмкіндігі-бағдарламалық интерфейсті немесе нәтижелерді үшінші тарап жүйелері мен қосымшаларына берудің басқа стандартты механизмін іске асыру.

Ескерту