The post has been translated automatically. Original language: Russian
We are developing a voice assistant for doctors, a system that listens to a doctor's conversation with a patient and automatically generates a medical document: an appointment protocol, conclusion, recommendations, or other structured text.
One of the key tasks in such a project is high—quality and fast speech recognition. We started testing different ASR solutions, including Whisper and GigAM ASR.
Whisper shows good recognition quality, but in our tests we encountered a performance problem. On the RTX 5090, processing 17-minute audio took too long — in some tests it reached 17-30 minutes. This is critical for a real medical appointment: the doctor does not have to wait as long for the document as the consultation itself lasted.
It is important to note that in the working architecture we do not send the entire long audio. We slice the record into chunks and process them in parts. This helps to speed up the process and increase stability. But even with this approach, it became clear that for a medical scenario, we need the fastest and most stable ASR.
After that, we tested the GigAM ASR. In our conditions, it showed significantly higher speed: where Whisper could take 17-30 minutes, GigAM could handle it in about 3 seconds.
This is an important result for us, because speed is very important in medicine. The voice assistant should work almost imperceptibly for the doctor: listen, recognize speech, structure information and prepare a document without unnecessary delay.
We are currently continuing to test the quality of speech recognition, stability in medical terminology, and working with noise, different voices, and mixed speech. Our goal is to make a tool that really saves doctors time and reduces the burden of paperwork.
Мы разрабатываем голосового помощника для врачей — систему, которая слушает разговор врача с пациентом и автоматически формирует медицинский документ: протокол приема, заключение, рекомендации или другой структурированный текст.
Одна из ключевых задач в таком проекте — качественное и быстрое распознавание речи. Мы начали тестировать разные ASR-решения, в том числе Whisper и GigAM ASR.
Whisper показывает хорошее качество распознавания, но в наших тестах мы столкнулись с проблемой производительности. На RTX 5090 обработка 17-минутного аудио занимала слишком много времени — в отдельных тестах доходило до 17–30 минут. Для реального медицинского приема это критично: врач не должен ждать документ столько же времени, сколько длилась сама консультация.
Важно отметить, что в рабочей архитектуре мы не отправляем длинное аудио целиком. Мы нарезаем запись на чанки и обрабатываем их по частям. Это помогает ускорить процесс и повысить стабильность. Но даже в таком подходе стало понятно, что для медицинского сценария нам нужен максимально быстрый и устойчивый ASR.
После этого мы протестировали GigAM ASR. В наших условиях он показал значительно более высокую скорость: там, где Whisper мог занимать 17–30 минут, GigAM справлялся примерно за 3 секунды.
Для нас это важный результат, потому что в медицине скорость имеет большое значение. Голосовой помощник должен работать почти незаметно для врача: слушать, распознавать речь, структурировать информацию и готовить документ без лишней задержки.
Сейчас мы продолжаем тестировать качество распознавания, устойчивость на медицинской терминологии, работу с шумом, разными голосами и смешанной речью. Наша цель — сделать инструмент, который реально экономит время врачей и снижает нагрузку на оформление документов.