The post has been translated automatically. Original language: Russian
When designing AI systems for the public sector, especially for law enforcement agencies, the standard development stack is broken down by strict information security requirements. You cannot use cloud APIs from OpenAI, Google, or Yandex to transcribe interrogations. The transfer of sensitive biometric and investigative data to external circuits is strictly prohibited.
The Kazakh IT company Nomad Tech LLP, together with Academician E.A. Buketov KarNIU, solved this problem by creating an autonomous hardware and software package for automating the logging of investigative actions.
In this article, we will analyze the engineering architecture of the prototype: from NVIDIA Jetson-based edge computing to local bilingual ASR and fixing data integrity through a distributed registry.
System Architecture: Edge Computing versus "clouds"
The main architectural principle of the complex is complete autonomy. The device must operate in isolated rooms without requiring a permanent network connection.
[ 360° Camera ] [ Microphone array ]
│ │
▼ ▼
[ RTSP video stream ] [ Primary DSP cleaning ]
│ │
└───────────┬─────────────┘
▼
┌───────────────────────────┐
│ NVIDIA Jetson Orin NX │
│ (Ubuntu Linux / JetPack) │
├───────────────────────────┤
│ • ASR Module (Offline) │
│ • NLP text analysis │
│ • Local DBMS & S3
│ • Blockchain hashing │
└───────────────────────────┘
NVIDIA Jetson Orin NX is used as a computing core running a specialized Linux build. The platform delivers up to 100 TOPS of performance in AI tasks with an energy consumption of only 10-25 watts. These characteristics are sufficient to process a circular video stream in parallel and run lightweight but accurate quantized deep Learning models.
Hardware level: Spatial sound selection
In a real investigation room, a standard lavalier microphone or voice recorder cannot cope: the reverberation (echo) of the rooms, extraneous noises (creaking chairs, the hum of the air conditioner) and the simultaneous speech of several people interfere.
To solve this problem, a microphone array with directional recording is embedded in the hardware stack.
- Primary Digital Processing (DSP): Acoustic echo (AEC) and static noise are suppressed at the hardware level.
- Spatial Beamforming: Array algorithms calculate the phase delay of sound waves and programmatically "direct" the microphone to a specific speaker.
- Audio stream segmentation: Audio is divided into isolated tracks based on sources in space. This prepares a "clean" signal for the diarization stage (determining who exactly is speaking) before sending it to the ASR engine.
In parallel with the sound, the built-in cameras take 360-degree high-resolution panoramic shots, unfolding the panorama of the room into a single coordinated video stream.
Software level: Bilingual ASR and NLP in tight isolation
The central software component of the complex is a local automatic speech recognition (ASR) module adapted for Kazakh and Russian languages.
1. Offline Transcription (ASR)
Since it is impossible to send embeddings to the cloud, the engineers optimized the acoustic models to work on Jetson Orin Tensor Cores. Quantization approaches (FP16/INT8) are used, which reduces memory requirements without critical loss of the Word Error Rate (WER) metric. The model performs:
- Real-time cleaning and normalization of incoming audio.
- Voice streaming transcription into structured text.
2. Intelligent NLP layer
Giving out a "sheet" of text is not enough for a legal document. A layer of intelligent text analysis (Natural Language Processing) is deployed on top of recognition, which solves the following tasks:
- Diarization and roles: Dividing replicas by roles (investigator, suspect, witness, lawyer).
- Timestamps: The rigid binding of each syntactic unit to the timecode of the video recording.
- NER (Entity Extraction): Recognition of dates, addresses, names, key events in the text and building a logical structure of readings.
The interaction between AI modules, backend services, and a lightweight user interface (UI) is implemented modularly through standardized local APIs. This simplifies the future integration of the complex with state-owned IP (for example, ERDR).
Security: Local stack and Blockchain validation
Investigative materials require the maximum level of protection against modification. The storage module is divided into two circuits:
- Metadata and text: Stored in a local relational database (SQL stack).
- Media Files: Heavy audio and video streams are recorded in a secure local object storage (S3-compatible) with access control at the OS kernel level.
How is immutability ensured?
To eliminate the fact of imperceptible text correction or video editing, Nomad Tech has implemented distributed registry technology.:
[Audio/Video/Text] ──> [SHA-256 Hashing] ──> [Writing the hash key to the Blockchain]
│
(Any file change)
│
▼
[Violation of integrity]
When recording readings, the system continuously generates control digital fingerprints (cryptographic hash keys) for each block of data (video fragment, audio track, chunk of text). These hashes are recorded in a distributed registry.
If during a trial or an internal audit someone tries to cut a frame from a video or change a word in an electronic protocol, the final hash of the file will not match the entry in the registry. The system will instantly record the fact of data compromise.
Current status and stack
At this stage, the prototype developed by Nomad Tech LLP is a functionally complete Hardware+Software solution. The complex performs the entire basic cycle: from 360° video capture and audio filtering to local ASR output, hashing in the blockchain and displaying the results through the UI interface. Due to its modularity, the architecture is ready for scaling and testing on real datasets within pilot zones.
При проектировании ИИ-систем для государственного сектора - особенно для правоохранительных органов - стандартный стек разработки разбивается о жесткие требования информационной безопасности. Вы не можете использовать облачные API от OpenAI, Google или Яндекса для транскрипции допросов. Передача чувствительных биометрических и следственных данных во внешние контуры категорически запрещена.
Казахстанская ИТ-компания ТОО «Nomad Tech» совместно с КарНИУ им. академика Е.А. Букетова решила эту задачу, создав автономный аппаратно-программный комплекс для автоматизации протоколирования следственных действий.
В этой статье мы разберем инженерную архитектуру прототипа: от edge-вычислений на базе NVIDIA Jetson до локального двуязычного ASR и фиксации целостности данных через распределенный реестр.
Архитектура системы: Edge-Computing против «облаков»
Главный архитектурный принцип комплекса - полная автономность. Устройство должно функционировать в изолированных помещениях, не требуя постоянного подключения к сети.
[ Камера 360° ] [ Микрофонный массив ]
│ │
▼ ▼
[ RTSP-видеопоток ] [ Первичная DSP-очистка ]
│ │
└───────────┬─────────────┘
▼
┌───────────────────────────┐
│ NVIDIA Jetson Orin NX │
│ (Ubuntu Linux / JetPack) │
├───────────────────────────┤
│ • Модуль ASR (Оффлайн) │
│ • NLP-анализ текста │
│ • Локальная СУБД & S3 │
│ • Блокчейн-хэширование │
└───────────────────────────┘
В качестве вычислительного ядра используется NVIDIA Jetson Orin NX под управлением специализированной сборки Linux. Платформа выдает до 100 TOPS производительности в ИИ-задачах при энергопотреблении всего 10-25 Вт. Таких характеристик достаточно, чтобы параллельно обрабатывать круговой видеопоток и запускать легковесные, но точные квантованные модели глубокого обучения (Deep Learning).
Hardware-уровень: Пространственное селекционирование звука
В условиях реальной следственной комнаты стандартный петличный микрофон или диктофон не справляются: мешают реверберация (эхо) помещений, посторонние шумы (скрип стульев, гул кондиционера) и одновременная речь нескольких людей.
Для решения этой проблемы в стек оборудования внедрен микрофонный массив с направленной записью.
- Первичная цифровая обработка (DSP): На аппаратном уровне происходит подавление акустического эха (AEC) и статического шума.
- Пространственное селекционирование (Beamforming): Алгоритмы массива вычисляют фазовую задержку звуковых волн и программно «направляют» микрофон на конкретного спикера.
- Сегментация аудиопотока: Звук разделяется на изолированные дорожки по источникам в пространстве. Это подготавливает «чистый» сигнал для этапа диаризации (определения, кто именно говорит) перед отправкой в ASR-движок.
Параллельно со звуком встроенные камеры ведут обзорную съемку в 360 градусов с высоким разрешением, разворачивая панораму комнаты в единый скоординированный видеопоток.
Software-уровень: Двуязычный ASR и NLP в условиях жесткой изоляции
Центральный программный компонент комплекса - локальный модуль автоматического распознавания речи (ASR), адаптированный для казахского и русского языков.
1. Оффлайн-транскрипция (ASR)
Поскольку отправка эмбеддингов в облако невозможна, инженеры оптимизировали акустические модели для работы на тензорных ядрах (Tensor Cores) Jetson Orin. Применяются подходы квантования (FP16/INT8), что позволяет снизить требования к памяти без критической потери метрики Word Error Rate (WER). Модель выполняет:
- Очистку и нормализацию входящего аудио в реальном времени.
- Потоковую транскрипцию голоса в структурированный текст.
2. Интеллектуальный NLP-слой
Выдать «простыню» текста недостаточно для юридического документа. Поверх распознавания развернут слой интеллектуального текстового анализа (Natural Language Processing), который решает следующие задачи:
- Диаризация и роли: Разделение реплик по ролям (следователь, подозреваемый, свидетель, адвокат).
- Временные метки: Жесткая привязка каждой синтаксической единицы к тайм-коду видеозаписи.
- NER (Извлечение сущностей): Распознавание в тексте дат, адресов, имен, ключевых событий и выстраивание логической структуры показаний.
Взаимодействие между AI-модулями, backend-сервисами и легковесным пользовательским интерфейсом (UI) реализовано по модульному принципу через стандартизированные локальные API. Это упрощает будущую интеграцию комплекса с государственными ИС (например, ЕРДР).
Безопасность: Локальный стек и блокчейн-валидация
Следственные материалы требуют максимального уровня защиты от модификации. Модуль хранения разделен на два контура:
- Метаданные и текст: Хранятся в локальной реляционной базе данных (SQL-стек).
- Медиафайлы: Тяжелые аудио- и видеопотоки записываются в защищенное локальное объектное хранилище (S3-совместимое) с разграничением прав доступа на уровне ядра ОС.
Как обеспечивается неизменяемость (Immutability)?
Для исключения факта незаметной корректировки текста или монтажа видеозаписи, Nomad Tech внедрили технологию распределенного реестра:
[Аудио/Видео/Текст] ──> [SHA-256 Хэширование] ──> [Запись хэш-ключа в Блокчейн]
│
(Любое изменение файла)
│
▼
[Нарушение целостности]
При фиксации показаний система непрерывно генерирует контрольные цифровые отпечатки (криптографические хэш-ключи) для каждого блока данных (видеофрагмент, аудиодорожка, чанк текста). Эти хэши записываются в распределенный реестр.
Если в процессе судебного разбирательства или служебной проверки кто-то попытается вырезать кадр из видео или изменить слово в электронном протоколе, итоговый хэш файла не совпадет с записью в реестре. Система мгновенно зафиксирует факт компрометации данных.
Текущий статус и стек
На данном этапе разработанный ТОО «Nomad Tech» прототип представляет собой функционально завершенное Hardware+Software решение. Комплекс выполняет весь базовый цикл: от захвата 360°-видео и фильтрации звука до локального ASR-вывода, хэширования в блокчейне и демонстрации результатов через UI-интерфейс. Благодаря модульности, архитектура готова к масштабированию и обкатке на реальных наборах данных (datasets) в рамках пилотных зон.