Транскрибация аудио
Отчёт по обработке 15 аудиофайлов из 4 источников. OpenVINO Whisper-base на NPU, язык принудительно русский, защита от зацикливания.
Всего аудио~259 мин4 источника
Время обработки~29 минNPU, ~9x real-time
Файлов159 (CCTV) + 6 (Zoom)
Галлюцинацийсрезано ~20%постобработкой
1. Аудио из C:\DOC\AUDIO (3 точки)
AVI/MP4 с 8кГц PCM/alaw (телефонное качество). Whisper-base не смог распознать речь на двух из трёх точек. Причина: слишком низкое качество записи.
| Точка | Файлов | Длит. | Формат | Результат |
| Белгород МегаГринн ЦМ | 4 AVI | 40 мин | PCM 8кГц | — пусто (галлюцинации The river...) |
| Севск | 2 MP4 | 35 мин | alaw 8кГц | — частично (грязный русский, ~65% кириллицы) |
| Унеча | 3 AVI | 30 мин | PCM 8кГц | — пусто (галлюцинации In In...) |
Вывод: Аудио с видеокамер (8кГц) не поддаётся качественной расшифровке моделью Whisper-base. Для таких записей нужна модель не меньше small/medium или предварительное улучшение аудио.
2. Zoom-записи «Омск Френдли🙏» (6 файлов)
Zoom recording (MP4 → MP3). Качество хорошее, 44.1кГц стерео. Результат: ~75% кириллицы, текст читаемый.
| # | Файл | Длит. | Обраб. | Скорость | Чанков |
| 1 | omsk_1.mp3 | 32:29 | 171с | 11.4x | 33 |
| 2 | omsk_2.mp3 | 10:22 | 41с | 15.3x | 11 |
| 3 | omsk_3.mp3 | 1:07:47 | 396с | 10.3x | 68 |
| 4 | omsk_4.mp3 | 28:08 | 211с | 8.0x | 29 |
| 5 | omsk_5.mp3 | 43:01 | 338с | 7.6x | 44 |
| 6 | omsk_6.mp3 | 44:04 | 362с | 7.3x | 45 |
| Итого | 3:45:54 | 25.3 мин | 8.9x | 230 |
Защита от зацикливания (anti-loop)
Проблема: NPU KV-Cache переполняется на длинных чанках → модель зацикливается (повторяет «я не знаю, что это» или «2 разум нас» бесконечно).
1. Чанки 60 секунд (вместо 120/300) — меньше контекста, ниже нагрузка KV-Cache
2. Пересоздание WhisperPipeline на каждый чанк — «холодный» старток, без остаточного кэша
3. language="<|ru|>" — принудительный русский, иначе модель уходит в англ. галлюцинации
4. Постобработка: обнаружение повторяющихся фраз (≥4 раз) → удаление лишних
5. Фильтр RMS 0.006 — пропуск тишины
6. Удаление водяных знаков Zoom («Редактор субтитров А.Семкин...»)
3. Рекомендации
Для CCTV / 8кГц записей
- Использовать модель Whisper-small или medium
- Предварительно апскейлить аудио через ресемплинг + фильтрацию
- Или использовать специализированный ASR для телефонного качества
Для Zoom / конференций
- Текущий pipeline работает стабильно
- Рекомендуется chunk-sec=60, overlap=3
- Принудительный язык — обязательно
- Постобработка обязательна (срезает 12-34% шума)
Для production
- Перейти на Whisper-small-ov (точнее, но медленнее)
- Добавить детектор спикеров (diarization)
- Автоматическая очередь через RabbitMQ
- Сохранять WAV + raw + clean версии
4. Анализ содержания
Zoom-встречи «Омск Френдли🙏»: Обсуждение оргструктуры, KPI, мотивации от прибыли, P&L точек, Activity-based ФОТ, Bitrix24, оптимизация салонов.
Ключевые темы:
- Переход от план-факта к управляемой прибыли
- Activity-based планирование персонала (не «кто согласился выйти», а «сколько нужно по нагрузке»)
- Связь бонусов с controllable profit
- Проблема T2-показателей и их оптимизация
- Zero-based офис и make/buy решения
- Jobs to Be Done для розничных клиентов
Точки из C:\DOC\AUDIO: Качество записи не позволило извлечь полезное содержание. Рекомендуется перезаписать через Zoom или телефонную линию.
5. Pipeline
Исходные файлы (ZIP/RAR/ссылки Zoom)
↓ yt-dlp / unzip
Аудио (AVI/MP4/MP3)
↓ ffmpeg → WAV 16кГц моно
Транскрибация Whisper (NPU)
↓ chunk=60s, lang=ru, pipeline per chunk
Raw-текст с метками времени
↓ Постобработка (удаление повторов, водяных знаков)
Clean-текст
↓ Telegram / Web
Готовая страница