Команда Microsoft Research анонсировала открытый доступ к VibeVoice-ASR — нейросетевой модели для распознавания речи, которая включает в себя разделение спикеров. Я, Илья, основатель ArtGeneration.me и преданный фанат нейросетей, подготовил портативную версию данной технологии для Windows и протестировал ее.

Данная система может обрабатывать до 60 минут аудио за один проход без нарезки на сегменты, выдавая структурированную транскрипцию с точными таймкодами и определением, кто говорит. VibeVoice-ASR использует уникальную архитектуру Qwen 2.5 и двойную систему токенизации для сохранения контекста.

Система также помечает неречевые события, такие как музыка и шум, что позволяет избежать неуместного распознавания. Благодаря поддержке 51 языка, включая русский, и возможности настройки пользовательских горячих слов, результат распознавания становится более точным.

Модель будет полезна подкастерам, создателям контента и бизнес-аналитикам. Для пользователей доступна онлайн-демо версия и установка с GitHub. Я создал портативную сборку VibeVoice ASR с улучшенным интерфейсом и функциями. Узнайте больше о нейросетях на моем YouTube-канале.