
Meta выпускает Muse Voice Transcribe — свою первую модель восприятия звука в реальном времени. Она обеспечивает многоязычную потоковую транскрипцию для Meta AI на Mac, Muse Code, а также для разработчиков через Meta Model API.
Muse Voice Transcribe обеспечивает системную диктовку на Mac
В Meta Superintelligence Labs заявляют, что Muse Voice Transcribe сочетает в себе потоковое автоматическое распознавание речи с диаризацией спикеров и определением конца реплики (endpointing).
На практике она способна расшифровывать речь по мере ее произнесения, разделять спикеров в записях (поддерживается более 20 голосов) и определять, когда собеседник закончил говорить — и всё это без необходимости отдельного этапа постобработки.
Модель была обучена на более чем 70 языках, причем 25 из них прошли валидацию на момент запуска. Она поддерживает аудиозаписи продолжительностью более часа, а также нативное переключение между языками внутри предложений или между ними. Настройка приоритета языков, ключевых слов и контекста позволяет еще больше повысить точность распознавания.
Вместо использования фиксированного баланса между скоростью и точностью, Muse Voice Transcribe сама решает, как долго слушать, прежде чем зафиксировать каждое слово. В Meta называют это «адаптивной задержкой». Система может быстро проскакивать более простую речь, задействуя больше аудиоконтекста для сложных слов.

По данным Meta, по состоянию на 1 сентября модель занимает первое место в рейтинге потокового распознавания речи Artificial Analysis.
Muse Voice Transcribe уже сегодня доступна через Meta Model API по цене $3 за 1000 минут аудио, что эквивалентно $0,18 в час.
Она также уже используется для диктовки в Meta AI для Mac и Muse Code. На Mac пользователи могут удерживать клавишу Fn для диктовки в любом приложении.
Последние публикации о Meta AI: