Введение в проблему: неожиданные перекосы современной распознаки речи
Представьте, что вы выкатываете в продакшн голосового ассистента для колл-центра, рассчитывая, что зумеры закроют все метрики по идеальной дикции (совсем как в том самом идеальном техзадании, которое никогда не совпадает с реальностью), но на тестах спотыкаетесь о неожиданный баг: нейросеть почему-то безупречно понимает бабушек и дедушек, а вот сбивчивый и быстрый сленг двадцатилетних превращает в кашу. Технологии автоматического распознавания речи (Automatic Speech Recognition, ASR) за последние несколько лет совершили колоссальный скачок. Модели глубокого обучения научились справляться с шумами в помещении, сильными региональными акцентами, быстрой речью и наложенными друг на друга голосами. Среди всего многообразия открытых и проприетарных решений семейство моделей Whisper от OpenAI занимает лидирующие позиции благодаря своей надежности, обученной на колоссальном массиве аудиоданных (более 680 тысяч часов).
Однако по мере того как инженеры, лингвисты и исследователи данных начинают детально бенчмаркить Whisper на разнообразных демографических группах, всплывают крайне любопытные и порой контринтуитивные артефакты. Один из самых интригующих выводов, которые делают исследователи в ходе тестирования моделей с открытым исходным кодом: в ряде сценариев Whisper транскрибирует речь пожилых людей (в возрасте около 70 лет) заметно точнее, чем речь представителей молодежи (в районе 20 лет). На первый взгляд это звучит парадоксально. Кажется, что молодые люди должны обладать более четкой дикцией, а пожилой возраст часто ассоциируется со снижением артикуляционной точности, шепелявостью, потерей зубов или тихим голосом.
Тем не менее, за этим феноменом стоят вполне конкретные лингвистические, архитектурные и датасетные причины. В этой статье мы подробно разберем, почему так происходит, заглянем под капот архитектуры Whisper, проанализируем особенности датасетов и покажем на примерах, как с этим работать разработчикам, внедряющим голосовые интерфейсы.
Но прежде чем переходить к цифрам метрик, давайте разберем, из каких кирпичиков строится эта языковая уверенность ИИ.
Архитектурные особенности Whisper и природа обучающих данных
Чтобы понять причины феномена точности распознавания речи у разных возрастов, необходимо вспомнить, как тренировалась модель Whisper. В отличие от традиционных ASR-систем, которые часто обучались на тщательно вычищенных студийных датасетах с безупречным качеством аудио (вроде LibriSpeech — тех самых легендарных датасетов, которые работают только в лаборатории, как и подзабытое «работает на моей машине»), Whisper обучалась методом слабых супервизий (weak supervision) на огромном объеме неразмеченных данных из интернета.
OpenAI собрала из открытых источников почти 680 000 часов аудиозаписей вместе с сопутствующими текстовыми расшифровками (субтитрами, стенограммами подкастов, интервью, лекций). Этот массив данных обладает следующими характеристиками:
- Огромное разнообразие акустических условий (микрофоны низкого качества, фоновый шум, эхо).
- Широчайший демографический срез: от детей до глубоких стариков.
- Различные стили речи: от неформального сленга до академических докладов.
Интересно, что исследования нейронной активности показывают: промежуточные слои Whisper удивительно точно коррелируют с ECoG-ответами человеческого мозга на речь, подтверждая глубокую иерархическую организацию корковой обработки звука, заложенную в архитектуру Transformer.
Именно эта архитектурная глубина и подводит нас к самому интересному вопросу: почему же зрелый голос оказывается для неё комфортнее?
Почему 70-летние звучат «понятнее» для нейросети?
Секрет кроется в особенностях генерации речи и специфике датасетов. Рассмотрим главные факторы, влияющие на WER (Word Error Rate):
1. Темп и артикуляция
Молодежь (20-летние) склонна к быстрой, слитной речи, использованию редуцированных звуков, локального сленга, аббревиатур и резких переходов между мыслями. В то же время спикеры старшего возраста (70+) на официальных записях, подкас