Ошибка в словах 2,4% — и по-прежнему неизвестно, кто говорил
MAI-Transcribe-1.5 от Microsoft показывает 2,4% ошибок на словах, а в собственной документации модели написано, что диаризация не поддерживается. Понятное объяснение того, что измеряет WER, почему рейтинг сбился в плотную группу у нижней границы и какие слои над распознаванием речи на самом деле решают, станет ли расшифровка пригодной рабочей записью встречи.
В начале июня команда AI Superintelligence в Microsoft выпустила MAI-Transcribe-1.5, и модель показала 2,4% ошибок на словах в независимом рейтинге Artificial Analysis. Одна модель покрывает 43 языка, справляется с акцентами и шумными переговорками и прогоняет час аудио меньше чем за пятнадцать секунд.
Теперь откройте документацию Microsoft по Azure для этой же модели. Среди примечаний к использованию есть строка: «Диаризация не поддерживается».
Диаризация — это то, что говорит вам, кто именно произнёс реплику. То есть самая обсуждаемая речевая модель года выдаёт почти безупречную стену слов, не имея ни малейшего представления, из чьих уст они прозвучали. Это не оплошность в примечаниях к релизу. Это точный снимок того, где на самом деле находится отрасль. Слышать научились почти идеально. А слышать никогда и не было сложной частью рабочей записи встречи.
Этот текст — о расстоянии между точной расшифровкой и записью, которую вы действительно отправите команде: что измеряет частота ошибок на словах, что она принципиально измерить не может и какие слои надстраиваются над распознаванием речи, тихо решая, окажется ли запись полезной. Если вам когда-нибудь возвращали расшифровку, технически безупречную и практически бесполезную, — вот объяснение этого ощущения.
TL;DR:
- Частота ошибок уже сбилась в плотную группу у нижней границы: девять лучших моделей независимого рейтинга Artificial Analysis укладываются в диапазон от 1,73% до 3,31%, так что переход на «более точный» движок выигрывает вам несколько десятков слов на часовой встрече.
- WER считает все слова одинаково важными. Потерянное «не» в решении стоит тех же 0,016%, что и проглоченное «э-э», — метрика не отличает опечатку от перевёрнутого обязательства.
- Оставшаяся работа находится над расшифровкой: определение говорящих, сегментация, очистка, резюмирование. Карточка модели самой Microsoft это и доказывает: точность высшего уровня, диаризации нет, стриминга нет.

Изображение: Steve Knight, Rockfield Studios, Wikimedia Commons, CC BY 2.0.
Что такое 2,4% на ощупь, когда читать приходится вам
Частота ошибок на словах — самое старое и самое грубое число в распознавании речи, и именно потому, что его цитируют повсюду, стоит разобраться точно. Берём то, что было сказано на самом деле, — эталонную расшифровку, сделанную людьми. Берём то, что написала модель. Затем считаем неверные слова трёх видов: замены (написала «задержка» там, где сказали «загрузка»), пропуски (слово исчезло целиком) и вставки (появилось слово, которого никто не произносил). Складываем, делим на число слов в эталоне — это и есть WER. Чем ниже, тем лучше.
Значит, 2,4% — это примерно одно неверное слово из сорока двух.
Приложим это к настоящей встрече. Час, из которого реально говорят минут сорок пять, в обычном разговорном темпе около 140 слов в минуту, даёт примерно 6300 слов. При WER 2,4% около 150 из них неверны. В пересчёте на текст это несколько ошибок на каждом экране.
И тут возникает вопрос, отвечать на который метрика отказывается: какие именно 150?
WER присваивает одинаковый вес каждому слову языка. Союз «и» и отрицание «не» стоят ровно одинаково. Представьте расшифровку, которая превращает «мы не выпускаем в третьем квартале» в «мы выпускаем в третьем квартале». Это один пропуск. Одно слово из 6300 — 0,016% расшифровки, погрешность округления на фоне бюджета в 2,4%. И запись теперь фиксирует ровно противоположное тому, что решила комната.
Та же асимметрия проходит через имена, кодовые обозначения продуктов и внутренние аббревиатуры — то есть через слова с наибольшей плотностью смысла на символ и наименьшей частотой в обучающих данных. Расшифровка может безошибочно взять 6150 слов соединительной ткани и изуродовать каждое имя собственное в комнате, а её WER по-прежнему будет выглядеть отлично. Тот, кто перечитывал расшифровку собственного стендапа, знает это ощущение: слова на месте, а встречи нет.
Рейтинг сбился в плотную группу у нижней границы
Именно этот пункт переосмысляет всю категорию. Мы посмотрели рейтинг speech-to-text от Artificial Analysis 4 августа 2026 года — это независимый бенчмарк, а не карточка вендора. Индекс AA-WER v2 представляет собой среднее, взвешенное по длительности аудио, примерно по восьми часам из трёх наборов данных: AA-AgentTalk (50%), VoxPopuli-Cleaned-AA (25%) и Earnings22-Cleaned-AA (25%). Вершина выглядит так:
| Место | Модель | AA-WER |
|---|---|---|
| 1 | Fun-Realtime-ASR-preview | 1,73% |
| 2 | Scribe v2 | 2,18% |
| 3 | MAI-Transcribe-1.5 | 2,38% |
| 4 | Smallest AI Pulse Pro | 2,43% |
| 5 | Voxtral Small | 2,77% |
| 6 | Gemini 3.1 Pro Preview (High) | 2,82% |
| 7 | Universal-3.5 Pro | 3,02% |
| 8 | Solaria-3 (Gladia) | 3,23% |
| 9 | GPT Transcribe | 3,31% |
| 11 | Whisper Large v3 | 4,07% |
Источник: рейтинг speech-to-text Artificial Analysis, данные получены 4 августа 2026 года (AA-WER v2, без стриминга).
Бросаются в глаза две вещи. Во-первых, 2,4% Microsoft реальны и измерены независимо — но это третье место, а не первое. Более сильное утверждение о лучшей в классе точности на FLEURS по всем 43 языкам исходит от самой Microsoft, поэтому читать его следует как цифру вендора, пока никто со стороны не проверил.
Во-вторых, и это куда важнее: девять моделей втиснуты в полосу шириной 1,6 процентного пункта. Вернёмся к нашей встрече на 6300 слов. Лидер рейтинга ошибается примерно в 109 словах. Девятая модель — примерно в 209. Whisper Large v3, открытая база, на которой до сих пор работает огромное количество продуктов, — примерно в 256.
Подумайте, что это значит для решения о закупке. Переход со среднего движка на лидера экономит вам около сотни слов в час. Это не пустяк, и в медицинской или юридической расшифровке действительно важно. Но это очень далеко от разницы между записью, которой вы доверяете, и записью, которую переписываете с нуля. Любой серьёзный движок сегодня выдаёт больше 96% точности. Переменная, определяющая полезность вашей записи встречи, находится совсем в другом месте.
Примечания к релизу Microsoft — самый честный документ в категории
Что возвращает нас к строке, с которой всё началось. Документация Azure Speech буднично перечисляет ограничения MAI-Transcribe: диаризация не поддерживается, настройка через промпт не поддерживается, а сама модель работает в публичном превью через LLM Speech API. Обзоры запуска добавляют, что нативного стримингового API тоже нет, что ограничивает применение в реальном времени.
Всмотритесь в форму этого набора. Компания вложила колоссальные инженерные усилия в задачу слышать — 43 языка против 25 в прошлом поколении, причём 18 новых добавлены без потери точности. И выпустила это без меток говорящих и без стриминга. То есть ровно без того, что нужно живой встрече.
Наша трактовка: это не пробел в продукте Microsoft, это заявление о слоистой структуре всей области. Распознавание сегодня — компонент, а не продукт. Оно стало тем, что покупают, замеряют и заменяют, а интересная работа переехала во всё, что его окружает.
Потолок стенографиста
Вот термин, которым мы пользуемся внутри команды: потолок стенографиста. Это точка, после которой более качественное слышание перестаёт помогать, потому что оставшаяся работа — это уже не слышание.
Идеальный стенографист даёт идеальную запись слов. Он не скажет вам, что два «да, конечно» произнесли разные люди и вкладывали в них разное. Он не отметит, где закончилась одна тема. И не подскажет, что двадцати минутам про переезд офиса в записи вообще не место. Над расшифровкой живут четыре отдельных слоя, и каждый ломается по-своему.
Определение говорящих, то есть диаризация. Это механика, которая разбивает единый аудиопоток на «говорящий 1, говорящий 2, говорящий 3» и удерживает эти метки стабильными на протяжении часа. Это по-настоящему отдельная от распознавания задача со своими режимами отказа: двое говорят одновременно, кто-то подключается на середине, один и тот же участник звучит по-разному со спикерфона и с гарнитуры. И когда она отказывает, отказ разрушителен. Расшифровка, приписавшая обязательство не тому человеку, хуже той, которая не приписала его никому, потому что читатель ей поверит. И именно эту способность модель с лучшим результатом не поставляет.
Сегментация. Сырой вывод распознавания — это река. Настоящая речь приходит не предложениями, а перезапусками, оборванными придаточными и перебиваниями. Система должна решить, где заканчиваются предложения, где завершается реплика одного участника и где разговор сменил тему. Ошибётесь — получите технически точный абзац, который никто не прочитает, потому что глазу не за что зацепиться. Сделаете правильно — те же самые слова станут пригодными для беглого чтения. В WER от этого улучшения не отражается ни один символ.
Очистка. Между сырой расшифровкой и записью есть проход уборки: убрать слова-паразиты и фальстарты, привести к единому виду числа и даты, исправить терминологию, которую акустическая модель знать не могла. «Третий квартал» превращается в «Q3». Внутреннее кодовое имя, вышедшее в виде трёх правдоподобных обычных слов, возвращается на место. Это слой, куда входит предметное знание, и именно он отделяет документ, читающийся как судебный протокол, от документа, читающегося как заметки.
Резюмирование. Наконец, оценка: какие части часа были решениями, какие — открытыми вопросами, какие — назначением работы на конкретного человека, а какие — двадцатью минутами про парковку. Это единственный слой, который большинство читателей действительно потребляет, и он полностью зависит от трёх предыдущих. Модуль резюмирования, работающий с нераспределённой и несегментированной расшифровкой, угадывает, кто и что пообещал. Дайте ему чистые реплики — и он перестанет угадывать.
Зависимость идёт в одну сторону, и именно поэтому разговор о точности так сбивает с толку. Улучшение WER с 2,4% до 1,7% улучшает вход цепочки из четырёх шагов, которые вообще никогда не измерялись.
Смещение по ключевым словам — это отрасль, тихо признающая нашу правоту
В релизе MAI-Transcribe-1.5 есть функция, которая раскрывает весь расклад, — и она же самое полезное во всём запуске.
Модель поддерживает смещение по ключевым словам, оно же смещение по сущностям: вы передаёте список до 200 предметных терминов — имена участников, названия продуктов, внутренние аббревиатуры, — и модель склоняет свои предсказания к этому списку, опираясь на окружающий контекст при решении, когда смещение применять, а не подгоняя совпадения вслепую. Microsoft сообщает о снижении WER на FLEURS до 30% при включённом смещении. Опубликованный пример очень конкретен: без списка ключевых слов три имени выходят как «Sean», «Oif» и «Societal». Со списком модель восстанавливает «Shaun», «Aoife» и «Xochitl».
Присмотритесь, что здесь произошло. Аудио не изменилось. Акустика не улучшилась. Модель раньше не слышала хуже — она слышала прекрасно и угадывала неверно, потому что не знала, кто в комнате. Передайте ей список участников — и почти треть ошибок испаряется.
Это и есть весь тезис этого текста, поставленный в виде продуктовой функции вендором с лучшей по баллам моделью. Самое результативное улучшение точности в главном релизе года работает за счёт вброса информации, которой в аудио никогда не было. А значит, оставшийся рубеж в расшифровке не акустический. Он контекстный — и контекст ровно тот материал, из которого сделаны слои над расшифровкой.
Тем временем все бегут захватывать больше аудио
Рынок железа пришёл к противоположному выводу, и это стоит отметить. Очки GO3 от INMO за 599 долларов обещают перевод в реальном времени более чем на 98 языков прямо на линзе, а также автоматическую запись, расшифровку и резюмирование каждого разговора и каждой встречи — на базе ChatGPT и Gemini. Всё это заявления самого производителя на странице продукта, и амбиция понятна: захватывать всё, везде, без рук.
Вот только захват никогда не был узким местом. Телефон на столе уже десять лет записывает встречи достаточно хорошо. Сделать захват более фоновым — значит лишь увеличить объём аудио, который вливается в ровно тот же нерешённый конвейер. Скорее наоборот, проблема заостряется: устройство, записывающее все ваши разговоры за день, производит куда больше материала, к которому нужно применить решение о том, что здесь важно.
Что стоит протестировать вместо чтения цифры WER
Если вы выбираете инструмент расшифровки или ведения записей встреч, опубликованная цифра точности кандидатов не разделит — все они укладываются в пару пунктов. А три теста разделят.
Запишите настоящую встречу минимум с тремя участниками и отрезком, где люди действительно говорят одновременно, а затем проверьте, остаются ли метки говорящих согласованными с пятой минуты по пятидесятую: именно там диаризация незаметно деградирует. Дальше возьмите решение, сформулированное с отрицанием («в этом квартале мы миграцию не делаем»), и поищите его в резюме; система, которая переворачивает или теряет отрицания, выдаст себя здесь. Наконец, сравните резюме с собственной памятью о встрече и посчитайте две вещи по отдельности: что попало в него зря и что важное было упущено. Второе число никто не публикует, и именно оно определяет, будете ли вы пользоваться инструментом через три месяца.
Итог
Частота ошибок на словах отвечала на вопрос «расслышала ли машина слова?» — и отрасль на него уже ответила. Ни один рейтинг никогда не отвечал на другой вопрос: «говорит ли это мне, что было решено на встрече?»
Это разные вопросы, и по-настоящему важен всегда был только один. Расшифровка — это запись звука. Рабочая запись встречи — это запись решения. Расстояние между ними не измеряется в процентных пунктах и не сокращается ни лучшим микрофоном, ни более низким WER. Оно сокращается всем, что вы строите сверху: знанием, кто говорил, где закончилась мысль, какие слова были шумом и какие три предложения из целого часа были той причиной, ради которой встречу вообще собрали.
Расшифровка никогда не была результатом. Она была сырьём.
Именно так мы и строим Telli.sh: распознавание речи — один компонент, а работа, которую мы считаем продуктом, находится над ним: разделение говорящих, сегментация, очистка и резюме, отделяющие решения от болтовни, на 15 языках. Если хотите увидеть разницу между расшифровкой и рабочей записью на собственной встрече, запишите одну и прочитайте результат через несколько минут.
Источники
- MAI-Transcribe in Azure Speech (preview) — Microsoft Learn — список ограничений, включая «диаризация не поддерживается»
- Microsoft AI Introduces MAI-Transcribe-1.5 — MarkTechPost, 8 июня 2026
- Introducing MAI-Transcribe-1.5 — Microsoft AI
- Рейтинг speech-to-text Artificial Analysis — значения AA-WER v2, получены 4 августа 2026 года
- Страница продукта INMO GO3 — заявления производителя о функциях перевода и расшифровки
- Страница изображения на Wikimedia Commons