Распознавание речи тихо стало открытым — и весит 1,56 ГБ
Модели Qwen3-ASR от Alibaba выпущены под Apache 2.0, покрывают 52 языка и диалекта и весят меньше двух гигабайт. Понятный разбор слоя открытых моделей транскрибации: что уже есть, что реально даёт запуск модели на своём ноутбуке и где закрытые API по-прежнему выигрывают.
У команды Qwen из Alibaba на Hugging Face лежат три модели распознавания речи, о которых почти никто не написал. Qwen3-ASR-0.6B, Qwen3-ASR-1.7B и сопутствующая Qwen3-ForcedAligner-0.6B — все под лицензией Apache 2.0. Самая маленькая весит 1,56 ГБ, справляется с 52 языками и диалектами, а с 26 июня запускается тремя строками обычного Python. Вы кладёте её на машину, которая у вас уже есть, и никто не может выставить вам счёт.
Закономерность видна невооружённым глазом, потому что мы это уже проходили. Большие языковые модели весь 2023-й и 2024-й были тем, что арендуют через API, а потом появился слой открытых весов и стал выбором по умолчанию для всех, кому важны стоимость, приватность или работа без сети. Транскрибация идёт тем же путём, примерно на два года позже.
Эта статья — карта такого сдвига для тех, кто не следит за релизами моделей по долгу службы: что такое открытая речевая модель, какие есть прямо сейчас и под какой лицензией, что на практике даёт «0.6B на ноутбуке» и — та часть, которую пропускает большинство публикаций, — где закрытые размещённые API по-прежнему уверенно впереди.
TL;DR:
- Открытая транскрибация уже пригодна к работе: Qwen3-ASR под Apache 2.0 с 52 языками и диалектами, Whisper под MIT, Parakeet и Canary от NVIDIA под CC BY 4.0, Voxtral от Mistral под Apache 2.0.
- Собственный хостинг даёт приватность, автономную работу и контроль над расходами. По независимому рейтингу Artificial Analysis, размещение открытой модели стоит 1,50 доллара за 1000 минут против 6,00 у Microsoft MAI-Transcribe-1.5 и 18,15 у Gemini 3.1 Pro Preview.
- Первое место по точности всё ещё занимает закрытая предварительная точка доступа. Но открытая модель под Apache 2.0, Voxtral Small, уже на пятом месте — примерно в одном процентном пункте по доле ошибочных слов.

Изображение: Aaron Parecki, Wikimedia Commons, CC BY 2.0. Осциллограмма и спектрограмма фразы «it rains a lot in Portland», буквы расставлены над теми участками звука, которым соответствуют, — именно с таким сырьём работает любая модель распознавания речи.
Что вы на самом деле скачиваете, когда скачиваете модель транскрибации
Модель ASR — автоматическое распознавание речи, то же самое, что STT, речь в текст, — это программа, которая принимает звук и выдаёт текст. Вся её работа в этом. Она не решает, кто говорил, не резюмирует, не знает, о чём была ваша встреча. Она слышит слова и записывает их.
«Открытые веса» означают, что лаборатория опубликовала сам файл готовой модели. Веса модели — это огромная сетка чисел, выученная при обучении, и их публикация означает, что вы скачиваете этот файл, запускаете на своём железе и строите поверх, ни у кого не спрашивая разрешения и не платя за каждый запрос. Альтернатива — закрытая модель: веса остаются на серверах поставщика, а вы арендуете доступ через API — звук уходит наверх, текст возвращается, счёт идёт по минутам.
Число в названии — количество параметров, и для речевых моделей оно необычайно осязаемо. «0.6B» значит около 600 миллионов параметров, а на практике это делает Qwen3-ASR-0.6B файлом на 1,56 ГБ, а Qwen3-ASR-1.7B — на 4,08 ГБ. Оба достаточно малы, чтобы лежать на SSD ноутбука незаметно. Сравните с открытыми языковыми моделями из нашего обзора китайской волны, где главный релиз занимал 1,56 терабайта в 96 частях, и кластер требовался только чтобы его загрузить. Речевые модели примерно в тысячу раз меньше передовых текстовых, и один этот факт объясняет, почему здесь сдвиг бьёт сильнее, чем там.
Вот термин, которым мы будем пользоваться дальше: ноутбучный класс. Это категория моделей, где вопрос о железе попросту исчезает — где «смогу ли я это запустить?» перестаёт быть разговором о бюджете и становится скачиванием. Текстовые модели в основном сюда не входят. Речевые входят почти все.
Ещё одна строка, которую стоит прочесть раньше любых бенчмарков, — лицензия. Apache 2.0 и MIT — свободный край: используйте, меняйте, встраивайте в коммерческий продукт, ничего не должны. CC BY 4.0, которую применяет NVIDIA, тоже допускает коммерческое использование, но требует указания авторства.
Qwen выпустила семейство в январе; лёгким оно стало в июне
Теперь о релизе, из-за которого написан этот текст, — с поправкой к тому, как его описывали. Семейство Qwen3-ASR появилось не в июне. Исходные репозитории выложили 28 января 2026 года, а технический отчёт лёг на arXiv на следующий день. 26 июня произошло другое: Qwen опубликовала -hf-версии всех трёх моделей — контрольные точки, которые работают в Hugging Face Transformers начиная с версии 5.13.0 без обвязки.
Звучит как сноска, но это не сноска. Раньше запустить модель означало поставить собственный пакет qwen-asr или бэкенд vLLM и освоить их инструментарий. Теперь это три строки стандартного Python, знакомые любому, кто хоть раз трогал Transformers. Барьер, из-за которого большинство открытых моделей остаются неиспользованными, редко бывает самой моделью. Это сорок минут возни с окружением до первой расшифровки — и именно их стёрло 26 июня.
Характеристики взяты прямо из карточек моделей. Оба размера выполняют определение языка и распознавание речи для 30 языков — английский, китайский, корейский, японский, испанский, арабский, хинди, тайский, вьетнамский, польский и ещё двадцать — плюс 22 китайских диалекта, отсюда и цифра «52 языка и диалекта». Оба ведут потоковый и офлайновый вывод из одной модели, что встречается реже, чем кажется: многие модели транскрибации умеют что-то одно. Оба принимают длинный звук, а в карточке среди поддерживаемых типов аудио указаны пение и песни с фоновой музыкой.
На третьей модели стоит остановиться. Qwen3-ForcedAligner-0.6B выполняет принудительное выравнивание: дайте ей звук и расшифровку, и она отметит, где начинается и заканчивается каждое слово, с точностью до миллисекунды, для 11 языков и до пяти минут речи за раз. Это механика, стоящая за кликабельными расшифровками, таймингом субтитров и переходом к моменту, когда кто-то что-то сказал. Ровно это показывает изображение в начале статьи. Публиковать выравниватель вместе с распознавателем — сигнал о том, кому адресован релиз: не тем, кто запускает демо, а тем, кто строит продукты.
О качестве стоит различать, кто и что утверждает. Собственная карточка Qwen приводит цифры Hugging Face Open ASR Leaderboard с датой 26 июня 2026 года: средняя доля ошибочных слов 5,59 % у модели 1.7B и 6,31 % у 0.6B, на подмножестве совещательного аудио AMI — 9,26 % и 10,57 %. Доля ошибочных слов — это доля слов, в которых модель ошиблась, поэтому меньше значит лучше, а AMI здесь самая тяжёлая цифра, потому что настоящие совещания беспорядочны. Qwen также называет версию 1.7B «лучшей среди ASR-моделей с открытым исходным кодом» и конкурентной с коммерческими API — считайте это утверждением поставщика, пока кто-то вне Alibaba не измерит. И учтите: это другой бенчмарк, чем независимый рейтинг ниже, и другое аудио, так что два набора цифр между собой не сопоставимы.
Всё начал Whisper — и его же до сих пор запускают все
Ничего этого в нынешнем виде не было бы без Whisper от OpenAI. Репозиторий открыли 16 сентября 2022 года под лицензией MIT — код и веса вместе — в момент, когда серьёзное распознавание речи означало договор с облачным провайдером. С тех пор он набрал 106 679 звёзд на GitHub.
Важным Whisper сделал не столько сам модельный файл, сколько то, что сообщество надстроило поверх за считаные месяцы. whisper.cpp переписал его на чистом C и C++, лицензия MIT, 52 591 звезда, и заставил работать на ноутбуках и телефонах без Python и без GPU. faster-whisper пересобрал его на CTranslate2 с большим выигрышем по скорости и памяти, снова MIT, 24 750 звёзд. Модель была семенем; деревом стала экосистема.
Четыре года спустя это по-прежнему самая используемая речевая модель в мире. За последние 30 дней whisper-large-v3-turbo скачали с Hugging Face 8,72 миллиона раз, а whisper-large-v3 — 5,50 миллиона; цифры мы снимали 5 августа 2026 года. Qwen3-ASR-0.6B с 4,29 миллиона растёт быстро для полугодовалой модели, но значением по умолчанию, к которому отрасль тянется не задумываясь, остаётся Whisper. Точность его, впрочем, состарилась: в рейтинге Artificial Analysis у Whisper Large v3 показатель AA-WER 4,07 % против 1,73 % у нынешнего лидера. И всё же множество выпущенных продуктов работает на нём.
Открытый речевой слой пришёл двумя волнами с разрывом в три года, между которыми почти ничего. Даты публикации по GitHub и Hugging Face, снято 5 августа 2026 года.
Открытая сторона — это не одна лаборатория
Qwen не одинока, и остальные хороши в заметно разном.
Линейка Parakeet от NVIDIA — ставка на скорость. parakeet-tdt-0.6b-v3, вышедшая в августе 2025 года под CC BY 4.0, — модель на 600 миллионов параметров, охватывающая 25 европейских языков, со встроенными автоопределением языка, пунктуацией, регистром и пословными метками времени; за один проход она берёт до 24 минут звука. Семейство Canary от NVIDIA — canary-1b-v2 и canary-qwen-2.5b, тоже CC BY 4.0 — покрывает похожую территорию другими архитектурными ставками. Модели Voxtral от Mistral появились в июле 2025 года под Apache 2.0 и важны по причине, к которой мы сейчас перейдём.
Вот открытая сторона рядом друг с другом; в последней строке для контраста — размещённый API.
| Модель | Загрузка | Лицензия | Языки | Где работает | Сильна в |
|---|---|---|---|---|---|
| Whisper Large v3 | 3,09 ГБ | MIT | 99 | Ноутбук или одна GPU | Значение по умолчанию, которое уже все поддерживают |
| Qwen3-ASR-0.6B | 1,56 ГБ | Apache 2.0 | 52 с диалектами | Ноутбук | Многоязычность при наименьшем размере |
| Qwen3-ASR-1.7B | 4,08 ГБ | Apache 2.0 | 52 с диалектами | Ноутбук или одна GPU | Лучшая точность в семействе Qwen |
| Parakeet TDT 0.6B v3 | 2,51 ГБ | CC BY 4.0 | 25 европейских | Ноутбук или одна GPU | Скорость и пословные метки времени |
| Voxtral Small | — | Apache 2.0 | — | Серверная GPU, 24 млрд параметров | Лучший открытый результат в независимом рейтинге |
| Размещённый API | Скачать нельзя | Проприетарная | По-разному | Облако поставщика | Разделение говорящих, потоковая передача, доступность |
Размер загрузки — контрольная точка по умолчанию в соответствующем репозитории Hugging Face; «—» отмечает значение, которое мы не смогли подтвердить по первоисточнику. Снято 5 августа 2026 года.
Дальше идёт работа по упаковке, которая доводит эти модели до реальных устройств, — точка, где ноутбучный класс перестаёт быть теорией. whisperkit-coreml, то есть Whisper, скомпилированный под железо Apple, за последние 30 дней скачали 8,31 миллиона раз. Сборка Parakeet под Apple Silicon на MLX набрала 1,87 миллиона, а две конверсии в GGUF — квантованный формат, позволяющий запускать модели на обычных процессорах, — 2,04 и 1,87 миллиона. Миллионы людей ежемесячно скачивают распознавание речи, упакованное специально для запуска на собственной машине. Это не исследовательская диковинка. Это канал дистрибуции.
Первое место — по-прежнему предварительная точка доступа, которую не скачать
Здесь начинается честный подсчёт, и режет он в обе стороны.
Мы сняли рейтинг речь-в-текст Artificial Analysis 5 августа 2026 года — независимый бенчмарк, который меряет открытые и закрытые модели на одном и том же звуке, в отличие от рейтинга Hugging Face, где соревнуются только открытые. Верхушка индекса AA-WER:
| Место | Модель | AA-WER | Можно скачать? |
|---|---|---|---|
| 1 | Fun-Realtime-ASR-preview | 1,73 % | Нет — предварительная точка доступа |
| 2 | Scribe v2, ElevenLabs | 2,18 % | Нет — размещённый API |
| 3 | MAI-Transcribe-1.5, Microsoft | 2,38 % | Нет — размещённый API |
| 4 | Smallest AI Pulse Pro | 2,43 % | Нет — размещённый API |
| 5 | Voxtral Small, Mistral | 2,77 % | Да — Apache 2.0 |
| 6 | Gemini 3.1 Pro Preview, High | 2,82 % | Нет — размещённый API |
| 11 | Whisper Large v3 | 4,07 % | Да — MIT |
Источник: рейтинг речь-в-текст Artificial Analysis, AA-WER v2, снят 5 августа 2026 года. Доступность для скачивания определена по опубликованной лицензии каждой модели.
Сначала прочтите четыре верхние строки: они поправляют любой рассказ о том, что открытое победило. Речевые модели с лучшими оценками в мире — это то, что арендуют, а лидер даже не в общем доступе: это предварительная точка доступа.
Теперь прочтите пятую строку — она поправляет саму поправку. Voxtral Small выпущена под Apache 2.0. Её можно скачать, запустить на своём железе и поставлять в коммерческом продукте — и она стоит пятой в независимом рейтинге с 2,77 %, примерно в одном процентном пункте от закрытой предварительной модели. В пересчёте на часовое совещание из 6300 слов этот разрыв — около 66 слов. Он реален, но это далеко не та пропасть, которую обычно подразумевают.
Наша оценка: точная формулировка — не «открытый STT сильно отстаёт». Открытые речевые модели давно перешагнули порог достаточного качества для большинства задач, а оставшееся преимущество закрытой стороны — это один процентный пункт по ошибкам плюс продукт, обёрнутый вокруг. Что подводит нас к компромиссу, который и решает дело.
Что даёт запуск у себя и чего он стоит
К собственному хостингу команды толкают три вещи, и точность не входит ни в одну из них.
Первое — приватность, и обычно она решающая. Если вы расшифровываете врачебные приёмы, юридические интервью или кадровые беседы, «звук не покидает наше железо» — не предпочтение, а требование закупки, и только собственная модель выполняет его чисто. Второе — автономная работа: модель на устройстве работает в самолёте, в подвале, в цеху, на объекте без связи. Именно поэтому у whisper.cpp и сборок GGUF такие цифры скачиваний.
Третье — стоимость, и здесь цифры резкие. Из того же среза Artificial Analysis, цена за 1000 минут аудио: Whisper Large v3 на fal.ai — 0,50 доллара, Canary Qwen 2.5B от NVIDIA на Replicate — 0,74, Parakeet TDT 0.6B V3 на Together AI — 1,50. На закрытой стороне: Nova-3 от Deepgram — 4,30, MAI-Transcribe-1.5 — 6,00, Gemini 3.1 Pro Preview — 18,15. Это четырёхкратный разрыв с Microsoft и двенадцатикратный с Google — и это лишь за размещение открытой модели на чужих серверах, до того как рассматривать запуск на своих, где предельная стоимость тысячного часа равна электричеству.
Скорость режет туда же, и это деталь, удивившая нас больше всего. Самая быстрая модель во всём рейтинге — Parakeet TDT 0.6B V3 на Together AI, 885-кратная скорость относительно реального времени: час аудио возвращается примерно за четыре секунды. Nova-3 от Deepgram выдаёт 512x, Whisper Large v3 на Together — 478x, MAI-Transcribe-1.5 — 189x. Самый быстрый доступный вариант транскрибации — открытая модель на 600 миллионов параметров, которую может скачать кто угодно.
Выбор никогда не стоял между точностью и точностью. Он стоит между контролем и стоимостью с одной стороны и функциями вокруг распознавания с другой.
Так что же тогда продают размещённые API? Всё, что не является распознаванием. Документация Deepgram — честная опись: разделение по говорящим, потоковая передача в реальном времени, форматирование, пользовательский словарь, маскирование сущностей, определение языка и эксплуатационная гарантия, что сервис жив, пока вы спите. Скачайте Qwen3-ASR — получите слова и метки времени. Никаких меток говорящих, никакого SLA, а счёт за GPU, масштабирование и звонок в три часа ночи — ваши.
Самая скачиваемая модель категории вовсе не транскрибирует
Одна цифра связывает всё это воедино, и мы её не ожидали.
Если отсортировать всю категорию автоматического распознавания речи на Hugging Face по скачиваниям, наверху окажется не Whisper, не Qwen и не Parakeet. Это pyannote/speaker-diarization-3.1 с 8,91 миллиона скачиваний за последние 30 дней, а вторая модель разделения по говорящим от pyannote занимает пятое место с 5,26 миллиона. Разделение по говорящим — это механика, определяющая, кто и когда говорил, то есть слой прямо над транскрибацией.
Открытые веса теперь покрывают два нижних слоя. Слои, которые решают, полезна ли заметка, лежат выше.
Самая востребованная модель в категории распознавания речи речь не распознаёт. Она отвечает на вопрос, который распознаватели оставляют без ответа, — тот же вывод, к которому мы пришли со стороны закрытого рынка, когда модель с лучшим в мире результатом вышла без меток говорящих. Две совершенно разные точки обзора и один и тот же итог: расслышать слова — это уже решённая часть.
Итог
Интересный вопрос об открытом распознавании речи никогда не звучал как «не хуже ли оно закрытых моделей». Оно примерно в одном процентном пункте по ошибкам, оно быстрее, оно в четыре-двенадцать раз дешевле и помещается на ноутбуке. Интересный вопрос в том, что вы построите в пространстве, которое открывается, когда транскрибация перестаёт быть арендованной статьёй расходов, — потому что файл на 1,56 ГБ, слышащий 52 языка, не продукт. Это деталь, которая только что стала бесплатной.
Для команды, выбирающей инструмент для заметок со встреч, а не модель, практический вывод короток. Работает продукт на открытой модели или на закрытом API — сегодня это по большей части деталь реализации, и всё чаще будет и то и другое: открытые веса для массовой работы, размещённые API там, где разделение по говорящим, потоковая передача и масштаб оправдывают цену. Telli.sh уже использует открытую модель в слое резюмирования, поэтому улучшения на открытой стороне попадают прямиком в транскрибацию, перевод и заметки со встреч без изменения цены. Судите об инструменте по тому, что выходит в конце: говорит ли заметка, кто и что взял на себя.
Источники
- Карточка модели Qwen3-ASR-0.6B-hf (Hugging Face) — лицензия, список языков, показатели рейтинга на 26 июня 2026 года
- Карточка модели Qwen3-ASR-1.7B-hf (Hugging Face)
- Qwen3-ForcedAligner-0.6B (Hugging Face)
- Qwen3-ASR Technical Report, arXiv:2601.21337 (подан 29 января 2026 года)
- Репозиторий OpenAI Whisper (MIT, опубликован 16 сентября 2022 года)
- whisper.cpp и faster-whisper
- Карточка модели NVIDIA parakeet-tdt-0.6b-v3 (CC BY 4.0)
- Mistral Voxtral-Small-24B-2507 (Apache 2.0)
- Рейтинг речь-в-текст Artificial Analysis — AA-WER v2, данные по скорости и цене сняты 5 августа 2026 года
- Hugging Face Open ASR Leaderboard
- Документация Deepgram по разделению говорящих
- Страница изображения на Wikimedia Commons