speech-to-text16 min de lectura

El reconocimiento de voz se volvió open weight en silencio — y cabe en 1,56 GB

Los modelos Qwen3-ASR de Alibaba son Apache 2.0, cubren 52 idiomas y dialectos y pesan menos de dos gigabytes. Una guía en lenguaje llano de la capa de transcripción open weight: qué existe, qué te da realmente ejecutar un modelo en tu propio portátil y dónde siguen ganando las API cerradas.

T
Telli.sh Team
#speech-to-text#open-weight#qwen3-asr#whisper#parakeet#transcription#self-hosting#ai-models

El equipo Qwen de Alibaba tiene tres modelos de reconocimiento de voz alojados en Hugging Face sobre los que casi nadie escribió. Qwen3-ASR-0.6B, Qwen3-ASR-1.7B y un compañero llamado Qwen3-ForcedAligner-0.6B, todos bajo licencia Apache 2.0. El más pequeño es una descarga de 1,56 GB, maneja 52 idiomas y dialectos y, desde el 26 de junio, se ejecuta en tres líneas de Python estándar. Lo pones en una máquina que ya tienes y nadie puede enviarte una factura por ello.

El patrón cuesta poco de ver, porque ya lo vimos desarrollarse una vez. Los grandes modelos de lenguaje pasaron 2023 y 2024 siendo cosas que se alquilaban por API, y entonces llegó la capa open weight y se convirtió en la opción por defecto para quien se preocupaba por el coste, la privacidad o poder trabajar sin conexión. La transcripción está haciendo lo mismo, unos dos años después.

Este artículo es un mapa de ese cambio para quienes no siguen los lanzamientos de modelos a diario: qué es un modelo de voz open weight, cuáles existen ahora mismo y bajo qué licencia, qué da en la práctica «0.6B en tu portátil» y —la parte que casi toda la cobertura se salta— dónde siguen ganando con claridad las API cerradas alojadas.

TL;DR:

  • La transcripción open weight ya es utilizable: Qwen3-ASR con Apache 2.0 y 52 idiomas y dialectos, Whisper con MIT, Parakeet y Canary de NVIDIA con CC BY 4.0, Voxtral de Mistral con Apache 2.0.
  • Autoalojarlo aporta privacidad, funcionamiento sin conexión y control de costes. En la tabla independiente de Artificial Analysis, alojar un modelo abierto cuesta 1,50 dólares por cada 1.000 minutos, frente a 6,00 de MAI-Transcribe-1.5 de Microsoft y 18,15 de Gemini 3.1 Pro Preview.
  • El primer puesto en precisión sigue siendo un endpoint cerrado en vista previa. Pero un modelo abierto con Apache 2.0, Voxtral Small, ya ocupa el quinto lugar, a alrededor de un punto de tasa de error de palabra.

Forma de onda y espectrograma de una frase hablada, con cada palabra alineada sobre su tramo de audio

Imagen: Aaron Parecki, Wikimedia Commons, CC BY 2.0. Forma de onda y espectrograma de la frase «it rains a lot in Portland», con las letras colocadas sobre el audio al que corresponden: esta es exactamente la materia prima con la que trabaja todo modelo de reconocimiento de voz.

Qué descargas en realidad cuando descargas un transcriptor

Un modelo ASR —reconocimiento automático del habla, que se usa indistintamente con STT, voz a texto— es un programa que recibe audio y produce texto. Ese es todo su trabajo. No decide quién habló, no resume, no sabe de qué iba tu reunión. Oye palabras y las escribe.

«Open weights» significa que el laboratorio publicó el archivo del modelo terminado. Los pesos de un modelo son la enorme rejilla de números que aprendió durante el entrenamiento, y publicarlos significa que puedes descargar ese archivo, ejecutarlo en tu propio hardware y construir sobre él sin pedir permiso ni pagar por petición. La alternativa es un modelo cerrado: los pesos se quedan en los servidores del proveedor y tú alquilas el acceso mediante una API —el audio sube, el texto vuelve y se factura por minutos.

El número del nombre es el recuento de parámetros y, en los modelos de voz, resulta inusualmente tangible. «0.6B» significa unos 600 millones de parámetros, lo que en la práctica convierte a Qwen3-ASR-0.6B en un archivo de 1,56 GB y a Qwen3-ASR-1.7B en uno de 4,08 GB: ambos lo bastante pequeños como para vivir en el SSD de un portátil sin que nadie se entere. Compáralo con los modelos de lenguaje abiertos de nuestro repaso a China, donde el lanzamiento estrella eran 1,56 terabytes repartidos en 96 fragmentos y hacía falta un clúster solo para cargarlo. Los modelos de voz son unas mil veces más pequeños que los modelos de texto de frontera, y ese solo hecho explica por qué este cambio golpea más fuerte aquí que allí.

Aquí va el término que usaremos en el resto del artículo: la categoría portátil. Es la clase de modelos en la que la pregunta del hardware sencillamente desaparece, donde «¿puedo ejecutar esto?» deja de ser una conversación de presupuesto y pasa a ser una descarga. Los modelos de texto en su mayoría no están ahí. Los de voz están casi todos.

Una línea más que conviene leer antes que cualquier benchmark: la licencia. Apache 2.0 y MIT son el extremo permisivo: úsalo, modifícalo, inclúyelo en un producto comercial, sin deber nada. CC BY 4.0, que emplea NVIDIA, también permite uso comercial pero exige atribución.

Qwen publicó la familia en enero; en junio fue cuando se volvió fácil

Vamos con el lanzamiento que motivó este artículo, con una corrección a cómo se ha contado. La familia Qwen3-ASR no apareció en junio. Los repositorios originales se publicaron el 28 de enero de 2026 y el informe técnico llegó a arXiv al día siguiente. Lo que ocurrió el 26 de junio es que Qwen publicó las versiones -hf de los tres modelos: puntos de control que funcionan de forma nativa en Hugging Face Transformers a partir de la versión 5.13.0.

Suena a nota al pie y no lo es. Antes, ejecutar el modelo implicaba instalar el paquete propio qwen-asr o un backend de vLLM y aprender una cadena de herramientas. Después son tres líneas de Python estándar que cualquier desarrollador que haya tocado Transformers ya conoce. La barrera que deja sin usar a la mayoría de los modelos abiertos rara vez es el modelo: son los cuarenta minutos de pelea con el entorno antes de la primera transcripción, y eso es lo que borró el 26 de junio.

Las especificaciones salen directamente de las fichas de modelo. Ambos tamaños hacen identificación de idioma y reconocimiento de voz en 30 idiomas —inglés, chino, coreano, japonés, español, árabe, hindi, tailandés, vietnamita, polaco y veinte más— más 22 dialectos chinos, y así se llega a la cifra de «52 idiomas y dialectos». Ambos hacen inferencia en streaming y sin conexión desde un único modelo, algo más raro de lo que parece: muchos modelos de transcripción hacen una cosa o la otra. Ambos aceptan audio largo, y la ficha incluye el canto y las canciones con música de fondo entre los tipos de audio admitidos.

El tercer modelo merece una pausa. Qwen3-ForcedAligner-0.6B hace alineamiento forzado: le das el audio y una transcripción y marca dónde empieza y termina cada palabra, con precisión de milisegundos, en 11 idiomas y hasta cinco minutos de habla por vez. Es la maquinaria que hay detrás de las transcripciones en las que puedes hacer clic, del ajuste de subtítulos y de saltar al momento en que alguien dijo algo. Es exactamente lo que muestra la imagen que abre este artículo. Publicar un alineador junto al reconocedor es una señal sobre a quién se dirige el lanzamiento: no a quien monta una demo, sino a quien construye productos.

Sobre la calidad, conviene separar quién afirma qué. La propia ficha de Qwen recoge cifras del Hugging Face Open ASR Leaderboard fechadas el 26 de junio de 2026: una tasa media de error de palabra del 5,59 % para el modelo de 1.7B y del 6,31 % para el de 0.6B, con el subconjunto de audio de reuniones AMI en 9,26 % y 10,57 %. La tasa de error de palabra es la proporción de palabras que el modelo falla, así que menos es mejor, y AMI es el número más duro porque las reuniones reales son desordenadas. Qwen también califica la versión 1.7B de «estado del arte entre los modelos ASR de código abierto» y competitiva con las API comerciales: trátalo como afirmación del fabricante hasta que alguien fuera de Alibaba lo mida. Y ojo: este es un benchmark distinto del ranking independiente que vemos más abajo, con audio distinto, así que las dos series de cifras no se pueden comparar entre sí.

Whisper empezó todo esto y sigue siendo el modelo que todos ejecutan

Nada de esto existiría con esta forma sin Whisper, de OpenAI. El repositorio se hizo público el 16 de septiembre de 2022 bajo licencia MIT —código y pesos juntos—, en un momento en que el reconocimiento de voz serio significaba un contrato con un proveedor de nube. Desde entonces ha acumulado 106.679 estrellas en GitHub.

Lo que hizo importante a Whisper fue menos el modelo que lo que la comunidad construyó encima en cuestión de meses. whisper.cpp lo reimplementó en C y C++ puros, con licencia MIT, 52.591 estrellas, y consiguió que funcionara en portátiles y teléfonos sin Python y sin GPU. faster-whisper lo reconstruyó sobre CTranslate2 con una gran mejora de velocidad y memoria, MIT también, 24.750 estrellas. El modelo era la semilla; el ecosistema, el árbol.

Cuatro años después sigue siendo el modelo de voz más usado del mundo. En los últimos 30 días, whisper-large-v3-turbo se descargó 8,72 millones de veces desde Hugging Face y whisper-large-v3 5,50 millones: cifras consultadas el 5 de agosto de 2026. Qwen3-ASR-0.6B, con 4,29 millones, sube rápido para un modelo de seis meses, pero Whisper sigue siendo la opción por defecto a la que el sector echa mano sin pensarlo. Eso sí, su precisión ha envejecido: en la tabla de Artificial Analysis, Whisper Large v3 marca un AA-WER del 4,07 % frente al 1,73 % del líder actual. Y aun así, muchísimos productos en producción lo ejecutan.

Cronología de los modelos abiertos de reconocimiento de voz, de Whisper en septiembre de 2022 a Qwen3-ASR en 2026

La capa de voz abierta llegó en dos oleadas separadas por tres años, con casi nada en medio. Fechas de publicación de GitHub y Hugging Face, consultadas el 5 de agosto de 2026.

El lado abierto es más que un laboratorio

Qwen no está solo, y los demás destacan en cosas claramente distintas.

La línea Parakeet de NVIDIA apuesta por la velocidad. parakeet-tdt-0.6b-v3, publicado en agosto de 2025 con CC BY 4.0, es un modelo de 600 millones de parámetros que cubre 25 idiomas europeos con detección automática de idioma, puntuación, mayúsculas y marcas de tiempo por palabra de serie, y procesa hasta 24 minutos de audio de una sola pasada. La familia Canary de NVIDIA —canary-1b-v2 y canary-qwen-2.5b, también CC BY 4.0— cubre terreno parecido con otras apuestas de arquitectura. Los modelos Voxtral de Mistral llegaron en julio de 2025 con Apache 2.0 e importan por un motivo al que llegamos enseguida.

Este es el lado abierto en paralelo, con una API alojada en la última fila a modo de contraste.

ModeloDescargaLicenciaIdiomasCorre enMejor para
Whisper Large v33,09 GBMIT99Portátil o una GPUSer el valor por defecto que ya soporta todo
Qwen3-ASR-0.6B1,56 GBApache 2.052 con dialectosPortátilMultilingüe en el tamaño más pequeño
Qwen3-ASR-1.7B4,08 GBApache 2.052 con dialectosPortátil o una GPULa mejor precisión de la familia Qwen
Parakeet TDT 0.6B v32,51 GBCC BY 4.025 europeosPortátil o una GPUVelocidad y marcas de tiempo por palabra
Voxtral SmallApache 2.0GPU de servidor, 24.000 M de parámetrosLa mejor puntuación abierta de la tabla independiente
API alojadaNo descargablePropietarioVariableLa nube del proveedorDiarización, streaming, disponibilidad

El tamaño de descarga corresponde al punto de control por defecto de cada repositorio de Hugging Face; «—» marca un valor que no pudimos confirmar en una fuente primaria. Consultado el 5 de agosto de 2026.

Luego está el trabajo de empaquetado que lleva estos modelos a dispositivos reales, el punto donde la categoría portátil deja de ser teórica. whisperkit-coreml —Whisper compilado para hardware de Apple— se descargó 8,31 millones de veces en los últimos 30 días. Una compilación MLX de Parakeet para Apple Silicon sumó 1,87 millones, y dos conversiones GGUF —el formato cuantizado que permite ejecutar modelos en CPU corrientes— 2,04 y 1,87 millones. Millones de personas al mes descargan reconocimiento de voz empaquetado específicamente para funcionar en su propia máquina. No es una curiosidad de investigación. Es un canal de distribución.

El primer puesto sigue siendo un endpoint en vista previa que no puedes descargar

Aquí empieza la contabilidad honesta, y corta por los dos lados.

Consultamos la tabla de voz a texto de Artificial Analysis el 5 de agosto de 2026: un benchmark independiente que mide modelos abiertos y cerrados sobre el mismo audio, a diferencia del ranking de Hugging Face, que es cosa de modelos abiertos. La cabeza del índice AA-WER:

PuestoModeloAA-WER¿Descargable?
1Fun-Realtime-ASR-preview1,73 %No — endpoint en vista previa
2Scribe v2, ElevenLabs2,18 %No — API alojada
3MAI-Transcribe-1.5, Microsoft2,38 %No — API alojada
4Smallest AI Pulse Pro2,43 %No — API alojada
5Voxtral Small, Mistral2,77 %Sí — Apache 2.0
6Gemini 3.1 Pro Preview, High2,82 %No — API alojada
11Whisper Large v34,07 %Sí — MIT

Fuente: ranking de voz a texto de Artificial Analysis, AA-WER v2, consultado el 5 de agosto de 2026. La disponibilidad para descarga se deduce de la licencia publicada de cada modelo.

Lee primero las cuatro filas de arriba, porque corrigen cualquier relato según el cual lo abierto ya habría ganado. Los modelos de voz con mejor puntuación del mundo son cosas que se alquilan, y el líder ni siquiera está disponible con carácter general: es un endpoint en vista previa.

Ahora lee la quinta fila, porque corrige la corrección. Voxtral Small es Apache 2.0. Puedes descargarlo, ejecutarlo en tu hardware y comercializarlo, y ocupa el quinto puesto de una tabla independiente con un 2,77 %, a alrededor de un punto de tasa de error de palabra de un modelo cerrado en vista previa. Llevado a una reunión de una hora y 6.300 palabras, esa diferencia son unas 66 palabras. Real, pero muy lejos del abismo que sugiere el relato habitual.

Nuestra lectura: el resumen exacto no es «el STT abierto está muy por detrás». Los modelos de voz abiertos superaron hace tiempo el umbral de lo suficientemente bueno para la mayoría de los trabajos, y la ventaja que le queda al lado cerrado es un punto de tasa de error de palabra más el producto que lo envuelve. Lo que nos lleva al compromiso que de verdad decide.

Qué te da ejecutarlo tú y qué te cuesta

Hay tres cosas que empujan a los equipos al autoalojamiento, y ninguna es la precisión.

La privacidad es la primera y suele ser la decisiva. Si transcribes consultas médicas, entrevistas jurídicas o conversaciones de recursos humanos, «el audio no sale de nuestro hardware» no es una preferencia, es un requisito de compra, y un modelo alojado por ti es la única arquitectura que lo cumple limpiamente. El funcionamiento sin conexión es la segunda: un modelo en el dispositivo funciona en un avión, en un sótano, en una nave industrial, en un emplazamiento sin cobertura. Por eso exactamente whisper.cpp y las compilaciones GGUF tienen las cifras de descarga que tienen.

El coste es la tercera, y aquí los números son descarnados. De la misma instantánea de Artificial Analysis, precio por cada 1.000 minutos de audio: Whisper Large v3 alojado en fal.ai cuesta 0,50 dólares, Canary Qwen 2.5B de NVIDIA en Replicate 0,74, y Parakeet TDT 0.6B V3 en Together AI 1,50. En el lado cerrado, Nova-3 de Deepgram está en 4,30, MAI-Transcribe-1.5 en 6,00 y Gemini 3.1 Pro Preview en 18,15. Eso es un factor de 4 frente a Microsoft y de 12 frente a Google solo por alojar un modelo abierto en servidores ajenos, antes de plantearte ejecutarlo en los tuyos, donde el coste marginal de la milésima hora es electricidad.

La velocidad corta en la misma dirección, y este es el detalle que más nos sorprendió. El modelo más rápido de toda la tabla es Parakeet TDT 0.6B V3 servido en Together AI, a 885 veces el tiempo real: una hora de audio vuelve en unos cuatro segundos. Nova-3 de Deepgram llega a 512x, Whisper Large v3 en Together a 478x y MAI-Transcribe-1.5 a 189x. La opción de transcripción más rápida disponible es un modelo open weight de 600 millones de parámetros que cualquiera puede descargar.

Comparación en dos columnas entre autoalojar pesos abiertos y usar una API de transcripción alojada

El dilema nunca fue precisión contra precisión. Es control y coste contra las funciones que envuelven al reconocimiento.

Entonces, ¿qué venden las API alojadas? Todo lo que no es reconocimiento. La documentación de Deepgram es un inventario honesto: diarización de hablantes, streaming en tiempo real, formateo, vocabulario personalizado, ocultación de entidades, detección de idioma y la garantía operativa de que sigue en pie mientras duermes. Si descargas Qwen3-ASR obtienes palabras y marcas de tiempo. Sin etiquetas de hablante, sin SLA, y tuyos son la factura de GPU, el escalado y la llamada de las tres de la madrugada.

El modelo más descargado de la categoría no es un transcriptor

Hay un dato que lo ata todo, y no lo esperábamos.

Cuando ordenas por descargas toda la categoría de reconocimiento automático del habla de Hugging Face, el modelo que encabeza la lista no es Whisper, ni Qwen, ni Parakeet. Es pyannote/speaker-diarization-3.1, con 8,91 millones de descargas en los últimos 30 días, y un segundo modelo de diarización de pyannote ocupa el quinto puesto con 5,26 millones. La diarización es la maquinaria que averigua quién habló y cuándo: la capa justo por encima de la transcripción.

Diagrama de la pila de transcripción, del audio a la nota de reunión, señalando qué capas tienen modelos abiertos

Los pesos abiertos ya cubren las dos primeras capas de la pila. Las que deciden si una nota sirve están por encima.

El modelo más buscado de la categoría de reconocimiento de voz no reconoce voz. Responde a una pregunta que los reconocedores dejan sin contestar, que es la misma conclusión a la que llegamos desde el lado cerrado del mercado, cuando el modelo con mejor puntuación del mundo salió sin etiquetas de hablante. Dos puntos de vista completamente distintos, el mismo hallazgo: oír las palabras es la parte resuelta.

En resumen

La pregunta interesante sobre el reconocimiento de voz open weight nunca fue «¿es tan bueno como los modelos cerrados?». Está a alrededor de un punto de tasa de error de palabra, es más rápido, cuesta entre cuatro y doce veces menos y cabe en un portátil. La pregunta interesante es qué construyes en el espacio que se abre cuando la transcripción deja de ser una partida que se alquila, porque un archivo de 1,56 GB que oye 52 idiomas no es un producto. Es un componente que acaba de volverse gratis.

Para un equipo que elige una herramienta de notas de reunión y no un modelo, la lectura práctica es corta. Que un producto ejecute un modelo abierto o una API cerrada es hoy en gran medida un detalle de implementación, y cada vez será las dos cosas: pesos abiertos para el grueso del trabajo y API alojadas donde la diarización, el streaming y la escala se ganan su precio. Telli.sh ya ejecuta un modelo abierto en su capa de resumen, así que las mejoras del lado abierto llegan directas a la transcripción, la traducción y las notas de reunión sin cambio de precio. Juzga la herramienta por lo que sale al final: si la nota te dice quién se comprometió a qué.

Empezar una nota IA en directo

Fuentes


Volver al blog