Un traductor en directo que responde en unos 2,3 segundos parece perfecto para una sala de reuniones. Qwen3.8-LiveTranslate ya está disponible, pero únicamente como API alojada de Alibaba Cloud/Model Studio; esos 2,3 segundos son una cifra oficial, no una medición independiente en producción. Y esa diferencia importa mucho a la hora de calcular costes y planificar el despliegue.
La decisión de compra, en 30 segundos
Usa Qwen3.8-LiveTranslate para un prototipo controlado si necesitas traducción de voz en streaming, subtítulos y salida de audio a través de una conexión en tiempo real. No tomes la latencia anunciada como una garantía para reuniones ruidosas, conversaciones con varios interlocutores hablando a la vez o cualquier combinación de idiomas: todavía hay pocas pruebas independientes sobre esta versión concreta.
El modelo encaja razonablemente bien en un servicio backend capaz de mantener la clave de API protegida y de asumir una configuración de Alibaba Cloud específica para cada región. En cambio, no es la opción adecuada si necesitas pesos descargables, una oferta madura de proveedores externos o benchmarks de precisión consolidados antes de definir los requisitos de producción.
Qué está disponible realmente
El ID exacto del modelo alojado es qwen3.8-livetranslate-flash-realtime. La documentación oficial de Alibaba Cloud y el registro de cambios de Model Studio lo presentan como un servicio en tiempo real lanzado el 17 de septiembre de 2026. La página oficial del modelo indica que reconoce 60 idiomas de entrada y ofrece salida hablada en 29 idiomas.
| Pregunta | Respuesta actual |
|---|---|
| ¿Está disponible? | Sí, como modelo accesible mediante API alojada |
| ID del modelo | qwen3.8-livetranslate-flash-realtime |
| Transporte principal | API en tiempo real, incluido WebSocket |
| Entrada | Audio y contexto de imagen |
| Salida | Texto y audio, según la configuración de la sesión |
| Latencia anunciada oficialmente | Unos 2,3 segundos de extremo a extremo |
| Pesos abiertos | No se ha encontrado evidencia oficial |
Por tanto, estamos ante un lanzamiento más concreto que un simple adelanto de producto, pero eso no lo convierte en un modelo abierto descargable. La documentación oficial plantea el acceso a la inferencia a través de Model Studio, no mediante checkpoints locales.
Calcula el coste antes de escribir código
Para el despliegue internacional/Singapur, la tarifa oficial separa cuatro categorías facturables. Los precios indicados corresponden a un millón de tokens:
| Métrica | Precio oficial |
|---|---|
| Entrada de audio | $7.50 / 1M tokens |
| Entrada de imagen | $0.55 / 1M tokens |
| Salida de texto | $20 / 1M tokens |
| Salida de audio | $30 / 1M tokens |
La guía de traducción en tiempo real de Qwen indica que la entrada de audio se contabiliza a razón de 7 tokens por segundo y la salida de audio, a 12.5 tokens por segundo. Con esos datos puedes estimar el coste de entrada de un flujo continuo:
- 60 segundos de audio de entrada: 420 tokens, es decir, aproximadamente $0.00315 con la tarifa indicada para la entrada de audio.
- 60 segundos de audio generado: 750 tokens, es decir, aproximadamente $0.0225 con la tarifa indicada para la salida de audio.
Estas cifras no representan el «coste por minuto» completo. No incluyen la salida de texto, las imágenes, el comportamiento de la conexión ni la posibilidad de que el audio traducido dure más o menos que el original. Si solicitas solo texto, también cambiará la métrica de salida aplicable. Consulta la página oficial de precios de modelos correspondiente a la región y el despliegue que vayas a utilizar.
La integración con WebSocket que debes tener clara
La integración documentada consiste en una sesión de servidor en tiempo real, no en una petición de traducción convencional de una sola ejecución. La descripción general de Realtime API identifica WebSocket como la opción más directa para aplicaciones de servidor y prototipos.
Una implementación mínima sigue este esquema:
- Crea una URL de WebSocket en tiempo real específica para la región, usando
qwen3.8-livetranslate-flash-realtimecomo modelo. - Envía
Authorization: Bearer <API_KEY>durante el handshake y mantén la clave en tu backend. - Envía
session.updatecon los idiomas de origen y destino, además de las modalidades de salida solicitadas. - Transmite el audio codificado en base64 mediante
input_audio_buffer.append. - Confirma el búfer o deja que la detección de actividad de voz configurada active el procesamiento.
- Consume los eventos de texto y audio traducidos hasta que termine el turno.
El endpoint depende del workspace y de la región, así que copiar el hostname de otro despliegue puede provocar errores aunque la carga útil de eventos sea correcta. Consulta la referencia de eventos de cliente de LiveTranslate para configurar la sesión, la detección de actividad de voz, las palabras clave o las confirmaciones manuales.
Dónde tiene sentido y dónde no
| Caso de uso | Ajuste | Motivo |
|---|---|---|
| Subtítulos en directo para un streaming controlado | Buen candidato para un prototipo | El audio en streaming y la salida de texto encajan con el diseño de la API |
| Traducción backend para una aplicación bidireccional | Buena opción, con pruebas | WebSocket mantiene la sesión abierta y puede devolver audio |
| Reunión pequeña con turnos claros | Posible | La traducción en tiempo real con conocimiento del interlocutor forma parte del posicionamiento documentado |
| Conferencia ruidosa con interrupciones | Sin demostrar | No hay pruebas independientes aquí que midan solapamientos, acentos o ruido |
| Interpretación médica o jurídica de alto riesgo | No es una opción predeterminada | La evidencia disponible no demuestra una fiabilidad suficiente con la terminología especializada |
| Despliegue local o sin conexión | No | El lanzamiento oficial es un servicio alojado, no un modelo descargable |
Un indicador interesante del ecosistema es la implementación de código abierto AlbusWei/LiveTranslate. Su README describe modos de traducción individual, doblaje de archivos y reuniones, con WebRTC como transporte principal y WebSocket como alternativa. Esto demuestra que los desarrolladores pueden construir una capa práctica sobre los modelos en tiempo real de Qwen; no demuestra la precisión de Qwen3.8 ni su disponibilidad sostenida en producción.
Lo que la evidencia permite afirmar —y lo que no— por ahora
La documentación oficial ofrece una superficie concreta de funciones y precios, pero las pruebas independientes siguen siendo el punto débil. En los debates de la comunidad solo aparecen unas pocas publicaciones sobre esta versión exacta y no se ha encontrado ningún hilo sustancial de Reddit dedicado a Qwen3.8-LiveTranslate.
Una publicación de un usuario resumía con cautela el cambio principal:
“2.3 秒还没有消失,但已经更接近人类能自然接话的节奏了。” — @WukongNumber1, X
La frase resulta útil como reacción humana a la afirmación sobre la latencia, pero no como benchmark. En otra conversación de Reddit sobre usos anteriores de Qwen para traducción, las opiniones fueron variadas: u/ReplacementTommy escribió: “Sinceramente, Qwen AI ha sido el sistema más preciso y natural para las traducciones que he usado”, mientras que u/Valhall22 afirmó que Qwen no quedó entre sus cinco primeros en pruebas en inglés, alemán y francés. Ninguno de esos comentarios identifica el modelo exacto de Qwen3.8 en tiempo real ni procede de una prueba controlada, así que no deben convertirse en una clasificación.
La conclusión práctica es más concreta: Qwen3.8-LiveTranslate se puede invocar oficialmente, su facturación está documentada y su arquitectura en tiempo real permite empezar a construir. La precisión en condiciones de audio difíciles sigue siendo una tarea de validación para quien lo vaya a comprar.
Preguntas frecuentes sobre la API Qwen3.8 LiveTranslate
¿Qwen3.8 LiveTranslate está disponible?
Sí. La documentación de Alibaba Cloud incluye qwen3.8-livetranslate-flash-realtime como modelo de Model Studio disponible mediante una API alojada. No hay evidencia de un lanzamiento con pesos abiertos.
¿Qwen3.8 LiveTranslate utiliza WebSocket?
Sí. La documentación oficial de Realtime API y las referencias de eventos de LiveTranslate describen el acceso mediante WebSocket, la autenticación, las actualizaciones de sesión, los eventos del búfer de audio y la salida en streaming.
¿Cuánto cuesta Qwen3.8 LiveTranslate por minuto?
No existe un precio único y universal por minuto, porque la entrada de audio, la salida de texto, la salida de audio y el contexto de imagen se cobran con métricas independientes. Según los valores documentados de 7 tokens de entrada por segundo y 12.5 tokens de salida por segundo, un minuto de audio de entrada cuesta aproximadamente $0.00315 y un minuto de audio generado, aproximadamente $0.0225 con las tarifas internacionales indicadas, antes de sumar el texto y otros consumos.
¿Puede devolver texto sin audio traducido?
Sí. La sesión permite configurar las modalidades de salida, incluido texto o texto más audio. Antes de ponerlo en producción, confirma los nombres actuales de los eventos en la documentación oficial de eventos de cliente.
¿Cuántos idiomas admite?
La información oficial del modelo indica 60 idiomas reconocidos y 29 idiomas de salida hablada. Por tanto, la cifra de idiomas con salida de audio es menor que la de idiomas reconocidos.
¿Puede traducir vídeo en tiempo real?
El modelo acepta audio y contexto de imagen, y está orientado a la traducción audiovisual. Eso no significa que cualquier flujo de doblaje de vídeo basado en archivos utilice este modelo en tiempo real; Qwen documenta rutas independientes para la traducción de audio y vídeo que no funcionan en tiempo real.
¿Puedo descargar el modelo y ejecutarlo localmente?
No se ha encontrado un lanzamiento oficial con pesos abiertos para este modelo en tiempo real concreto. Cuenta con inferencia alojada salvo que Qwen publique un checkpoint y una licencia independientes.
La recomendación práctica: prototipa con un interruptor de emergencia
Qwen3.8-LiveTranslate merece un prototipo controlado mediante API, pero no una apuesta ciega para producción. Antes del despliegue, prueba tres aspectos con tu propio audio: el tiempo medido hasta la primera salida traducida, la calidad de cada combinación de idiomas con nombres y términos de dominio, y el comportamiento ante silencios, interrupciones y reconexiones.
Mantén el modelo detrás de un interruptor de configuración para poder cambiar de región, transporte o proveedor sin reescribir la aplicación. Ese es el equilibrio sensato hoy: la superficie de la API y sus precios son lo bastante reales como para construir sobre ellos, mientras que las preguntas más difíciles de producción —la precisión en salas ruidosas y la fiabilidad sostenida— siguen perteneciendo a tu plan de pruebas, no al anuncio de lanzamiento.