AIREITER

Gemini 3.5 Transcribe API: precios, límites y configuración

Última actualización: 2026-08-28 03:54:44

¿Necesitas convertir una grabación en texto utilizable o generar subtítulos desde un micrófono en tiempo real? Gemini 3.5 Transcribe destaca por la limpieza del texto, las sugerencias de vocabulario y el manejo multilingüe, pero sus dos vías de API tienen límites muy distintos. La API de archivos encaja mejor con transcripciones que quieras conservar; la Live API está pensada para sesiones cortas y con poca latencia.

La respuesta práctica: usa la API de archivos salvo que necesites subtítulos en directo

Gemini 3.5 Transcribe es la familia de modelos de Google dedicada a convertir voz en texto y está disponible en preview pública desde el 26 de agosto de 2026. Google documenta identificadores de modelo, transportes, eventos de salida y restricciones diferentes para el audio grabado y el audio en tiempo real.

NecesidadIdentificador de modeloVía de APIRestricción importante
Reuniones, llamadas y grabaciones subidasgemini-3.5-transcribeInteractions APIHasta 1 hora en una solicitud unary estándar; 30 minutos con diarización o marcas de tiempo por palabra
Subtítulos en directo, entrada de micrófono e interfaces de vozgemini-3.5-transcribe-liveLive APISesiones continuas de 10 minutos; sin diarización en directo ni marcas de tiempo por palabra

Para archivar reuniones, analizar llamadas o preparar subtítulos, empieza con gemini-3.5-transcribe. Si quieres mostrar una previsualización de subtítulos o crear una interfaz de pulsar para hablar, utiliza gemini-3.5-transcribe-live. La guía de transcripción de audio grabado y la guía de Live API de Google explican ambos flujos por separado.

Documentación de Google Gemini 3.5 Transcribe API con la configuración de transcripción y sus opciones

La disponibilidad sigue limitada a la preview

Google anunció Gemini 3.5 Transcribe el 26 de agosto de 2026 y ofrece la API para desarrolladores en preview pública a través de Google AI Studio y Google Antigravity. El acceso empresarial también aparece en preview mediante Gemini Enterprise Agent Platform. Al estar en preview, la cobertura regional, las cuotas y la estabilidad pueden diferir de las de un servicio de voz con disponibilidad general. Conviene probar audio representativo antes de trasladar un volumen importante.

Precios de Gemini 3.5 Transcribe en unidades prácticas

La página de precios de Gemini API de Google muestra tarifas basadas en tokens, no una tarifa fija por transcripción. La referencia actual indica 2 $ por millón de tokens de entrada de audio y 12 $ por millón de tokens de salida de texto para gemini-3.5-transcribe.

La documentación de audio de Google indica que el audio se representa con 32 tokens por segundo, es decir, 1.920 tokens de audio por minuto. Por tanto, la parte correspondiente a la entrada de audio equivale aproximadamente a 0,00384 $ por minuto con una tarifa de 2 $ por millón de tokens, sin contar la salida de texto ni otros tokens facturables.

ModeloBase de precios publicadaEstimación combinada orientativaEstimación orientativa por 1 hora
gemini-3.5-transcribe2 $/M de tokens de entrada de audio + 12 $/M de tokens de salida de textoAproximadamente 0,005 $/minAproximadamente 0,30 $/hora
gemini-3.5-transcribe-liveProcesamiento de audio y texto en directo basado en tokensAproximadamente 0,009 $/minAproximadamente 0,54 $/hora

Las cifras combinadas dependen del volumen de texto generado, así que son estimaciones para planificar y no tarifas garantizadas por minuto. Una salida más densa, el contexto repetido o instrucciones adicionales pueden modificar la factura. Comprueba la tabla de precios actual antes de comprometer un volumen importante, ya que los precios de la preview pueden cambiar.

Página de precios de Google Gemini API con información sobre las tarifas de los modelos

Las diferencias de funciones que importan en producción

Transcripción literal frente a transcripción inteligente

VERBATIM es el modo predeterminado en la documentación de transcripción de Google. Conserva las muletillas, repeticiones, pausas, arranques en falso y correcciones tal como se pronunciaron. Es la opción adecuada cuando la transcripción debe servir como registro, prueba, fuente para subtítulos o entrada para controles de calidad.

SMART transforma el texto para facilitar su lectura. Elimina disfluencias, resuelve autocorrecciones, añade puntuación y estructura, y puede dar formato a fechas, monedas, números, listas y párrafos. La frase hablada «martes… no, miércoles» puede convertirse en «miércoles» en el resultado limpio.

El modo inteligente no es compatible con la diarización de hablantes ni con las marcas de tiempo por palabra. Si la aplicación necesita notas legibles y trazabilidad, solicita primero una salida literal y limpia después una copia.

Vocabulario personalizado y cambios de idioma

Google documenta la detección automática de idiomas en más de 85 configuraciones regionales, incluidos los cambios de idioma dentro de una misma conversación. Si conoces el idioma, proporciona un código BCP-47 como en-US o es-ES para orientar el reconocimiento.

El vocabulario personalizado admite hasta 1.000 términos, aunque las recomendaciones prácticas de Google indican que los resultados suelen ser mejores con 100 términos o menos. Incluye nombres de productos distintivos, acrónimos, nombres propios, términos médicos o palabras técnicas, no una lista de vocabulario común.

Etiquetas de hablante y marcas de tiempo por palabra

El audio grabado puede devolver la atribución de hablantes y la temporización de cada palabra. La documentación de la API establece un máximo de ocho hablantes, mientras que la publicación de lanzamiento de Google destaca la atribución de hasta tres y califica como experimental la compatibilidad con tres o más hablantes.

Las marcas de tiempo por palabra se activan en el modo literal e incluyen los desplazamientos inicial y final de cada palabra. Google advierte de que las marcas de tiempo pueden reducir la precisión general de la transcripción. La diarización y las marcas de tiempo también reducen de una hora a 30 minutos el límite estándar de duración del audio.

Requisito¿Compatible?Particularidad
Etiquetas de hablante en audio grabadoSíHasta 8 según la documentación; la atribución de 3 o más es experimental
Marcas de tiempo por palabra en audio grabadoSíSolo en modo literal; pueden reducir la precisión
Etiquetas de hablante en transcripción en directoNoUsa audio grabado cuando la atribución sea importante
Marcas de tiempo por palabra en transcripción en directoNoLa salida en directo es incremental y está orientada a enunciados
Modo inteligente con etiquetas o marcas de tiempoNoElige el modo literal para obtener estas anotaciones

Cómo enviar un archivo grabado a Gemini 3.5 Transcribe API

La guía de audio grabado de Google describe tres pasos: subir el archivo, pasar el URI del archivo devuelto a la Interactions API y leer la transcripción completa desde interaction.output_text.

  1. Sube el audio con la Files API. Utiliza esta vía para grabaciones de más de unos segundos o archivos que vayas a reutilizar.
  2. Conserva el URI del archivo y su tipo MIME, por ejemplo audio/mp3.
  3. Envía el URI a gemini-3.5-transcribe mediante la Interactions API.
  4. Lee la salida de texto y, si lo has solicitado, consulta las anotaciones word_info para obtener datos de hablantes y tiempos.

El flujo con el SDK oficial puede resumirse en este ejemplo de subida y transcripción:

from google import genai

client = genai.Client()
file = client.files.upload(file="path/to/sample.mp3")

interaction = client.interactions.create(
    model="gemini-3.5-transcribe",
    input=[{
        "role": "user",
        "content": [{
            "type": "audio",
            "uri": file.uri,
            "mime_type": file.mime_type,
        }],
    }],
)

print(interaction.output_text)

Una solicitud REST compacta tendría este aspecto después de que la subida mediante Files API haya devuelto FILE_URI:

curl -X POST \
  "https://generativelanguage.googleapis.com/v1beta/interactions" \
  -H "x-goog-api-key: $GEMINI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "gemini-3.5-transcribe",
    "input": [{
      "role": "user",
      "content": [{
        "type": "audio",
        "uri": "FILE_URI",
        "mime_type": "audio/mp3"
      }]
    }]
  }'

Para obtener una transcripción limpia, añade una configuración de transcripción con el modo inteligente:

{
  "generation_config": {
    "transcription_config": {
      "mode": { "type": "smart" },
      "language_codes": ["en-US"],
      "custom_vocabulary": ["Kubernetes", "BigQuery", "Acme Ledger"]
    }
  }
}

Para las etiquetas de hablante y la temporización de palabras, utiliza en su lugar el modo literal:

{
  "generation_config": {
    "transcription_config": {
      "mode": {
        "type": "verbatim",
        "diarization_mode": "speaker",
        "timestamp_granularities": ["word"]
      }
    }
  }
}

No combines la configuración inteligente con la diarización o las marcas de tiempo. Las reglas de modo documentadas por la API lo convierten en una decisión de diseño, no solo en una preferencia de formato.

Cómo funciona la transcripción en directo

La Live API abre una conexión bidireccional de streaming mediante gemini-3.5-transcribe-live. El cliente envía audio de forma continua y recibe dos eventos de texto:

  • interim_input_transcription: una hipótesis cambiante y de baja latencia para subtítulos o previsualizaciones en la interfaz.
  • input_transcription: texto finalizado que se puede guardar en la transcripción o confirmar en el estado de la aplicación.

La guía de Live API de Google especifica audio PCM de 16 bits, 16 kHz, mono y little-endian. Recomienda fragmentos de unos 100 milisegundos, con aproximadamente 1.024–2.048 frames por fragmento. Los clientes web y móviles deberían utilizar tokens efímeros restringidos en lugar de exponer una clave de API normal; los ejemplos de Google emplean un token de un solo uso con una caducidad de 30 minutos.

El endpoint en directo admite detección automática de idioma, sugerencias BCP-47, vocabulario personalizado y salida VERBATIM o SMART. No admite diarización de hablantes ni marcas de tiempo por palabra en directo. Una sesión continua está limitada a 10 minutos, por lo que las emisiones más largas requieren gestionar las sesiones y unir las transcripciones desde la aplicación.

Para detectar los límites entre turnos, la Live API ofrece tres opciones:

  1. VAD automático: el servidor detecta cuándo empieza y termina el habla.
  2. VAD híbrido: un detector en el cliente señala el final del habla, mientras la detección del servidor permanece como respaldo.
  3. VAD manual: una interfaz de pulsar para hablar envía explícitamente los eventos de inicio y final de actividad.

Qué demuestra la evidencia inicial —y qué no

Google comunica cifras medias de WER del 4,0 % en streaming y del 2,6 % sin streaming a través de Artificial Analysis. Su publicación de lanzamiento también recoge resultados de FLEURS de 5,50 % de WER en streaming y 5,04 % de WER sin streaming, además de una mejora del 70 % en el tiempo hasta la transcripción final frente a Chirp 3.

Estas cifras proceden de Google o de fuentes citadas por Google; no son una comparación independiente cara a cara de Gemini 3.5 Transcribe. El benchmark STT de koedesk midió Gemini 3.5 Flash y otros motores, pero no evaluó directamente Gemini 3.5 Transcribe.

Los primeros usuarios están preguntando por los límites de duración de archivos y sesiones en directo, las transcripciones de referencia para WER y la fiabilidad al reconocer números de teléfono o identificadores de pedido en fragmentos con poco ruido. Prueba nombres, identificadores, números, cambios de hablante, tiempos y latencia con audio representativo en lugar de confiar únicamente en el WER medio.

Cuándo elegir Gemini 3.5 Transcribe y cuándo esperar

SituaciónAdecuaciónConfiguración inicial recomendable
Notas de reuniones limpias o dictadoAltaFile API, SMART e indicación explícita del idioma si se conoce
Registro legal, de cumplimiento o archivadoCondicionalFile API, VERBATIM; revisa manualmente los pasajes críticos
Llamadas grabadas con varios hablantesCondicionalFile API, VERBATIM + diarización; limita las sesiones a 30 minutos
Subtítulos sincronizados por palabraCondicionalFile API, VERBATIM + marcas de tiempo por palabra; valida los tiempos y la precisión
Subtítulos en directoAlta para sesiones cortasLive API; utiliza solo los eventos finales para confirmar el texto
Agente de voz de larga duraciónRequiere trabajo de ingenieríaDivide las sesiones antes del límite de 10 minutos y gestiona las reconexiones
Procesamiento local, sin conexión o confidencialPoca adecuaciónEl flujo documentado envía el audio al servicio de Google; considera una vía ASR autoalojada

Gemini 3.5 Transcribe encaja especialmente bien cuando la transcripción es el primer paso de un flujo más amplio: limpiar el habla, conservar el vocabulario técnico, identificar a los hablantes y pasar el texto estructurado a la siguiente etapa. Es menos apropiado cuando el único requisito es una transcripción literal barata o el procesamiento obligatorio sin conexión.

Preguntas frecuentes sobre Gemini 3.5 Transcribe API

¿Gemini 3.5 Transcribe es gratis?

Google ofrece un nivel gratuito para el uso de Gemini API, pero las cuotas y la disponibilidad de los modelos pueden cambiar. El uso de pago se factura por tokens; la página de precios muestra actualmente estimaciones combinadas orientativas de unos 0,005 $ por minuto para transcripción grabada y 0,009 $ por minuto para el modelo en directo.

¿Cuál es la diferencia entre los modelos de archivos y directo?

gemini-3.5-transcribe procesa grabaciones subidas mediante la Interactions API y admite diarización y marcas de tiempo por palabra en audio grabado. gemini-3.5-transcribe-live transmite PCM sin procesar mediante la Live API, devuelve eventos provisionales y finales, y está limitado a sesiones de 10 minutos sin diarización en directo ni marcas de tiempo por palabra.

¿Puede procesar una grabación de tres horas en una sola solicitud?

No con la configuración de transcripción grabada específica. El límite unary estándar es de una hora, y la diarización o las marcas de tiempo por palabra lo reducen a 30 minutos. Un flujo más largo necesita dividir el audio desde la aplicación y gestionar con cuidado el contexto y la continuidad de los hablantes.

¿Puedo usar Gemini 3.5 Transcribe sin conexión?

El flujo documentado sube o transmite el audio al servicio de Google. Google no describe una versión de Gemini 3.5 Transcribe para uso sin conexión o autoalojado.

La integración inicial más segura

Empieza con una muestra real de tu carga de trabajo, no con un clip de demostración limpio. Ejecuta el mismo audio dos veces: una en modo literal para comprobar la fidelidad y otra en modo inteligente para evaluar la legibilidad. Mide por separado los nombres propios, los números, los cambios de hablante, la desviación de las marcas de tiempo y el coste.

Conserva la transcripción original como fuente de verdad, utiliza la salida inteligente para las notas destinadas al usuario y añade una alternativa para los fallos de subida o los cambios del modelo en preview. Pasa a la Live API solo cuando el cliente pueda gestionar fragmentos PCM de 100 milisegundos, eventos provisionales y finales, tokens efímeros y el límite de sesión de 10 minutos.