Gemini 3.8 Live: benchmarks oficiales, precios reales y qué cambia para los asistentes de voz

Por Daniele Forciniti

Gemini 3.8 Live: benchmarks oficiales, precios reales y qué cambia para los asistentes de voz

Gemini 3.8 Live es el nuevo modelo de voz de Google para quien construye asistentes que escuchan y responden en tiempo real. Llegó el 15 de septiembre de 2026 junto a la versión Extended Thinking, que razona mientras sigue hablando, y se suma a Gemini 3.5 Transcribe para la transcripción. En la clasificación independiente de Artificial Analysis, la versión Extended Thinking va primera con 82,6 puntos, y el precio de lista es de 0,005 dólares por minuto de audio de entrada y 0,018 de salida.

Hasta aquí la nota de prensa. En este artículo miro las tres cosas que la nota no dice: cuánto valen de verdad esos benchmarks, cuánto cuesta una conversación real comparada con OpenAI, y por qué el número de idiomas cambia según la página que abras.

Qué presentó Google el 15 de septiembre

El anuncio, firmado por Tom Ouyang y Malini Jaganathan del equipo Gemini Audio, presenta dos modelos que hablan y escuchan, más un tercero dedicado a la transcripción que salió el mes anterior:

  • Gemini 3.8 Live: el modelo para la mayoría de asistentes de voz, pensado para costar poco y responder rápido.
  • Gemini 3.8 Live Extended Thinking: la versión que razona más tiempo, para peticiones complejas de varios pasos.
  • Gemini 3.5 Transcribe: solo de voz a texto, publicado el 26 de agosto de 2026.

Los tres son ya estables, no están en vista previa: lo confirma el changelog oficial de la API. Se prueban desde Google AI Studio y se usan a través de la Live API, además de dentro de Search Live, Gemini Live y Workspace para quien tenga suscripción AI Pro o Ultra.

Gemini 3.8 Live y Extended Thinking: la diferencia que importa

La diferencia no es «uno es más inteligente». Es cómo se comportan mientras trabajan. Los modelos normales, cuando tienen que consultar un sistema externo, se paran: tú te quedas en silencio escuchando la nada. Extended Thinking no: sigue hablando mientras trabaja, con frases como «estoy mirando los vuelos a Seattle».

En la documentación esto se regula con un parámetro, thinkingLevel, que acepta tres valores: bajo, medio y alto. Las funciones que el modelo llama hay que declararlas como no bloqueantes, y el estado de la conversación se sigue con interaction_status, que indica si el modelo sigue trabajando o ya ha terminado.

Las otras capacidades declaradas son cuatro: llamadas a sistemas externos en segundo plano sin cortar el audio, contexto visual (el modelo mira la cámara o la pantalla mientras hablas), precisión con códigos y números de expediente, y cambio de idioma automático durante la conversación. Todo el audio generado lleva la marca SynthID, la misma tecnología de la que hablé cuando Google quitó la marca de agua visible de las imágenes.

Los benchmarks, y qué miden de verdad

Google declara el primer puesto en el índice de Artificial Analysis, que es una clasificación independiente. Merece la pena entender qué mide, porque el nombre hace pensar en una nota única sobre la «calidad de la voz» y en realidad es otra cosa.

El índice nació el 23 de junio de 2026 y junta tres pruebas distintas, con el mismo peso cada una: el razonamiento a partir del audio (Big Bench Audio), la naturalidad del ida y vuelta (Full Duplex Bench) y la capacidad de completar tareas concretas (τ-Voice). Un modelo entra en la clasificación solo si tiene resultado válido en las tres.

Gráfico de barras con las puntuaciones del Speech to Speech Index de Artificial Analysis: Gemini 3.8 Live Extended Thinking primero con 82,6
Gemini 3.8 Live Extended Thinking va primero, pero saca poco más de un punto al segundo.

Esta es la clasificación, y cuenta una historia más interesante que la nota de prensa:

ModeloÍndiceCoste por hora de audio
Gemini 3.8 Live Extended Thinking82,63,50 $
GPT-Live-1 (Astra)81,55,83 $
Grok Voice Think Fast 2.081,34,80 $
GPT-Live-1 (Sol)80,14,47 $
Gemini 3.8 Live76,00,84 $
GPT-Realtime-2.173,910,75 $
Puntuaciones y costes recogidos de Artificial Analysis el 16 de septiembre de 2026.

El primer puesto está, pero entre el primero y el cuarto bailan 2,5 puntos sobre 100. Traducido: en calidad están todos ahí. Lo que cambia de verdad es la columna de la derecha. Gemini 3.8 Live Extended Thinking cuesta algo más de la mitad que GPT-Live-1 y un tercio que GPT-Realtime-2.1, y la versión normal, que se queda en 76 puntos, cuesta 3,50 dólares menos por hora que GPT-Live-1.

Google aporta otros tres números: 68,6% en tareas completadas (τ-Voice), 35,1% en la prueba bancaria de Sierra y 97,7% en Big Bench Audio. El segundo es el más honesto de los tres: significa que, en un escenario de atención al cliente de banca, dos de cada tres veces la tarea no se cierra. Estamos lejos del asistente que lo resuelve todo solo.

Cuánto cuesta de verdad hacer hablar a una IA

La lista de precios oficial es pública, y conviene leerla con calma porque mezcla dos formas de contar: por minuto y por tokens.

ModeloAudio de entradaDe salida
Gemini 3.8 Live y Extended Thinking0,005 $/min (3 $ por millón de tokens)0,018 $/min (12 $ por millón)
Gemini 3.5 Transcribe Live0,005 $/min (3,50 $ por millón)0,004 $/min de texto
Gemini 3.5 Live Translate0,0053 $/min0,0315 $/min
Gemini 3.1 Flash TTS1 $ por millón de tokens de texto20 $ por millón
Lyria 3.5 (música)0,08 $ por tema
Precios de lista de la Gemini API a 16 de septiembre de 2026. Todos los modelos tienen también un nivel gratuito, menos Lyria.

Hay una nota a pie de página que casi nadie recoge y que conviene leer: esos precios por minuto son una estimación de Google, calculada sobre la tarifa por tokens. La cuenta real depende de cuánto habla el modelo y de cuánto contexto arrastra. Es la misma razón por la que en OpenAI el gasto real sube en las llamadas largas.

Para comparar fui a la lista de precios de OpenAI. GPT-Live-1 cuesta 0,05 dólares por minuto, precio fijo. GPT-Realtime-2.1 en cambio se paga por tokens: 32 dólares por millón de entrada y 64 de salida.

Llevémoslo a mil minutos de conversación al mes, o sea algo más de dieciséis horas:

  • Gemini 3.8 Live a precio de lista: unos 23 dólares, contando entrada y salida.
  • GPT-Live-1 a precio de lista: 50 dólares.
  • Medidos sobre el terreno por Artificial Analysis, que cuenta también el contexto que crece: unos 14 dólares para Gemini 3.8 Live, 58 para la versión Extended Thinking y 97 para GPT-Live-1.

La diferencia sigue siendo grande incluso tomando los números medidos en lugar de los de lista. Si te interesa el tema de ahorrar en modelos, lo conté más a fondo en estás pagando la IA diez veces de más.

Gemini 3.5 Transcribe: la parte menos vistosa y más útil

El modelo de transcripción salió el 26 de agosto de 2026 y para muchos negocios es más útil que el modelo que habla. Google declara una tasa media de error de palabra del 4,0% en directo y del 2,6% en archivos grabados, con una mejora del 70% en el tiempo de respuesta frente al modelo anterior.

Una tasa de error del 4% quiere decir que de cada cien palabras se equivoca en cuatro. En una reunión de una hora es mucho o poco según para qué la uses: para un acta interna va perfecto, para un informe médico no.

Lo que lo hace usable de verdad, sacado de la documentación:

  • Vocabulario personalizado: le pasas hasta 1.000 términos tuyos, nombres de producto, siglas, apellidos, y deja de destrozarlos.
  • Cambio de idioma dentro de la misma frase: lo gestiona solo, sin configurar nada.
  • Transcripción limpia: quita las muletillas y arregla las frases a medias, devolviendo un texto legible.
  • Identificación de quién habla: hasta 8 personas en archivos grabados.

Los límites que hay que saber antes de diseñar nada encima: una hora por archivo, que baja a 30 minutos si activas la identificación de hablantes o las marcas de tiempo palabra por palabra, y sesiones en directo de 10 minutos.

Daniele Forciniti · DF Studio Design

Antes de la voz, hace falta que la IA te encuentre

Un asistente de voz sirve cuando alguien ya te está buscando. El paso anterior es que te encuentren: aparecer en Google y que las IA te citen cuando alguien pregunta quién hace lo que haces tú.

Me llamo Daniele Forciniti: llevo diez años haciendo webs y posicionamiento, y dos trabajando también en GEO. Si quieres saber por dónde empezar, hablamos.

Consultoría SEO Diseño web WordPress

¿97, 85 o 70 idiomas? Pongamos orden

Aquí hay una confusión que he visto rebotar en bastantes artículos, también en español. Los números son tres y todos son ciertos, pero se refieren a cosas distintas.

  • 97 idiomas: es lo que Google declara en el anuncio para los nuevos modelos que hablan, con detección y cambio automático durante la conversación.
  • 85 idiomas: es la cobertura de Gemini 3.5 Transcribe, es decir, la transcripción.
  • 70 idiomas: es lo que sigue indicando hoy la página general de la Live API, y también vale para la traducción de voz.

No he encontrado una página oficial que liste los 97 idiomas del modelo nuevo, así que el consejo práctico es simple: si tu proyecto depende de un idioma concreto, pruébalo en AI Studio antes de comprometerte con un cliente. Es gratis y son cinco minutos.

Qué cambia para un negocio, en concreto

El silencio al teléfono desaparece

El problema número uno de los contestadores automáticos no era la voz falsa: eran las pausas. Preguntabas algo y te quedabas cinco segundos en el vacío, pensando si se había cortado la llamada. Un modelo que habla mientras trabaja elimina justo ese momento, y por eso estos lanzamientos importan más de lo que parece.

El coste ya no es el obstáculo

Mil minutos de conversación al mes, o sea un negocio pequeño que atiende un centenar de llamadas, se quedan por debajo de 25 dólares de modelo. El coste real se ha movido a otro sitio: integrar el sistema de gestión, controlar los errores y la responsabilidad de lo que el asistente le diga a un cliente.

Sigue haciendo falta quien lo construya

Google enumera siete socios (Agora, Fishjam, LiveKit, LangChain, Pipecat, Vercel, Vision Agents) que se encargan de la infraestructura de audio, y publica ejemplos listos en GitHub. Siguen siendo herramientas de desarrollador. Si el tema de los asistentes que actúan te interesa de cerca, lo traté entero en la guía de agentes IA, y la parte de conectarlos a los datos de la empresa la expliqué hablando de BigQuery Data Agents.

Qué pienso yo

Llevo más de diez años trabajando con webs, contenidos y posicionamiento, y los lanzamientos de modelos ya los leo con un filtro fijo: el primer puesto en la clasificación importa poco, el precio importa muchísimo. Aquí el primer puesto está, pero vale un punto de ventaja. La noticia de verdad es que una conversación de voz decente ha bajado a unos céntimos por minuto.

La parte que menos me convence es la distancia entre la demo y los números. Un asistente que cierra el 35% de las tareas bancarias no está listo para quedarse solo delante de un cliente: está listo para ayudar a la persona que atiende. Quien lo venda como sustituto completo de la centralita hará daño, y luego la culpa se la echarán a la IA.

Lo que sí seguiría de cerca es Transcribe. No es noticia, cuesta medio céntimo por minuto y resuelve un problema que tiene todo el mundo: convertir en texto buscable las llamadas, las reuniones y los audios. Ahí el retorno se ve enseguida.

Conclusión

Gemini 3.8 Live trae dos cosas concretas: un modelo que sigue hablando mientras ejecuta tareas, y un precio que hace sostenible un asistente de voz incluso para un negocio pequeño. Los benchmarks dicen que va primero, pero también dicen que la competencia está a un punto y que en las tareas difíciles nadie es todavía fiable por su cuenta. Si tienes que elegir hoy, la versión normal vale para casi todo, Extended Thinking solo donde haga falta razonar en varios pasos, y Transcribe es el que antes se paga solo.

Preguntas frecuentes

¿Cuánto cuesta Gemini 3.8 Live?

A precio de lista, 0,005 dólares por minuto de audio de entrada y 0,018 de salida, o sea unos 23 dólares cada mil minutos de conversación. Google precisa que son estimaciones calculadas sobre la tarifa por tokens, así que la cuenta real cambia con la duración de las conversaciones. También hay un nivel gratuito para probar.

¿Cuál es la diferencia con Extended Thinking?

Extended Thinking razona más tiempo antes de responder y lo hace hablando, en vez de dejarte en silencio. Se regula con tres niveles de razonamiento. Cuesta más: medido sobre el terreno, 3,50 dólares por hora frente a 0,84.

¿Es de verdad el mejor modelo de voz?

Va primero en el índice de Artificial Analysis con 82,6 puntos, pero GPT-Live-1 está en 81,5 y Grok Voice Think Fast 2.0 en 81,3. En calidad están muy cerca. La diferencia grande es el coste por hora de audio.

¿Cuántos idiomas admite?

Google declara 97 idiomas para los nuevos modelos de voz, con cambio automático durante la conversación. Gemini 3.5 Transcribe cubre más de 85 y la página general de la Live API sigue indicando 70. Conviene probar el idioma que necesitas antes de diseñar nada.

¿Cómo de precisa es la transcripción de Gemini 3.5 Transcribe?

Google declara una tasa media de error del 4,0% en directo y del 2,6% en archivos grabados: cuatro palabras mal de cada cien en el primer caso. Se pueden subir archivos de hasta una hora, que bajan a 30 minutos si activas la identificación de hablantes.

¿Hace falta saber programar para usarlos?

Para probarlos no, bastan Google AI Studio y el micrófono. Para meterlos dentro de un servicio real sí: se pasa por la Live API, hay que gestionar las llamadas a tus propios sistemas y hace falta una infraestructura de audio, que Google delega en socios como LiveKit o Pipecat.

¿Están disponibles en español?

Sí, el español está entre los idiomas admitidos y Gemini Live habla español desde hace tiempo. Lo que conviene comprobar es el resultado en tu caso concreto, sobre todo con términos técnicos o nombres propios, donde ayuda el vocabulario personalizado de Transcribe.

Leer también:
Agentes IA: la guía completa ·
GPT-6 Astra y Gemini 3.8 Flash comparados ·
Estás pagando la IA 10 veces de más

Fuentes

Avatar de Daniele Forciniti
Contáctanos ahora