Google presenta Gemini 3.8 Live para conversaciones de voz más complejas

0
3
Google presenta Gemini 3.8 Live para conversaciones de voz más complejas

En resumen

Google anunció Gemini 3.8 Live y Gemini 3.8 Live Extended Thinking, modelos orientados a interacciones de voz más naturales y a la ejecución de tareas complejas. Según la empresa, ya están disponibles mediante la API de Gemini, Google Workspace y la aplicación Gemini.

Google anunció el 15 de septiembre de 2026 dos modelos para la interacción por voz: Gemini 3.8 Live y Gemini 3.8 Live Extended Thinking. La empresa los describe como sus modelos de diálogo en vivo más avanzados hasta ahora, con un enfoque en conversaciones naturales, razonamiento cercano al tiempo real y ejecución de tareas complejas mediante comandos de voz.

Según el material divulgado por Google DeepMind, los modelos ya pueden utilizarse mediante la API de Gemini, Google Workspace y la aplicación Gemini. El anuncio combina así una oferta para desarrolladores y empresas con la integración en productos utilizados directamente por los consumidores. El informe no indica precios, límites de uso, disponibilidad regional ni requisitos técnicos para cada plataforma.

Qué cambia en la interacción por voz

El principal cambio presentado está en la capacidad de mantener una conversación mientras el sistema trabaja. Google afirma que los modelos gestionan interrupciones, cambios de idioma, contexto visual en tiempo real y tareas ejecutadas en segundo plano sin interrumpir el diálogo. En la práctica, la propuesta permite que el usuario hable con el sistema, añada información y continúe la conversación mientras se procesa una acción más compleja.

Gemini 3.8 Live Extended Thinking añade una capa de razonamiento prolongado al modelo orientado a conversaciones en vivo. El texto de la empresa relaciona esta versión con tareas que requieren más planificación y con agentes de voz destinados a flujos de trabajo. Sin embargo, la documentación proporcionada no detalla cómo decide el sistema cuándo utilizar este modo, cuánto tardan las respuestas ni qué controles existen para interrumpir una tarea en curso.

La referencia a explicaciones del proceso de pensamiento aparece en parte del material reproducido en el informe, pero no está acompañada de una descripción técnica sobre el formato de esas explicaciones. Por ello, no es posible concluir que el usuario recibirá una exposición completa del razonamiento interno del modelo. El hecho sustentado es únicamente que Google presenta los sistemas como capaces de hacer más comprensible el trabajo realizado durante la conversación.

Rendimiento divulgado por Google

Para respaldar la presentación, Google cita evaluaciones de terceros y benchmarks específicos de voz. La empresa afirma que Gemini 3.8 Live Extended Thinking obtuvo el primer puesto general en el Speech to Speech Quality Index de Artificial Analysis, con 82,6 puntos. También declara resultados del 68,6 % en τ-Voice y del 35,1 % en el benchmark de atención bancaria de Sierra.

El mismo modelo habría obtenido un 97,7 % en Big Bench Audio, según las cifras divulgadas. Google también afirma que mantiene un precio competitivo frente a otros modelos de frontera, pero el material no presenta valores, condiciones de comparación ni la fecha exacta de las mediciones. Esta ausencia impide evaluar el significado económico de la afirmación.

Para Gemini 3.8 Live, la empresa menciona el segundo puesto en Speech Agent Arena y lo describe como una opción eficiente para desarrolladores y empresas que necesitan operar a escala. El informe no indica el tamaño de la muestra, la composición de los competidores, los criterios de preferencia de los usuarios ni si los resultados se obtuvieron antes o después de ajustes en el modelo.

También hay una referencia a EVA-Bench, de ServiceNow, en el que los modelos habrían avanzado en la frontera entre precisión y calidad conversacional en flujos de trabajo complejos. La expresión indica una comparación entre rendimiento y calidad de interacción, pero el contenido proporcionado no incluye puntuaciones, escenarios evaluados ni resultados de sistemas competidores.

Implicaciones para empresas y usuarios

El lanzamiento refuerza la competencia por agentes de voz capaces de hacer más que responder preguntas. La combinación de diálogo continuo, percepción visual y tareas en segundo plano apunta a aplicaciones en atención al cliente, productividad y automatización de procesos. Para las empresas, la promesa central es reducir la fricción de las interacciones prolongadas sin exigir que el usuario abandone la conversación para seguir cada etapa.

Esto también desplaza parte de la evaluación de los modelos de voz. No basta con medir si la respuesta suena natural: será necesario observar si el agente entiende las interrupciones, conserva el contexto, ejecuta correctamente las acciones y avisa cuando no puede completar una tarea. Los benchmarks citados por Google cubren aspectos diferentes, pero el informe no permite saber si representan condiciones reales de uso en todos los sectores.

La disponibilidad simultánea en la API, Workspace y Gemini puede acelerar la adopción, pero también vuelve relevantes cuestiones que no fueron respondidas en el anuncio proporcionado. Entre ellas están los permisos para acceder a datos, el tratamiento de errores, el registro de las acciones ejecutadas, la privacidad del audio y las imágenes, y los mecanismos de revisión humana. Sin esta información, la descripción del uso corporativo sigue siendo una promesa de producto, no una demostración de fiabilidad operativa.

Lo que debe seguirse ahora es la documentación técnica de cada integración, la confirmación independiente de los resultados y los informes de uso en tareas reales. También será necesario comprobar si el rendimiento divulgado se mantiene con ruido, cambios de idioma, interrupciones frecuentes e instrucciones ambiguas. Hasta el momento, el informe respalda el anuncio y las afirmaciones de Google, pero no ofrece pruebas suficientes para medir las limitaciones prácticas ni comparar los modelos de forma exhaustiva.

Nuestro prisma

El anuncio sitúa la voz en el centro de una estrategia más amplia de agentes capaces de conversar y actuar al mismo tiempo. La novedad relevante no es solo la naturalidad del diálogo, sino el intento de convertir una conversación continua en una interfaz para tareas complejas. Las cifras divulgadas sugieren avances, pero siguen siendo afirmaciones de la propia Google sin una metodología detallada en el material disponible. La adopción real dependerá del precio, los controles, la privacidad, la latencia y el rendimiento fuera de los benchmarks citados.

Fuentes: Google DeepMind · blog.google

Preguntas frecuentes

¿Qué son Gemini 3.8 Live y Extended Thinking?

Son modelos de diálogo en vivo de Google orientados a conversaciones por voz, razonamiento en tiempo casi real, contexto visual y ejecución de tareas.

¿Dónde están disponibles los modelos?

Google afirma que los recursos pueden utilizarse mediante la API de Gemini, Google Workspace y la aplicación Gemini.

¿Los resultados de los benchmarks fueron verificados de forma independiente?

El informe reproduce resultados divulgados por Google, pero no proporciona una metodología detallada ni una evaluación independiente de esas cifras.

Recibe Radar de IA todos los días

Las noticias de inteligencia artificial que importan — con nuestro prisma y siempre con las fuentes. Gratis.

Sin spam. Cancela cuando quieras.