27 agosto 2026

Gemini 3.5 Transcribe es el nuevo modelo de Google mejorado para entender el habla natural en más de 85 idiomas

Gemini 3.5 Transcribe es el nuevo modelo de Google mejorado para entender el habla natural en más de 85 idiomas
Compartir esto:

   MADRID, 27 Ago. –

   Google ha presentado su nuevo modelo de conversión de voz a texto Gemini 3.5 Transcribe, diseñado para interacciones de voz inteligentes y con capacidad para capturar el estilo de habla natural, reconocer vocabulario personalizado y realizar tareas a partir de la voz, incluso rellenando campos de texto en Chrome.

   El gigante tecnológico ha asegurado que es su modelo «más preciso hasta la fecha», al entender el habla de los usuarios a la perfección y transcribirlo en más de 85 idiomas, incluso eliminando expresiones de relleno como «ums» o «ahs» y capturando la intención natural y estilo.

   Así lo ha dado a conocer en un comunicado en su blog, donde ha detallado que Gemini 3.5 Transcribe ha sido mejorado igualmente para capturar audio con precisión en entornos ruidoso, distinguir hasta tres hablantes distintos con marcas de tiempo y detectar acentos regionales o dialectos.

   Concretamente, Google ha explicado que el modelo convierte el audio sin procesar directamente en texto «preciso, pulido y formateado», gestionando las autocorrecciones mientras la persona habla y formateando automáticamente el texto para reflejar la intención final.

   Estas mejoras se traducen en datos como que alcanza una tasa de error de palabras (WER) promedia del 4 por ciento para la transmisión de datos y del 2,6 por ciento para los casos de uso sin transmisión, según mediciones de Análisis Artificial.

   Siguiendo esta línea, también cuenta con tasas de error de palabras mejoradas y una latencia reducida con respecto al modelo antecesor. Por ejemplo, Google asegura que el tiempo para la transcripción final mejora en un 70.

TRANSCRIPCIÓN INTELIGENTE PARA EL TRABAJO INTUITIVO

   Además de presentar el modelo Google también ha compartido cómo la conversión de voz a texto puede ayudar a que trabajar sea «más natural e intuitivo». Así, con Gemini 3.5 Trasncribe, la compañía ha anunciado que integra la comprensión contextual directamente en interfaces como Gboard, Antigravity, la aplicación Gemini y, próximamente en Chrome.

   En la práctica, en Gboard para Android, Gemini 3.5 Trasncribe permitirá transformar los pensamientos hablados en texto eliminando las palabras de relleno. Igualmente, en Google Antigravity podrá combinar contexto de pantalla y el historial de chat de los usuarios para realizar una transcripción precisa.

   Lo mismo ocurre en Google AI Studio, donde los usuarios podrán utilizar el modelo para escribir código de aplicaciones con la voz, aunque solo está disponible en el modo Build.

   Por otra parte, en la ‘app’ de Gemini para macOS, el modelo facilitará utilizar comandos de voz que se integrarán con el contexto de pantalla para optimizar flujos de trabajo. Por ejemplo, al pedir resumir archivos, reutilizar texto en diferentes ‘apps’ o generar imágenes, todo ello con solo la voz.

   Finalmente, Google está trabajando en una opción en Chrome para, mediante Gemini 3.5 Trasncribe, que los usuarios puedan dictar texto en cualquier campo web, de cara a redactar respuestas, publicaciones o utilizar Gemini de forma más sencilla con la voz.

   Gemini 3.5 Trasncribe ya está disponible para todos los usuarios en la aplicación de Gemini para macOS en inglés y Rambler para Android. Para los desarrolladores, se ha lanzado en versión preliminar pública en la API Gemini a través de Google AI Studio y Google Antigravity. También está disponible en versión preliminar en Gemini Enterprise Agent Platform.

CL24