29 julio 2026

OpenAI lanza nuevos modelos de voz con IA para transcripción y conversaciones en tiempo real

OpenAI lanza nuevos modelos de voz con IA para transcripción y conversaciones en tiempo real
Compartir esto:

   MADRID, 29 Jul. –

   OpenAI ha anunciado el lanzamiento de dos nuevos modelos de voz de Inteligencia Artificial (IA) diseñados expresamente para todo lo que tiene que ver con las conversaciones, ya sea para transcribirlas en tiempo real o hacerlo por lotes con archivos.

   El laboratorio de IA propietario de ChatGPT ha anunciado desde su cuenta para desarrolladores en X (antes Twitter) la disponibilidad de GPT-Live-Transcribe, el modelo diseñado para cargas de trabajo de baja latencia en la transcripción de habla a texto, y GPT-Transcribe, optimizado para archivos de audio completos y procesamiento por lotes asíncrono.

   Ambos modelos tienen la capacidad de comprender mejor el contexto de las conversaciones y ofrecen una transcripción de mayor calidad del audio en tiempo real, incluso comprendiendo mejor acentos e idiomas, a la vez que frases cortas, números, términos más especializados y conversaciones con ruido de fondo fuerte.

   GPT-Live-Transcribe se caracteriza por su habilidad para utilizar automáticamente textos transcritos con anterioridad como contexto.

   El laboratorio de IA ha compartido algunos datos del rendimiento de los modelos en la prueba de ASR con reconocimiento de contexto (Context Aware ASR) de OpenAI, que muestran que la posibilidad de añadir contexto mejoró la precisión semántica del 38,5 por ciento al 44,6 por ciento en GPT-Live-Transcribe, mientras que en GPT-Transcribe pasó del 41,6 por ciento al 45,2 por ciento.

   Es decir, que aportar información a ambos modelos, como los idiomas que se esperan o el tema de la reunión, mejora considerablemente su capacidad de transcripción, ya sea en una conversación en tiempo real o a través de un audio grabado anteriormente para que lo transcriba.

   Por lo que respecta al rendimiento en audios del mundo real, el modelo GPT-Live-Transcribe registró una tasa de error de transcripción del 9,60 por ciento en comparación con el 11,65 por ciento obtenido con GPT-Realtime-Whisper (la versión anterior de transcripción en vivo de OpenAI), mientras que GPT-Transcribe consiguió una tasa de error del 8,98 por ciento, disminuyéndola respecto al 15,21 por ciento de Whisper-1 (el modelo original de OpenAI para convertir voz a texto).

   Finalmente, el laboratorio independiente de análisis Artificial Analysis reportó una tasa de error de palabras del 3,31 por ciento para GPT-Transcribe. Esto supone una mejora a tener en cuenta si se compara con los modelos anteriores de OpenAI.

   En este sentido, GPT-Transcribe se convierte en el mejor modelo de OpenAI en esta categoría, aunque queda ligeramente por detrás de alternativas como Voxtral Small de Mistral y Gemini 3.1 Pro de Google, en tanto que ambas se sitúan en un 2,8 por ciento de tasa de error.

   El laboratorio de IA ha fijado el precio de GPT-Transcribe en 4,50 dólares por cada mil minutos.

CL11