OpenAI presentó dos nuevos modelos de inteligencia artificial especializados en el reconocimiento de voz y la transcripción de conversaciones. Se trata de GPT-Live-Transcribe, pensado para convertir voz en texto en tiempo real, y GPT-Transcribe, diseñado para procesar archivos de audio completos y tareas de transcripción por lotes.
El anuncio fue realizado por la compañía a través de su cuenta para desarrolladores en X, donde destacó que ambos modelos fueron desarrollados específicamente para mejorar la comprensión del contexto de las conversaciones y ofrecer transcripciones más precisas.
Mejor comprensión del contexto
Según OpenAI, los nuevos modelos son capaces de reconocer con mayor precisión distintos acentos, idiomas, expresiones breves, números, terminología especializada e incluso conversaciones realizadas en entornos con mucho ruido de fondo.
En el caso de GPT-Live-Transcribe, el sistema también puede utilizar automáticamente transcripciones previas como contexto para mejorar la calidad de los resultados en tiempo real.
La empresa aseguró que proporcionar información adicional, como el idioma esperado o el tema de una reunión, incrementa significativamente la precisión de las transcripciones.
Menos errores que los modelos anteriores
OpenAI compartió resultados de sus pruebas internas de reconocimiento automático de voz, en las que los nuevos modelos mostraron mejoras respecto a sus predecesores.
- Dos nuevos modelosOpenAI lanzó el 29 de julio de 2026 GPT-Live-Transcribe, para transcripción en tiempo real, y GPT-Transcribe, para procesamiento de archivos de audio por lotes.
- Mejora de precisiónCon contexto adicional, GPT-Live-Transcribe elevó su precisión semántica del 38,5% al 44,6%, y GPT-Transcribe del 41,6% al 45,2%.
- Tasa de errorGPT-Live-Transcribe logró un 9,6% de error frente al 11,65% de su predecesor; GPT-Transcribe bajó al 8,98% contra el 15,21% de Whisper-1.
- Mejor modelo OpenAISegún Artificial Analysis, GPT-Transcribe registra una tasa de error de palabras del 3,31%, la más baja alcanzada por OpenAI en transcripción.
- Rezagado ante competenciaVoxtral Small de Mistral y Gemini 3.1 Pro de Google superan a GPT-Transcribe con tasas de error cercanas al 2,8%.
- Precio para desarrolladoresGPT-Transcribe tendrá un costo de 4,50 dólares por cada 1.000 minutos de audio procesado.
En las evaluaciones realizadas con contexto adicional, GPT-Live-Transcribe mejoró su precisión semántica del 38,5% al 44,6%, mientras que GPT-Transcribe pasó del 41,6% al 45,2%.
Además, GPT-Live-Transcribe registró una tasa de error de transcripción del 9,6%, frente al 11,65% obtenido por GPT-Realtime-Whisper.
Por su parte, GPT-Transcribe redujo la tasa de error al 8,98%, una mejora considerable respecto al 15,21% registrado por Whisper-1, el primer modelo de OpenAI para convertir voz en texto.
Cómo se compara con la competencia
Datos del laboratorio independiente Artificial Analysis sitúan la tasa de error de palabras de GPT-Transcribe en 3,31%, lo que lo convierte en el mejor modelo de transcripción desarrollado hasta ahora por OpenAI.
No obstante, todavía queda ligeramente por detrás de algunas alternativas del mercado, como Voxtral Small, de Mistral, y Gemini 3.1 Pro, de Google, que registran una tasa de error cercana al 2,8%.
Precio
OpenAI informó que GPT-Transcribe tendrá un costo de 4,50 dólares por cada 1.000 minutos de audio procesado, orientado principalmente a desarrolladores y empresas que integren esta tecnología en sus aplicaciones y servicios.
Con información de Europa Press.