OpenAI presentó dos nuevos modelos de inteligencia artificial especializados en el reconocimiento de voz y la transcripción de conversaciones. Se trata de GPT-Live-Transcribe, pensado para convertir voz en texto en tiempo real, y GPT-Transcribe, diseñado para procesar archivos de audio completos y tareas de transcripción por lotes.

El anuncio fue realizado por la compañía a través de su cuenta para desarrolladores en X, donde destacó que ambos modelos fueron desarrollados específicamente para mejorar la comprensión del contexto de las conversaciones y ofrecer transcripciones más precisas.

Mejor comprensión del contexto

Según OpenAI, los nuevos modelos son capaces de reconocer con mayor precisión distintos acentos, idiomas, expresiones breves, números, terminología especializada e incluso conversaciones realizadas en entornos con mucho ruido de fondo.

En el caso de GPT-Live-Transcribe, el sistema también puede utilizar automáticamente transcripciones previas como contexto para mejorar la calidad de los resultados en tiempo real.

La empresa aseguró que proporcionar información adicional, como el idioma esperado o el tema de una reunión, incrementa significativamente la precisión de las transcripciones.

Menos errores que los modelos anteriores

OpenAI compartió resultados de sus pruebas internas de reconocimiento automático de voz, en las que los nuevos modelos mostraron mejoras respecto a sus predecesores.

Datos clave

En las evaluaciones realizadas con contexto adicional, GPT-Live-Transcribe mejoró su precisión semántica del 38,5% al 44,6%, mientras que GPT-Transcribe pasó del 41,6% al 45,2%.

Además, GPT-Live-Transcribe registró una tasa de error de transcripción del 9,6%, frente al 11,65% obtenido por GPT-Realtime-Whisper.

Por su parte, GPT-Transcribe redujo la tasa de error al 8,98%, una mejora considerable respecto al 15,21% registrado por Whisper-1, el primer modelo de OpenAI para convertir voz en texto.

Cómo se compara con la competencia

Datos del laboratorio independiente Artificial Analysis sitúan la tasa de error de palabras de GPT-Transcribe en 3,31%, lo que lo convierte en el mejor modelo de transcripción desarrollado hasta ahora por OpenAI.

No obstante, todavía queda ligeramente por detrás de algunas alternativas del mercado, como Voxtral Small, de Mistral, y Gemini 3.1 Pro, de Google, que registran una tasa de error cercana al 2,8%.

Precio

OpenAI informó que GPT-Transcribe tendrá un costo de 4,50 dólares por cada 1.000 minutos de audio procesado, orientado principalmente a desarrolladores y empresas que integren esta tecnología en sus aplicaciones y servicios.

Con información de Europa Press.