Meta presentó Muse Voice Transcribe, un modelo de reconocimiento de voz en tiempo real capaz de transcribir audio con múltiples hablantes y en decenas de idiomas. La herramienta fue desarrollada por Meta Superintelligence Labs y pertenece a la familia de modelos Muse Spark, según informó la compañía.

El sistema procesa el audio en fragmentos de 80 milisegundos —equivalente a 12,5 veces por segundo— mediante una técnica denominada retraso adaptativo, que ajusta de forma dinámica el tiempo de respuesta según la dificultad de cada fragmento. Meta describió este mecanismo como un equilibrio entre velocidad y precisión, medido por el tiempo necesario para la transcripción final.

Muse Voice Transcribe puede identificar en tiempo real hasta 20 participantes en una misma conversación, a los que etiqueta individualmente como "hablante 1", "hablante 2" y así sucesivamente, precisó la empresa. También admite entradas de audio de larga duración que pueden superar la hora de grabación.

El modelo está entrenado en más de 70 idiomas, aunque solo 25 han sido "ampliamente verificados", entre ellos el español, el portugués, el alemán, el italiano, el inglés, el chino mandarín y el árabe. Además, permite mejorar la precisión mediante el uso de sesgo por idioma, palabras clave y contexto.

Muse Voice Transcribe está disponible a través de Meta Model API, Meta AI para Mac y Muse Code.

Con información de Europa Press