Meta presentó Muse Voice Transcribe, un nuevo modelo de voz en tiempo real multilingüe que detecta la voz, incluso de varios hablantes, para realizar una transcripción precisa.
Muse Voice Transcribe lo desarrolló Meta Superintelligence Labs y se presenta como un modelo multimodal autorregresivo de la familia Muse Spark.
Ofrece reconocimiento automático de voz en tiempo real. Para ello, procesa el audio en fragmentos de 80 ms (12,5 Hz) y lo hace con una técnica llamada retraso adaptativo. Es decir, ajusta el retraso que introduce para predecir la siguiente palabra de manera dinámica, según la dificultad.
De esta forma, ofrece un equilibrio óptimo entre velocidad y precisión, medido por el tiempo necesario para la transcripción final, como explican desde Meta en la página de Muse Voice Transcribe.
El modelo es multilingüe y está entrenado en más de 70 idiomas, aunque solo 25 están ampliamente verificados. Entre ellos, se incluyen el español, el portugués, el alemán, el italiano, el inglés, el chino mandarín y el árabe.
Meta explica que Muse Voice Transcribe es capaz de distinguir en tiempo real hasta 20 participantes en una conversación. A ellos los identifica de manera individual con etiquetas del tipo ‘hablante 1′, hablante 2’, etc.
También se suma su capacidad para admitir de forma nativa entradas de audio de larga duración, que puede superar la hora. Cuenta además con la mejora de la precisión mediante el sesgo por idioma, palabras clave y contexto.
Muse Voice Transcribe está disponible a través de Meta Model API, Meta AI para Mac y Muse Code.
ComputerHoy











