Meta se ha adelantado a OpenAI al lanzar un modelo que transcribe voz en tiempo real. Desarrollado por el equipo de Superinteligencia, Muse Voice Transcribe es capaz de identificar distintas personas en una conversación y detectar las pausas. El nuevo modelo estará disponible en la API y en la app de Meta AI para Mac.

De acuerdo con una publicación en su blog, Muse Voice Transcribe es el primer modelo de percepción en tiempo real que desarrolla Meta. A diferencia de otras variantes con las que ha experimentado la compañía, esta IA puede distinguir más de 20 hablantes distintos dentro de una misma grabación. Si has intentado grabar una reunión con varias personas hablando a la vez, seguramente sabrás que es casi imposible realizar una transcripción.

Meta entrenó el sistema con más de 70 idiomas, de los cuales 25 pasaron por un proceso de validación exhaustiva antes del lanzamiento. Esta variedad no solo permite que más personas puedan hacer transcripciones, sino también hablar en múltiples idiomas en la misma conversación. La compañía señala que los hablantes bilingües alternan entre idiomas de forma natural y a veces lo hacen a mitad de una frase, lo cual no representará problemas para este modelo.

En la parte técnica, la arquitectura detrás de Muse Voice Transcribe procesa el audio en fragmentos de 80 milisegundos. Esto equivale a 12,5 segmentos por segundo, los cuales se convierten cada uno en un token que analiza de forma autorregresiva. En cada fragmento, la IA es capaz de elegir si emite una palabra de inmediato o espera el siguiente bloque de audio para obtener más contexto.

Muse Voice Transcribe reconoce a más de 20 personas hablando, incluso si cambian idioma

Según Meta, este sistema funciona porque no todas las palabras requieren el mismo tiempo de análisis. Las palabras sencillas se transcriben casi al instante, mientras que aquellas que son ambiguas o más difíciles de interpretar necesitan más contexto antes de que la IA las convierta a texto. Los ingenieros de Meta usaron entrenamiento con refuerzo que combina la precisión de la transcripción y el tiempo de espera como parte de la recompensa.

Muse Voice Transcribe es compatible con grabaciones de más de una hora sin necesidad de procesamiento adicional. Cuando el audio se detiene, un token le indica al modelo que no hay más información entrante, por lo que libera cualquier texto pendiente de emitir. La compañía define este comportamiento como escucha flexible y lo aplica también al momento de identificar quién está hablando en ese momento.

En términos de rendimiento, el modelo registra una tasa de error de palabras del 3.1% en idioma inglés, superando a GPT Live Transcribe y Gemini Transcribe Live. A la hora de identificar distintos hablantes, la tasa de error se ubica en 17,5%, que representa el valor más bajo entre los modelos de transcripción más populares.

Muse Voice Transcribe

Muse Voice Transcribe ya está disponible a través de la API por un coste de 3 dólares por cada 1.000 minutos de audio procesado. Meta confirmó que no tiene planes de publicar los pesos abiertos de este modelo, pero podrás acceder a él a través del dictado de Meta AI para Mac y Muse Code. Si ya la instalaste, solo presiona la tecla Fn y comienza a hablar en cualquier aplicación.