El Technology Innovation Institute de Abu Dhabi ha lanzado Falcon-ASR, un modelo de reconocimiento de voz de 1.600 millones de parámetros construido principalmente para árabe, con especial atención al dialecto emiratí.
En los seis conjuntos de prueba del Open Universal Arabic ASR Leaderboard, Falcon-ASR logró una tasa de error de palabra (WER) promedio del 20,92%, frente a un mejor resultado publicado del 23,17% en la instantánea que usó TII — una mejora de 2,25 puntos porcentuales. En la evaluación interna de TII sobre dialecto emiratí, el modelo registró un 22,73% de WER y un 10,19% de tasa de error de carácter (CER), la más baja entre los sistemas comparados, superando al siguiente mejor resultado (Qwen3-Omni) por 4,07 puntos porcentuales en WER.
El modelo se entrenó con dialecto emiratí, árabe estándar moderno, otros dialectos del Golfo y árabes, e inglés, con datos de entrenamiento que incluían ruido de fondo, habla superpuesta, música, reverberación y efectos de telefonía para reflejar condiciones de grabación reales como llamadas y reuniones.
Más allá del árabe, Falcon-ASR transcribe inglés, francés, español y portugués usando los mismos pesos del modelo, sin necesidad de especificar el idioma de antemano. En los siete conjuntos de prueba públicos en inglés del Open ASR Leaderboard de Hugging Face, obtuvo un WER medio del 5,74%. El modelo también admite marcas de tiempo a nivel de palabra, que vinculan cada palabra transcrita con su posición en el audio.
Falcon-ASR se apoya en el trabajo previo de TII, Falcon3-Audio. Hay una demo disponible en Hugging Face para probar con grabaciones proporcionadas por el usuario; el acceso por API y las aplicaciones nativas se describen como planeados pero aún no disponibles.