Saltar al contenido

TII lanza Falcon-ASR, modelo de voz árabe de 1.600M

Respuesta corta

El Technology Innovation Institute lanzó Falcon-ASR, un modelo de reconocimiento de voz de 1.600 millones de parámetros centrado en árabe y, en particular, en el dialecto emiratí. Obtuvo un 20,92% de tasa de error de palabra en seis benchmarks árabes, superando el mejor resultado publicado (23,17%), y lideró una evaluación interna en emiratí. También transcribe inglés, francés, español y portugués.

Qué significa para las operaciones

Para un equipo de soporte o ventas que atiende llamadas en los Emiratos o el Golfo en general, la precisión de transcripción en árabe dialectal ha sido un punto débil persistente en los pipelines de automatización de voz: los ASR estándar ajustados para árabe estándar moderno suelen distorsionar el habla emiratí cotidiana, lo que rompe el scoring de QA, el registro en CRM y las herramientas de asistencia al agente. Las marcas de tiempo a nivel de palabra de Falcon-ASR y su menor tasa de error en dialectos emiratí y del Golfo lo convierten en un candidato para equipos que construyen o reconstruyen pipelines de transcripción de llamadas, tickets de voz o notas de reuniones en esa región; el modelo ya puede probarse mediante una demo en Hugging Face, aunque el acceso por API y las aplicaciones nativas solo están planeados, por lo que la integración en producción todavía no es posible.

El Technology Innovation Institute de Abu Dhabi ha lanzado Falcon-ASR, un modelo de reconocimiento de voz de 1.600 millones de parámetros construido principalmente para árabe, con especial atención al dialecto emiratí.

En los seis conjuntos de prueba del Open Universal Arabic ASR Leaderboard, Falcon-ASR logró una tasa de error de palabra (WER) promedio del 20,92%, frente a un mejor resultado publicado del 23,17% en la instantánea que usó TII — una mejora de 2,25 puntos porcentuales. En la evaluación interna de TII sobre dialecto emiratí, el modelo registró un 22,73% de WER y un 10,19% de tasa de error de carácter (CER), la más baja entre los sistemas comparados, superando al siguiente mejor resultado (Qwen3-Omni) por 4,07 puntos porcentuales en WER.

El modelo se entrenó con dialecto emiratí, árabe estándar moderno, otros dialectos del Golfo y árabes, e inglés, con datos de entrenamiento que incluían ruido de fondo, habla superpuesta, música, reverberación y efectos de telefonía para reflejar condiciones de grabación reales como llamadas y reuniones.

Más allá del árabe, Falcon-ASR transcribe inglés, francés, español y portugués usando los mismos pesos del modelo, sin necesidad de especificar el idioma de antemano. En los siete conjuntos de prueba públicos en inglés del Open ASR Leaderboard de Hugging Face, obtuvo un WER medio del 5,74%. El modelo también admite marcas de tiempo a nivel de palabra, que vinculan cada palabra transcrita con su posición en el audio.

Falcon-ASR se apoya en el trabajo previo de TII, Falcon3-Audio. Hay una demo disponible en Hugging Face para probar con grabaciones proporcionadas por el usuario; el acceso por API y las aplicaciones nativas se describen como planeados pero aún no disponibles.

Fuente: Hugging Face

Siguiente paso

Visibility Analyzer

Una noticia sobre IA no dice cómo los asistentes ven tu sitio. El Visibility Analyzer lo comprueba en el sitio real: qué respuestas te citan, qué páginas el motor no puede recuperar y qué arreglar primero. Ejecutarlo es gratis.

Lanzar una auditoría de visibilidad gratuita

Lanzarlo es gratis. Sin tarjeta.

Precio
Gratis
Duración
Una ejecución, minutos

Plan gratuito: dos análisis al día, sin tarjeta.