Technology Innovation Institute из Абу-Даби выпустил Falcon-ASR - модель распознавания речи на 1,6 млрд параметров, созданную в первую очередь для арабского языка с особым вниманием к эмиратскому диалекту.
На шести тестовых наборах Open Universal Arabic ASR Leaderboard Falcon-ASR показал средний WER 20,92% против лучшего опубликованного результата 23,17% в снимке данных, который использовал TII, - улучшение на 2,25 процентных пункта. На внутренней оценке TII по эмиратскому диалекту модель зафиксировала WER 22,73% и CER 10,19%, что оказалось лучшим результатом среди сравниваемых систем, опередив следующую по качеству (Qwen3-Omni) на 4,07 процентных пункта по WER.
Модель обучали на эмиратском, литературном арабском, других диалектах Залива и арабских диалектах в целом, а также на английском языке, причём обучающие данные включали фоновый шум, перекрывающуюся речь, музыку, реверберацию и эффекты телефонной связи, чтобы отразить реальные условия записи - звонки и совещания.
Помимо арабского, Falcon-ASR распознаёт английский, французский, испанский и португальский языки на тех же весах модели, без необходимости заранее указывать язык. На семи публичных англоязычных тестовых наборах Hugging Face Open ASR Leaderboard модель показала средний WER 5,74%. Модель также поддерживает пословные метки времени, связывающие каждое распознанное слово с его позицией в аудиозаписи.
Falcon-ASR развивает более раннюю работу TII над Falcon3-Audio. Демо-версия доступна на Hugging Face для тестирования на собственных записях; доступ через API и нативные приложения заявлены как планируемые, но пока недоступны.