O Technology Innovation Institute, em Abu Dhabi, lançou o Falcon-ASR, um modelo de reconhecimento de fala com 1,6 bilhão de parâmetros construído principalmente para o árabe, com atenção especial ao dialeto emirati.
Nos seis conjuntos de teste do Open Universal Arabic ASR Leaderboard, o Falcon-ASR obteve uma taxa média de erro de palavras (WER) de 20,92%, contra o melhor resultado publicado de 23,17% no recorte usado pela TII — uma melhora de 2,25 pontos percentuais. Na avaliação interna de emirati conduzida pela TII, o modelo registrou WER de 22,73% e taxa de erro de caracteres (CER) de 10,19%, a menor entre os sistemas comparados, superando o segundo melhor resultado (Qwen3-Omni) em 4,07 pontos percentuais de WER.
O modelo foi treinado com emirati, árabe padrão moderno, outros dialetos do Golfo e árabes, além de inglês, com dados de treinamento que incluíam ruído de fundo, fala sobreposta, música, reverberação e efeitos de telefonia, reproduzindo condições reais de gravação como chamadas e reuniões.
Além do árabe, o Falcon-ASR transcreve inglês, francês, espanhol e português usando os mesmos pesos do modelo, sem necessidade de indicar previamente o idioma. No Open ASR Leaderboard do Hugging Face, com sete conjuntos de teste públicos em inglês, o modelo registrou WER médio de 5,74%. Ele também oferece timestamps por palavra, vinculando cada palavra transcrita à sua posição exata no áudio.
O Falcon-ASR é construído sobre o trabalho anterior da TII com o Falcon3-Audio. Uma demo está disponível no Hugging Face para testes com gravações fornecidas pelo usuário; acesso por API e aplicações nativas são descritos como planejados, mas ainda não disponíveis.