Ir para o conteúdo

TII lança Falcon-ASR, modelo de voz árabe de 1,6B

Resposta curta

O Technology Innovation Institute lançou o Falcon-ASR, modelo de reconhecimento de fala com 1,6 bilhão de parâmetros voltado ao árabe, com foco no dialeto emirati. O modelo obteve taxa de erro de palavras de 20,92% em seis benchmarks árabes, superando o melhor resultado publicado (23,17%), e liderou uma avaliação interna de emirati. Também transcreve inglês, francês, espanhol e português.

O que isso significa na operação

Para uma equipe de suporte ou vendas que atende chamadas nos Emirados ou no Golfo mais amplo, a precisão de transcrição em dialetos árabes tem sido um ponto fraco persistente nos pipelines de automação de voz — sistemas de ASR padrão, ajustados para o árabe padrão moderno, costumam distorcer a fala cotidiana emirati, o que compromete a pontuação de QA, o registro em CRM e as ferramentas de assistência ao agente. Os timestamps por palavra do Falcon-ASR e sua menor taxa de erro em dialetos emirati e do Golfo o tornam candidato para equipes que constroem ou reconstroem pipelines de transcrição de chamadas, ticketing por voz ou notas de reunião nessa região; o modelo já pode ser testado via demo no Hugging Face, mas o acesso por API e aplicações nativas ainda estão apenas planejados, então a integração em produção ainda não está pronta.

O Technology Innovation Institute, em Abu Dhabi, lançou o Falcon-ASR, um modelo de reconhecimento de fala com 1,6 bilhão de parâmetros construído principalmente para o árabe, com atenção especial ao dialeto emirati.

Nos seis conjuntos de teste do Open Universal Arabic ASR Leaderboard, o Falcon-ASR obteve uma taxa média de erro de palavras (WER) de 20,92%, contra o melhor resultado publicado de 23,17% no recorte usado pela TII — uma melhora de 2,25 pontos percentuais. Na avaliação interna de emirati conduzida pela TII, o modelo registrou WER de 22,73% e taxa de erro de caracteres (CER) de 10,19%, a menor entre os sistemas comparados, superando o segundo melhor resultado (Qwen3-Omni) em 4,07 pontos percentuais de WER.

O modelo foi treinado com emirati, árabe padrão moderno, outros dialetos do Golfo e árabes, além de inglês, com dados de treinamento que incluíam ruído de fundo, fala sobreposta, música, reverberação e efeitos de telefonia, reproduzindo condições reais de gravação como chamadas e reuniões.

Além do árabe, o Falcon-ASR transcreve inglês, francês, espanhol e português usando os mesmos pesos do modelo, sem necessidade de indicar previamente o idioma. No Open ASR Leaderboard do Hugging Face, com sete conjuntos de teste públicos em inglês, o modelo registrou WER médio de 5,74%. Ele também oferece timestamps por palavra, vinculando cada palavra transcrita à sua posição exata no áudio.

O Falcon-ASR é construído sobre o trabalho anterior da TII com o Falcon3-Audio. Uma demo está disponível no Hugging Face para testes com gravações fornecidas pelo usuário; acesso por API e aplicações nativas são descritos como planejados, mas ainda não disponíveis.

Fonte: Hugging Face

Próximo passo

Visibility Analyzer

Uma notícia sobre IA não diz como os assistentes veem o seu site. O Visibility Analyzer verifica isso no site real: quais respostas citam você, quais páginas o motor não consegue recuperar e o que corrigir primeiro. Rodar é grátis.

Rodar uma auditoria de visibilidade grátis

Rodar é grátis. Sem cartão.

Preço
Grátis
Duração
Uma rodada, minutos

Plano grátis: duas análises por dia, sem cartão.