Technology Innovation Institute (TII) выпустил Falcon-Emirati-7B - арабскую языковую модель на 7 миллиардов параметров, построенную поверх семейства Falcon-H1-Arabic и адаптированную именно под эмиратский диалект стран Залива, включая его лексику, идиомы и культурные отсылки, а не под литературный арабский (MSA).
TII обучил модель на подлинных эмиратских текстах из веба и форумов, материалах на литературном арабском об эмиратской культуре и наследии, а также на синтетических диалектных данных, ограниченных глоссариями, составленными под эмиратскую грамматику и лексику.
На бенчмарке Alyah - наборе из 1173 вопросов, проверяющих владение эмиратским диалектом на уровне носителя, - Falcon-Emirati-7B набирает 84,83%, опережая все остальные арабские и многоязычные модели, протестированные TII, включая более крупные. Отдельная открытая оценка, проведённая Gemini 3.7 Flash, измеряла, действительно ли модели отвечают на эмиратском диалекте, а не переходят по умолчанию на литературный арабский: Falcon-Emirati-7B набрал 0,52 по достоверности диалекта против 0,05 у ALLaM-7B-Instruct-preview, 0,03 у gemma-3-27b-it, 0,02 у Jais-2-8B-Chat и фактически 0,00 у Fanar-2-27B-Instruct. Разрыв сохранялся почти во всех тематических категориях, за исключением базовых приветствий, где диалект и литературный арабский пересекаются сильнее всего.
На части бенчмарка ArabCulture-Dialogue, посвящённой ОАЭ и проверяющей культурно уместные ответы, Falcon-Emirati-7B набрал 85,57%, опередив ALLaM-7B (83,39%), Jais-2-8B (73,79%) и Fanar-2-27B (71,50%).
TII отмечает, что модель всё ещё может отражать смещения обучающих данных и ошибаться на редких выражениях или узколокальных отсылках, и рекомендует проводить оценку под конкретные сценарии использования, прежде чем полагаться на неё для чувствительного или официального контента. Модель уже доступна на чат-платформе TII.