Перейти к содержимому

Новая арабская LLM отвечает на эмиратском диалекте, а не на литературном арабском по умолчанию

Короткий ответ

Technology Innovation Institute выпустил Falcon-Emirati-7B - арабскую модель, дообученную на данных эмиратского диалекта. На бенчмарке Alyah она набирает 84,83%, а в тесте на достоверность диалекта отвечает на эмиратском в 0,52 случаев против 0,00-0,05 у конкурентов, которые по умолчанию переходят на литературный арабский.

Что это значит для операций

Для компании, которая ведёт поддержку или продажи через чат для клиентов в ОАЭ, это имеет значение, потому что универсальные арабские языковые модели склонны отвечать на формальном литературном арабском, даже когда клиент пишет на повседневном эмиратском - а это звучит для местной аудитории чопорно и чужеродно. Falcon-Emirati-7B создан распознавать диалект и отвечать на нём же, включая культурно специфичные отсылки, что напрямую касается любого, кто оценивает арабоязычного чат-бота, систему маршрутизации тикетов или ассистента продаж для рынка стран Залива. Команды, уже автоматизировавшие поддержку на арабском, должны сделать достоверность диалекта, а не только точность перевода, критерием выбора модели и тестировать любого кандидата на реальных формулировках клиентов перед запуском.

Technology Innovation Institute (TII) выпустил Falcon-Emirati-7B - арабскую языковую модель на 7 миллиардов параметров, построенную поверх семейства Falcon-H1-Arabic и адаптированную именно под эмиратский диалект стран Залива, включая его лексику, идиомы и культурные отсылки, а не под литературный арабский (MSA).

TII обучил модель на подлинных эмиратских текстах из веба и форумов, материалах на литературном арабском об эмиратской культуре и наследии, а также на синтетических диалектных данных, ограниченных глоссариями, составленными под эмиратскую грамматику и лексику.

На бенчмарке Alyah - наборе из 1173 вопросов, проверяющих владение эмиратским диалектом на уровне носителя, - Falcon-Emirati-7B набирает 84,83%, опережая все остальные арабские и многоязычные модели, протестированные TII, включая более крупные. Отдельная открытая оценка, проведённая Gemini 3.7 Flash, измеряла, действительно ли модели отвечают на эмиратском диалекте, а не переходят по умолчанию на литературный арабский: Falcon-Emirati-7B набрал 0,52 по достоверности диалекта против 0,05 у ALLaM-7B-Instruct-preview, 0,03 у gemma-3-27b-it, 0,02 у Jais-2-8B-Chat и фактически 0,00 у Fanar-2-27B-Instruct. Разрыв сохранялся почти во всех тематических категориях, за исключением базовых приветствий, где диалект и литературный арабский пересекаются сильнее всего.

На части бенчмарка ArabCulture-Dialogue, посвящённой ОАЭ и проверяющей культурно уместные ответы, Falcon-Emirati-7B набрал 85,57%, опередив ALLaM-7B (83,39%), Jais-2-8B (73,79%) и Fanar-2-27B (71,50%).

TII отмечает, что модель всё ещё может отражать смещения обучающих данных и ошибаться на редких выражениях или узколокальных отсылках, и рекомендует проводить оценку под конкретные сценарии использования, прежде чем полагаться на неё для чувствительного или официального контента. Модель уже доступна на чат-платформе TII.

Источник: Hugging Face

Следующий шаг

Visibility Analyzer

Ровно это Visibility Analyzer и меряет на живом сайте: в каких ответах вас цитируют, до каких страниц движок не дотягивается и что чинить первым. Запуск бесплатный.

Запустить бесплатный аудит видимости

Запуск бесплатный, карта не нужна.

Стоимость
Бесплатно
Срок
Один прогон, минуты

Бесплатный тариф: два анализа в день, без карты.