Mistral AI открыла публичное превью Mistral Large 4 (ML4) - модели на 1 триллион параметров, изначально мультимодальной, с открытыми весами и 49 миллиардами активных параметров. Превью-API доступен уже сейчас через Mistral Studio и обслуживается на собственной европейской дата-центровой инфраструктуре Mistral; полные веса модели запланированы к выпуску до конца месяца.
Компания сообщает, что ML4 набирает 59,9% на AutomationBench - тесте из 657 задач, охватывающем агентную работу с Gmail, Google Sheets, Slack и Salesforce, опережая по этому показателю Kimi K3, MiMo-V2.6-Pro и DeepSeek V4 Pro. На AA-Briefcase, бенчмарке для долгосрочной интеллектуальной работы вроде таблиц, презентаций и PDF, модель достигает рейтинга 1393 Elo, также опережая DeepSeek V4 Pro.
Mistral также сообщает о высоких результатах в агентном программировании (61,7% на DeepSWE v1.1, 59,4% на SWE-Atlas-QnA), кибербезопасности (93% на Cybench, 82% на тесте воспроизведения и патчинга уязвимостей), а также на юридических и финансовых задачах, оцененных сторонним оценщиком vals.ai, где, по словам компании, ML4 превосходит GPT-6-Astra по обоим направлениям. По устойчивости к атакам Mistral сообщает, что ML4 выдерживает 93,3% атак на публичном бенчмарке B3 от Lakera и лидирует среди протестированных открытых моделей по собственным оценкам устойчивости к prompt-инъекциям.
Цена превью-API указана как $1,36 за миллион входных токенов и $4,18 за миллион выходных токенов. Полные веса, дополнительные детали архитектуры, результаты тестов и методология пост-обучения обещаны вместе с релизом в конце месяца. Mistral представляет ML4 как первую продуктовую веху, профинансированную раундом серии D на €3 млрд, и заявляет, что модель станет основой для следующего поколения специализированных моделей.