Mistral AI abrió una vista previa pública de Mistral Large 4 (ML4), un modelo nativamente multimodal de pesos abiertos con 1 billón de parámetros y 49.000 millones de parámetros activos. La API de vista previa está disponible ahora a través de Mistral Studio, servida en la infraestructura de centros de datos propia de Mistral en Europa; los pesos completos del modelo están previstos para fin de mes.
La compañía reporta que ML4 obtiene 59,9% en AutomationBench, un benchmark de 657 tareas que cubre el uso agéntico de Gmail, Google Sheets, Slack y Salesforce, por delante de Kimi K3, MiMo-V2.6-Pro y DeepSeek V4 Pro en esa medida específica. En AA-Briefcase, un benchmark para trabajo de conocimiento de largo alcance como hojas de cálculo, presentaciones y PDFs, alcanza 1.393 Elo, también por delante de DeepSeek V4 Pro.
Mistral reporta además resultados sólidos en codificación agéntica (61,7% en DeepSWE v1.1, 59,4% en SWE-Atlas-QnA), ciberseguridad (93% en Cybench, 82% en una prueba de reproducción y parcheo de vulnerabilidades), y tareas legales y financieras evaluadas por el evaluador externo vals.ai, donde la compañía afirma que ML4 supera a GPT-6-Astra en ambas. En robustez de seguridad, Mistral reporta que ML4 resiste el 93,3% de los ataques en el benchmark público B3 de Lakera y encabeza sus propias evaluaciones de robustez frente a inyección de prompts entre los modelos de pesos abiertos evaluados.
El precio de la API de vista previa está listado en $1,36 por millón de tokens de entrada y $4,18 por millón de tokens de salida. Los pesos completos, detalles adicionales de arquitectura, benchmarks y metodología de post-entrenamiento se prometen junto con el lanzamiento de fin de mes. Mistral presenta a ML4 como el primer hito de producto financiado por su ronda Serie D de 3.000 millones de euros y dice que el modelo servirá de base para una nueva generación de modelos especializados.