Simon Willison informa que TypeSafe AI presentó Jev la semana pasada, el primer modelo de una categoría que la empresa llama 'modelos System One'; Willison y otros prefieren el término 'modelos de decisión'. En lugar de generar texto, Jev acepta un objeto de texto o semiestructurado de 'estado' y devuelve números en punto flotante: puntuaciones de confianza para preguntas de sí/no ('Noul'), distribuciones de probabilidad entre varias opciones, o puntuaciones dentro de un rango numérico definido.
El precio es inusual: Jev cobra únicamente por los tokens de entrada, a 0,042 USD por millón, con la salida gratuita, más barato que GPT-5 Nano de OpenAI, que cuesta 0,05 USD por millón. Las preguntas se evalúan en paralelo contra un mismo documento, por lo que enviar muchas preguntas cuesta aproximadamente lo mismo que enviar una sola.
Willison señala usos prácticos: detección de spam, etiquetado, priorización y ranking, y reordenamiento de resultados de búsqueda, donde un método económico como BM25 presenta candidatos y Jev los puntúa por relevancia respecto a la consulta original.
También plantea una preocupación específica de este formato: Jev es una caja negra más difícil de interpretar que un LLM estándar, ya que solo devuelve un número sin justificación alguna. En una prueba, Jev calificó a Cupertino como la 'mejor' ciudad del Área de la Bahía y a East Palo Alto como la peor ante la pregunta de sí/no '¿Buena ciudad?', lo que ilustra cómo el sesgo puede esconderse dentro de una puntuación sin explicar. Willison advierte explícitamente contra usar Jev para clasificar candidatos a un empleo por esta razón, y argumenta que las evaluaciones estructuradas importan aquí más que en un proyecto típico de LLM, aunque señala que el bajo costo de Jev hace asequible correr grandes lotes de prompts de prueba.
El lanzamiento ya ha generado experimentos comunitarios y recreaciones de peso abierto, incluido un proyecto llamado Kev construido sobre Qwen 3.5 en versiones de 0,8B, 4B y 9B parámetros, además de un benchmark (JevBench) que compara modelos de decisión. Jev se lanzó menos de una semana antes de este informe.