Skip to content

Jev, de TypeSafe AI, convierte la clasificación en una llamada de API casi gratuita

Respuesta corta

TypeSafe AI lanzó Jev, un 'System One' o 'modelo de decisión' que toma texto como entrada y devuelve puntuaciones en punto flotante (confianza sí/no, probabilidades de elección o calificaciones) en lugar de texto generado. Cuesta 0,042 USD por millón de tokens de entrada con salida gratuita, por debajo de GPT-5 Nano, y evalúa muchas preguntas en paralelo.

Qué significa para las operaciones

Para un equipo B2B que gestiona puntuación de leads, triaje de tickets de soporte, filtrado de spam o ranking de relevancia en búsquedas, el formato de Jev encaja directamente con esos flujos: se le pasa el registro de un cliente o el texto de un ticket junto con un conjunto de preguntas de sí/no o con puntuación, y devuelve números de confianza estructurados a un costo lo bastante bajo como para aplicarlos a cada registro, no solo a una muestra. El problema es que Jev no da ninguna explicación de sus puntuaciones, así que cualquier uso que toque contratación, crédito u otras decisiones de alto riesgo necesita evaluaciones estructuradas antes de implementarse, y hasta usos de menor riesgo como la priorización de tickets deberían revisarse para detectar resultados sesgados.

Simon Willison informa que TypeSafe AI presentó Jev la semana pasada, el primer modelo de una categoría que la empresa llama 'modelos System One'; Willison y otros prefieren el término 'modelos de decisión'. En lugar de generar texto, Jev acepta un objeto de texto o semiestructurado de 'estado' y devuelve números en punto flotante: puntuaciones de confianza para preguntas de sí/no ('Noul'), distribuciones de probabilidad entre varias opciones, o puntuaciones dentro de un rango numérico definido.

El precio es inusual: Jev cobra únicamente por los tokens de entrada, a 0,042 USD por millón, con la salida gratuita, más barato que GPT-5 Nano de OpenAI, que cuesta 0,05 USD por millón. Las preguntas se evalúan en paralelo contra un mismo documento, por lo que enviar muchas preguntas cuesta aproximadamente lo mismo que enviar una sola.

Willison señala usos prácticos: detección de spam, etiquetado, priorización y ranking, y reordenamiento de resultados de búsqueda, donde un método económico como BM25 presenta candidatos y Jev los puntúa por relevancia respecto a la consulta original.

También plantea una preocupación específica de este formato: Jev es una caja negra más difícil de interpretar que un LLM estándar, ya que solo devuelve un número sin justificación alguna. En una prueba, Jev calificó a Cupertino como la 'mejor' ciudad del Área de la Bahía y a East Palo Alto como la peor ante la pregunta de sí/no '¿Buena ciudad?', lo que ilustra cómo el sesgo puede esconderse dentro de una puntuación sin explicar. Willison advierte explícitamente contra usar Jev para clasificar candidatos a un empleo por esta razón, y argumenta que las evaluaciones estructuradas importan aquí más que en un proyecto típico de LLM, aunque señala que el bajo costo de Jev hace asequible correr grandes lotes de prompts de prueba.

El lanzamiento ya ha generado experimentos comunitarios y recreaciones de peso abierto, incluido un proyecto llamado Kev construido sobre Qwen 3.5 en versiones de 0,8B, 4B y 9B parámetros, además de un benchmark (JevBench) que compara modelos de decisión. Jev se lanzó menos de una semana antes de este informe.

Fuente: Simon Willison

Siguiente paso

Visibility Analyzer

Esto es lo que el Visibility Analyzer mide en un sitio real: qué respuestas te citan, qué páginas el motor no puede recuperar y qué arreglar primero. Ejecutarlo es gratis.

Lanzar una auditoría de visibilidad gratuita

Lanzarlo es gratis. Sin tarjeta.

Precio
Gratis
Duración
Una ejecución, minutos

Plan gratuito: dos análisis al día, sin tarjeta.