Simon Willison relata que a TypeSafe AI apresentou o Jev na semana passada, o primeiro modelo de uma categoria que a empresa chama de 'System One models' — Willison e outros preferem o termo 'modelos de decisão'. Em vez de gerar texto, o Jev recebe um texto ou um objeto de 'estado' semiestruturado e devolve números em ponto flutuante: escores de confiança para perguntas sim/não ('Noul'), distribuições de probabilidade entre opções de múltipla escolha, ou notas dentro de uma faixa numérica definida.
O preço é incomum: o Jev cobra apenas pelos tokens de entrada, a US$ 0,042 por milhão, com saída gratuita — mais barato que o GPT-5 Nano da OpenAI, a US$ 0,05 por milhão. As perguntas são avaliadas em paralelo sobre um único documento, então enviar muitas perguntas custa aproximadamente o mesmo que enviar uma só.
Willison destaca usos práticos: detecção de spam, rotulagem, priorização e ranqueamento, e reranking de busca, em que um método barato como o BM25 traz os candidatos e o Jev pontua a relevância deles em relação à consulta original.
Ele também levanta uma preocupação específica desse formato: o Jev é uma caixa-preta ainda mais fechada que um LLM comum, já que devolve apenas um número, sem justificativa. Em um teste, o Jev classificou Cupertino como a 'melhor' cidade da Bay Area e East Palo Alto como a pior, num prompt sim/não do tipo 'Boa cidade?', ilustrando como viés pode se esconder dentro de um escore não explicado. Por essa razão, Willison alerta explicitamente contra usar o Jev para ranquear candidatos a emprego, e argumenta que avaliações estruturadas importam mais aqui do que em projetos típicos de LLM — embora observe que o baixo custo do Jev torna viável rodar grandes lotes de prompts de teste.
O lançamento já gerou experimentos da comunidade e recriações de peso aberto, incluindo um projeto chamado Kev, construído sobre o Qwen 3.5 nos tamanhos 0,8B, 4B e 9B, além de um benchmark (JevBench) comparando modelos de decisão. O Jev foi lançado há menos de uma semana antes deste relato.