Skip to content

TypeSafe AI lança Jev, que transforma classificação em chamada de API baratíssima

Resposta curta

A TypeSafe AI lançou o Jev, um 'System One' ou 'modelo de decisão' que recebe texto e retorna escores em ponto flutuante (confiança sim/não, probabilidades de escolha ou notas) em vez de texto gerado. Custa US$ 0,042 por milhão de tokens de entrada, com saída gratuita, mais barato que o GPT-5 Nano, e avalia muitas perguntas em paralelo.

O que isso significa na operação

Para um time B2B que roda pontuação de leads, triagem de tickets de suporte, filtragem de spam ou ranqueamento de relevância em busca, o formato do Jev encaixa diretamente nesses fluxos: você envia o registro de um cliente ou o texto de um ticket junto com um conjunto de perguntas sim/não ou com notas, e recebe números de confiança estruturados a um custo baixo o suficiente para rodar em cada registro, não apenas numa amostra. O problema é que o Jev não dá nenhuma explicação para seus escores, então qualquer uso que toque em contratação, crédito ou outras decisões de alto risco precisa de avaliações estruturadas antes de entrar em produção, e mesmo usos de risco mais baixo, como priorização de tickets, merecem checagem pontual para detectar saídas enviesadas.

Simon Willison relata que a TypeSafe AI apresentou o Jev na semana passada, o primeiro modelo de uma categoria que a empresa chama de 'System One models' — Willison e outros preferem o termo 'modelos de decisão'. Em vez de gerar texto, o Jev recebe um texto ou um objeto de 'estado' semiestruturado e devolve números em ponto flutuante: escores de confiança para perguntas sim/não ('Noul'), distribuições de probabilidade entre opções de múltipla escolha, ou notas dentro de uma faixa numérica definida.

O preço é incomum: o Jev cobra apenas pelos tokens de entrada, a US$ 0,042 por milhão, com saída gratuita — mais barato que o GPT-5 Nano da OpenAI, a US$ 0,05 por milhão. As perguntas são avaliadas em paralelo sobre um único documento, então enviar muitas perguntas custa aproximadamente o mesmo que enviar uma só.

Willison destaca usos práticos: detecção de spam, rotulagem, priorização e ranqueamento, e reranking de busca, em que um método barato como o BM25 traz os candidatos e o Jev pontua a relevância deles em relação à consulta original.

Ele também levanta uma preocupação específica desse formato: o Jev é uma caixa-preta ainda mais fechada que um LLM comum, já que devolve apenas um número, sem justificativa. Em um teste, o Jev classificou Cupertino como a 'melhor' cidade da Bay Area e East Palo Alto como a pior, num prompt sim/não do tipo 'Boa cidade?', ilustrando como viés pode se esconder dentro de um escore não explicado. Por essa razão, Willison alerta explicitamente contra usar o Jev para ranquear candidatos a emprego, e argumenta que avaliações estruturadas importam mais aqui do que em projetos típicos de LLM — embora observe que o baixo custo do Jev torna viável rodar grandes lotes de prompts de teste.

O lançamento já gerou experimentos da comunidade e recriações de peso aberto, incluindo um projeto chamado Kev, construído sobre o Qwen 3.5 nos tamanhos 0,8B, 4B e 9B, além de um benchmark (JevBench) comparando modelos de decisão. O Jev foi lançado há menos de uma semana antes deste relato.

Fonte: Simon Willison

Próximo passo

Visibility Analyzer

É isto que o Visibility Analyzer mede num site real: quais respostas citam você, quais páginas o motor não consegue recuperar e o que corrigir primeiro. Rodar é grátis.

Rodar uma auditoria de visibilidade grátis

Rodar é grátis. Sem cartão.

Preço
Grátis
Duração
Uma rodada, minutos

Plano grátis: duas análises por dia, sem cartão.