Jev, o modelo que decide sem escrever: onde ele entra na sua automação e onde não entra

O Dani Geek — arte original
A TypeSafe AI lançou um modelo que não gera texto: ele recebe um estado e devolve um veredito tipado com probabilidade. Abaixo, o mapa de onde isso substitui uma chamada de LLM na sua automação, o custo em real, e a parte que ainda é número do fabricante.
A maior parte das suas chamadas de LLM não escreve nada
Abra o seu fluxo do n8n, do Make ou aquele script em Python que você mantém há meses. Conte quantas chamadas de modelo existem ali. Agora conte quantas delas existem para produzir um texto que alguém vai ler.
A conta costuma ser feia. O resto é veredito: esse e-mail merece interromper você? esse lead vai pra qual fila? esse comentário é spam? Você pede o veredito escrevendo um prompt, acrescentando “responda apenas em JSON”, escrevendo um parser para o caso de o modelo enfeitar a resposta, e pendurando um retry porque às vezes ele enfeita mesmo assim.
É por isso que esse nó é lento e caro. Você está pagando um modelo treinado para redigir bem em inglês e português para ele devolver a palavra “sim”.
Aqui dentro da ODG o padrão é o mesmo. O estúdio usa IA pesado, e boa parte das chamadas que rodam por dia são julgamentos: essa peça passa no guardian? essa manchete vira pauta? Nenhuma das duas precisa de uma frase bonita.
O que o Jev faz
O Jev, da TypeSafe AI, saiu do stealth em 15/set/2026. É o primeiro modelo público de uma classe que eles chamam de “System One”, nome emprestado do Sistema 1 do Kahneman, o pensamento rápido e automático.
Você manda um estado (texto, um objeto JSON ou uma lista de textos) e um conjunto de perguntas tipadas. Ele devolve valores tipados com probabilidade, avaliados em paralelo sobre o mesmo estado. Não existe geração de string na saída. São três tipos de pergunta, documentados na página do modelo na Cloudflare: Choice (escolhe entre até 255 opções e devolve a distribuição), Score (um nível numa escala ordenada) e Noul (a probabilidade de “sim”, no lugar de um booleano seco).
O Noul é o que muda mais coisa na prática: um booleano some com a informação mais útil que o modelo tem, o quanto ele está seguro.
A tese do fundador, Diogo Almeida, que passou cerca de quatro anos na OpenAI antes de fundar a TypeSafe em 2024, é uma inversão do que ele fazia lá: “people can’t be the only consumers of intelligence” (The Register, 16/09). Se quem consome a resposta é software, a resposta não precisa ser texto.
Os números de velocidade e custo são medição da própria TypeSafe
A internet passou a semana repetindo esses números como se fossem benchmark.
O post de lançamento declara latência de 70 a 500 ms ponta a ponta e ganhos de “40x a 200x”, com um teto de “193,6x mais rápido, 444,6x mais barato” contra GPT-5.6 Terra, GPT-6 Astra, Fable 5.1 e DeepSeek. A própria TypeSafe avisa no mesmo texto que as avaliações foram feitas por gente da equipe de capacidades deles, que algum viés pode existir, e que esses ganhos estão na ponta alta do que se vê no mundo real.
A frase “0% de alucinação” merece o mesmo cuidado. Ela quer dizer que a resposta sempre respeita o schema, e a TypeSafe escreve isso sem rodeio: “Our number is not empirical. Schema matching is guaranteed.” Thomas Claburn, no The Register, aponta o motivo de a comparação não se sustentar: a saída não é linguagem natural, então não há o que alucinar no sentido em que o termo é usado para LLM. Uma resposta pode vir perfeitamente tipada e completamente errada.
Até 20/09 não havia benchmark independente de acurácia. Como resume o Matheus Battisti no Hora de Codar, sem validação independente isso é claim de fornecedor.
O que terceiros relataram
Os relatos de terceiros valem mais porque vêm de nós que já rodavam em produção (TechCrunch, 18/09):
- Vercel. Pranit Sharma trocou o classificador de revisão de segurança que rodava em ChatGPT Luna 5.6 por Jev, e relata de 5 a 18 vezes mais rápido, com acurácia maior.
- Bryo AI. Nikhil Mudholkar testou classificação de e-mail. O Gemini ficou “slightly more accurate”, e custou de 10 a 20 vezes mais caro. O que mudou ali foi o preço, com a probabilidade calibrada de brinde.
A LangChain mediu o Jev avaliando saída de agente em cerca de 0,44 s por chamada e US$ 0,00035, e o Matthew Berman rodou 724 anúncios de 37 marcas, 8.724 julgamentos em torno de 40 s por uns nove centavos de dólar (36kr, 20/09). O próprio 36kr classifica esses testes como iniciais e de pequena escala.
O mapa: onde isso entra no seu fluxo
Um nó é candidato quando as três condições valem juntas. O texto que sai dele nunca é lido por uma pessoa. A resposta cabe num conjunto fechado de até 255 opções, numa nota ou num sim/não. E hoje existe um parser ali, ou um retry, ou os dois.
Casos que caem nisso em quase toda operação: triagem de caixa de entrada, roteamento de ticket, moderação de conteúdo enviado por usuário, classificação de lead, detecção de duplicata, decisão do próximo passo de um agente, aprovação de saída antes de publicar.
O limiar é a parte que o modelo te dá e o seu fluxo provavelmente não tem hoje. Quando a resposta vem com probabilidade, você pode escrever a regra de negócio que faltava. Armin Ronacher, CTO da Earendil, resume a régua no TechCrunch: com 50% de probabilidade é “a coin toss, and I disregard it”; com 95%, dá pra fazer alguma coisa com aquilo.
Traduzindo para a sua automação: abaixo de 0,70 o item vai para uma fila humana em vez de seguir adiante. Hoje o seu prompt devolve “sim” com a mesma cara de certeza que devolveria “não”.
A limitação que ninguém em PT-BR está citando
Os docs declaram treino primariamente em inglês. Outros idiomas, nas palavras deles, “are handled but not equally well”. E não há fine-tuning nem adaptação aos seus dados.
Se o seu estado é texto em português (e-mail de cliente, comentário, manchete, ticket), essa é a variável que decide se vale a troca, e ninguém mediu isso publicamente. Por isso o teste em sombra abaixo não é opcional.
Outras limitações declaradas: entrada só de texto, JSON ou lista de textos, sem imagem, áudio ou vídeo; cardinalidade máxima de 255, acima disso você quebra em dois estágios; 64K tokens por requisição, dos quais 32K são o teto do estado mais a pergunta mais longa; limites de uso de 250.000 tokens/s e 1.200 requisições/min que, segundo os docs, estão sendo ajustados dinamicamente por causa da demanda. Qualquer número de throughput nesta peça envelhece rápido.
Contexto brasileiro: acesso, preço e o dado do seu cliente
O acesso deixou de ser por waitlist em 20/set, cinco dias depois do lançamento (X, 20/09). Você entra no console da TypeSafe, cria a chave e começa com US$ 5 de crédito, algo como 120 milhões de tokens de entrada. Dá para rodar o teste em sombra que descrevo abaixo sem pagar nada. No entanto, nesse momento, eles fecharam as portas porque a infra-estrutura não suportou.
Fora o console, o modelo está no OpenRouter (typesafe/jev-1.13 e typesafe/jev-latest) e no Cloudflare Workers AI (typesafe/jev), nos dois casos com janela de 32K contra os 64K da API direta. Se a sua automação já passa por um gateway, esse é o caminho de menos atrito. Se o estado for grande, vá de API direta.
Preço: US$ 0,042 por milhão de tokens de entrada, saída não cobrada. Em real, cerca de R$ 0,22 por milhão de tokens de entrada, pela conversão do Hora de Codar no câmbio de R$ 5,14 em 19/09. É conversão do dia, então trate como ordem de grandeza. A própria TypeSafe não descarta que o preço esteja subsidiado nesta fase, e o nome do modelo homenageia William Stanley Jevons, de quem vem o paradoxo: eficiência barata costuma aumentar o consumo.
E a régua que vale para qualquer API de IA vale aqui: o estado que você manda é dado seu e do seu cliente. Enviar conteúdo de e-mail de cliente para um endpoint de terceiro nos EUA é tratamento de dado pessoal, com as obrigações de LGPD que você já conhece. Resolva base legal e contrato antes do teste.
O critério: um nó, um limiar, uma semana
Não testei o Jev em produção. Ele tem uma semana de vida pública, os números de velocidade são do fabricante, e o comportamento em português é uma incógnita declarada nos próprios docs. O que eu faria, e recomendo, é o teste em sombra:
- Escolha um nó, o de maior volume entre os que devolvem veredito.
- Rode o Jev em paralelo ao que já está lá, sem trocar nada no fluxo. Grave as duas respostas e a probabilidade.
- Depois de alguns dias, compare: quantas vezes discordaram, e quem estava certo nas discordâncias.
- Defina o limiar a partir desses dados, não por chute.
- Só então troque, mantendo a rota humana abaixo do limiar.
O crédito inicial cobre isso sem custo. O que eu não faria por enquanto é migrar o pipeline inteiro por causa de uma tabela de latência que o próprio fabricante marcou como ponta alta.
O fio que fica
Se decisão barata virar decisão em todo lugar, como o nome do modelo sugere, a pergunta seguinte é de desenho, não de custo. Um fluxo com trinta pontos de veredito calibrado é um fluxo com trinta limiares para manter, e ninguém tem ferramenta boa para isso hoje.
Antes disso, um exercício de dez minutos: qual decisão da sua automação hoje passa por um prompt que só precisava responder sim ou não? Abra o fluxo, liste esses nós num papel e marque quantos têm um parser pendurado. Esse número é o tamanho da sua oportunidade aqui, e ele também é, provavelmente, o tamanho da sua conta de API no mês passado.