GPT-6 Astra operando o computador: a conta que a OpenAI publicou e pouca gente repete

O Dani Geek — arte original
O anúncio traz 72,6% em tarefas de desktop sem internet, a cerca de 40 minutos cada. Antes de deixar um agente clicando no seu Mac, vale fazer a conta que vem depois desse número.
Onde o Astra aparece de verdade
A OpenAI lançou o GPT-6 Astra em 3 de setembro de 2026 com uma promessa central: usar o computador. Preencher formulário, atualizar CRM, organizar agenda, instalar e testar software, resolver o que estiver visível na tela. É o sucessor do GPT-5.6 Sol, segundo a página oficial e o post dos OpenAI Developers no X.
O primeiro detalhe prático já muda a experiência de quem paga o Plus. Segundo o Notebookcheck, no Plus o Astra aparece apenas nos modos Work e Codex do app desktop. Quem abre o Chat comum esperando o modelo novo não encontra. O GPT-6 Pro (com o Astra por baixo) no Chat fica para os planos Pro, Business e Enterprise.
Tem mais dois pontos de fricção antes do primeiro clique. O app desktop precisa estar atualizado e o Codex CLI na versão 0.153.0 ou superior, segundo o mesmo Notebookcheck. E o rollout foi gradual: no dia 3 chegou a um conjunto limitado de organizações, com Plus, Pro, Business e Enterprise “nos próximos dias”, segundo o 9to5Mac. No Enterprise, o acesso vem desligado por padrão e depende do administrador. Há inclusive uma issue aberta no repositório do Codex de uma conta Pro elegível, no Windows, sem o modelo no seletor.
Isso importa para qualquer review que você leia: a data em que o modelo apareceu de fato na conta, o plano e a versão do CLI são parte do resultado. Sem esses três dados, o relato pode ser de outro modelo.
O número que pouca gente repete: 40 minutos por tarefa
O dado que circula é 72,6% no OSWorld 2.0. A frase completa dos OpenAI Developers é outra: “GPT-6 Astra scores 72.6% on OSWorld 2.0 Offline, which tests desktop tasks without internet access”. O benchmark é de tarefas de desktop sem internet. Uso real, com browser aberto e formulário de sistema legado, é outro terreno, e eu não encontrei um número oficial do OSWorld 2.0 online.
O mesmo post traz o dado que quase não aparece nos resumos: cerca de 40 minutos por tarefa, contra cerca de 75 minutos e 65,7% do GPT-5.6 Sol. A OpenAI apresenta isso como avanço, e é. Mas para quem vai usar, a leitura é esta:
Dez tarefas de complexidade parecida com as do benchmark custam cerca de 400 minutos de agente rodando. Sete saem certas. Três voltam para você. Se cada tarefa que voltou leva 20 minutos para diagnosticar e refazer à mão, são mais 60 minutos seus. E ainda falta a conta que nenhum benchmark mede: quanto do tempo do agente você passou olhando a tela para ter certeza de que ele não ia mandar o e-mail errado.
É essa a conta de usar um agente no computador, e quase ninguém a publica, porque exige registrar a semana inteira, tarefa por tarefa, com relógio.
O gate de segurança que pausa trabalho inocente
O segundo ponto que a timeline está pulando: o Astra atingiu o limiar “Critical” de cibersegurança no Preparedness Framework da OpenAI. Está no system card da OpenAI, não num resumo: “Astra is our first model to reach the Critical level of cybersecurity capability under our Preparedness Framework”. Em testes internos, segundo o InfoQ lendo o mesmo documento, o modelo achou vulnerabilidades até então desconhecidas num browser e num kernel de sistema operacional e montou uma cadeia de exploit funcional; duas delas a OpenAI diz ter repassado aos mantenedores.
A consequência prática está descrita no MarkTechPost e no VentureBeat, que traz a frase da própria OpenAI: trabalho legítimo pode ser “slowed, paused or stopped” por atividade que pareça não relacionada. As capacidades ofensivas ficam restritas aos programas Trusted Access e Daybreak, e os checks de segurança podem pausar ou bloquear tarefas mesmo em trabalho não relacionado. Isso significa que um agente organizando a sua pasta de notas fiscais pode parar no meio porque um verificador decidiu que a sequência de ações parecia suspeita. Nenhuma demo de lançamento mostra essa tela, mas ela faz parte do produto.
O que uma semana de uso precisa registrar
Sem log, teste nenhum vale nada. São seis campos que eu cobraria de qualquer review que você for ler:
- Quando o modelo apareceu. Data no seletor, plano da conta, versão do app e do CLI. Dias antes disso não contam.
- A tarefa, por escrito, antes de começar. O que era pra fazer, em que app, com que resultado esperado. Sem isso, “deu certo” vira opinião.
- Tempo do agente, cronometrado. Do envio da instrução até o agente parar, por conta própria ou por pausa.
- Tempo de supervisão. Quanto tempo eu fiquei olhando a tela em vez de fazer outra coisa. É o número que decide se o agente devolveu tempo ou consumiu.
- O ponto exato onde travou. Qual menu, qual campo, qual diálogo. E se a parada foi erro do modelo, limite do app ou o gate de segurança.
- O que foi refeito à mão. Tarefa por tarefa, com o tempo.
Com esses seis campos, a conta fecha sozinha: horas de agente, horas minhas, tarefas entregues, tarefas refeitas. Sem eles, a peça é a demo da OpenAI recontada em português.
Onde fica o ponto de confirmação
A conclusão que dá para desenhar sem log nenhum vem da própria descrição do produto. A OpenAI diz que o Astra pode “usar o seu Mac ou outro desktop, inclusive em segundo plano enquanto você trabalha”. A pergunta que decide o uso é esta, e o Help Center bloqueou a minha tentativa de responder: o Work mode pede confirmação antes de clicar em enviar, pagar ou apagar, ou roda até o fim sem perguntar?
Se ele pergunta, o desenho do fluxo é razoável: o agente roda em segundo plano, faz o trabalho de preencher e navegar, e você fica no ponto de confirmação, que é o único momento com consequência fora do seu computador. Se ele não pergunta, o ponto de confirmação precisa ser construído por você, com o agente operando só em contas de teste ou em tarefas onde o pior caso é reversível.
Nos dois cenários, “não deixaria sem supervisão” é uma decisão de desenho de fluxo, não de coragem. Um agente que acerta 7 em 10 e leva 40 minutos por tarefa é um bom estagiário para tarefas de preenchimento, e um péssimo responsável por qualquer clique com efeito fora da tela. O desenho do fluxo decide qual dos dois ele vai ser na sua semana.
O que eu quero saber de você
Uma pergunta concreta para quem já tem o Astra no seletor do Work mode: na sua conta, ele pediu confirmação antes do primeiro clique com efeito fora da tela, tipo enviar um formulário ou salvar um arquivo em pasta compartilhada? Me conta no X, em @odanigeek, com o plano e a versão do CLI. Esse dado diz mais sobre o uso real do que o benchmark.
Fontes: OpenAI, GPT-6 Astra · OpenAI Developers no X, 03/set/2026 · OpenAI, system card do GPT-6 Astra · InfoQ, set/2026 · MarkTechPost, 03/set/2026 · VentureBeat, 03/set/2026 · Notebookcheck · 9to5Mac, 04/set/2026 · openai/codex issue #42853
NO-PHOTO: nenhuma das fotos do lote é sobre o assunto (duas são de aves e paisagem, duas são do carro Opel Astra).