ODANIGEEK

Apple Intelligence passa a ter cota: o que muda para quem automatiza com Atalhos

O Dani Geek — arte original

A Apple detalhou em setembro quais recursos de IA rodam medidos no servidor e quais continuam livres no aparelho. Se você montou fluxo em cima de Atalhos achando que era ilimitado, vale redesenhar antes que a cota comece a valer.

Em 9 de setembro de 2026 a Apple publicou dois documentos discretos: um artigo de suporte e os Termos de Uso da Apple Intelligence. Nenhum dos dois é notícia de manchete, mas juntos eles respondem a uma pergunta que quem automatiza vinha respondendo por palpite: quais partes da Apple Intelligence são de graça e ilimitadas, e quais são recurso medido.

A resposta curta: o que roda no aparelho não tem limite. O que roda no Private Cloud Compute tem.

Isso não é novo, aliás. A primeira menção pública saiu no press release da WWDC, em 9 de junho: “Some Apple Intelligence features, including image generation, have daily usage limits because they rely on powerful server models” (via MacRumors). O que mudou em setembro foi o detalhamento. A Apple nomeou os recursos, escreveu os termos e deixou claro que haverá acesso pago.

O mapa: o que é local e o que é servidor

A lista oficial de recursos com limite está no artigo de suporte HT127901:

Tudo que não está nessa lista roda no aparelho e não conta. Na sessão 319 da WWDC26, a Apple foi explícita com os desenvolvedores: “The on-device model has no request limits, while PCC offers a daily limit per user.”

A mesma sessão dá as diferenças técnicas que explicam por que alguém escolheria a nuvem em primeiro lugar: 4 mil tokens de contexto no aparelho contra 32 mil no PCC, reasoning (nos níveis light, moderate e deep) exclusivo do servidor, e o modelo local funcionando offline. É escolha de capacidade, não só de qualidade de resposta.

Quando o limite estoura, o recurso não some para sempre: “If you reach a limit in a particular feature, that feature will become available again after a time out period.” A Apple não diz quanto dura esse time out, nem quantas requisições cabem no dia. Nenhum número de cota foi publicado, por ninguém.

A cota é da pessoa, não do app

Este é o ponto que quase todo mundo vai deixar passar, e é o que mais importa para quem monta sistema.

Na sessão 319, a frase é direta: “Requests are counted with your user’s iCloud account.” E logo depois: “Each user gets a daily limit. And users can upgrade to iCloud+ to get higher limits.”

Traduzindo para a sua realidade: três Atalhos seus, mais dois apps de terceiros que você instalou e usam Foundation Models no servidor, bebem todos do mesmo balde. O Atalho que resume seu e-mail de manhã compete com o app de notas que você usa à tarde. Você não tem visibilidade dessa soma. O desenvolvedor do app tem uma API para consultar (model.quotaUsage, com isApproachingLimit e isLimitReached), e você, montando fluxo no Atalhos, não tem nada análogo documentado.

Para o desenvolvedor, a compensação é boa: “there are no token costs to you, the developer”, desde que o app tenha menos de 2 milhões de downloads e passe por inscrição. O custo foi transferido para a cota do usuário. Para quem automatiza sem publicar app, a compensação simplesmente não existe.

O parágrafo dos Termos que fala com você

Os Termos de Uso da Apple Intelligence trazem uma linha que passou batida na cobertura:

“Excessive, abusive, automated, fraudulent, illegal or otherwise unreasonable use … may be restricted, throttled, suspended, or subject to additional limits.”

Leia de novo a terceira palavra: automated. Um Atalho disparado por automação em loop é, literalmente, uso automatizado. Não estou dizendo que a Apple vai sair estrangulando quem usa Atalhos de forma sensata, e não tenho como afirmar como isso será aplicado na prática. Estou dizendo que o contrato deixa a porta aberta, e quem desenha sistema trabalha com o contrato, não com a expectativa de boa vontade.

Os mesmos Termos guardam o direito de “change, suspend, remove, or disable access to any part of Apple Intelligence Features at any time without notice”. Isso vale para o recurso inteiro, não só para a cota.

O acesso pago que ainda não tem preço

O press release de junho dizia que “Increased access is available with most iCloud+ subscription plans”. O artigo de setembro é mais seco: “Increased access to such features will be available for a fee.”

Aqui vale cortar uma confusão que já vi circulando. A única cota concreta que a Apple publicou, com números, é a do app Casa: resumo de vídeo para 1 câmera no plano de 2 TB, 2 câmeras no de 6 TB, 5 câmeras no de 12 TB. Para Fotos, Atalhos e o resto, não existe plano anunciado, nem preço, nem data. Quem afirmar que “o Atalhos agora precisa de iCloud+ de X TB” está inventando.

O que a Apple data é o acesso pago: ele chega com os “2027 software releases”, o nome que ela dá à família iOS 27/macOS 27 lançada em setembro de 2026. Quando a cota em si passa a valer, o artigo não diz — só “in the future”.

Como desenhar o fallback

A parte boa desta história é que a Apple publicou o contrato de cota junto com a API para lidar com ela. O desenvolvedor de app tem isLimitReached e pode ramificar. Você, no Atalhos, vai fazer à mão o que ele faz em código: decidir antes o que acontece quando a nuvem diz não.

Três rotas, em ordem de preferência.

Rota 1: modelo local como caminho padrão, não como plano B. Boa parte do que a gente joga na nuvem cabe no aparelho. Classificar um texto em três categorias, extrair uma data, reescrever uma frase, gerar um título: isso vive confortavelmente nos 4 mil tokens de contexto do modelo on-device, roda offline e não conta cota. Reserve o PCC para o que realmente precisa de contexto longo ou de reasoning. Na prática, boa parte do que a gente manda pra nuvem cabe no modelo local — e cada passo que desce pro aparelho é um passo que deixa de depender da cota.

Rota 2: outro provedor no mesmo Atalho. Um passo de chamada HTTP para a API de outro modelo, com a chave no app Chaves ou num app de segredos, resolve o caso em que você precisa mesmo de contexto longo. Custa dinheiro, e é uma escolha consciente: você trocou uma cota opaca por um custo previsível.

Rota 3: falhar alto. Se nenhuma das duas serve, faça o Atalho avisar e parar. Uma notificação, uma linha num arquivo de log, qualquer coisa. O pior desenho possível é o fluxo que falha em silêncio e devolve vazio: você descobre três dias depois, quando o relatório que deveria estar pronto não está.

Um detalhe que ainda não sei responder e vale testar no seu setup: se os Atalhos mostram algum aviso de “perto do limite”, análogo ao isApproachingLimit dos desenvolvedores, ou se simplesmente falham. A sessão 319 não menciona Atalhos, e o artigo de suporte também não. Se você chegar ao limite e o comportamento for diferente do que descrevi aqui, quero saber.

O padrão por trás disso

Vale registrar o que aconteceu aqui, porque não é sobre a Apple.

Um recurso de IA apareceu como parte gratuita do sistema operacional, as pessoas construíram em cima dele, e depois ele virou recurso medido com acesso ampliado por taxa. Esse arco já se repetiu em várias plataformas nos últimos anos, e a Apple, para ser justa, avisou no primeiro dia: a frase sobre limites diários estava no press release de junho, antes de qualquer um escrever um Atalho para o AFM 3 Cloud.

A lição de arquitetura é a de sempre, e dói aplicar: a camada que você não controla vira premissa, e premissa vira dívida. O fluxo que depende de um único provedor de inferência tem um ponto de falha comercial. O antídoto é isolar a chamada de IA num passo trocável, para que mudar de rota seja edição de um passo e não reconstrução do Atalho inteiro.

Isso levanta a pergunta que vou perseguir na próxima peça: quanto do que você joga no modelo de servidor realmente precisa dele? A suspeita é que o número seja bem menor do que parece.


Fontes: Apple Support HT127901 · Apple Intelligence Usage Terms HT148587 · WWDC26, sessão 319 · MacMagazine, 10/09/2026 · 9to5Mac, 09/09/2026 · MacRumors, 09/06/2026