🧩Grok 4.5 alcança 85,7% no teste de raciocínio ARC-AGI
O Grok 4.5 acaba de ser avaliado no ARC-AGI, o benchmark que testa a capacidade de uma IA de resolver problemas visuais de raciocínio que nunca viu antes, algo que humanos fazem com relativa facilidade. O resultado: 85,7% no ARC-AGI-1 a um custo de 0,33 dólar por tarefa, e 52,6% no ARC-AGI-2, mais difícil, a 0,78 dólar por tarefa. --- No ARC-AGI-3, a versão mais desafiadora, o modelo praticamente travou: 0,3% de acerto a um custo absurdo de quase 7 mil dólares. Um detalhe curioso é que aumentar o esforço de raciocínio do modelo de médio para alto não melhorou nem a performance, nem o custo. Ou seja, pensar mais não ajudou. --- Os números mostram que modelos de ponta estão ficando muito bons em raciocínio de nível básico, mas a fronteira real continua longe de ser conquistada.

O Grok 4.5 acaba de ser avaliado no ARC-AGI, o benchmark que testa a capacidade de uma IA de resolver problemas visuais de raciocínio que nunca viu antes, algo que humanos fazem com relativa facilidade. O resultado: 85,7% no ARC-AGI-1 a um custo de 0,33 dólar por tarefa, e 52,6% no ARC-AGI-2, mais difícil, a 0,78 dólar por tarefa.
— @arcprize View on X
O Grok 4.5 alcançou 85,7% no benchmark ARC-AGI-1, resultado que posiciona o modelo da xAI entre os líderes atuais em raciocínio visual abstrato. Os números, divulgados pela ARC Prize, revelam, porém, que o salto para tarefas de generalização real ainda enfrenta barreiras de custo e eficiência que não se resolvem apenas com mais capacidade computacional.
O que mede o ARC-AGI
Criado por François Chollet, o ARC-AGI (Abstraction and Reasoning Corpus for Artificial General Intelligence) avalia a capacidade de uma IA de resolver problemas visuais inéditos a partir de poucos exemplos. Diferente de benchmarks tradicionais que premiam memorização de padrões, ele testa a adaptação eficiente a regras novas — habilidade que humanos executam com relativa facilidade e que é considerada central para a Inteligência Artificial Geral (AGI).
Desempenho por nível de dificuldade
A avaliação do Grok 4.5 mostrou resultados fragmentados conforme a complexidade aumentou:
- ARC-AGI-1: 85,7% de acerto a US$ 0,33 por tarefa
- ARC-AGI-2: 52,6% de acerto a US$ 0,78 por tarefa
- ARC-AGI-3: 0,3% de acerto a um custo próximo a US$ 7 mil
O desempenho nas duas primeiras versões indica que os grandes modelos de linguagem (LLMs) estão dominando raciocínios básicos de baixa variabilidade. Já o colapso na terceira versão aponta que a fronteira da generalização permanece distante.
O limite do "pensar mais"
Um detalhe técnico chamou atenção: aumentar o esforço de raciocínio do modelo — escalando o compute de médio para alto — não melhorou a performance nem reduziu o custo por tarefa. Isso desafia a lógica frequente na engenharia de LLMs de que mais tokens de chain-of-thought ou maior capacidade de inferência necessariamente geram respostas superiores. Para times de machine learning, o dado sugere que há um teto de retorno quando se investe apenas em escala de processamento, sem mudanças arquiteturais ou estratégicas.
Implicações para devs e builders
Para desenvolvedores brasileiros, os números do Grok 4.5 funcionam como um guia prático de onde aplicar IA generativa hoje — e onde evitar. Tarefas de raciocínio visual estruturado e previsível já podem ser automatizadas com custo acessível. Por outro lado, cenários que exigem abstração profunda, como interpretação de interfaces complexas ou adaptação a lógicas totalmente novas, ainda demandam pipelines híbridos com regras explícitas, validação humana ou modelos especializados.
O resultado reforça que a indústria avançou no domínio de problemas introdutórios, mas a AGI continua sendo uma métrica, não uma realidade de produção.
