News24 JulhoGrok 4.5 alcança 85,7% no teste de raciocínio ARC-AGI
Edição #162·24 de julho de 2026·2 min

🧩Grok 4.5 alcança 85,7% no teste de raciocínio ARC-AGI

O Grok 4.5 acaba de ser avaliado no ARC-AGI, o benchmark que testa a capacidade de uma IA de resolver problemas visuais de raciocínio que nunca viu antes, algo que humanos fazem com relativa facilidade. O resultado: 85,7% no ARC-AGI-1 a um custo de 0,33 dólar por tarefa, e 52,6% no ARC-AGI-2, mais difícil, a 0,78 dólar por tarefa. --- No ARC-AGI-3, a versão mais desafiadora, o modelo praticamente travou: 0,3% de acerto a um custo absurdo de quase 7 mil dólares. Um detalhe curioso é que aumentar o esforço de raciocínio do modelo de médio para alto não melhorou nem a performance, nem o custo. Ou seja, pensar mais não ajudou. --- Os números mostram que modelos de ponta estão ficando muito bons em raciocínio de nível básico, mas a fronteira real continua longe de ser conquistada.

Grok 4.5 alcança 85,7% no teste de raciocínio ARC-AGI

O Grok 4.5 alcançou 85,7% no benchmark ARC-AGI-1, resultado que posiciona o modelo da xAI entre os líderes atuais em raciocínio visual abstrato. Os números, divulgados pela ARC Prize, revelam, porém, que o salto para tarefas de generalização real ainda enfrenta barreiras de custo e eficiência que não se resolvem apenas com mais capacidade computacional.

O que mede o ARC-AGI

Criado por François Chollet, o ARC-AGI (Abstraction and Reasoning Corpus for Artificial General Intelligence) avalia a capacidade de uma IA de resolver problemas visuais inéditos a partir de poucos exemplos. Diferente de benchmarks tradicionais que premiam memorização de padrões, ele testa a adaptação eficiente a regras novas — habilidade que humanos executam com relativa facilidade e que é considerada central para a Inteligência Artificial Geral (AGI).

Desempenho por nível de dificuldade

A avaliação do Grok 4.5 mostrou resultados fragmentados conforme a complexidade aumentou:

  • ARC-AGI-1: 85,7% de acerto a US$ 0,33 por tarefa
  • ARC-AGI-2: 52,6% de acerto a US$ 0,78 por tarefa
  • ARC-AGI-3: 0,3% de acerto a um custo próximo a US$ 7 mil

O desempenho nas duas primeiras versões indica que os grandes modelos de linguagem (LLMs) estão dominando raciocínios básicos de baixa variabilidade. Já o colapso na terceira versão aponta que a fronteira da generalização permanece distante.

O limite do "pensar mais"

Um detalhe técnico chamou atenção: aumentar o esforço de raciocínio do modelo — escalando o compute de médio para alto — não melhorou a performance nem reduziu o custo por tarefa. Isso desafia a lógica frequente na engenharia de LLMs de que mais tokens de chain-of-thought ou maior capacidade de inferência necessariamente geram respostas superiores. Para times de machine learning, o dado sugere que há um teto de retorno quando se investe apenas em escala de processamento, sem mudanças arquiteturais ou estratégicas.

Implicações para devs e builders

Para desenvolvedores brasileiros, os números do Grok 4.5 funcionam como um guia prático de onde aplicar IA generativa hoje — e onde evitar. Tarefas de raciocínio visual estruturado e previsível já podem ser automatizadas com custo acessível. Por outro lado, cenários que exigem abstração profunda, como interpretação de interfaces complexas ou adaptação a lógicas totalmente novas, ainda demandam pipelines híbridos com regras explícitas, validação humana ou modelos especializados.

O resultado reforça que a indústria avançou no domínio de problemas introdutórios, mas a AGI continua sendo uma métrica, não uma realidade de produção.

arcagicustogrokraciocínionãocapacidadeacertotarefaresultadomodelo

Mais da mesma edição

@OpenAI

🏥ChatGPT começa a ler seus dados de saúde

A OpenAI começou a liberar, para usuários nos Estados Unidos, uma integração do ChatGPT com o Apple Health e prontuários médicos compatíveis. A ideia é que você possa conectar seus dados de saúde ao chat e ter conversas mais informadas: perguntar sobre mudanças nos seus exames, entender resultados de laboratório ou acompanhar tendências ao longo do tempo. --- A conexão é feita de forma segura dentro do app. É o tipo de funcionalidade que pode ser incrivelmente útil para quem tem dificuldade de interpretar exames, mas também levanta questões óbvias sobre privacidade. Ter seus dados médicos passando por um modelo de linguagem exige um nível de confiança que nem todo mundo está pronto para dar. --- Por enquanto, a funcionalidade é exclusiva dos EUA. Mas se funcionar bem, é questão de tempo até chegar a outros mercados.

@AndrewYNg

🛠️Andrew Ng lança agente open source que entrega trabalho pronto

Andrew Ng, um dos nomes mais conhecidos do mundo da IA, anunciou o OpenWorker: um agente de código aberto que não fica só na conversa, ele entrega resultados concretos. Pode preparar um relatório, organizar sua agenda, redigir documentos ou filtrar alertas do Slack. E antes de fazer algo importante, pede sua confirmação. --- O diferencial é a filosofia: o OpenWorker roda na sua máquina (Mac por enquanto, Windows em breve), não te prende a nenhum modelo específico e seus dados só saem do computador se você quiser. Você pode usar GPT 5.6 Sol, Claude Fable, Gemini 3.6, modelos abertos como DeepSeek e Kimi, ou até rodar tudo localmente com Ollama. --- Ng e o cofundador Rohit Prasad argumentam que assistentes de IA que realmente trabalham por você serão cada vez mais comuns, e que precisa existir uma opção aberta, privada e independente de fornecedor. O código está no GitHub e basta uma chave de API para testar.

@emollick

🧭Ethan Mollick publica guia prático de qual IA usar agora

Ethan Mollick, professor da Wharton e uma das vozes mais sensatas sobre IA, publicou mais um de seus guias periódicos para quem não é especialista mas quer usar IA no dia a dia. O foco: os sistemas agenticos, aqueles que não só respondem perguntas mas agem por conta própria, que estão ficando extremamente poderosos. --- O próprio Mollick admite que está confuso com a quantidade de nomes, planos e funcionalidades que mudam toda semana. Pro, Ultra, Work, Codex: cada empresa parece competir para criar a nomenclatura mais incompreensível possível. O guia tenta colocar ordem nesse caos para quem só quer saber o que funciona de verdade. --- Se você está perdido com tantas opções de IA, esse é o tipo de recurso que vale salvar nos favoritos.

Receba no seu email

Todo dia, grátis pra sempre.

Assinar newsletter