O benchmark que foi construído para não cair
O ARC-AGI-3 foi lançado em março de 2026 com uma missão explícita: resistir ao progresso dos modelos de IA pelo maior tempo possível. Diferente de seus predecessores — ARC-AGI-1 (saturado pelos modelos atuais) e ARC-AGI-2 (onde o Sol marcou 92%) — o ARC-AGI-3 é um benchmark interativo: o modelo não responde a uma pergunta estática, mas deve explorar um ambiente desconhecido, formular hipóteses, testar e adaptar sua abordagem em tempo real.
Em março de 2026, o melhor resultado no ARC-AGI-3 era 0,37%. Em 9 de julho, o GPT-5.6 Sol marcou 7,8% em esforço máximo de raciocínio — tornando-se o primeiro modelo a vencer um jogo completo do benchmark (ft09, 87%). O humano médio marca 100%.
O que o Sol faz diferente
Segundo a ARC Prize Foundation, o Sol não pontua melhor porque executa melhor — pontua melhor porque se orienta melhor. "O Sol consegue ler uma cena desconhecida corretamente e no vocabulário próprio do jogo. Trata uma hipótese falha como razão para replanejar, não para travar." A maioria dos fracassos em agentes de IA acontece antes do código — na fase de orientação ao ambiente. O Sol quebra esse padrão.
O custo é real: o esforço máximo consumiu aproximadamente US$ 20.000 em tokens de avaliação — contra US$ 10.000 para o esforço "high". Em esforços baixo e médio, o Sol mal registra acima de zero. O score só sobe de forma significativa em xhigh e max — o que significa que o comportamento diferencial do modelo é compute-intensivo e caro.
O que 7,8% realmente significa
A resposta honesta é: um avanço real mas não uma ruptura. O próprio criador do benchmark, François Chollet, enquadrou o ARC-AGI-3 como "projeto de múltiplos anos" — 7,8% é uma jogada de abertura, não uma linha de chegada. A distância entre 7,8% e 100% humano é ainda vastíssima.
O que o número confirma: modelos de fronteira em 2026 começam a demonstrar capacidade de adaptação situacional em ambientes novos — algo que benchmarks estáticos de texto não conseguiam capturar. Isso é relevante para raciocínio agentivo real, não para previsão de AGI.
O que o número não confirma: inteligência geral. O benchmark testa adaptação visual-lógica em ambientes construídos. Não testa linguagem, memória de longo prazo, raciocínio causal ou transferência de conhecimento entre domínios.
A trajetória
ARC-AGI-1: saturado. ARC-AGI-2: Sol marcou 92% a US$ 1,44 por tarefa. ARC-AGI-3: 7,8%. Cada versão foi projetada para ser exponencialmente mais resistente que a anterior. O padrão histórico sugere que o ARC-AGI-3 também será saturado — a questão é em quanto tempo e a que custo computacional.

