O que é a AGI? Depende de quem a está a vender.

Tags
ia

Os novos modelos avançam rumo à AGI. Ninguém concorda sobre o que é. Uma breve história de uma palavra que não para de mudar, e o que eu acho que ela realmente significa.

Estamos em setembro, e em três semanas aconteceram duas coisas.

No dia 3, a OpenAI lançou o GPT-6 Astra, e Greg Brockman disse que poderá ser visto como a chegada da AGI. No dia 22, a Anthropic lançou o Claude Opus 5.5, que supera o Astra na maioria dos benchmarks de referência.

Então, qual deles é AGI? Os dois? Nenhum? Passámos a meta no dia 3, ou a meta simplesmente voltou a mudar de sítio no dia 22?

Se a meta tivesse uma definição, saberíamos. Não tem.

A AGI não tem definição. Tem uma história. E essa história diz-nos mais sobre onde estamos do que qualquer tabela de benchmarks.

O que é a AGI? Cinco definições que não batem certo

Pergunte a cinco especialistas o que significa AGI (inteligência artificial geral) e vai ouvir cinco respostas que soam parecidas e medem coisas completamente diferentes.

  • A carta da OpenAI fala de "sistemas altamente autónomos que superam os humanos na maior parte do trabalho com valor económico". Esta é sobre empregos.
  • O artigo "Levels of AGI" da Google DeepMind (2023) desenha uma grelha de desempenho e generalidade, de "emergente" a "sobre-humano". Capacidades, portanto.
  • O contrato entre a Microsoft e a OpenAI, segundo foi noticiado no final de 2024, dizia que a AGI chega quando os sistemas da OpenAI conseguirem gerar cerca de cem mil milhões de dólares de lucro. É uma definição sobre dinheiro. A reestruturação de outubro de 2025 passou a decisão para um painel de especialistas e, em abril de 2026, a cláusula foi simplesmente abandonada, o que mostra o pouco peso que a palavra tinha, na prática, num contrato.
  • Os engenheiros tendem a dizer: tudo o que um humano consegue fazer num computador, o modelo consegue fazer.
  • A minha é um sistema capaz de resolver qualquer problema de matemática, ciência ou código, e depois pôr a solução em prática, a um nível que nenhum humano consegue igualar. É sobre resultados, e dá para verificar área a área.

Ponha-as lado a lado e quase não se sobrepõem. Um sistema pode passar numa e chumbar nas outras quatro.

É o que acontece a uma palavra que significa tudo. Acaba por significar aquilo que convém a quem a usa. Para um laboratório, é uma missão. Para um investidor, é uma avaliação. Para um contrato, era uma cláusula de saída. Para um crítico, é uma meta que está sempre a um ano de distância.

De onde vem o termo AGI

A IA nasceu como AGI. Só não precisava do "G".

O workshop de Dartmouth de 1956, que deu nome à área, propunha simular "todos os aspetos da aprendizagem ou qualquer outra característica da inteligência". Depois vieram dois invernos da IA, e a área sobreviveu ao restringir o foco: motores de xadrez, reconhecimento de voz, filtros de spam.

A expressão "artificial general intelligence" apareceu pela primeira vez em 1997, num artigo de Mark Gubrud que quase ninguém leu. Pegou por volta de 2002, quando Shane Legg, mais tarde cofundador da DeepMind, a sugeriu a Ben Goertzel como título de um livro. Artificial General Intelligence saiu em 2007, e uma pequena comunidade passou finalmente a ter um nome.

Portanto o "G" não era uma ideia nova. Foi acrescentado porque a área se tinha esquecido do que queria no início.

Como o significado mudou

Desde então, a palavra mudou de função pelo menos três vezes, e de cada vez apareceu alguém novo com razões para a usar.

Nos anos 2000 era um objetivo de investigação, e marginal. Ninguém ganhava grande coisa em usá-la. As conferências eram pequenas, e admitir que se trabalhava nisso num laboratório sério não ajudava a carreira de ninguém. Significava uma máquina capaz de aprender tudo o que uma pessoa aprende.

Nos anos 2010 tornou-se uma declaração de missão, e quem ganhou foram os laboratórios. A DeepMind foi fundada em 2010 para "resolver a inteligência". A OpenAI surgiu em 2015, a sua carta comprometeu-se mais tarde a garantir que a AGI "beneficie toda a humanidade". Uma missão desse tamanho atrai os melhores investigadores e justifica os maiores cheques. A palavra saiu da margem e entrou nos documentos fundadores dos laboratórios mais bem financiados do mundo.

Depois do ChatGPT passou a ser um argumento de venda, e agora quem ganha são os que vendem. A AGI tornou-se algo que se lança, com que se angaria financiamento e que se escreve em contratos. Cada grande lançamento vem acompanhado da pergunta, quer o laboratório a faça quer não, e a avaliação da empresa oscila consoante a resposta.

E durante todo esse tempo, a meta foi mudando de sítio.

Supostamente, o xadrez exigia inteligência a sério, até o Deep Blue vencer Kasparov em 1997. Aí passou a ser "só cálculo". O Go ia ser diferente, até ao AlphaGo em 2016. Aí passou a ser "só reconhecimento de padrões". O teste de Turing aguentou-se setenta anos, e as pessoas deixaram discretamente de falar dele quando os modelos de linguagem o passaram. A medalha de ouro na Olimpíada Internacional de Matemática era o muro seguinte. Caiu em 2025.

Sempre que uma máquina faz a coisa, a coisa deixa de contar. Não acho que seja desonestidade. É o que acontece quando se tenta definir inteligência com uma lista de exemplos.

Onde estão os modelos de IA em 2026

Esqueça a palavra por um momento e olhe para o que os modelos estão a fazer este ano. Escrevi no mês passado que a corrida à AGI tem dois marcadores. Os benchmarks são o que aparece nas notícias, e "AGI" é o título que se escreve por cima. Aqui fica esse marcador, e o que não cabe nele.

Comecemos pela matemática. Em maio, um modelo da OpenAI encontrou um contraexemplo para a conjetura da distância unitária, um problema de geometria discreta que Paul Erdős formulou em 1946. Oitenta anos de matemáticos, e a resposta veio de uma máquina. A OpenAI seguiu com mais dez resultados em problemas abertos de longa data, em geometria, teoria de códigos, complexidade e criptografia, e a Quanta publicou um artigo inteiro sobre porque é que os problemas de Erdős continuam a cair perante a IA.

Este mês a OpenAI foi mais longe, com um resultado sobre Navier–Stokes, um dos Problemas do Prémio do Milénio. A Quanta publicou-o com o título a IA resolveu um deles. A demonstração foi verificada em Lean, um sistema que confirma a matemática linha a linha. Os matemáticos ainda discutem quanto do mérito pertence a trabalho humano anterior e se cumpre os critérios do prémio, que é exatamente o que devem fazer. Há um ano, ninguém levaria a frase a sério o suficiente para discutir.

Matemática de investigação

O FrontierMath Tier 4 é matemática ao nível da investigação, problemas que podem levar dias a um especialista. Em abril, o GPT-5.5 resolvia cerca de um terço. Em setembro, o Astra resolve quase todos (segundo o próprio laboratório). Para contexto, há um ano o melhor modelo resolvia 13% de uma versão anterior do conjunto. A Anthropic não publicou resultado para o Opus 5.5. Fonte: Epoch AI, OpenAI, setembro de 2026.

O Humanity's Last Exam foi pensado para ser o exame final da IA. Quando foi lançado, os melhores modelos ficavam abaixo dos 10% sem ferramentas, e à volta dos 27% com elas. O Opus 5.5 faz agora 67,7% com ferramentas.

Humanity's Last Exam

Criado em janeiro de 2025 com perguntas que especialistas escreveram para derrotar os melhores modelos. Vinte meses depois, dois terços estão respondidos. Fonte: Center for AI Safety e Scale AI, relatórios dos laboratórios, setembro de 2026.

Os sentidos também chegaram lá. Os assistentes que pomos em produção no Ardaven recebem a mensagem de voz de um cliente, a fotografia de um produto danificado ou a captura de ecrã de um erro, e respondem às três a partir do mesmo conhecimento do negócio. Ainda há pouco tempo, isso exigia sistemas separados, mal colados uns aos outros.

E é desigual, que é a parte que os títulos não mostram. O Astra lidera o Opus 5.5 no Terminal-Bench-Science, 64,6% contra 58,7%. O Opus 5.5 lidera o Astra no Humanity's Last Exam por mais de dez pontos com ferramentas, e cerca de sete sem. O mesmo modelo que encontra um contraexemplo que escapou a Erdős ainda se pode baralhar com um puzzle espacial que uma criança resolve em segundos.

Chama-se a isto inteligência irregular (jagged intelligence): sobre-humana em algumas direções, estranhamente fraca noutras. Deita por terra qualquer definição que trate a inteligência como um número que se pode ordenar.

Mas a inteligência não é um número. Nunca foi, nem para nós. Um grande matemático pode ser um desastre a ler as pessoas. Um cirurgião brilhante pode não conseguir escrever um parágrafo decente. Nunca exigimos às pessoas que fossem igualmente boas em tudo antes de lhes chamarmos inteligentes.

É no mundo físico que estamos mais atrasados

Há uma área onde a distância é real, e é o mundo físico.

Perceber uma sala a partir de uma fotografia é uma coisa. Entrar nessa sala, abrir uma gaveta encravada e dobrar a camisola que está lá dentro é outra. Os modelos descrevem a gaveta lindamente. Os robôs ainda têm dificuldade em abri-la.

Isto importa, porque muito do trabalho humano faz-se com as mãos, não com o teclado.

Mesmo assim, o avanço nos últimos dois anos foi enorme. A robótica passou de controladores programados à mão para modelos de base. Os modelos visão-linguagem-ação deixam um robô receber uma instrução em linguagem simples e transformá-la em movimento, e os sistemas mais recentes acrescentam modelos do mundo, para que o robô consiga imaginar o que acontece a seguir antes de se mexer. O GR00T e o Cosmos Reason da NVIDIA são modelos abertos feitos exatamente para isto. E pela primeira vez, os dados de treino de robôs começam a mostrar o mesmo tipo de comportamento de escala que fez descolar os modelos de linguagem.

Ainda assim, 2026 é o ano em que os robôs se estão a provar em trabalho industrial e logístico bem delimitado. Um robô de uso geral na sua cozinha ainda está a alguns anos de distância, porque autonomia fiável em sítios desarrumados e imprevisíveis é difícil.

Os modelos já pensam. Os robôs ainda estão a aprender a mexer-se, mas mais depressa do que se previa há dois anos.

O que a AGI significa para mim

Então, esta é a minha posição.

A minha definição, outra vez: um sistema capaz de resolver qualquer problema de matemática, ciência ou código, e pôr a solução em prática, a um nível que nenhum humano consegue igualar. Pus a fasquia alta de propósito. Tem de ser melhor do que qualquer pessoa, e a solução tem de estar pronta para funcionar no mundo real, porque encontrá-la é só metade do trabalho.

Nenhum modelo passa essa fasquia hoje. Mas não espero acordar um dia de manhã e descobrir que foi ultrapassada. Para mim, essa fasquia é o extremo mais distante de um espectro, e nós já entrámos na outra ponta.

A ponta mais próxima tem um teste simples. Durante anos, sempre que um modelo fazia algo impressionante, acrescentávamos uma ressalva: "para uma IA, está bom." Bom código, para uma IA. Uma demonstração inteligente, para uma IA. Essa ressalva fazia muito trabalho. Queria dizer que estávamos a avaliar com critérios mais brandos.

Vai saber que uma área entrou no intervalo quando deixar de dizer "para uma IA, está bom." Quando o trabalho é simplesmente bom, e o leitor revê-o como reveria o trabalho de um colega, e nada na revisão muda por ter sido um modelo a fazê-lo.

Todas as definições acima tentam escolher um único momento, como o dia em que um modelo bate os humanos na maioria dos empregos ou o dia em que gera cem mil milhões de dólares. Esse momento não vai chegar com um anúncio limpo, porque a capacidade não chega toda de uma vez. Aparece área a área, de forma desigual, um benchmark e um problema de Erdős de cada vez. A matemática está bem dentro do intervalo. O código está lá dentro. O raciocínio científico está perto. O mundo físico está na fronteira, a entrar.

Quando um modelo encontra um contraexemplo para uma conjetura com oitenta anos, ninguém diz "para uma IA". É um resultado, e um que nenhum humano tinha conseguido. É a ponta mais distante do espectro a ser tocada, pelo menos num canto da matemática. O extremo mais distante ainda está à frente. Noutras áreas, sobretudo em tudo o que envolve mãos, ainda digo a ressalva todos os dias.

De onde estou, a AGI parece um motor, a rodar a velocidades diferentes em áreas diferentes, e já bem longe do zero.

O que fazer com isto na segunda-feira

Não precisa de fechar a definição para a usar.

  • Aplique o teste da ressalva ao seu próprio trabalho: Para cada tipo de tarefa que entrega a um modelo, pergunte se ainda o avalia com complacência. Na LayerX, deixámos de fazer essa ressalva nas primeiras versões de código há meses: os agentes escrevem a maior parte e revemo-la como qualquer pull request de um colega.
  • Quando um fornecedor disser AGI, pergunte qual definição, e o que ganha com ela. Empregos, capacidades, dinheiro ou resultados. A resposta diz mais sobre o pitch do que sobre o modelo.
  • Meça área a área, não com um único número. Um modelo que lidera em matemática pode ficar atrás em tarefas científicas. As suas avaliações, sobre o seu trabalho, são o único indicador que conta.
  • Invista na camada à volta do modelo. Um modelo ser bom numa área não quer dizer que seja seguro pô-lo em produção. Por isso o Ardaven, a nossa plataforma de agentes, responde apenas a partir dos seus documentos, regista cada mensagem com o modelo, os tokens e as chamadas a ferramentas por trás, e dá aos administradores um botão para parar qualquer conversa. O modelo fica mais inteligente todos os meses. É a camada à volta dele que permite interagir com o mundo nos nossos sistemas de produção.

A inteligência está a chegar. A engenharia, auditabilidade, orquestração e a governação à volta dela continua a ser o trabalho da LayerX.

Related posts