Inside OpenAI’s Breakthroughs in Mathematical Reasoning
Lisha Li, sócia de infraestrutura na Andreessen Horowitz (a16z), conversa com Mehtaab Sawhney e Mark Sellke, matemáticos e pesquisadores na OpenAI. Ambos discutem a evolução dos modelos de raciocínio da OpenAI, o impacto dos novos resultados matemáticos obtidos por IA (em especial o conjunto de 10 problemas resolvidos no projeto Astra), a dinâmica interna do raciocínio dos modelos e as transformações na prática da matemática pura e aplicada.
Transição da Matemática Acadêmica para a OpenAI e Primeiras Impressões
Mark Sellke e Mehtaab Sawhney compartilharam o mesmo orientador acadêmico e já haviam colaborado em artigos antes de ingressarem na OpenAI. Sellke relata que seu interesse pela empresa se intensificou no verão anterior, ao acompanhar o desempenho de modelos em problemas de nível de medalha de ouro na Olimpíada Internacional de Matemática (IMO). Pouco depois, Mehtaab Sawhney começou a testar as versões preliminares dos modelos de raciocínio.
Sawhney destaca como momento de virada o uso do modelo em problemas combinatórios do catálogo aberto de Paul Erdős. Em pesquisas tradicionais, verificar se um problema listado como aberto já havia sido resolvido na literatura exigia horas ou dias de busca bibliográfica complexa. Em um teste com o modelo, a IA identificou em cinco minutos a referência exata e explicou a rota de solução para um problema em que Sawhney e colegas haviam trabalhado sem sucesso. O mesmo padrão se repetiu em cerca de dez outros casos, evidenciando a capacidade do modelo em conectar tópicos dispersos na literatura e estruturar abordagens viáveis.
Dinâmica de Raciocínio: Execução Técnica, Poda de Busca e Backtracking
Sellke e Sawhney argumentam que a força dos modelos recentes não reside em buscas exaustivas por força bruta, mas em um processo qualitativamente análogo ao de um matemático especialista:
- Execução e rigor nos detalhes: Humanos frequentemente abandonam ideias promissoras por fadiga técnica ou pela complexidade de calibrar constantes e parâmetros (como ajustes finos de $\varepsilon$ e $\delta$). O modelo executa esses passos com alta precisão e sem frustração.
- Poda da árvore de busca e julgamento: Em vez de testar todas as ramificações, o modelo seleciona caminhos promissores com base no contexto matemático e em critérios de viabilidade.
- Backtracking desimpedido de viés de confirmação: Quando matemáticos humanos falham em uma abordagem inicial, tendem a descartar o método por completo ou a manter o foco preso em erros anteriores. O modelo atualiza dinamicamente as probabilidades de sucesso de cada caminho, retrocede sem apego cognitivo ao contexto fracassado e testa novas direções.
Limitações do Treinamento Baseado em Textos Matemáticos e Emergência do Raciocínio
Lisha Li e os pesquisadores analisam por que textos matemáticos formais são conjuntos de dados subótimos para ensinar raciocínio:
- Omissão do processo real: Livros didáticos clássicos (como a obra de Walter Rudin em Análise Real) e artigos acadêmicos apresentam apenas a versão polida, sintética e linear das provas, ocultando o histórico de tentativas, erros, motivações conceituais e a intuição subjacente.
- Contraste com código-fonte: Diferente do código de programação, que preserva contextos estruturais e dependências operacionais amplas, os artigos matemáticos carecem de anotações sobre o raciocínio semântico de alto nível.
- Generalidade das técnicas: As capacidades de backtracking, reconsideração e decomposição de problemas demonstradas pelos modelos da OpenAI não foram derivadas de regras explícitas em sistemas formais (como Lean), mas emergiram do treinamento de raciocínio para propósitos gerais aplicado a múltiplos domínios.
Resultados Técnicos do Conjunto de Problemas Astra
1. Empacotamento de Esferas em Dimensões Altas (Sphere Packing)
O problema investiga a densidade máxima $\Delta_d$ com que esferas de raio unitário podem preencher o espaço Euclidiano em dimensão $d$:
- Dimensões conhecidas: A solução é trivial em $d=1$; foi provada para $d=2$ (reticulado hexagonal) na década de 1960; para $d=3$ (empacotamento padrão de laranjas), Thomas Hales apresentou uma prova de centenas de páginas nos anos 1990/2000; e para $d=8$ (reticulado $E_8$) e $d=24$ (reticulado de Leech), Maryna Viazovska obteve provas exatas em 2017 (trabalho que lhe rendeu a Medalha Fields em 2022).
- Comportamento assintótico em grandes dimensões: O limite inferior elementar é $2^{-d}$. O melhor limite superior assintótico histórico, estabelecido pelos matemáticos russos Kabatiansky e Levenshtein na década de 1970 por meio de otimização, situava-se em torno de $2^{-0,599 d}$.
- O avanço do Astra: Henry Cohn e Noam Elkies desenvolveram uma formulação baseada em Programação Linear (LP) em dimensão infinita, na qual uma função auxiliar $f(x)$ com certas propriedades em seu valor e em sua transformada de Fourier limita $\Delta_d$. Cohn e colaboradores haviam conjecturado numericamente o limite exato do método LP, mas sem prova teórica. O modelo Astra construiu explicitamente a função ótima $f$ e provou analiticamente, em poucas páginas de análise complexa, que o limite assintótico exato da abordagem de Programação Linear é $\left(\frac{e}{2\pi} + o(1)\right)^d \approx 2^{-0,604 d}$ (ou cerca de $2^{-0,61 d}$), estabelecendo uma igualdade estrita que delimita o alcance máximo desse método.
2. Códigos Esféricos e Códigos Binários de Correção de Erro
- Conceito: Em teoria da informação, códigos binários de correção de erro correspondem à seleção de vértices distantes em um hipercubo (maximizando a distância de Hamming para tolerar taxas de erro na transmissão). Códigos esféricos transferem esse problema para o arranjo de pontos na superfície de uma hiperesfera.
- Resultado e interação com o modelo: O Astra refinou os limites assintóticos clássicos de Kabatiansky-Levenshtein para ambas as estruturas utilizando teoria de representação para explorar as simetrias algébricas das esferas e hipercubos. Diferente de outros casos autônomos, este envolveu refinamento interativo: após o modelo fornecer uma melhoria inicial, os pesquisadores solicitaram que ele levasse a técnica ao limite. O modelo ampliou o uso de teoria de representação e recuperou, no regime assintótico contínuo, as estimativas correspondentes ao problema de empacotamento de esferas no espaço completo.
3. Construção de um Grupo Não-Sófico (Non-Sofic Group)
- Definição de grupo sófico: Grupos finitos ou infinitos contáveis que podem ser bem aproximados localmente por grupos simétricos finitos (análogo a como os inteiros mod $n$ aproximam a reta dos inteiros $\mathbb{Z}$ em seus grafos de Cayley).
- Contexto histórico: Mikhail Gromov introduziu a noção nos anos 1990 ligada à conjectura de surjuntividade de Gottschalk (anos 1970). A questão aberta central era se todo grupo contável é sófico. Em probabilidades, a conjectura relacionada de Aldous-Lyons afirmava que todo grafo aleatório unimodular pode ser aproximado por grafos finitos. A conjectura de Aldous-Lyons foi refutada recentemente em um trabalho de cerca de 250 páginas apoiado em mais de 200 páginas de literatura prévia com física quântica e teoria da complexidade quântica.
- A prova do modelo: O Astra provou diretamente a existência de um grupo não-sófico em um artigo de aproximadamente 15 páginas puramente fundamentado em teoria combinatória de grupos. Apoiando-se em resultados de matemáticos como Yves Cornulier e Andreas Thom, o modelo introduziu restrições algébricas que eliminaram a obstrução combinatória que impedia pesquisadores anteriores de fechar a prova.
Definição de "Gosto Matemático" e Arquitetura de Sistemas
Mark Sellke defende uma visão utilitária para o conceito de "gosto matemático" em IAs: o gosto se manifesta pela capacidade de escolher caminhos que levam à resolução mais rápida de problemas difíceis e pela formulação de boas perguntas.
Discute-se a separação entre o modelo de raciocínio (modelo base/executor) e a infraestrutura externa (harness ou supervisor):
- Sistemas futuros podem operar com modelos supervisores dedicados a definir estratégias de alto nível e modelos executores encarregados do desenvolvimento técnico rigoroso e da computação de etapas longas.
- Essa estrutura replica o modelo de colaboração humana, onde um pesquisador sênior ou colega pode desbloquear um projeto ao sugerir correções de rota de alto nível para quem está imerso na execução técnica.
Mudança no Papel dos Matemáticos e Futuro da Disciplina
Sawhney e Sellke avaliam que a IA transformará as prioridades e a rotina da pesquisa matemática:
- Deslocamento de gargalos: Historicamente, a maior barreira era a derivação técnica da prova. À medida que os modelos assumem a execução de provas com argumentos concisos e elegantes, o valor relativo migra para a contextualização conceitual, síntese de teorias e comunicação entre áreas.
- Digestão acelerada da literatura: Ferramentas baseadas em IA já permitem que pesquisadores extraiam a estrutura lógica central de artigos extensos no arXiv em minutos, compensando a sobrecarga causada pelo aumento exponencial de publicações geradas por IA.
- Democratização e aceleração da matemática aplicada: Pesquisadores de áreas aplicadas (como física teórica e engenharia) poderão implementar resultados avançados de matemática pura em seus trabalhos sem a necessidade mandatória de consultar especialistas de nicho.
- Limites da automação: Devido à profundidade da disciplina, problemas fundamentais de altíssima complexidade teórica — como $P \text{ vs } NP$ — devem permanecer fora do alcance de curto e médio prazo, mantendo a matemática como um campo aberto com desafios de longo prazo para humanos e máquinas.
