Daily Journal

Greg Brockman on Astra and the Future of OpenAI

TBPN08 de setembro de 202624minVer no YouTube|

Em entrevista ao canal TBPN, Greg Brockman, cofundador e presidente da OpenAI, discute os avanços recentes da empresa em modelos de fronteira, detalhando a resolução matemática das equações de Navier-Stokes, o lançamento do Astra, o uso de agentes autônomos para controle de computadores, a expansão do ChatGPT para a área da saúde e a reorganização interna da companhia em torno do foco de execução.

Resolução do Problema de Navier-Stokes e Geração de Novo Conhecimento

A OpenAI anunciou que seu modelo resolveu uma vertente teórica ligada às equações de Navier-Stokes — um dos sete Problemas do Prêmio Millennium —, encontrando um contraexemplo e uma prova matemática de singularidade/colapso das equações sob determinadas condições.

  • Significado científico: Além da elegância da demonstração, a conquista sinaliza que os modelos de IA passaram a gerar conhecimento inédito para a humanidade, superando a barreira de apenas sintetizar dados existentes.
  • Impacto prático: As equações regem a dinâmica de fluidos (correntes oceânicas, fluxo de ar sobre aeronaves, turbulência). Brockman argumenta que o principal valor reside no método: acelerar a pesquisa de cientistas e matemáticos para reduzir o tempo de desenvolvimento de soluções complexas, desde novas drogas até tratamentos de doenças.

Lançamento do Astra e a Evolução do Uso de Computadores

O lançamento do Astra estabeleceu um novo patamar para a capacidade de "computer use" (interação direta com sistemas operacionais e softwares). A comunidade tem utilizado o modelo para tarefas multimodais avançadas, integrando ferramentas como o Blender para transformar fotos de espaços físicos em modelos 3D voltados à fabricação de peças no mundo real (como mecanismos sob medida para ralos de banheiro e planejamento de reformas residenciais).

  • Abstração da complexidade técnica: A visão de longo prazo da OpenAI é fazer com que ferramentas técnicas complexas (como Blender ou ambientes de código) operem nos bastidores. O usuário não deve precisar entender detalhes de baixo nível — como tamanho de janelas de contexto, seleção de modelos ou parâmetros de raciocínio —, interagindo apenas por objetivos finais em uma interface unificada.
  • De conectores frágeis ao uso nativo: Diferente de integrações anteriores que dependiam de conectores e APIs programadas manualmente, o modelo agora opera o computador da mesma forma que um humano, visualizando interfaces e executando ações.

Transição de Chatbots para Agentes e Métricas do ChatGPT

Brockman descreve uma mudança de paradigma: de interações pontuais de perguntas e respostas para fluxos de trabalho contínuos com agentes autônomos que operam em segundo plano.

  • Escala do ChatGPT: O produto ultrapassou a marca de 1 bilhão de usuários ativos semanais, com um contingente adicional estimado entre 1 bilhão e 1,5 bilhão de pessoas que já experimentaram o sistema no passado.
  • Adoção corporativa: O lançamento do ChatGPT para trabalho gerou um crescimento vertical no uso de agentes dedicados a tarefas de alta carga cognitiva.
  • Desafio de descoberta e "desvantagem do pioneiro": Muitos usuários antigos criaram um modelo mental limitado às primeiras versões do ChatGPT. A OpenAI pretende utilizar a própria capacidade contextual do modelo para sugerir recursos e integrações proativamente, orientando o usuário sobre como delegar tarefas mais complexas.
  • Estratégia de produto e marketing: Brockman traça um paralelo com a Apple, apontando que o marketing de IA deve focar em casos de uso específicos e tangíveis (como a conversão de esboços 2D em protótipos físicos exibida no lançamento do ChatGPT Images 2.5), em vez de apenas campanhas genéricas de marca.

Geração de Imagens e Multimodalidade Unificada

A introdução de modelos como o ChatGPT Images 2.5 busca ultrapassar a linha de corte de qualidade necessária para o trabalho profissional. Quando a fidelidade, a velocidade e o controle fino de edição atingem determinado padrão, surgem fluxos de valor direto em marketing, criação de apresentações e design de interfaces web. A OpenAI trata imagem, áudio, código e texto não como verticais isoladas, mas como uma suíte integrada.

Três Pilares da Estratégia de Saúde da OpenAI

O setor de saúde é apontado por Brockman como uma das frentes mais transformadoras da IA, com cerca de 300 milhões de pessoas realizando perguntas sobre saúde semanalmente no ChatGPT. A operação está estruturada em três eixos complementares:

  1. Consumidor: Pacientes utilizando o chat para entender diagnósticos, interpretar exames e dialogar com médicos com maior embasamento.
  2. Médicos (abordagem bottom-up): Uma versão adaptada para a prática clínica, fornecendo citações diretas da literatura médica especializada para apoiar decisões em consultório.
  3. Institucional/Hospitalar (Enterprise): Venda direta e integração profunda com prontuários eletrônicos (como a integração em andamento com o sistema Epic).

Memória longitudinal e gargalos médicos

O avanço na memória dos modelos permite correlacionar sintomas relatados ao longo de semanas ou meses, superando a fragmentação da medicina hiperespecializada. Brockman compartilhou o caso de sua esposa, que enfrentou cinco anos de consultas com diversos especialistas isolados até que um alergista correlacionou os sintomas a uma condição genética sistêmica. Outro gargalo crítico citado que a IA pode mitigar é o recrutamento e triagem de pacientes qualificados para ensaios clínicos no desenvolvimento de novos medicamentos.

Do Aprendizado com o Operator à Nova Postura Operacional da OpenAI

Ao analisar a evolução dos agentes de controle de interface, Brockman explicou o papel do Operator:

  • Limitações do Operator: O sistema operava abaixo do limiar de utilidade prática por ser lento, impreciso e cansativo no uso contínuo, mas seu lançamento gerou os dados e aprendizados do mundo real necessários para o avanço que culminou no Astra.
  • Mudança de cultura organizacional: Brockman e o entrevistador destacam que a OpenAI reverteu uma postura temporária de grande corporação — na qual projetos eram lançados com baixa convicção interna (apostas de 5% a 20% de chance de sucesso) — para retomar uma dinâmica de startup, realinhando toda a equipe técnica e de produto com foco disciplinado e metas de longo prazo unificadas.