Box's Aaron Levie: On Reinventing Yourself in the AI Age and Enterprise Diffusion
Conversa entre Aaron Levie, cofundador e CEO da Box, e Sonya Huang, sócia da Sequoia Capital, sobre a transformação da Box em uma plataforma centrada em inteligência artificial, a disputa de valor entre a camada de infraestrutura/modelos de fronteira e a camada de aplicação empresarial, o impacto dos modelos de pesos abertos e os gargalos reais de difusão da IA nos fluxos de trabalho corporativos.
A tese dos "Neolabs" e o valor da camada de aplicação
Aaron Levie defende que a visão inicial de que empresas de aplicação seriam apenas meros "wrappers de LLM" sem valor defensável está se provando incorreta. Cerca de US$ 1 trilhão foi implicitamente apostado em uma de duas visões de mundo: ou a ponte entre o modelo de linguagem e o fluxo de trabalho empresarial é rasa (e a superinteligência absorve todo o software), ou essa ponte é vasta, profunda e repleta de complexidades operacionais.
Levie argumenta que o mercado real corrobora a segunda hipótese:
- Abismo operacional: Modelos de fronteira são treinados em inteligência pura, mas as empresas reais exigem conexão com sistemas legados não modernizados, gestão de mudanças nos processos de negócios, introdução de pausas com intervenção humana (human-in-the-loop) e controle rigoroso de governança.
- Paralelo histórico com a infraestrutura em nuvem: Assim como AWS, GCP e Azure criaram trilhões de dólares em infraestrutura enquanto viabilizaram outras dezenas de bilhões em camadas de software especializado (como Snowflake e Databricks no setor de dados), a infraestrutura de inteligência permitirá o surgimento de um ecossistema massivo de aplicações verticais.
- Escala de distribuição dos laboratórios: Para que laboratórios como OpenAI e Anthropic capturassem toda a camada de negócios, precisariam operar com estruturas de mais de 100 mil funcionários dedicados a suporte, integração e consultoria de campo nas empresas.
Subsídio de tokens e o papel do intermediário agnóstico
Levie aponta duas forças estruturais que favorecem as empresas de aplicação:
- O dilema do "guarda do galinheiro": Clientes corporativos preferem que a decisão de roteamento e otimização de custo/precisão seja feita por uma empresa agnóstica em relação ao modelo, e não pelo próprio laboratório que lucra com a venda direta do token.
- Fim dos subsídios de tokens: O barateamento artificial de tokens oferecido pelos laboratórios é temporário. Conforme essas empresas se aproximarem do mercado público, serão cobradas pelas leis tradicionais de margem bruta, precisando amortizar custos de treinamento de dezenas de bilhões de dólares.
- Pressão de atores com objetivos não econômicos: Companhias como Meta, SpaceX, governos e empresas na China, além da Nvidia, operam sob lógicas de teoria dos jogos distintas. Elas podem aceitar margens brutas mínimas em inferência (em torno de 10%) apenas para justificar clusters de computação maciços, pressionando o custo do token para baixo e transferindo mais valor para a camada de aplicação.
A reinvenção da Box e a arquitetura de agentes
A Box — que hoje opera em um ritmo anual de receita (run rate) de US$ 1,3 bilhão e armazena centenas de bilhões de arquivos corporativos — iniciou experimentos com IA entre 2015 e 2018 (com foco em classificação de imagens e OCR), mas o alto custo computacional e a necessidade de modelos hipertreinados para cada caso de uso inviabilizaram a escala na época. Com a chegada dos LLMs modernos, a empresa reestruturou seu time técnico para integrar agentes diretamente ao repositório de dados não estruturados das empresas.
Casos de uso principais (Hero Use Cases)
- Extração de metadados em escala: Análise massiva de milhões de contratos, documentos de empréstimos ou arquivos de pesquisa farmacêutica para extração de dados estruturados e inserção em bancos de dados relacionais para consultas automatizadas.
- Agentes assíncronos de longa duração (long-running agents): Processos complexos como a integração de novos clientes (onboarding) em bancos, que historicamente levavam de uma a duas semanas de idas e vindas de documentos, passando a ser executados em cerca de uma hora, com intervenção humana disparada apenas em etapas que exigem verificação adicional.
Conteúdo versus Código: O fenômeno do "Work Slop"
Levie traça uma distinção cultural e funcional sobre por que o código gerado por IA foi prontamente aceito, enquanto textos e apresentações enfrentam resistência:
- Código como utilitário: O código é avaliado estritamente pela sua capacidade de executar uma função sem bugs. Se um agente produz o backend ou o frontend funcionalmente, o resultado é imediatamente útil.
- Conteúdo como proxy de julgamento: Documentos estratégicos, relatórios e apresentações corporativas servem historicamente como métrica de confiança sobre o preparo, o pensamento crítico e a capacidade de execução de um profissional. A proliferação de apresentações e memorandos gerados por IA ("work slop") gera desconfiança porque remove a clareza sobre o quanto daquele raciocínio pertence de fato ao autor.
O Harness de Agentes da Box e Métricas de Avaliação (Evals)
A Box desenvolveu um harness de agentes proprietário que se conecta profundamente à sua estrutura de permissões, indexação de busca e sistemas de arquivos, superando chamadas diretas às APIs de modelos de fronteira em latência e precisão:
- Capacidades do harness: Execução de múltiplas buscas simultâneas, re-ranqueamento de relevância, geração de embeddings em tempo real e extração de trechos (chunks) ou leitura integral de documentos conforme o contexto.
- Sistemas de avaliação:
- Complex Work Eval: Conjunto de testes voltado para documentos e tarefas complexas em setores regulados (ciências da vida, serviços financeiros e setor público).
- Holdback Eval: Avaliação contínua baseada no comportamento real de uso de dados internos da própria Box.
- Desempenho dos modelos: Os resultados no harness correlacionam-se fortemente com os benchmarks de programação, com destaque para o Gemini em tarefas de uso de ferramentas (tool use) e conhecimento geral, ao lado de modelos de fronteira das famílias Claude e GPT.
- Distribuição de volume: Embora os usuários finais interajam com o agente por caixas de busca e perguntas diretas, a esmagadora maioria do consumo de tokens da Box decorre de agentes em segundo plano voltados para extração de dados e automação de fluxos de trabalho (onde clientes exigem precisão de até 98% a custos previsíveis).
Adoção de Modelos Open-Weight e Estratégia de Roteamento
Levie afirma que a adoção corporativa de modelos de pesos abertos (open-weight) ainda é modesta, impulsionada em parte pelo desejo de CIOs de manterem alternativas (hedges), mas que se tornará massiva em cinco anos:
- Especialização de tarefas maduras: Conforme casos de uso corporativos se estabilizam, tarefas rotineiras são migradas de modelos proprietários pesados para modelos abertos menores via post-training e ajuste fino.
- Arquitetura híbrida: Modelos de ponta fechados (como GPT ou Claude) atuam na orquestração complexa de alto nível, enquanto modelos abertos executam tarefas secundárias da cauda longa. Levie estima que o orçamento financeiro pode se dividir meio a meio entre modelos abertos e fechados, mas com um volume de tokens até dez vezes superior nos modelos abertos.
Memória, Contexto vs. Pesos e Controles de Acesso
Questionado sobre a inclusão de memória contínua diretamente nos pesos dos modelos (continual learning) versus o uso de RAG (Retrieval-Augmented Generation):
- O desafio corporativo das permissões: Em ambientes empresariais, o acesso à informação é restrito por barreiras legais rigorosas (como advogados impedidos de acessar documentos de clientes concorrentes dentro do mesmo escritório). Como permissões mudam diariamente, gravar informações proprietárias dinâmicas nos pesos do modelo cria problemas regulatórios complexos.
- Critério de separação: A inclusão nos pesos faz sentido em domínios verticais de alta estabilidade e colaboração irrestrita (como descoberta de fármacos na Eli Lilly), enquanto dados operacionais voláteis e sujeitos a controle de acesso continuam dependentes de recuperação dinâmica em contexto (RAG).
Sistemas de Registro (Systems of Record) e Interfaces de Usuário
Para plataformas tradicionais de SaaS que atuam como sistemas de registro, Levie define duas exigências simultâneas de sobrevivência:
- Agente nativo hiperespecializado: A empresa deve criar um agente proprietário que seja comprovadamente de 10 a 20 pontos percentuais mais preciso que agentes genéricos ao operar dentro do seu próprio sistema.
- Arquitetura aberta (Headless/APIs): A plataforma deve expor seus dados e APIs de forma estruturada via protocolos abertos (como MCP - Model Context Protocol), permitindo que assistentes externos (Claude, ChatGPT) acessem suas informações e convertendo o uso em receita volumétrica.
Exemplos de casos de uso autônomos
- Agentes de governança preventiva: Monitoramento contínuo em segundo plano para detectar infrações de conformidade ou direcionar arquivos a custódia legal (legal hold) no momento em que um funcionário executa uma ação de risco.
A evolução das interfaces de IA
Levie sustenta que interfaces de chat universais continuarão sendo padrão para consultas individuais, mas são inadequadas para a maior parte do trabalho corporativo, que é assíncrono e invisível. O trabalho empresarial demanda painéis, filas de triagem e listas de tarefas gerenciadas por agentes.
"Daqui a cinco anos, aposto que 90% de todos os tokens consumidos nas empresas irão para trabalhos que nenhum usuário humano iniciou manualmente."
Por que a programação difundiu rápido e o resto do trabalho não
A rápida difusão de agentes em desenvolvimento de software em relação a outras funções corporativas decorre de assimetrias estruturais claras:
- Propriedades exclusivas da programação:
- Texto como produto final: O valor gerado por um desenvolvedor é diretamente medido pelo código funcional produzido.
- Repositório centralizado: A integração técnica é simplificada pela existência do GitHub ("basta fornecer o GitHub").
- Usuários autônomos: Desenvolvedores resolvem seus próprios erros de configuração e problemas de conexão sem demandar suporte externo.
- Métrica de pesquisa dos laboratórios: Pesquisadores de IA utilizam código diariamente como o principal benchmark competitivo de novos modelos.
- Gargalos nas demais funções corporativas:
- Dependência de fatores externos: Um vendedor de software, por exemplo, é limitado pela agenda, orçamento e resposta dos compradores, independentemente do nível de automação interna.
- Fragmentação de dados legados: As empresas mantêm informações espalhadas em servidores locais (on-premises), sistemas legados e unidades de rede compartilhadas que não dialogam nativamente com agentes.
- Barreiras manuais de acesso: Falta de permissões universais e necessidade de aprovação humana entre áreas para compartilhamento de arquivos básicos.
Essa fricção, segundo Levie, é o que garante que a oportunidade de capturar trilhões de dólares permaneça com as empresas da camada de aplicação que tiverem a disciplina operacional de executar integrações e gestão de mudança junto aos clientes.
Cultura de Engenharia e Práticas para uma Empresa AI-First
Sobre a governança interna na Box e recomendações para líderes de tecnologia:
- Higiene e arquitetura unificada de dados: Todas as atas de reunião, projeções financeiras, roadmaps e documentos estratégicos da Box são mantidos compulsoriamente dentro da própria plataforma, facilitando a implantação de agentes internos.
- Centro de excelência e FTEs de IA: Contratação de profissionais dedicados exclusivamente a auditar processos internos, identificar fluxos de alto impacto e disseminar técnicas de produtividade (como sessões de demonstração entre equipes técnicas).
- Uso do X/Twitter como fonte primária: Levie ressalta a importância de acompanhar diariamente as discussões técnicas no X para antecipar atualizações e benchmarks da indústria.
- Vantagens e desvantagens de fundadores atuais: Startups fundadas hoje contam com alavancagem técnica incomparável (equipes de duas pessoas entregando plataformas que exigiriam 40 engenheiros há cinco anos), mas enfrentam uma velocidade de competição inédita, com múltiplos concorrentes financiados simultaneamente em cada nicho.
Levie conclui que, em um cenário onde desenvolver software se tornou trivialmente rápido com IA, a vantagem competitiva definitiva deixa de ser a velocidade de codificação e passa a ser a capacidade de distribuição, vendas e integração profunda dentro do cliente corporativo.
