Open Models Change The Economics of AI
Open Models Change The Economics of AI
Jeffrey Morgan, cofundador e CEO da Ollama (empresa acelerada na turma W21 do Y Combinator), discute a transformação econômica e técnica provocada pela ascensão dos modelos de pesos abertos (open-weight/open-source), a infraestrutura necessária para executá-los e a trajetória da empresa desde sua fundação até atingir 9 milhões de desenvolvedores, 178 mil estrelas no GitHub e penetração em 85% das empresas da Fortune 500.
Adoção Corporativa e Explosão no Uso de Tokens
- Crescimento de Volume: Desde o início de 2024, o tráfego no Ollama Cloud registrou um crescimento agregado de 150x no consumo de tokens. No nível individual por desenvolvedor, a média de uso semanal saltou entre 10x e 20x.
- Gatilhos da Explosão:
- Janeiro/Fevereiro: Primeiras ondas de modelos abertos capazes de sustentar agentes de programação autônomos (coding agents), como Kimi, modelos GLM e MiniMax.
- Março/Abril: Surgimento e tração de ferramentas como Open Claw e o projeto Hermes Agent, que expandiram a automação baseada em agentes para áreas de negócios (finanças, suporte, marketing e vendas).
- Janelas de Contexto: A expansão de limites de contexto de 128k para mais de 1 milhão de tokens em modelos abertos aumentou drasticamente o throughput exigido em tarefas complexas.
- Caso de Uso Corporativo (AT&T): A AT&T migrou 40% de todo o seu consumo de tokens para modelos de código aberto. Embora o foco inicial seja modelos ocidentais (EUA/Europa), a empresa já avalia a adoção de modelos de origem chinesa.
Onde Modelos Abertos Superam Modelos Proprietários
- Controle e Customização vs. Custo: Embora a redução de custos seja o principal atrativo imediato, o benefício de longo prazo para grandes corporações é a autonomia sobre os pesos, segurança de dados e capacidade de ajustar (fine-tuning) modelos para fluxos internos.
- Cibersegurança e Testes de Invasão (Pen-testing): Modelos fechados de ponta (como Claude da Anthropic) impõem restrições de alinhamento e recusam comandos para testes de vulnerabilidade e simulações de ataque. Modelos abertos (ou especializados em segurança, como o GLM-53) permitem testes ofensivos legítimos de software corporativo.
- Velocidade de Atualização: O intervalo entre lançamentos de pesos abertos de alta capacidade caiu para ciclos de cerca de 3 meses (ex.: três iterações do DeepSeek no último verão), encurtando a distância em relação aos laboratórios de fronteira fechados.
Desafios de Engenharia: A Camada de Sistema Operacional (OS Layer)
Jeffrey Morgan compara o Ollama a um sistema operacional clássico, posicionado entre os modelos/hardware e os aplicativos dos desenvolvedores:
- Pipeline de Lançamento em 24 Horas: Quando um laboratório publica um novo modelo (muitas vezes sem aviso prévio alargado), a equipe do Ollama precisa implementar suporte ao grafo computacional, mecanismos de chamada de ferramentas (tool calling), drivers de inferência e validação de benchmarks em uma janela crítica de 24 horas.
- Otimização de Hardware: Integração direta com backends específicos — frameworks como MLX da Apple para chips Apple Silicon e bibliotecas otimizadas da NVIDIA para plataformas DGX/CUDA.
- Camadas Intermediárias em Desagregação: Assim como a infraestrutura de computação em nuvem evoluiu de plataformas agregadas (Heroku, Google App Engine) para soluções best-of-breed, o ecossistema de IA está dividindo a camada entre modelo e aplicação em três verticais independentes:
- Conhecimento (Knowledge): Ingestão de contexto corporativo e dados.
- Orquestração (Orchestration): Gerenciamento de sub-agentes locais e em nuvem.
- Execução/Runtime (Compute): Execução distribuída de código e chamadas de API via protocolos como o MCP (Model Context Protocol).
Distribuição Geográfica e Modelos Locais vs. Nuvem
- Nuvem vs. Local:
- Nuvem (Ollama Cloud): Domínio quase total de modelos chineses (DeepSeek, Qwen, GLM, Kimi) devido à relação custo-benefício e eficiência em tarefas de agentes pesados.
- Local (Desktop/Workstations): Divisão equilibrada entre modelos americanos/europeus (família Llama da Meta, Gemma do Google) e chineses (Qwen).
- Paridade de Desempenho Local: Modelos como Qwen 2.5 32B/38B atingiram métricas de programação comparáveis a versões anteriores de modelos de fronteira fechados (como Claude 3 Opus), rodando localmente em MacBooks intermediários ou estações de trabalho de entrada.
- Ressurgimento do Hardware Desktop:
- Estações de trabalho compactas como NVIDIA DGX Station / DGX Spark (com chips GB300 e 128 GB de memória unificada) permitem rodar modelos de 20B a 120B parâmetros localmente com latência de milissegundos para preenchimento de código, dispensando o custo recorrente de APIs em nuvem.
- Módulos interconectados via rede de alta velocidade permitem clusters locais para rodar modelos de até 400B de parâmetros.
Economia dos Tokens: Estado de Equilíbrio Corporativo
- A Regra 80/20 Invertida:
- 80% a 90% do volume total de tokens de uma empresa tenderá a rodar em modelos abertos (especialmente classes ultra-eficientes como DeepSeek Flash e GPT-4o mini/Luna).
- 10% a 20% do orçamento financeiro cobrirá essa maioria esmagadora de tokens abertos.
- Apenas as tarefas mais complexas ou de raciocínio extremo serão roteadas para os modelos proprietários de ponta (Anthropic/OpenAI), que consumirão a maior fatia do orçamento restante.
- Orquestração de Modelos Flash: A composição de múltiplos modelos rápidos e baratos coordenados via roteadores (routers) supera o custo-benefício de enviar todas as etapas de um fluxo de trabalho para um único "modelo deus" (God Model).
Geopolítica e Segurança na Cadeia de Suprimentos
- Origem dos Pesos: Clientes corporativos se dividem em dois grupos: aqueles que priorizam apenas onde a inferência é executada (privacidade dos dados em trânsito) e aqueles que exigem rastreabilidade completa dos dados de treinamento (ex.: modelos NeMo da NVIDIA) para infraestruturas críticas (como operadoras de energia e defesa).
- Risco de Backdoors / "Candidato Manchuriano": Morgan aponta que o risco em pesos abertos é análogo ao gerenciamento de dependências no ecossistema de software tradicional (supply-chain security). Equipes maduras de segurança de TI na Fortune 500 tratam pesos abertos como código de terceiros, aplicando auditorias estruturadas e filtros de entrada/saída determinísticos.
A História do Ollama: Pivot e Ajuste de Produto ao Mercado (PMF)
- Fundadores e Antecedentes: Jeffrey Morgan e seu cofundador Michael (colegas de quarto na University of Waterloo) construíram anteriormente o Docker Desktop após sua primeira startup ser adquirida pela Docker.
- Entrada no Y Combinator (W21): Inscreveram-se com a ideia de uma ferramenta de desktop para Kubernetes/SSO corporativo (um "Kitematic para Kubernetes").
- Dois Anos no Vazio (2021–2023):
- Levantaram uma rodada Series A com a Benchmark (liderada por Peter Fenton, investidor histórico da Docker) em 2022 sem um produto com tração clara.
- Mantiveram uma equipe de cerca de 10 engenheiros explorando segurança e infraestrutura de desenvolvimento sem encontrar validação real de mercado.
- A Virada (Julho de 2023): Em Toronto, decidiram simplificar radicalmente a proposta e deram a si mesmos duas semanas para lançar uma ferramenta que permitisse rodar LLMs locais tão facilmente quanto um container Docker. O lançamento coincidiu exatamente com a liberação do Llama 2 da Meta.
- Adoção Orgânica: O projeto ganhou tração espontânea via Reddit (r/LocalLlama), atingindo 100 mil estrelas no GitHub mais rápido do que Docker e Kubernetes, impulsionado pela ausência de barreiras corporativas (desenvolvedores podiam baixar e rodar sem aprovação de TI).
Mudanças de Paradigma: DevOps Clássico vs. Era da IA
- A falácia do "Platform as a Service (PaaS)": No ciclo anterior (década de 2010), acreditava-se que startups situadas como camadas intermediárias eram vulneráveis a comoditização. Na IA, subir na hierarquia para ficar próximo da experiência do desenvolvedor e da orquestração cria um fosso defensável.
- Convivência com o Não-Determinismo: Na engenharia tradicional de sistemas, o objetivo é a previsibilidade estrita de software. Em LLMs, a variabilidade probabilística é inerente e necessária.
- Equipes Enxutas e Agentes Internos: A infraestrutura moderna permite suportar milhões de usuários com equipes técnicas muito menores do que as necessárias há uma década, substituindo camadas inteiras de suporte e manutenção por automação orientada a agentes.
