让人类交出方向盘:特斯拉FSD十三年的冒险、争议与进化
Em setembro, a Tesla iniciou a operação do Cybercab em Austin, Texas — um veículo nativo para transporte autônomo sem volante ou pedais. A trajetória de treze anos do sistema Full Self-Driving (FSD) da Tesla envolveu disputas com fornecedores, rupturas de parcerias, transições de arquitetura de hardware, demissões em massa e mudanças completas no paradigma de software. A análise reúne depoimentos de Kerry Liu (ex-gerente sênior de desenvolvimento de hardware de IA da Tesla por quase 12 anos), Srihari Sampathkumar (ex-diretor de engenharia de software de IA da Tesla), Cathy (ex-engenheira de hardware da Waymo) e outros engenheiros do setor.
A experiência no Cybercab e o estado da frota Robotaxi
- O veículo: O Cybercab é um modelo estritamente para dois passageiros, significativamente menor que o Model 3 e o Model Y, desprovido de volante, pedais de aceleração e freio.
- Redundância e segurança operacional: Como os passageiros não têm meios físicos de assumir o controle, a Tesla utiliza conexão via Starlink, monitoramento em tempo real por operadores remotos ("war room"), botão de parada de emergência (Emergency Stop), botão de encostar (Pull-over) e canal direto de voz com o suporte exclusivo da frota Robotaxi.
- Tamanho da frota em Austin (dados de 22 de setembro): A frota registrada em operação soma 476 veículos, sendo 67 Cybercabs e 409 Model Y convencionais (ainda equipados com volante).
As origens: O conflito de rotas e o modelo "Caixa-Preta" da Mobileye (2013–2016)
Em 2013, ao completar dez anos de fundação, a Tesla buscou a Google para desenvolver direção autônoma. O acordo não avançou por duas divergências fundamentais:
- Custo e tecnologia: A abordagem da Google exigia LiDAR e mapas de alta definição (HD Maps), o que violava o princípio de custo e "primeiros princípios" de Elon Musk.
- Estratégia de produto: A Google defendia pular direto para o Nível 4 (L4) de autonomia, enquanto Musk defendia iniciar com sistemas L2 em carros de produção e evoluir iterativamente até o L4.
Hardware 1.0 e o rompimento com a Mobileye
- Configuração do HW 1.0 (outubro de 2014): 1 câmera frontal, 1 radar de ondas milimétricas dianteiro, 12 sensores ultrassônicos e o chip Mobileye EyeQ3 (frequência de 500 MHz e 256 MB de memória RAM).
- Autopilot (2015): Lançamento com manutenção de faixa e controle de cruzeiro adaptativo.
- O acidente fatal de 7 de maio de 2016 (Flórida): Um Model S colidiu contra a lateral de um caminhão em conversão à esquerda que o sistema de visão não identificou, vitimando o motorista.
- A causa do divórcio: A Mobileye fornecia um modelo fechado (black box), processando as imagens diretamente no chip EyeQ3 e entregando apenas a saída de percepção para a Tesla planejar a trajetória. Sem acesso ou controle para customizar a camada de percepção, a Tesla rompeu a parceria para desenvolver seus próprios algoritmos.
A transição com a Nvidia e o nascimento da redundância (HW 2.0 e HW 2.5)
- Hardware 2.0 (outubro de 2016): 8 câmeras integradas com o sistema Nvidia Drive PX2 (uma SoC com GPU externa). A maior parte das 8 câmeras servia como preparação de hardware para o futuro, já que a capacidade de processamento da época não dava conta de processar todos os fluxos simultaneamente.
- Hardware 2.5 (10 meses depois): Introdução de uma GPU secundária para redundância caso o chip primário falhasse — embrião da arquitetura de chip duplo da Tesla.
- Atritos com a Nvidia: O hardware da Nvidia era de uso geral, não otimizado exclusivamente para condução autônoma. Kerry Liu relata que, em 2017, durante investigações de aquecimento nas placas, a Tesla solicitou um driver simples de poucas linhas para exibir a temperatura do chip. A Nvidia passou uma semana negociando, exigiu pagamento adicional pela função e pediu mais uma semana de prazo para entrega, o que acelerou a decisão de Musk de internalizar o silício.
Chips próprios: A saga do Hardware 3.0 e negociações com fornecedores
O desenvolvimento do chip AI3
- Contratações-chave (2016): Musk contratou Jim Keller (arquiteto dos processadores AMD K7/K8 e Zen, além dos chips Apple A4/A5) em janeiro, e Peter Bannon (ex-Apple e PA Semi, líder dos chips Apple A4 a A9) em fevereiro.
- Execução: Com apoio técnico da Samsung, o chip de IA (AI3) levou apenas 18 meses para ser projetado, atingindo o primeiro tape-out bem-sucedido em dezembro de 2017 em processo de 14 nm. O chip foi para produção em massa praticamente sem alterações.
- Eficiência: Diferente de GPUs generalistas (oneradas por despacho de threads, controle de memória genérico e previsão de desvios), o AI3 foi desenhado exclusivamente para redes neurais, alcançando mais de 80% de utilização real (um ganho de 50% em eficiência efetiva sobre chips universais) e multiplicando por mais de 5 vezes a capacidade de redes neurais em relação ao HW 2.5.
- Saída de Jim Keller: Keller deixou a Tesla antes da produção em massa, seguindo seu padrão de carreira focado na criação inicial ("do zero ao um") em vez da otimização de escala ("do um ao dez"), deixando Peter Bannon no comando do hardware.
O estresse pré-lançamento e corte de custos
- Falta de braço de software: Musk mantinha as equipes muito enxutas. O time de software precisava manter o HW 2.5 e ao mesmo tempo escrever o software do HW 3. Faltando três meses para a produção em massa, o time de hardware precisou criar instruções improvisadas (hacks) para simular o software e testar os chips a tempo.
- Conflito com a Texas Instruments (TI): No final de 2018, sob severa pressão de caixa, a Tesla exigiu que a TI reduzisse os preços de seus componentes automotivos (que tinham margens de lucro de 50% a 55%). Diante da recusa da TI, Kerry Liu redesenhou os circuitos para substituir todos os componentes da TI por peças equivalentes da Analog Devices (ADI). Diante da perda iminente de faturamento, a liderança da TI cedeu e aceitou a tabela de descontos, gerando uma economia anual de cerca de US$ 20 milhões.
A era Andrej Karpathy e as quatro grandes evoluções na percepção (2018–2021)
Andrej Karpathy deixou a OpenAI aos 30 anos para liderar a visão computacional na Tesla, reportando diretamente a Musk, tornando-se o principal ímã para atração de talentos de IA. A equipe reformulou o módulo de percepção em quatro fases:
- Substituição de regras por Redes Neurais Profundas: Detecção de faixas, veículos, pedestres e placas de trânsito passou integralmente para modelos treinados com dados massivos da frota.
- Arquitetura HydraNet: Uma única rede espinhal (backbone) compartilhada para extração de características visuais, ramificando-se em múltiplos "heads" de tarefas (semáforos, cones, pedestres). Isso economizou poder computacional e permitiu ajustar tarefas específicas sem degradar as demais.
- De fotos para fluxo de vídeo (modelagem temporal): O sistema deixou de analisar quadros estáticos isolados (CNNs simples) e passou a usar informações temporais em janelas de tempo contínuas, mantendo uma "memória" de objetos mesmo quando temporariamente obstruídos (ex.: um carro encoberto por um ônibus).
- Bird's Eye View (BEV) com Transformers: Fusão espacial dos 8 fluxos de câmeras projetados em uma coordenada de visão superior unificada (2.5D) por meio de mecanismos de atenção cruzada (Cross-Attention).
Remoção de radares e o nascimento da Occupancy Network (2021–2022)
- O motivo real do corte do radar (maio de 2021): Embora Musk defendesse a visão pura em tese, a remoção imediata foi precipitada pela crise de fornecimento na pandemia. A fornecedora de radar da Tesla, a Continental (Conti), não conseguiu entregar os lotes e se recusou a priorizar a montadora. Musk rompeu o contrato e ordenou a eliminação física do componente em meio à escassez.
- Occupancy Network (AI Day 2022): Para compensar a perda do radar e resolver o problema de objetos com formatos atípicos (como escavadeiras com braços estendidos ou ônibus articulados fazendo curvas), o sistema adotou uma matriz de vóxeis 3D (pequenos cubos tridimensionais). O sistema não precisa categorizar formalmente o objeto para saber que aquele espaço físico está ocupado.
- Geração de Ground Truth: Rotular espaços 3D manualmente com nuvens de pontos de LiDAR custaria mais de 10 vezes o custo de caixas 2D. A Tesla desenvolveu redes de auto-rotulagem (auto-labeling) e manteve uma frota interna específica equipada com sensores LiDAR exclusivamente para coletar dados de verdade fundamental (ground truth) e calibrar o sistema de visão.
Os bastidores do Hardware 4.0: Conflitos de design e limitações de memória
Iniciado em 2020 e lançado nos veículos em fevereiro de 2023, o HW4 foi um redesenho estrutural completo, inviabilizando upgrades nos carros antigos com HW3.
As brigas pelas câmeras
- Resolução de 5 Megapixels (vs. 1,2 MP do HW3): Não se adotou resoluções extremas de smartphones (ex.: 108 MP) devido a restrições térmicas automotivas, estabilidade de sinal em cabos de até 3 metros até o computador central e necessidade de taxas de quadros (frame rate) elevadas para respostas rápidas.
- Corte de câmeras e ponto cego: O HW3 possuía 3 câmeras no para-brisa frontal; Musk determinou cortar para 2, sob o argumento de que "humanos dirigem com apenas dois olhos". Durante reuniões tensas, Musk chegou a dar murros na mesa e gritar palavrões contra os engenheiros que discordavam. A remoção do radar combinada com o corte das câmeras gerou um ponto cego crítico no para-choque dianteiro em manobras de estacionamento. A Tesla foi forçada a reintroduzir uma câmera no para-choque dianteiro a partir da Cybertruck.
A indecisão entre placa de 2 ou 3 chips
- A equipe de software exigiu três chips de IA para rodar modelos maiores. O time de hardware desenvolveu a complexa arquitetura de três chips (envolvendo arbitração de redundância, energia e sinal).
- Faltando cerca de dois meses para a produção em massa, após alertas da equipe financeira sobre o custo, Musk cancelou a configuração de 3 chips e decretou o retorno imediato para 2 chips. A placa teve de ser redesenhada às pressas.
O problema da memória GDDR
- O gargalo do AI3 era a largura de banda de memória (memory bandwidth). Para o HW4, Musk optou por memórias GDDR (típicas de placas de vídeo gamer) em vez de LPDDR.
- Consequências: A memória GDDR automotiva tornou-se uma escolha de nicho com altíssimo consumo de energia, custo elevado e fornecimento limitado de densidade (nem Micron nem Samsung desenvolveram variantes de alta capacidade só para a Tesla). Internamente, a Tesla passou a trabalhar na revisão Hardware 4.3, revertendo a arquitetura para LPDDR para ganhar capacidade de memória, mesmo sacrificando um pouco de largura de banda.
- Estrutura de custo: Segundo Kerry Liu, o custo total de fabricação do módulo de computação do HW4 é comparável ao valor de um iPad comum, muito abaixo de um MacBook Air.
A virada para "Ponta a Ponta" (End-to-End) e a evolução do V12 ao V14
A saída de Karpathy e a aposta de Dhaval Shroff
- Em julho de 2022, Andrej Karpathy deixou a Tesla ao se ver sobrecarregado por tarefas gerenciais, sendo sucedido por Ashok Elluswamy.
- No final de 2022, quando Musk comprou o Twitter e tentou realocar engenheiros para a rede social, o engenheiro Dhaval Shroff evitou a transferência apresentando a ideia de criar um "ChatGPT para carros": uma rede neural única de ponta a ponta (E2E) que substitui centenas de milhares de linhas de código em C++ por aprendizado por imitação das ações de motoristas humanos.
- O software enxugou de mais de 300.000 linhas de código de controle e regras para cerca de 2.000 linhas.
Transição do FSD V12 ao V14
- FSD V12 (lançado internamente no fim de 2023, público em janeiro de 2024): Prova de conceito do modelo E2E. A visualização no painel (BEV) foi mantida apenas como um "head apêndice", que serve exclusivamente para renderizar o desenho na tela do motorista sem interferir na tomada de decisão do carro.
- FSD V13 (novembro de 2024): Entrada direta de fótons das câmeras para o modelo sem pré-processamento de imagem (reduzindo latência), aumento da resolução e taxa de quadros, suporte a navegação vaga a vaga (parking-to-parking) e redução de hesitações.
- FSD V14.1 (outubro de 2025):
- Modelo com 10 vezes mais parâmetros que o anterior, aplicando leis de escala (Scaling Laws) para IA física.
- Treinamento com aprendizado por reforço (RL) e compilador de IA proprietário.
- Caso real de desempenho: No fim de 2025, um Model 3 cruzou os Estados Unidos da Califórnia até a Carolina do Sul (2.700 milhas / ~4.345 km) em dois dias sob o FSD V14 sem nenhuma intervenção humana.
- Uso de Modelos de Mundo (World Models): Substituição da simulação 3D manual tradicional por redes neurais generativas rodando em servidores equipados com chips AI4, simulando cenários extremos e validação de direção (pixel injection).
- Entrada de áudio: O modelo passou a processar sons ambientais (sirenes de ambulância/polícia), com previsão de receber futuramente comandos de voz integrados ao controle do veículo.
A crise de desenvolvimento do chip AI5 e o cancelamento do Dojo
Em agosto de 2025, Musk cancelou o supercomputador Dojo e dissolveu a equipe do projeto, alegando que os futuros chips AI5 e AI6 seriam suficientes tanto para inferência no carro quanto para treinamento nos data centers.
Ocultação de problemas e demissões
- Após atritos com a Samsung no HW4, Peter Bannon decidiu que o chip AI5 seria 100% desenvolvido internamente, sem terceirização.
- Sem o suporte das centenas de engenheiros da Samsung e sem experiência prévia em projetar um chip complexo do zero sem parceiros, a equipe enfrentou atrasos severos.
- O líder do projeto no Texas escondeu os problemas técnicos de Musk, repetindo por quase um ano que o chip estaria pronto em "dois meses".
- Quando Musk enviou o projeto diretamente à TSMC para agendar a fabricação (tape-out), os engenheiros da TSMC afirmaram que o design estava incompleto e levaria pelo menos mais um ano para atingir condições de produção.
- Ao descobrir a farsa, Musk demitiu os responsáveis, incluindo Peter Bannon e os diretores do setor de chips.
O plano de contingência do AI5
Musk assumiu o comando direto e estabeleceu duas frentes paralelas:
- Versão TSMC: Desenvolvimento com auxílio de uma consultoria externa de design para produção em processo avançado na TSMC (primeiro tape-out concluído em 15 de abril de 2026, com previsão de produção em massa para 2027).
- Versão Samsung: Retomada da parceria com a Samsung para produzir uma variante alternativa do AI5.
- Especificações estimadas: Uso de tecnologia Multi-Chip Module (MCM), capacidade estimada de 2.000 a 2.500 TOPS (desempenho até 40 vezes superior ao AI4 em tarefas específicas). Há discussões internas de que os primeiros lotes de AI5 possam ser direcionados prioritariamente a data centers e aos robôs humanoides Optimus, mantendo o AI4 nos veículos por mais tempo caso o poder computacional deste continue suficiente.
O cenário competitivo: Tesla vs. Waymo na "Guerra Econômica"
Treze anos após a divisão original entre Musk e a Google, a disputa pela liderança da direção autônoma entrou na fase de escala comercial:
- Waymo: Mantém a liderança na operação comercial de Robotaxis sem motorista em áreas delimitadas (geofenced), respaldada por redundância pesada e validação rigorosa de segurança.
- Tesla: Sustenta a vantagem de custo, produção em massa e coleta de dados planetária via frota de consumidores, mas o Cybercab opera de forma restrita e está sob investigação de órgãos reguladores federais norte-americanos quanto aos seus padrões de segurança sem volante.
- Perspectiva: O lançamento previsto do FSD V15 (com ampliação de parâmetros em mais 10x focado em L4) marca a transição definitiva da disputa: a barreira deixou de ser apenas a arquitetura do algoritmo e passou a ser a eficiência econômica por quilômetro rodado, a infraestrutura de suporte e a velocidade de expansão regulatória.
