MiroMind desbanca GPT-5.4 e Claude 4.6 Opus no BrowseComp com verificação dual
MiroThinker-H1 atinge SOTA em BrowseComp (88,2) e FrontierScience cortando 82% das etapas de raciocínio.
Pontos principais
- BrowseComp: 88,2 vs Gemini-3.1-Pro 85,9, Claude-4.6-Opus 84,0, GPT-5.4 82,7
- FrontierScience-Olympiad: 79,0 vs GPT-5.2 77,1
- Verificador local reduz etapas de raciocínio em ~82% com +26,4 pontos de acurácia
- Abordagem de 'Effective Interaction Scaling' melhora qualidade por etapa
- Pipeline de treinamento combina mid-training agêntico, SFT, DPO e GRPO
A MiroMind lançou o MiroThinker-1.7 e seu sistema flagship MiroThinker-H1, alcançando estado da arte no BrowseComp com 88,2 — superando Gemini-3.1-Pro (85,9), Claude-4.6-Opus (84,0) e GPT-5.4 (82,7). O resultado vem do paradigma 'Effective Interaction Scaling', que prioriza a qualidade de cada etapa de raciocínio em vez de escalar tamanho ou compute.
O sistema usa verificação em duas camadas: um verificador local que audita decisões intermediárias em tempo real, cortando ~82% das etapas enquanto melhora acurácia em +26,4 pontos em subsets difíceis, e um verificador global que revisa trajetórias completas de raciocínio.
Comentários
Carregando comentários...
