Zhipu lança GLM-5V-Turbo, modelo multimodal que transforma screenshots em código
200K de contexto e 128K de output para tarefas em nível de repositório, otimizado para OpenClaw.
Pontos principais
- GLM-5V-Turbo processa imagens, vídeos e wireframes nativamente para gerar código
- 200K tokens de contexto e até 128K de output
- Treinado com 30+ tarefas de RL conjunto para evitar trade-off entre visão e código
- Otimizado para workflows agênticos em OpenClaw e Claude Code
- SOTA em benchmarks CC-Bench-V2 e ZClawBench
A Zhipu AI apresentou o GLM-5V-Turbo, modelo multimodal de visão e código que processa nativamente screenshots, wireframes e protótipos de design para gerar código funcional. O modelo suporta 200K tokens de contexto com até 128K de output, permitindo tarefas em nível de repositório.
O GLM-5V-Turbo foi treinado com mais de 30 tarefas de reinforcement learning conjunto para evitar o 'efeito gangorra' entre capacidades visuais e de código. É otimizado para workflows agênticos em OpenClaw e Claude Code, dominando o loop 'perceber, planejar, executar'.
Comentários
Carregando comentários...
