Daily Journal
Daily Journal

Zhipu lança GLM-5V-Turbo, modelo multimodal que transforma screenshots em código

200K de contexto e 128K de output para tarefas em nível de repositório, otimizado para OpenClaw.

Daily Journal
||
02/04 às 09:00

Pontos principais

  • GLM-5V-Turbo processa imagens, vídeos e wireframes nativamente para gerar código
  • 200K tokens de contexto e até 128K de output
  • Treinado com 30+ tarefas de RL conjunto para evitar trade-off entre visão e código
  • Otimizado para workflows agênticos em OpenClaw e Claude Code
  • SOTA em benchmarks CC-Bench-V2 e ZClawBench

A Zhipu AI apresentou o GLM-5V-Turbo, modelo multimodal de visão e código que processa nativamente screenshots, wireframes e protótipos de design para gerar código funcional. O modelo suporta 200K tokens de contexto com até 128K de output, permitindo tarefas em nível de repositório.

O GLM-5V-Turbo foi treinado com mais de 30 tarefas de reinforcement learning conjunto para evitar o 'efeito gangorra' entre capacidades visuais e de código. É otimizado para workflows agênticos em OpenClaw e Claude Code, dominando o loop 'perceber, planejar, executar'.

Comentários

Carregando comentários...