Daily Journal
Daily Journal

PrismML lança Ternary Bonsai 2 27B com 5,9 GB e licença Apache 2.0

O modelo retém 98,2% do desempenho do Qwen3.8 27B usando mais de 9x menos memória que a versão em precisão completa.

Daily Journal
||
18/09 às 09:00

Pontos principais

  • Anunciado em 17 de setembro, é um modelo multimodal de 27,8 bilhões de parâmetros baseado no Qwen3.8 27B da Alibaba, com download gratuito sob Apache 2.0.
  • Com 5,9 GB, reduz o consumo de memória em mais de 9x ante os cerca de 54 GB da contraparte em FP16.
  • Em 20 benchmarks de raciocínio, matemática, programação, seguimento de instruções, visão e uso agêntico de ferramentas, marca 83,9 contra 85,4 do modelo em precisão completa.
  • Chega a 143 tokens por segundo numa Nvidia GeForce RTX 5090 e herda contexto de 262 mil tokens, rodando no dispositivo.
  • Cada peso é armazenado como -1, 0 ou +1, com escala FP16 compartilhada a cada 128 pesos, resultando em 1,72 bits efetivos por peso.
  • O antecessor, o Bonsai 27B de 14 de julho sobre o Qwen3.6, retinha 95% da média de benchmarks do modelo base.

As perdas são desiguais: o model card mostra conhecimento e raciocínio em 79,86 contra 85,55 do FP16 e visão em 66,19 contra 71,36, enquanto programação fica acima da linha de base, em 89,42 contra 89,07. O ganho de retenção sobre o antecessor não custou nada em tamanho de arquivo. Os arquivos compactos exigem o fork próprio do llama.cpp feito pela PrismML.

A PrismML é um spinout da Caltech liderado por Babak Hassibi, apoiado por Khosla Ventures, Cerberus, Google e Samsung. A empresa diz que seus próximos modelos comprimidos ficarão na faixa de várias centenas de bilhões de parâmetros, dentro de alguns meses.

Comentários

Carregando comentários...