A PrismML lançou o Bonsai 2 27B, um modelo de raciocínio comprimido projetado para PCs e celulares, reforçando o caso da IA privada no dispositivo.

A PrismML lançou o Bonsai 2 27B, um modelo de raciocínio comprimido que, segundo a startup, pode entregar quase o desempenho de um modelo muito maior cabendo em 5,9 GB de armazenamento. O lançamento é o teste mais claro até agora do esforço da PrismML para levar modelos de linguagem capazes de servidores em nuvem para PCs e, potencialmente, para smartphones de ponta.
A abordagem da empresa pode ser relevante para construtores de IA e equipes de produto, porque a inferência local pode reduzir custos de nuvem, melhorar a latência de resposta e manter dados sensíveis no dispositivo do usuário. Mas os números mais fortes de desempenho e adoção disponíveis até agora vêm da própria PrismML, e a startup não demonstrou que os resultados de benchmark se traduzam da mesma forma em aplicações do mundo real.
O Bonsai 2 27B comprime o Qwen3.8 27B, um modelo de código aberto da Alibaba, em um arquivo aproximadamente 9 a 10 vezes menor que o original, segundo a cobertura da TechCrunch. Com 5,9 GB, o modelo deve caber confortavelmente em muitos computadores pessoais e pode rodar em alguns smartphones de ponta, embora o desempenho prático dependa de memória, capacidades do processador, quantização e do software usado para executá-lo.
A PrismML foi fundada por pesquisadores do Caltech e é liderada por Babak Hassibi, professor do Caltech conhecido por seu trabalho em compressão. Ion Stoica, cofundador da Databricks e diretor do Sky Computing Lab da Universidade da Califórnia, Berkeley, é conselheiro. A startup levantou uma rodada seed de US$ 22,25 milhões com Khosla Ventures, Cerberus Capital e Caltech.
A empresa não está sozinha na busca por compressão de LLMs. A Multiverse Computing também está desenvolvendo métodos para reduzir o tamanho dos modelos. O diferencial da PrismML, segundo Hassibi, é que seus modelos mantêm quase toda a capacidade medida do modelo de origem em vez de trocar precisão substancial por uma pegada menor.
O método da PrismML usa o que chama de pesos ternários. Os pesos do modelo normalmente armazenam informações aprendidas usando representações numéricas relativamente grandes. A empresa reduz esses valores a três estados possíveis: positivo um, negativo um ou zero. Isso limita a quantidade de informação necessária para representar cada peso e reduz drasticamente a demanda de memória.
A técnica resultante, amplamente conhecida como compressão de LLM, busca mudar onde a inferência pode acontecer. Em vez de enviar cada prompt para um serviço hospedado, um aplicativo poderia executar pelo menos algumas tarefas localmente. Isso pode viabilizar funcionalidade offline, interações mais rápidas e maior controle sobre os fluxos de dados.
O primeiro modelo Bonsai da PrismML, lançado alguns meses antes do Bonsai 2 27B, teria igualado 95% das pontuações agregadas de benchmark do modelo de origem. A nova versão alega atingir 98%. Esses números indicam progresso entre versões, mas não são o mesmo que validação independente em um amplo conjunto de tarefas, dispositivos e métodos de avaliação.
O resultado de 98% é uma alegação de benchmark divulgada pelo fornecedor e atribuída à PrismML. Ele sugere uma pequena diferença em relação ao modelo Qwen original na avaliação agregada escolhida pela empresa, mas não estabelece que o Bonsai 2 27B se comportará de forma idêntica em produção. Benchmarks podem deixar passar falhas envolvendo contexto longo, uso de ferramentas, conhecimento de domínio, prompts multilíngues ou a camada de orquestração em torno de um modelo.
Hassibi reconheceu que a compressão provavelmente sempre introduzirá algum impacto no desempenho. Ele também argumentou que uma diferença de 2% no benchmark pode não ter muito significado prático, já que modelos de linguagem sem compressão são imperfeitos e as pontuações de benchmark não preveem com precisão os resultados dos usuários. É um argumento de engenharia razoável, mas continua sendo uma afirmação que equipes de produto terão de testar em suas próprias cargas de trabalho.
A PrismML também afirma que seu modelo Bonsai original foi baixado mais de 11 milhões de vezes, enquanto seus modelos menores receberam mais 2,6 milhões de downloads. Esses números são sinais de adoção relatados pela empresa, não prova de uso contínuo em produção, usuários ativos ou implantações comerciais. Os totais de downloads podem incluir experimentos, atividade automatizada e downloads repetidos.
Se o modelo funcionar de forma confiável em hardware de consumo, o Bonsai 2 27B pode ampliar o espaço de design para IA no dispositivo. Desenvolvedores poderiam criar assistentes que continuam funcionando sem conexão de rede, processam documentos privados localmente ou usam um modelo em nuvem apenas quando uma tarefa excede a capacidade local. Para compradores corporativos, essa arquitetura pode reduzir a exposição de prompts e documentos confidenciais a provedores externos de inferência.
Os trade-offs são igualmente importantes. Um modelo que cabe no armazenamento ainda pode ser exigente para rodar em velocidade útil. Largura de banda de memória, limites térmicos, consumo de bateria, suporte do sistema operacional e disponibilidade de runtimes otimizados determinarão se um modelo local parece responsivo. As equipes de aplicação também precisarão avaliar se o raciocínio comprimido é confiável o suficiente para fluxos de trabalho como assistência de codificação, análise de documentos, suporte ao cliente ou agentes de IA.
O plano de longo prazo da PrismML é comprimir modelos com várias centenas de bilhões de parâmetros. Hassibi disse à TechCrunch que modelos maiores podem oferecer mais espaço para compressão sem perder tanta inteligência. Se essa afirmação se mantiver, a empresa pode acabar mirando sistemas locais substancialmente mais capazes do que os modelos pequenos de hoje. Ainda assim, trata-se de uma meta futura, não de uma capacidade de produto demonstrada.
O próximo sinal importante será o teste independente do Bonsai 2 27B em PCs e smartphones de consumo, incluindo velocidade, uso de memória, impacto na bateria e precisão em tarefas práticas. Os desenvolvedores também devem acompanhar runtimes suportados, detalhes de licenciamento, disponibilidade do modelo e dados de avaliação reproduzíveis.
A PrismML diz esperar lançar modelos na faixa de várias centenas de bilhões de parâmetros nos próximos dois meses. Se esses lançamentos chegarem no prazo, preservarem a qualidade alegada e rodarem em hardware comercialmente relevante, isso mostrará se a abordagem da empresa pode escalar além de uma demonstração convincente de compressão.
Relatos de que a PrismML pode estar em conversas com a Apple não foram confirmados; Hassibi recusou comentar. Qualquer parceria formal com dispositivo ou plataforma daria um sinal mais claro sobre implantação comercial, mas nenhuma evidência disponível estabelece tal acordo.
O lançamento da PrismML é significativo menos porque um modelo de 5,9 GB substitui automaticamente a IA em nuvem e mais porque torna a decisão entre local e nuvem mais flexível. Um modelo comprimido, um pouco mais fraco, mas privado, barato de operar e disponível offline pode ser mais útil do que um modelo maior para muitos fluxos de trabalho de produto bem específicos.
A questão principal não é se o Bonsai 2 27B atinge 98% de um benchmark. É se os construtores podem depender dele sob restrições reais: memória limitada, prompts variáveis, chamadas de ferramentas, políticas de segurança e dados corporativos desorganizados. Se a PrismML conseguir mostrar que sua compressão sobrevive a esses testes — e escala para modelos maiores — ela pode tornar a IA local uma camada prática de implantação, e não uma otimização para especialistas.