PrismML hat Bonsai 2 27B veröffentlicht, ein komprimiertes Reasoning-Modell für PCs und Smartphones, das das Argument für private KI direkt auf dem Gerät stärkt.

PrismML hat Bonsai 2 27B veröffentlicht, ein komprimiertes Reasoning-Modell, das laut dem Startup nahezu die Leistung eines deutlich größeren Modells liefern kann, während es nur 5,9 GB Speicherplatz benötigt. Die Veröffentlichung ist der bisher klarste Test für PrismMLs Bemühungen, leistungsfähige Sprachmodelle von Cloud-Servern auf PCs und möglicherweise auch auf High-End-Smartphones zu verlagern.
Der Ansatz des Unternehmens könnte für KI-Entwickler und Produktteams wichtig sein, weil lokale Inferenz Cloud-Kosten senken, die Antwortlatenz verbessern und sensible Daten auf dem Gerät des Nutzers halten kann. Die bislang stärksten Leistungs- und Akzeptanzzahlen stammen jedoch von PrismML selbst, und das Startup hat nicht gezeigt, dass sich die Benchmark-Ergebnisse in realen Anwendungen gleichermaßen übertragen lassen.
Bonsai 2 27B komprimiert Qwen3.8 27B, ein Open-Source-Modell von Alibaba, in eine Datei, die laut TechCrunch-Berichterstattung etwa 9 bis 10 Mal kleiner ist als das Original. Mit 5,9 GB sollte das Modell auf vielen PCs problemlos Platz finden und möglicherweise auch auf einigen High-End-Smartphones laufen, wobei die praktische Leistung von Speicher, Prozessorfähigkeiten, Quantisierung und der verwendeten Laufzeitsoftware abhängt.
PrismML wurde von Forschern des Caltech gegründet und wird von Babak Hassibi geleitet, einem Caltech-Professor, der für Arbeiten zur Kompression bekannt ist. Ion Stoica, Mitgründer von Databricks und Direktor des Sky Computing Lab der University of California, Berkeley, ist Berater. Das Startup hat eine Seed-Runde über 22,25 Millionen US-Dollar von Khosla Ventures, Cerberus Capital und Caltech eingesammelt.
Das Unternehmen ist nicht allein bei der LLM-Kompression. Auch Multiverse Computing entwickelt Methoden zur Verkleinerung von Modellen. PrismMLs Besonderheit ist laut Hassibi, dass die Modelle nahezu die gesamte gemessene Fähigkeit des Ausgangsmodells behalten, statt für einen kleineren Speicherbedarf erhebliche Genauigkeitseinbußen hinzunehmen.
PrismMLs Verfahren nutzt sogenannte ternäre Gewichte. Modellgewichte speichern erlernte Informationen normalerweise in vergleichsweise großen numerischen Darstellungen. Das Unternehmen reduziert diese Werte auf drei mögliche Zustände: positiv eins, negativ eins oder null. Dadurch sinkt die Menge an Informationen, die zur Darstellung jedes Gewichts nötig ist, und der Speicherbedarf wird deutlich verringert.
Die daraus entstehende Technik, allgemein als LLM-Kompression bekannt, zielt darauf ab, zu verändern, wo Inferenz stattfinden kann. Statt jede Eingabe an einen gehosteten Dienst zu senden, könnte eine Anwendung zumindest einige Aufgaben lokal ausführen. Das könnte Offline-Funktionalität, schnellere Interaktionen und mehr Kontrolle über Datenflüsse ermöglichen.
PrismMLs erstes Bonsai-Modell, das einige Monate vor Bonsai 2 27B veröffentlicht wurde, soll 95% der aggregierten Benchmark-Werte des Ausgangsmodells erreicht haben. Die neue Version soll 98% erreichen. Diese Zahlen deuten auf Fortschritte zwischen den Versionen hin, sind aber nicht dasselbe wie eine unabhängige Validierung über eine breite Palette von Aufgaben, Geräten und Bewertungsmethoden hinweg.
Das 98%-Ergebnis ist eine vom Anbieter gemeldete Benchmark-Angabe, die PrismML zugeschrieben wird. Sie deutet auf eine kleine Lücke zum ursprünglichen Qwen-Modell in der von dem Unternehmen gewählten Gesamtbewertung hin, beweist jedoch nicht, dass Bonsai 2 27B sich in der Produktion identisch verhält. Benchmarks können Fehler übersehen, die langen Kontext, Tool-Nutzung, domänenspezifisches Wissen, mehrsprachige Eingaben oder die Orchestrierungsebene um ein Modell betreffen.
Hassibi räumte ein, dass Kompression wahrscheinlich immer gewisse Leistungseinbußen mit sich bringt. Er argumentierte jedoch auch, dass ein 2%-Unterschied im Benchmark möglicherweise kaum praktische Bedeutung habe, weil unkomprimierte Sprachmodelle unvollkommen seien und Benchmarks die Nutzerergebnisse nicht exakt vorhersagten. Das ist ein nachvollziehbares ingenieurwissenschaftliches Argument, bleibt aber eine Behauptung, die Produktteams an ihren eigenen Workloads testen müssen.
PrismML sagt außerdem, dass sein ursprüngliches Bonsai-Modell mehr als 11 Millionen Mal heruntergeladen wurde, während seine kleineren Modelle weitere 2,6 Millionen Downloads erhalten haben. Diese Zahlen sind vom Unternehmen gemeldete Nutzungsindikatoren, kein Beweis für dauerhafte Produktionsnutzung, aktive Nutzer oder kommerzielle Einsätze. Download-Zahlen können Experimente, automatisierte Aktivitäten und wiederholte Abrufe umfassen.
Wenn das Modell auf Consumer-Hardware zuverlässig funktioniert, könnte Bonsai 2 27B den Gestaltungsspielraum für On-Device-KI erweitern. Entwickler könnten Assistenten bauen, die auch ohne Netzwerkverbindung weiterarbeiten, private Dokumente lokal verarbeiten oder ein Cloud-Modell nur dann nutzen, wenn eine Aufgabe die lokale Leistungsfähigkeit übersteigt. Für Unternehmenskunden könnte diese Architektur die Offenlegung vertraulicher Eingaben und Dokumente gegenüber externen Inferenzanbietern verringern.
Die Kompromisse sind ebenso wichtig. Ein Modell, das in den Speicher passt, kann trotzdem anspruchsvoll sein, wenn es mit brauchbarer Geschwindigkeit laufen soll. Speicherbandbreite, thermische Grenzen, Akkulaufzeit, Betriebssystemunterstützung und die Verfügbarkeit optimierter Laufzeitumgebungen entscheiden darüber, ob sich ein lokales Modell reaktionsschnell anfühlt. Anwendungsteams müssen außerdem prüfen, ob komprimiertes Reasoning für Workflows wie Programmierhilfe, Dokumentenanalyse, Kundensupport oder KI-Agenten zuverlässig genug ist.
PrismMLs längerfristiger Plan ist es, Modelle mit mehreren hundert Milliarden Parametern zu komprimieren. Hassibi sagte TechCrunch, dass größere Modelle möglicherweise mehr Spielraum für Kompression bieten, ohne so viel Intelligenz zu verlieren. Wenn diese Behauptung zutrifft, könnte das Unternehmen eines Tages lokale Systeme anvisieren, die deutlich leistungsfähiger sind als heutige kleine Modelle. Das ist jedoch weiterhin ein zukunftsgerichtetes Ziel und keine nachgewiesene Produktfähigkeit.
Das nächste wichtige Signal wird unabhängiges Testen von Bonsai 2 27B auf Consumer-PCs und Smartphones sein, einschließlich Geschwindigkeit, Speichernutzung, Akkubelastung und Genauigkeit bei praktischen Aufgaben. Entwickler sollten außerdem auf unterstützte Laufzeitumgebungen, Lizenzdetails, Modellverfügbarkeit und reproduzierbare Bewertungsdaten achten.
PrismML sagt, dass es hoffe, Modelle im Bereich von mehreren hundert Milliarden Parametern innerhalb der nächsten paar Monate zu veröffentlichen. Ob diese Veröffentlichungen im Zeitplan liegen, die behauptete Qualität bewahren und auf kommerziell relevanter Hardware laufen, wird zeigen, ob sich der Ansatz des Unternehmens über eine überzeugende Kompressionsdemonstration hinaus skalieren lässt.
Berichte, dass PrismML möglicherweise Gespräche mit Apple führt, sind unbestätigt; Hassibi lehnte eine Stellungnahme ab. Eine formale Partnerschaft mit einem Gerät oder einer Plattform würde ein klareres Signal für den kommerziellen Einsatz liefern, doch nach dem vorliegenden Beleg wurde eine solche Vereinbarung nicht nachgewiesen.
Die Veröffentlichung von PrismML ist weniger deshalb bedeutend, weil ein 5,9-GB-Modell Cloud-KI automatisch ersetzt, sondern weil sie die Entscheidung zwischen lokal und in der Cloud flexibler macht. Ein komprimiertes Modell, das etwas schwächer, aber privat, kostengünstig im Betrieb und offline verfügbar ist, kann für viele eng umrissene Produkt-Workflows nützlicher sein als ein größeres Modell.
Die Schlüsselfrage ist nicht, ob Bonsai 2 27B 98% eines Benchmarks erreicht. Entscheidend ist, ob Entwickler sich unter realen Einschränkungen auf das Modell verlassen können: begrenzter Speicher, wechselnde Prompts, Tool-Aufrufe, Sicherheitsrichtlinien und unübersichtliche Unternehmensdaten. Wenn PrismML zeigen kann, dass seine Kompression diese Tests übersteht – und auf größere Modelle skaliert –, könnte es lokale KI zu einer praktischen Bereitstellungsebene machen statt zu einer Spezialoptimierung.