PrismML réduit un modèle de raisonnement de 27B à 5,9 Go pour l’IA locale

PrismML a publié Bonsai 2 27B, un modèle de raisonnement compressé conçu pour les PC et les téléphones, renforçant l’argument en faveur d’une IA privée sur l’appareil.

AI News

PrismML a publié Bonsai 2 27B, un modèle de raisonnement compressé que la startup dit capable d’offrir presque les performances d’un modèle bien plus grand tout en tenant dans 5,9 Go de stockage. Cette sortie constitue à ce jour le test le plus clair des efforts de PrismML pour faire passer des modèles de langage capables des serveurs cloud vers les PC et, potentiellement, les smartphones haut de gamme.

L’approche de l’entreprise pourrait compter pour les développeurs d’IA et les équipes produit, car l’inférence locale peut réduire les coûts cloud, améliorer la latence de réponse et garder les données sensibles sur l’appareil de l’utilisateur. Mais les chiffres de performance et d’adoption les plus solides disponibles jusqu’à présent proviennent de PrismML elle-même, et la startup n’a pas démontré que les résultats des benchmarks se traduisent de manière équivalente dans des applications réelles.

Un modèle plus petit avec une ambition plus grande

Bonsai 2 27B compresse Qwen3.8 27B, un modèle open source d’Alibaba, dans un fichier environ 9 à 10 fois plus petit que l’original selon les informations rapportées par TechCrunch. Avec 5,9 Go, le modèle devrait tenir confortablement sur de nombreux ordinateurs personnels et pourrait fonctionner sur certains smartphones haut de gamme, bien que les performances réelles dépendront de la mémoire, des capacités du processeur, de la quantification et du logiciel utilisé pour l’exécuter.

PrismML a été fondée par des chercheurs de Caltech et est dirigée par Babak Hassibi, professeur à Caltech connu pour ses travaux sur la compression. Ion Stoica, cofondateur de Databricks et directeur du Sky Computing Lab de l’Université de Californie à Berkeley, est conseiller. La startup a levé un tour d’amorçage de 22,25 millions de dollars auprès de Khosla Ventures, Cerberus Capital et Caltech.

L’entreprise n’est pas la seule à poursuivre la compression des LLM. Multiverse Computing développe également des méthodes pour réduire la taille des modèles. Ce qui distingue PrismML, selon Hassibi, c’est que ses modèles conservent presque toute la capacité mesurée du modèle source, plutôt que d’échanger une précision substantielle contre une empreinte plus faible.

Comment PrismML dit que la compression fonctionne

La méthode de PrismML utilise ce qu’elle appelle des poids ternaires. Les poids du modèle stockent normalement les informations apprises au moyen de représentations numériques relativement importantes. L’entreprise réduit ces valeurs à trois états possibles : positif un, négatif un ou zéro. Cela limite la quantité d’informations nécessaire pour représenter chaque poids et réduit fortement les besoins en mémoire.

La technique résultante, généralement appelée compression de LLM, vise à modifier l’endroit où l’inférence peut avoir lieu. Au lieu d’envoyer chaque requête à un service hébergé, une application pourrait exécuter au moins certaines tâches localement. Cela pourrait permettre des fonctionnalités hors ligne, des interactions plus rapides et un meilleur contrôle des flux de données.

Le premier modèle Bonsai de PrismML, publié quelques mois avant Bonsai 2 27B, aurait égalé 95 % des scores de benchmark agrégés du modèle source. La nouvelle version est annoncée à 98 %. Ces chiffres indiquent des progrès d’une version à l’autre, mais ce n’est pas la même chose qu’une validation indépendante sur un large ensemble de tâches, d’appareils et de méthodes d’évaluation.

Preuves, benchmarks et limites non résolues

Le résultat de 98 % est une affirmation de benchmark communiquée par le fournisseur et attribuée à PrismML. Il suggère un faible écart par rapport au modèle Qwen original sur l’évaluation agrégée choisie par l’entreprise, mais ne démontre pas que Bonsai 2 27B se comportera de manière identique en production. Les benchmarks peuvent manquer des échecs impliquant un long contexte, l’utilisation d’outils, des connaissances propres à un domaine, des requêtes multilingues ou la couche d’orchestration autour d’un modèle.

Hassibi a reconnu que la compression introduira probablement toujours un certain impact sur les performances. Il a aussi soutenu qu’un écart de 2 % sur un benchmark pourrait n’avoir que peu de signification pratique, car les modèles de langage non compressés sont imparfaits et les scores de benchmark ne prédisent pas précisément les résultats utilisateurs. C’est un argument d’ingénierie raisonnable, mais cela reste une affirmation que les équipes produit devront tester sur leurs propres charges de travail.

PrismML affirme également que son modèle Bonsai original a été téléchargé plus de 11 millions de fois, tandis que ses modèles plus petits ont reçu 2,6 millions de téléchargements supplémentaires. Ces chiffres sont des signaux d’adoption communiqués par l’entreprise, et non une preuve d’utilisation soutenue en production, d’utilisateurs actifs ou de déploiements commerciaux. Les totaux de téléchargements peuvent inclure des essais, des activités automatisées et des téléchargements répétés.

Pourquoi l’inférence locale compte pour les développeurs

Si le modèle fonctionne de manière fiable sur du matériel grand public, Bonsai 2 27B pourrait élargir l’espace de conception pour l’IA sur appareil. Les développeurs pourraient créer des assistants qui continuent à fonctionner sans connexion réseau, traitent localement des documents privés ou n’utilisent un modèle cloud que lorsqu’une tâche dépasse la capacité locale. Pour les acheteurs en entreprise, cette architecture pourrait réduire l’exposition de requêtes et de documents confidentiels à des fournisseurs d’inférence externes.

Les compromis sont tout aussi importants. Un modèle qui tient dans le stockage peut malgré tout être exigeant à exécuter à une vitesse utile. La bande passante mémoire, les limites thermiques, la consommation de batterie, la prise en charge du système d’exploitation et la disponibilité de runtimes optimisés détermineront si un modèle local paraît réactif. Les équipes applicatives devront également évaluer si le raisonnement compressé est suffisamment fiable pour des workflows comme l’assistance au codage, l’analyse de documents, le support client ou les agents IA.

Le plan à long terme de PrismML est de compresser des modèles comptant plusieurs centaines de milliards de paramètres. Hassibi a déclaré à TechCrunch que les modèles plus grands pourraient offrir davantage de marge pour la compression sans perdre autant d’intelligence. Si cette affirmation se vérifie, l’entreprise pourrait à terme viser des systèmes locaux nettement plus capables que les petits modèles actuels. Il s’agit encore d’un objectif prospectif, et non d’une capacité produit démontrée.

Ce qu’il faut surveiller ensuite

Le prochain signal important sera des tests indépendants de Bonsai 2 27B sur des PC et smartphones grand public, notamment la vitesse, l’utilisation mémoire, l’impact sur la batterie et la précision sur des tâches pratiques. Les développeurs devraient aussi surveiller les runtimes pris en charge, les détails de licence, la disponibilité du modèle et des données d’évaluation reproductibles.

PrismML dit espérer publier dans les prochains mois des modèles dans la gamme de plusieurs centaines de milliards de paramètres. Le fait que ces sorties arrivent dans les délais, conservent la qualité annoncée et fonctionnent sur du matériel commercialement pertinent montrera si l’approche de l’entreprise peut passer à l’échelle au-delà d’une démonstration convaincante de compression.

Les informations selon lesquelles PrismML pourrait être en discussion avec Apple ne sont pas confirmées ; Hassibi a refusé de commenter. Tout partenariat officiel avec un appareil ou une plateforme fournirait un signal plus clair sur le déploiement commercial, mais aucune preuve disponible n’établit un tel accord.

Point de vue de Creati.ai

La sortie de PrismML est importante moins parce qu’un modèle de 5,9 Go remplace automatiquement l’IA cloud que parce qu’elle rend la décision entre local et cloud plus flexible. Un modèle compressé, un peu moins performant mais privé, peu coûteux à exploiter et disponible hors ligne peut être plus utile qu’un modèle plus grand pour de nombreux flux de travail produit très ciblés.

La question clé n’est pas de savoir si Bonsai 2 27B atteint 98 % d’un benchmark. C’est de savoir si les développeurs peuvent s’y fier dans des contraintes réelles : mémoire limitée, prompts changeants, appels d’outils, politiques de sécurité et données d’entreprise désordonnées. Si PrismML peut montrer que sa compression survit à ces tests — et passe à des modèles plus grands — elle pourrait faire de l’IA locale un niveau de déploiement pratique plutôt qu’une optimisation de spécialiste.

Publicités