PrismML reduce un modelo de razonamiento de 27B a 5,9 GB para IA local

PrismML lanzó Bonsai 2 27B, un modelo de razonamiento comprimido diseñado para PCs y teléfonos, reforzando el argumento a favor de una IA privada en el dispositivo.

AI News

PrismML ha lanzado Bonsai 2 27B, un modelo de razonamiento comprimido que, según la startup, puede ofrecer casi el rendimiento de un modelo mucho más grande mientras cabe en 5,9 GB de almacenamiento. El lanzamiento es la prueba más clara hasta ahora del esfuerzo de PrismML por trasladar modelos de lenguaje capaces desde servidores en la nube a PCs y, potencialmente, a smartphones de gama alta.

El enfoque de la empresa podría ser importante para desarrolladores de IA y equipos de producto, porque la inferencia local puede reducir los costes de nube, mejorar la latencia de respuesta y mantener los datos sensibles en el dispositivo del usuario. Sin embargo, las cifras más sólidas de rendimiento y adopción disponibles hasta ahora provienen de la propia PrismML, y la startup no ha demostrado que los resultados de los benchmarks se traduzcan por igual en aplicaciones del mundo real.

Un modelo más pequeño con una ambición mayor

Bonsai 2 27B comprime Qwen3.8 27B, un modelo de código abierto de Alibaba, en un archivo que es aproximadamente 9 a 10 veces más pequeño que el original, según la cobertura de TechCrunch. Con 5,9 GB, el modelo debería caber cómodamente en muchos ordenadores personales y podría ejecutarse en algunos teléfonos de gama alta, aunque el rendimiento práctico dependerá de la memoria, las capacidades del procesador, la cuantización y el software utilizado para ejecutarlo.

PrismML fue fundada por investigadores de Caltech y está dirigida por Babak Hassibi, profesor de Caltech conocido por su trabajo en compresión. Ion Stoica, cofundador de Databricks y director del Sky Computing Lab de la Universidad de California, Berkeley, es asesor. La startup ha recaudado una ronda seed de 22,25 millones de dólares de Khosla Ventures, Cerberus Capital y Caltech.

La empresa no está sola en la búsqueda de la compresión de LLM. Multiverse Computing también está desarrollando métodos para reducir el tamaño de los modelos. La diferencia de PrismML, según Hassibi, es que sus modelos conservan casi toda la capacidad medida del modelo original en lugar de sacrificar una precisión sustancial para obtener una huella más pequeña.

Cómo dice PrismML que funciona la compresión

El método de PrismML utiliza lo que llama pesos ternarios. Los pesos del modelo normalmente almacenan la información aprendida usando representaciones numéricas relativamente grandes. La empresa reduce esos valores a tres estados posibles: uno positivo, uno negativo o cero. Eso limita la cantidad de información necesaria para representar cada peso y reduce de forma drástica la demanda de memoria.

La técnica resultante, conocida en general como compresión de LLM, busca cambiar dónde puede ocurrir la inferencia. En lugar de enviar cada consulta a un servicio alojado, una aplicación podría ejecutar al menos algunas tareas localmente. Eso podría ofrecer funcionalidad sin conexión, interacciones más rápidas y mayor control sobre los flujos de datos.

El primer modelo Bonsai de PrismML, lanzado unos meses antes de Bonsai 2 27B, supuestamente igualó el 95% de las puntuaciones agregadas de benchmark del modelo de origen. Se afirma que la nueva versión alcanza el 98%. Esas cifras indican progreso entre lanzamientos, pero no son lo mismo que una validación independiente en un amplio conjunto de tareas, dispositivos y métodos de evaluación.

Evidencia, benchmarks y límites sin resolver

El resultado del 98% es una afirmación de benchmark reportada por el proveedor y atribuida a PrismML. Sugiere una pequeña brecha frente al modelo original Qwen en la evaluación agregada elegida por la empresa, pero no demuestra que Bonsai 2 27B se comporte de forma idéntica en producción. Los benchmarks pueden pasar por alto fallos relacionados con contexto largo, uso de herramientas, conocimiento específico de un dominio, prompts multilingües o la capa de orquestación alrededor de un modelo.

Hassibi reconoció que la compresión probablemente siempre introducirá cierto impacto en el rendimiento. También argumentó que una diferencia del 2% en benchmark puede no tener mucha importancia práctica porque los modelos de lenguaje sin comprimir son imperfectos y las puntuaciones de benchmark no predicen con precisión los resultados de los usuarios. Es un argumento de ingeniería razonable, pero sigue siendo una afirmación que los equipos de producto tendrán que probar con sus propias cargas de trabajo.

PrismML también afirma que su modelo Bonsai original ha sido descargado más de 11 millones de veces, mientras que sus modelos más pequeños han recibido otros 2,6 millones de descargas. Esas cifras son señales de adopción reportadas por la empresa, no prueba de uso sostenido en producción, usuarios activos o despliegues comerciales. Los totales de descargas pueden incluir experimentos, actividad automatizada y descargas repetidas.

Por qué la inferencia local importa para los desarrolladores

Si el modelo funciona de forma fiable en hardware de consumo, Bonsai 2 27B podría ampliar el espacio de diseño para la IA en el dispositivo. Los desarrolladores podrían crear asistentes que sigan funcionando sin conexión a la red, procesen documentos privados localmente o usen un modelo en la nube solo cuando una tarea supere la capacidad local. Para los compradores empresariales, esa arquitectura podría reducir la exposición de consultas y documentos confidenciales a proveedores externos de inferencia.

Las compensaciones son igualmente importantes. Un modelo que cabe en el almacenamiento aún puede ser exigente para ejecutarse a una velocidad útil. El ancho de banda de memoria, los límites térmicos, el consumo de batería, el soporte del sistema operativo y la disponibilidad de runtimes optimizados determinarán si un modelo local se siente ágil. Los equipos de aplicación también tendrán que evaluar si el razonamiento comprimido es lo bastante fiable para flujos de trabajo como asistencia de programación, análisis de documentos, soporte al cliente o agentes de IA.

El plan a largo plazo de PrismML es comprimir modelos con varios cientos de miles de millones de parámetros. Hassibi dijo a TechCrunch que los modelos más grandes pueden ofrecer más margen para la compresión sin perder tanta inteligencia. Si esa afirmación se cumple, la empresa podría terminar apuntando a sistemas locales mucho más capaces que los pequeños modelos actuales. Sigue siendo un objetivo de futuro, no una capacidad de producto demostrada.

Qué observar a continuación

La próxima señal importante será la prueba independiente de Bonsai 2 27B en PCs y smartphones de consumo, incluyendo velocidad, uso de memoria, impacto en la batería y precisión en tareas prácticas. Los desarrolladores también deberían vigilar los runtimes compatibles, los detalles de licencia, la disponibilidad del modelo y datos de evaluación reproducibles.

PrismML afirma que espera lanzar modelos en el rango de varios cientos de miles de millones de parámetros en los próximos dos meses aproximadamente. Si esos lanzamientos llegan a tiempo, mantienen la calidad reclamada y funcionan en hardware comercialmente relevante mostrará si el enfoque de la empresa puede escalar más allá de una demostración convincente de compresión.

Los informes de que PrismML podría estar en conversaciones con Apple no están confirmados; Hassibi se negó a comentar. Cualquier asociación formal con un dispositivo o una plataforma ofrecería una señal más clara sobre el despliegue comercial, pero no existe evidencia disponible que establezca un acuerdo de ese tipo.

Perspectiva de Creati.ai

El lanzamiento de PrismML es significativo no tanto porque un modelo de 5,9 GB sustituya automáticamente a la IA en la nube, sino porque hace más flexible la decisión entre local y nube. Un modelo comprimido que sea un poco más débil pero privado, barato de operar y disponible sin conexión puede ser más útil que un modelo más grande para muchos flujos de trabajo de producto de alcance limitado.

La pregunta clave no es si Bonsai 2 27B iguala el 98% de un benchmark. Es si los desarrolladores pueden confiar en él bajo restricciones reales: memoria limitada, prompts cambiantes, llamadas a herramientas, políticas de seguridad y datos empresariales desordenados. Si PrismML puede demostrar que su compresión supera esas pruebas —y escala a modelos más grandes— podría convertir la IA local en una capa práctica de despliegue y no en una optimización para especialistas.

Anuncios