PrismML이 PC와 휴대폰용으로 설계된 압축 추론 모델 Bonsai 2 27B를 공개하며, 프라이빗한 온디바이스 AI의 가능성을 더욱 강화했다.

PrismML이 Bonsai 2 27B를 공개했다. 스타트업은 이 압축 추론 모델이 5.9GB의 저장공간만 차지하면서 훨씬 더 큰 모델에 가까운 성능을 제공할 수 있다고 말한다. 이번 출시는 PrismML이 유능한 언어 모델을 클라우드 서버에서 PC로, 그리고 잠재적으로는 고급 스마트폰으로 옮기려는 노력을 시험하는 가장 분명한 사례다.
로컬 추론은 클라우드 비용을 낮추고, 응답 지연을 개선하며, 민감한 데이터를 사용자 기기에 그대로 둘 수 있기 때문에 AI 개발자와 제품팀에 중요할 수 있다. 다만 지금까지 확보된 가장 강한 성능 및 채택 수치는 모두 PrismML이 자체적으로 제시한 것이며, 스타트업은 벤치마크 결과가 실제 애플리케이션에서도 동일하게 이어진다는 점을 입증하지는 못했다.
Bonsai 2 27B는 Alibaba의 오픈소스 모델 Qwen3.8 27B를 TechCrunch 보도에 따르면 원본보다 약 9~10배 작은 파일로 압축한다. 5.9GB라면 많은 개인용 컴퓨터에 무리 없이 들어가며 일부 고급 스마트폰에서도 실행될 수 있지만, 실제 성능은 메모리, 프로세서 성능, 양자화, 그리고 이를 실행하는 데 사용되는 소프트웨어에 따라 달라진다.
PrismML은 Caltech 연구진이 설립했고, 압축 연구로 잘 알려진 Caltech 교수 Babak Hassibi가 이끌고 있다. Databricks 공동창업자이자 UC 버클리 Sky Computing Lab 디렉터인 Ion Stoica는 자문 역할을 맡고 있다. 이 스타트업은 Khosla Ventures, Cerberus Capital, Caltech으로부터 2,225만 달러의 시드 라운드를 유치했다.
이 회사만 LLM 압축에 뛰어든 것은 아니다. Multiverse Computing도 모델 크기를 줄이는 방법을 개발하고 있다. Hassibi에 따르면 PrismML의 차별점은, 모델 크기를 줄이기 위해 상당한 정확도를 희생하는 대신 원본 모델의 측정된 성능 대부분을 유지한다는 점이다.
PrismML의 방식은 회사가 ‘ternary weights’라고 부르는 것을 사용한다. 모델 가중치는 보통 비교적 큰 수치 표현으로 학습된 정보를 저장한다. 회사는 이 값을 양의 1, 음의 1, 0이라는 세 가지 상태로 줄인다. 이를 통해 각 가중치를 표현하는 데 필요한 정보량이 제한되고 메모리 요구량이 크게 감소한다.
이렇게 얻어진 기법은 널리 LLM 압축으로 알려져 있으며, 추론이 어디서 일어날 수 있는지를 바꾸는 데 목적이 있다. 모든 프롬프트를 호스팅 서비스로 보내는 대신, 애플리케이션은 적어도 일부 작업을 로컬에서 실행할 수 있다. 이는 오프라인 기능, 더 빠른 상호작용, 데이터 흐름에 대한 더 큰 통제를 가능하게 한다.
Bonsai 2 27B보다 몇 달 আগে 출시된 PrismML의 첫 Bonsai 모델은 원본 모델의 집계 벤치마크 점수의 95%를 기록한 것으로 알려졌다. 새 버전은 98%에 도달한다고 주장된다. 이 수치는 릴리스 간 진전을 보여주지만, 다양한 작업, 기기, 평가 방법 전반에 걸친 독립 검증과는 같은 의미가 아니다.
98% 결과는 PrismML에 귀속된 벤더 보고 벤치마크 주장이다. 이는 회사가 선택한 집계 평가에서 원래 Qwen 모델과의 격차가 작다는 뜻이지만, Bonsai 2 27B가 실제 운영 환경에서 동일하게 동작한다는 것을 입증하지는 않는다. 벤치마크는 긴 문맥, 도구 사용, 특정 도메인 지식, 다국어 프롬프트, 또는 모델 주변의 오케스트레이션 계층과 관련된 실패를 놓칠 수 있다.
Hassibi는 압축이 아마도 항상 어느 정도의 성능 저하를 가져올 것이라고 인정했다. 그는 또한 비압축 언어 모델 자체가 완벽하지 않고, 벤치마크 점수가 사용자 결과를 정확히 예측하지 못하므로 2%의 벤치마크 차이는 실질적으로 큰 의미가 없을 수 있다고 주장했다. 이는 타당한 공학적 주장일 수 있지만, 제품팀이 자신들의 워크로드로 검증해야 하는 주장인 것은 변함없다.
PrismML은 또 원래 Bonsai 모델이 1,100만 회 이상 다운로드되었고, 더 작은 모델들은 추가로 260만 회 다운로드되었다고 말한다. 이 수치는 회사가 보고한 채택 신호이지, 지속적인 프로덕션 사용, 활성 사용자, 상업적 배포의 증거는 아니다. 다운로드 총계에는 실험, 자동화된 활동, 반복 다운로드가 포함될 수 있다.
모델이 소비자 하드웨어에서 안정적으로 작동한다면, Bonsai 2 27B는 온디바이스 AI의 설계 가능성을 넓힐 수 있다. 개발자들은 네트워크 연결 없이도 계속 동작하는 도우미, 개인 문서를 로컬에서 처리하는 기능, 또는 작업이 로컬 성능을 넘을 때만 클라우드 모델을 사용하는 기능을 만들 수 있다. 기업 구매자에게는 이런 아키텍처가 기밀 프롬프트와 문서가 외부 추론 제공자에게 노출되는 위험을 줄여줄 수 있다.
트레이드오프도 중요하다. 저장공간에 들어가는 모델이라도 유용한 속도로 실행하려면 여전히 부담이 클 수 있다. 메모리 대역폭, 발열 제한, 배터리 소모, 운영체제 지원, 최적화된 런타임의 가용성이 로컬 모델이 얼마나 반응적으로 느껴지는지를 좌우할 것이다. 애플리케이션 팀은 또한 압축 추론이 코딩 지원, 문서 분석, 고객 지원, AI 에이전트 같은 워크플로에 충분히 신뢰할 만한지 평가해야 한다.
PrismML의 장기 계획은 수천억 개 매개변수를 가진 모델까지 압축하는 것이다. Hassibi는 TechCrunch에 더 큰 모델일수록 지능을 덜 잃으면서 압축할 여지가 더 많을 수 있다고 말했다. 이 주장이 맞다면, 회사는 결국 오늘날의 작은 모델보다 훨씬 더 유능한 로컬 시스템을 겨냥할 수 있다. 다만 이는 여전히 장기적 목표일 뿐, 입증된 제품 기능은 아니다.
다음 중요한 신호는 Bonsai 2 27B를 소비자용 PC와 스마트폰에서 독립적으로 테스트해 속도, 메모리 사용량, 배터리 영향, 실용 작업 정확도를 확인하는 것이다. 개발자들은 또한 지원되는 런타임, 라이선스 세부사항, 모델 가용성, 재현 가능한 평가 데이터에도 주목해야 한다.
PrismML은 앞으로 몇 달 안에 수천억 개 매개변수 규모의 모델을 출시하길 희망한다고 말한다. 이러한 출시가 일정대로 이뤄지는지, 주장한 품질을 유지하는지, 상업적으로 의미 있는 하드웨어에서 실행되는지가 회사의 접근 방식이 설득력 있는 압축 시연을 넘어 확장될 수 있는지를 보여줄 것이다.
PrismML이 Apple과 논의 중일 수 있다는 보도는 확인되지 않았으며, Hassibi는 언급을 거부했다. 기기 또는 플랫폼과의 공식 파트너십은 상업적 배포에 대한 더 분명한 신호가 되겠지만, 현재 확보된 증거로는 그런 합의가 입증되지 않았다.
PrismML의 출시는 5.9GB 모델이 클라우드 AI를 자동으로 대체하기 때문이 아니라, 로컬과 클라우드 사이의 선택을 더 유연하게 만들기 때문에 중요하다. 조금 더 약하지만 프라이빗하고, 운영 비용이 저렴하며, 오프라인에서도 사용할 수 있는 압축 모델은 많은 좁은 범위의 제품 워크플로에서 더 큰 모델보다 유용할 수 있다.
핵심 질문은 Bonsai 2 27B가 벤치마크 98%를 맞추는지 여부가 아니다. 실제 제약 조건, 즉 제한된 메모리, 바뀌는 프롬프트, 도구 호출, 안전 정책, 그리고 복잡한 기업 데이터를 전제로 빌더들이 이를 신뢰할 수 있는지가 핵심이다. PrismML이 자사의 압축이 이런 테스트를 견디고 더 큰 모델로도 확장된다는 점을 보여준다면, 로컬 AI는 특수 최적화가 아니라 실용적인 배포 계층이 될 수 있다.