
전 OpenAI CTO 미라 무라티가 설립한 AI 연구소 Thinking Machines가 두 번째 모델 Inkling Small을 공개하며, 초점을 단순한 규모에서 효율성으로 옮겼다. The Decoder의 보도에 따르면, 이 새 모델은 회사의 이전 Inkling 모델보다 훨씬 적은 활성 파라미터를 사용하면서도 광범위한 벤치마크 지수에서는 거의 비슷한 결과를 내고, 일부 코딩 및 추론 테스트에서는 더 뛰어나다.
이러한 포지셔닝이 중요한 이유는 현재 모델 시장의 핵심 압박 지점을 직접 겨냥하기 때문이다. 많은 개발자와 기업 구매자는 대형 프런티어 시스템에 따라붙는 추론 비용, 지연 시간, 배포 복잡성을 치르지 않으면서도 강력한 추론 성능을 원한다. Thinking Machines가 더 작은 오픈 모델도 의미 있는 작업에서 경쟁력을 유지할 수 있음을 보여준다면, 점점 더 큰 모델을 향한 획일적인 경쟁보다 미세 조정된 도메인 특화 배포의 필요성을 강화하게 된다.
핵심 뉴스는 단순하다. Thinking Machines는 Inkling Small을 오픈 웨이트 추론 모델로 소개했으며, The Decoder는 그것이 언급된 핵심 파라미터 수 기준으로 Inkling의 3분의 1도 안 되는 크기라고 보도했다. Artificial Analysis의 벤치마크 추적에 따르면, Inkling Small은 해당 업체의 Intelligence Index에서 40점을 받아 Inkling의 41점과 근접한다.
같은 보도에 따르면 이 모델은 총 2760억 개의 파라미터와 120억 개의 활성 파라미터를 갖는다. 이 구분은 중요하다. 현재의 모델 설계, 특히 희소(sparse) 또는 mixture 계열 시스템에서는 활성 파라미터 수가 전체 파라미터 수보다 실행 비용의 더 나은 대리 지표가 될 수 있다. 특정 토큰에서 실제로 네트워크의 어느 정도가 동원되는지를 반영하기 때문이다. 제공된 소스 자료는 Inkling Small의 아키텍처를 자세히 설명하지 않지만, 총 파라미터와 활성 파라미터의 격차는 Thinking Machines가 단지 모델 마케팅에서만이 아니라 추론이 실제로 어떻게 관리되는지에서도 효율성을 강조하고 있음을 시사한다.
VentureBeat도 별도 보도에서 이 출시를 유사하게 설명하며, Inkling Small을 이전 모델의 성능에 대략 4분의 1 규모로 근접하는 오픈소스 AI 모델이라고 소개했다. 해당 보도의 전체 텍스트는 소스 증거에 없었으므로, 여기서의 더 자세한 기술 및 벤치마크 설명은 주로 The Decoder의 보도와 그가 인용한 제3자 벤치마크에 기반한다.
The Decoder에 따르면, Inkling Small은 추론과 코딩 중심의 여러 평가에서 더 큰 형제 모델을 앞선다. 보고된 예로는 Humanity's Last Exam에서 Inkling Small이 32%로 Inkling의 30%를 넘었고, GPQA Diamond에서는 89% 대 87%를 기록했다.
이는 사소한 승리가 아니다. Humanity's Last Exam은 더 고급 추론 능력을 살펴보도록 설계된 까다로운 벤치마크로 사용되어 왔고, GPQA Diamond는 고급 과학 및 전문가 수준의 질의응답 논의에서 자주 언급된다. 이러한 향상은 Thinking Machines가 Inkling Small을 단지 넓은 기본 역량을 유지하는 수준이 아니라, 작고 어려운 추론 작업에서 잘 수행하도록 튜닝했을 가능성을 시사한다.
동시에, 이 모델은 에이전트 기반 작업과 사실 지식에서는 더 큰 Inkling에 뒤처지는 것으로 전해진다. 이 트레이드오프는 중요하다. 코딩 어시스턴트, 내부 연구 코파일럿, 또는 좁은 추론 워크플로를 구축하는 팀에게는 더 나은 토큰당 성능이 더 넓은 지식 범위보다 더 가치 있을 수 있다. 하지만 사실을 검색하고, 더 긴 시간축에서 도구를 사용하며, 여러 기업 업무에서 안정적으로 작동해야 하는 범용 에이전트에게는 그런 약점이 여전히 중요할 수 있다.
또 다른 성능 관점은 출력 효율성이다. The Decoder는 Inkling Small이 작업당 평균 24K 출력 토큰을 사용한다고 보도했는데, 이는 Deepseek V4 Flash의 45K, GPT-5.4 mini의 78K와 비교된다. 이 비교가 비슷한 조건에서 유지된다면, 실질적인 이점을 시사한다. 생성되는 토큰 수가 적더라도 결과에 도달하는 모델은 비용을 낮추고 사용자에게 보이는 지연 시간을 줄일 수 있기 때문이다. 다만 많은 벤치마크형 효율 비교와 마찬가지로, 정확한 작업 구성과 평가 설정이 중요하며, 구매자는 독립적 테스트 없이 단일 토큰 효율 수치에 과도하게 의미를 부여해서는 안 된다.
이번 출시는 Thinking Machines가 모델을 어떻게 패키징하는지에서도 주목할 만하다. The Decoder는 Inkling Small이 텍스트, 이미지, 음성 입력을 지원해 텍스트 전용 추론 엔진이 아니라 멀티모달 프로필을 갖춘다고 전했다. 또한 256K 토큰 컨텍스트 윈도우를 제공해 대규모 문서 분석, 코드베이스 작업, 장시간 대화 세션에 기대되는 범위에 들어간다.
접근 측면에서 이 모델은 Apache 2.0으로 배포되며, 가중치는 Hugging Face에서 제공된다. 이 라이선스 선택은 상업적 채택에 중요하다. Apache 2.0은 일반적으로 기업 친화적으로 여겨지는데, 더 제한적인 커뮤니티 라이선스에 따를 수 있는 일부 법적 불확실성 없이 광범위한 사용, 수정, 배포를 지원하기 때문이다.
The Decoder에 따르면 Thinking Machines는 또한 Tinker Playground를 통해 Inkling Small을 제공하고 있으며, 사용자는 브라우저에서 모델을 파인튜닝할 수 있다. 이는 단일의 정형화된 모델 엔드포인트를 판매하기보다, 기본 모델을 사용자화 가능한 출발점으로 만드는 제품 전략과 맞닿아 있다. 보도에서 설명된 바와 같이, 회사는 자사 모델을 사용자가 자신의 데이터로 조정할 수 있는 기반으로 포지셔닝하고 있다.
이 메시지는 소유권과 특화에 점점 더 관심을 갖는 시장에 잘 맞는다. 많은 제품 팀은 이제 지연 시간, 배포 토폴로지, 안전 동작, 도메인 적응에 대한 통제권을 원한다. Hugging Face를 통해 배포되고 가벼운 튜닝 도구와 결합된 오픈 웨이트 모델은 Thinking Machines가 폐쇄형 API 전용 제공보다 이 구매자층에 더 명확하게 접근할 수 있게 한다.
Inkling Small 출시를 뒷받침하는 증거는 유망하지만 아직 상대적으로 얇다. 이 묶음에서 가장 상세한 소스는 The Decoder이며, 그 역시 주요 성능 프레이밍을 Artificial Analysis에 귀속시킨다. 이는 핵심 주장인 더 작은 활성 크기에서 Inkling에 가까운 성능이 제3자 벤치마크 추적에 기반하며, 제공된 증거에 포함된 완전한 기술 논문에 근거한 것은 아님을 뜻한다.
Apache 2.0 라이선스, Hugging Face의 가중치, 256K 컨텍스트 윈도우, Tinker Playground를 통한 제공과 같은 일부 주장은 직접 확인하기 쉽다. 반면 더 신중해야 하는 부분도 있다. Intelligence Index, Humanity's Last Exam, GPQA Diamond 같은 벤치마크 점수는 평가 프로토콜, 프롬프트 선택, 모델 버전에 의존한다. 동일하거나 더 작은 크기의 오픈 모델 중 더 높은 점수를 기록한 것은 없다는 주장은 The Decoder가 인용한 Artificial Analysis의 것이지, 여기 제공된 자료에서 독립적으로 재현된 시장 전체 감사는 아니다.
또한 소스 증거에는 상세한 배포 데이터가 없다. 처리량, 실제 서빙 비용, 기업 사용 사례, 파인튜닝 안정성, 적대적 테스트 하의 안전성에 대한 직접적인 수치는 아직 없다. 따라서 Inkling Small은 종이 위에서는 효율적인 오픈 웨이트 공개처럼 매력적이지만, 현재의 그림은 현장 검증보다는 벤치마크 중심으로 봐야 한다.
AI 빌더에게 이 공개의 가장 강한 신호는 Thinking Machines가 또 다른 모델을 출시했다는 사실 자체가 아니다. 회사가 다른 최적화 목표를 제시하고 있다는 점이다. 여전히 플래그십 모델 발표가 지배하는 시장에서, Inkling Small은 더 작은 활성 크기, 더 적은 토큰 소비, 더 쉬운 커스터마이징을 바탕으로 한 유용한 추론 중심의 제품 전략이 여전히 가능하다는 것을 시사한다.
이는 여러 워크플로에서 공감을 얻을 수 있다. 빠른 반복 제안을 필요로 하는 코딩 어시스턴트는 가능한 한 넓은 세계 지식보다 토큰 효율성에서 더 많은 이익을 볼 수 있다. 독점 문서를 중심으로 구축된 내부 기업 AI 시스템은 기업 데이터로 파인튜닝하고 허용적 라이선스로 배포할 수 있는 모델을 선호할 수 있다. 멀티모달 입력을 다루는 팀은 더 큰 독점 스택으로 기본 전환하지 않고도 텍스트, 이미지, 음성을 처리할 수 있는 하나의 모델에서 가치를 볼 수 있다.
경쟁 측면도 분명하다. Deepseek V4 Flash와 GPT-5.4 mini에 대한 출력 토큰 효율 비교를 통해 이번 출시는 절대적 벤치마크 1위가 아니라 비용 대비 성능으로 경쟁하는 혼잡한 중간급 모델 영역에 들어간다. 실제로 많은 기업 AI 예산이 그 지점에서 결정된다. 질문은 “가장 똑똑한 모델이 무엇인가?”보다 “프로덕션에 넣을 만큼 충분히 좋고, 제어 가능하고, 감당할 수 있는 것은 무엇인가?”에 가깝다.
Thinking Machines에게 이번 출시는 정체성을 정의하는 데 도움이 된다. 가장 큰 폐쇄형 모델 벤더를 단지 화제성만으로 압도하려 하기보다, 회사는 오픈 배포, 효율적 추론, 파인튜닝 유연성이 지속 가능한 위치를 만들 수 있다고 베팅하는 듯하다.
앞으로 볼 신호는 홍보성보다 실용적일 것이다. 첫째, 코딩 어시스턴트 작업, 에이전트 신뢰성, 사실적 근거에서 Inkling Small의 독립적 테스트를 보면 벤치마크 이야기가 실제 생산 사용으로 이어지는지 알 수 있다.
둘째, Hugging Face 공개가 의미 있는 커뮤니티 반응, 즉 파생 체크포인트, 튜닝 레시피, 프레임워크 통합, 재현 가능한 지연 시간 보고서를 만들어내는지 살펴볼 필요가 있다. 오픈 웨이트 출시는 다운로드만이 아니라 생태계를 끌어들일 때 더 중요하다.
셋째, Tinker Playground의 역할을 추적할 가치가 있다. 브라우저 기반 파인튜닝이 특화의 장벽을 낮춘다면, Thinking Machines는 무거운 ML 인프라가 없는 소규모 팀에서 더 많은 채택을 얻을 수 있다.
마지막으로 Thinking Machines의 향후 기술 공개도 중요하다. 아키텍처, 학습 방법, 안전 동작, 추론 경제성에 대한 더 많은 정보가 있으면 기업이 Inkling Small이 주로 벤치마크 효율형 모델인지, 아니면 더 큰 독점 시스템의 실제 운영 대안인지 판단하는 데 도움이 된다.
Inkling Small은 기업 AI 구매에서 더 넓은 변화를 반영한다. 최적화가 원시적인 모델 명성에서 배포 수학으로 이동하고 있다. 리더보드에서는 약간 떨어지지만 토큰 사용, 튜닝 유연성, 라이선스에서 훨씬 더 나은 모델이 더 중요한 제품이 될 수 있다.
남은 질문은 Thinking Machines가 이 가설을 실제 채택으로 바꿀 수 있느냐는 것이다. Inkling Small은 특히 Apache 2.0, Hugging Face, Tinker Playground를 통해 회사에 오픈 웨이트 시장에서 신뢰할 만한 진입점을 제공한다. 그러나 돌파하려면 단지 Inkling에 근접한 벤치마크만으로는 부족하다. 팀들이 그 위에 폐쇄형 대안보다 더 나은 비용, 제어, 속도로 실제 기업 AI와 AI 에이전트를 안정적으로 구축할 수 있다는 증거가 필요하다.
Thinking Machines는 Inkling의 결과에 훨씬 적은 활성 파라미터로 근접하는 Apache 2.0 오픈 웨이트 추론 모델 Inkling Small을 공개했다.