AI News

Nous Research가 140억 파라미터 규모의 오픈소스 코딩 모델 NousCoder-14B를 공개했다. 회사는 이 모델이 더 큰 독점 시스템과도 경쟁할 수 있다고 말한다. 이번 출시는 Anthropic의 Claude Code가 개발자들의 큰 주목을 받는 가운데 이뤄졌으며, 오픈 모델이 실제 소프트웨어 작업에서 비슷한 성과를 낼 수 있는지에 대한 관심을 다시 끌어올리고 있다.

VentureBeat AI에 따르면 Nous Research는 48개의 Nvidia B200 GPU를 사용해 4일 만에 모델을 학습시켰다. 회사는 모델 가중치, 강화학습 환경, 그리고 이를 만드는 데 사용한 학습 하네스를 공개했다. 따라서 이번 공개는 보고된 벤치마크 점수뿐 아니라, 외부 연구자들이 검토·재현·확장할 수 있는 인프라의 규모 면에서도 주목할 만하다.

검증 가능한 코드를 중심으로 만든 작은 모델

첨부된 기술 보고서에 따르면 NousCoder-14B는 Alibaba의 Qwen3-14B를 기반으로 한다. Nous Research는 2024년 8월부터 2025년 5월 사이에 발표된 경쟁 프로그래밍 문제를 다루는 LiveCodeBench v6에서 67.87%의 정확도를 기록했다고 밝혔다. 회사는 이 결과가 베이스 모델 성능보다 7.08%포인트 높다고 설명한다.

이 수치는 벤더가 보고한 벤치마크 결과로 읽어야 하며, 코딩 보조 도구의 품질을 완전히 측정하는 지표는 아니다. LiveCodeBench v6는 정답이 알려진 프로그래밍 문제의 해법을 평가한다. 이것만으로는 NousCoder-14B가 대규모 코드베이스, 낯선 저장소, 도구 사용, 여러 차례에 걸친 디버깅, 운영상의 제약을 얼마나 잘 처리하는지는 알 수 없다.

이 구분이 중요한 이유는 현재 시장의 논의가 점점 에이전트형 도구에 의해 형성되고 있기 때문이다. Claude Code는 프로젝트를 검사하고, 변경을 가하고, 작동하는 소프트웨어를 향해 반복적으로 개선해 가는 시연으로 주목을 받았다. 반면 Nous Research의 보고된 결과는 생성된 코드를 자동 실행해 정답/오답을 판별할 수 있는 경쟁 프로그래밍에 초점을 맞춘다.

Nous Research가 모델을 학습시킨 방식

이번 공개에는 Nous Research가 모델과 함께 공개한 Atropos 프레임워크가 사용됐다. 학습에는 24,000개의 경쟁 프로그래밍 문제가 포함됐고, 검증 가능한 보상에 기반한 강화학습 과정이 적용됐다. 모델이 해답을 생성하면 시스템이 테스트 케이스에 대해 실행했고, 그 결과가 학습 신호를 제공했다.

VentureBeat는 Nous Research가 Modal을 사용해 샌드박스화된 코드 실행을 병렬로 수행했다고 보도했다. 시스템은 제출물에 시간과 메모리 제한을 적용했고, 생성·검증·추가 학습을 겹쳐 GPU 클러스터를 계속 활용했다. 연구진은 다른 접근법과 비교한 끝에 Dynamic Sampling Policy Optimization, 즉 DAPO를 선택했다.

보고된 한 기법은 모델이 매번 성공하거나 매번 실패하는 문제를 제거했다. 두 경우 모두 연구진은 해당 예시들이 모델 개선에 유용한 신호를 거의 제공하지 않는다고 판단했다. 또한 처음에는 32,000토큰의 컨텍스트 윈도우로 학습한 뒤 이를 확장했으며, 약 80,000토큰에서 평가했을 때 보고된 최고 점수가 나왔다.

이 기술적 접근은 더 큰 사전학습 시스템에만 의존하지 않고 작은 모델을 개선하는 경로를 보여준다는 점에서 개발자들에게 중요하다. 출력물을 자동으로 테스트할 수 있다면 강화학습은 특정 행동을 정확하게 겨냥할 수 있다. 하지만 이 장점은 신뢰할 수 있는 평가자가 있는 분야에서 가장 강하게 나타나며, 코드 유지보수성, 제품 요구사항, 아키텍처 판단처럼 모호한 작업에는 적용하기가 더 어렵다.

벤치마크 향상 뒤의 데이터 한계

기술 보고서는 향후 코딩 모델 연구의 방향을 좌우할 수 있는 제약도 지적한다. 보고서 저자인 Joe Li에 따르면, Nous Research가 사용한 24,000개 문제는 표준화되고 검증 가능한 형식으로 쉽게 이용 가능한 경쟁 프로그래밍 문제의 상당 부분을 차지한다.

Li는 이 분야가 이미 고품질 공개 학습 데이터의 공급 한계에 가까워지고 있을 수 있다고 주장한다. 이는 코딩 모델의 발전이 멈췄다는 뜻이 아니라, 추가적인 향상이 단순히 온라인 문제를 더 많이 모으는 것보다 데이터 효율성, 합성 예시, 더 나은 학습 목표에 더 크게 의존하게 될 수 있음을 의미한다.

연구진은 문제 생성과 셀프 플레이를 향후 가능성으로 제시한다. 유용하고 풀 수 있는 프로그래밍 과제를 만들어내는 모델은 다른 모델, 혹은 자기 자신을 위한 지속적인 커리큘럼을 생성할 수 있다. 보고서는 또한 멀티턴 강화학습을 제안하며, 시스템이 컴파일러 오류, 실패한 테스트, 시간 제한 피드백을 반복 시도 전반에 걸쳐 활용하고 최종 합격/불합격 보상만 받지 않도록 해야 한다고 말한다.

이러한 제안은 아직 연구 방향일 뿐, NousCoder-14B의 입증된 능력은 아니다. 보고서는 또한 잘못된 해답이 더 긴 경향이 있었고, 몇몇 기법은 학습 중 사용 가능한 컨텍스트를 소모하려는 모델의 성향을 해결하지 못했다고 적고 있다.

이번 공개가 AI 코딩 제품에 의미하는 것

개발자와 창업자에게 가장 즉각적인 매력은 통제권이다. NousCoder-14B는 Hugging Face에서 Apache 2.0 라이선스로 제공되며, 함께 공개된 Atropos 스택은 일반적인 폐쇄형 API보다 학습 과정을 더 자세히 들여다볼 수 있게 해준다. 적절한 인프라를 갖춘 조직이라면 모델을 비공개로 평가하고, 내부 워크플로에 맞게 조정하거나, 학습 환경을 새로운 실험의 기반으로 활용할 수 있다.

그렇다고 해서 바로 호스팅된 코딩 에이전트를 대체하는 것은 아니다. 제품 팀은 여전히 추론 비용, 지연 시간, 컨텍스트 처리, 저장소 규모에서의 성능, 보안 격리, 그리고 오류에서 회복하는 능력을 검토해야 한다. 한 번에 끝나는 프로그래밍 문제에서는 잘 작동하는 오픈 모델도, 장기간 유지되는 코드베이스를 탐색하거나 여러 도구를 조율해야 할 때는 전혀 다른 행동을 보일 수 있다.

그럼에도 시점은 경쟁 압박을 높인다. Claude Code는 엔드투엔드 코딩 에이전트를 매우 눈에 띄는 제품 카테고리로 만드는 데 기여했지만, Nous Research는 재현성과 오픈 인프라를 강조하고 있다. 이는 채택으로 가는 서로 다른 경로다. 하나는 세련되고 관리되는 워크플로를 우선시하고, 다른 하나는 연구자와 기업에게 모델과 운영 환경에 대한 더 큰 통제권을 준다.

회사의 더 넓은 오픈소스 전략도 중요하다. 암호화폐 벤처 기업 Paradigm의 지원을 받는 Nous Research는 이전에 Hermes 4와 DeepHermes-3 같은 모델을 공개한 바 있다. VentureBeat는 2025년 4월 Paradigm이 주도한 5,000만 달러 라운드를 포함해 총 6,500만 달러를 조달했다고 보도했다. 이러한 자금 조달 세부사항과 회사의 경쟁적 포지셔닝은 보고된 출처에 따른 것이며, NousCoder-14B의 상업적 견인력을 독립적으로 검증한 것은 아니다.

앞으로 무엇을 주목할 것인가

가장 유용한 후속 검증은 LiveCodeBench v6를 넘어선 독립 테스트가 될 것이다. 개발자들은 저장소 수준의 수정, 다중 파일 변경, 도구 보조 워크플로, 테스트와 컴파일러와의 반복 상호작용에서의 결과를 살펴봐야 한다. 다른 오픈 모델과의 비교도 NousCoder-14B의 우위가 경쟁 프로그래밍 밖에서도 유지되는지 밝혀줄 것이다.

연구자들은 공개된 Atropos 스택이 비슷한 하드웨어에서 재현 가능한 결과를 가능하게 하는지, 그리고 성능이 특정 24,000문제 데이터셋에 얼마나 의존하는지에 주목할 가능성이 높다. 추론 비용과 긴 컨텍스트 신뢰성에 대한 추가 증거는 이 모델이 제품에 실용적인지, 아니면 주로 연구 산출물로 가치가 있는지를 결정할 것이다.

Creati.ai 관점

NousCoder-14B가 중요한 이유는 단일 벤치마크가 오픈 대 클로즈드 논쟁에 결론을 내서가 아니라, 비교적 컴팩트한 코딩 모델을 개선할 수 있는 신뢰할 만하고 검토 가능한 경로를 드러내기 때문이다. 검증 가능한 보상과 공개된 학습 인프라의 결합은 AI 개발자들에게 구체적으로 연구할 대상을 제공한다.

더 어려운 시험은 배포다. 코딩 제품에는 콘테스트 문제의 정답만이 아니라, 신뢰할 수 있는 반복 작업, 저장소 인식, 안전한 실행이 필요하다. Nous Research나 외부 팀이 이 공개를 그런 워크플로로 확장할 수 있다면 Claude Code에 대한 의미 있는 견제 세력이 될 수 있다. 현재로서는 더 좁은 주장이 가장 강하다. 오픈 연구는 코딩의 측정 가능한 부분에서 빠르게 진전하고 있지만, 덜 측정 가능한 제품 과제는 여전히 해결되지 않은 상태다.

추천

오픈소스 코딩 모델이 Claude Code의 순간을 맞이하며 Nous Research가 NousCoder-14B를 공개

Nous Research가 보고된 LiveCodeBench 향상을 내세운 오픈 코딩 모델 NousCoder-14B를 공개하며 AI 소프트웨어 개발 경쟁을 더욱 치열하게 만들었다.