
Nous Research는 경쟁 프로그래밍용으로 설계된 140억 파라미터 오픈소스 모델 NousCoder-14B를 공개했다. 개발자들이 AI 시스템이 소프트웨어 개발의 더 큰 부분을 처리할 수 있는지 점점 더 시험하는 가운데 나온 발표다. 회사는 이 모델이 48개의 Nvidia B200 GPU에서 4일간 강화학습을 수행한 뒤 LiveCodeBench v6에서 67.87%의 정확도를 달성했다고 밝혔다.
이번 공개 시점은 Anthropic의 에이전틱 프로그래밍 도구인 Claude Code에 쏠린 강한 관심과 맞물린다. Claude Code가 소프트웨어 작업의 엔드투엔드 데모로 주목받아 온 반면, Nous Research는 다른 길을 택했다. 모델, 학습 환경, 평가 체계를 공개해 다른 연구자들이 시스템을 검토하거나 확장할 수 있게 하는 것이다. 이러한 차이는 호스팅된 코딩 에이전트를 도입할지, 아니면 자체 통제 아래 모델을 운영할지 결정하는 개발자들에게 중요하다.
공개에 동반된 기술 보고서에 따르면 NousCoder-14B는 Alibaba의 Qwen3-14B를 기반으로 한다. Nous Research는 강화학습을 통해 이 기반 모델 대비 LiveCodeBench v6 점수가 7.08%포인트 향상되어 67.87%에 도달했다고 밝혔다.
LiveCodeBench v6는 2024년 8월부터 2025년 5월 사이에 공개된 경쟁 프로그래밍 문제로 모델을 평가한다. 생성된 해답을 컴파일하고 알려진 테스트 케이스와 대조할 수 있기 때문에 알고리즘적 코딩 능력을 측정하는 데 유용하다. 그러나 소프트웨어 엔지니어링 성능을 완전히 보여주는 지표는 아니다. 현재 उपलब्ध한 증거로는 NousCoder-14B가 저장소 수준의 변경, 여러 파일에 걸친 디버깅, 도구 사용, 코드 리뷰, 자율적 작업 계획에서 어떤 성능을 내는지 알 수 없다.
이러한 한계는 시장의 관심이 일회성 코드 생성에서 에이전틱 워크플로로 이동하는 상황에서 중요하다. 모델은 개별 프로그래밍 문제에서는 잘할 수 있지만, 코드베이스를 읽고, 파일을 수정하고, 테스트를 실행하고, 실패를 해석하며, 그 과정을 반복하는 도구와는 동등하지 않을 수 있다. 또한 제공된 자료만으로는 NousCoder-14B가 그런 다단계 사용에 최적화되어 있는지 확인할 수 없다.
이번 공개는 모델 가중치에 그치지 않는다. Nous Research는 Atropos 강화학습 프레임워크, 학습 하네스, 관련 환경 및 벤치마크 구성 요소도 공개했다. 모델은 Hugging Face에서 Apache 2.0 라이선스로 제공되며, 개발자와 연구자는 자체 인프라와 운영 제약에 따라 시스템을 내려받고, 검토하고, 수정할 수 있다.
학습 과정에서는 검증 가능한 보상이 사용됐다. 모델이 코드를 생성하면 시스템이 이를 테스트 케이스에 대해 실행했고, 정답 또는 오답 결과가 피드백 신호를 제공했다. Nous Research는 Modal을 사용해 샌드박스화된 코드 실행을 병렬로 처리했으며, 생성된 해답은 시간 및 메모리 제한을 기준으로 검사됐다.
기술 보고서는 팀의 실험에서 DAPO, 즉 Dynamic Sampling Policy Optimization을 선호 학습 방식으로 설명한다. 모든 시도가 성공하거나 모든 시도가 실패한 예시는 유용한 학습 신호가 거의 없었기 때문에 버려졌다. 또한 추론, 검증, 학습을 겹치게 수행해 해답이 확인되는 동안에도 GPU 클러스터가 계속 일하도록 했다.
팀은 처음에는 32,000토큰 컨텍스트 창으로 학습했고 이후 이를 40,000토큰으로 확장했다. 보고된 최상의 평가 결과는 약 80,000토큰의 컨텍스트를 사용했다. 이러한 구현 세부사항은 헤드라인 점수보다 다른 연구자들에게 더 중요할 수 있다. 재현 가능한 코드 실행과 효율적인 강화학습 파이프라인은 소규모 및 중간 규모 코딩 모델 실험의 진입 장벽을 낮출 수 있기 때문이다.
이 기사에서 가장 강한 성능 주장은 VentureBeat가 설명한 Nous Research의 자체 기술 보고서에서 나온다. 따라서 67.87%의 LiveCodeBench v6 결과는 이용 가능한 원자료에 제시된 독립 평가가 아니라 벤더가 보고한 벤치마크다. 독점 시스템과의 비교는 신중해야 하는데, 결과는 프롬프팅, 샘플링, 컨텍스트 길이, 테스트 시점 연산량, 외부 도구 사용 여부에 따라 달라질 수 있기 때문이다.
그러나 보고서는 데이터에 관해 더 실질적인 발견도 제시한다. Nous Research는 24,000개의 경쟁 프로그래밍 문제로 학습했으며, 이것이 표준화된 형식으로 쉽게 구할 수 있고 검증 가능한 문제의 상당 부분을 차지한다고 말했다. 연구자 Joe Li는 이 분야가 이 좁은 영역의 고품질 데이터 공급에 가까워지고 있을 수 있다고 결론지었다.
이 제약은 단순히 더 큰 텍스트 코퍼스를 모으는 익숙한 문제와 다르다. 프로그래밍 문제에는 신뢰할 수 있는 해답과 자동화된 테스트가 필요하기 때문에 이진 보상에는 적합하지만 대규모로 만들기 어렵다. 보고서는 합성 문제 생성과 self-play를 다음 단계의 가능성으로 제시하면서도, 모델이 여전히 유용하고 흥미로운 문제를 생성하는 데 어려움을 겪고 있음을 인정한다.
보고서는 또한 모델의 개선을 Li의 Codeforces 성과 향상과 비교한다. 이 비유는 과학적 학습 효율 지표라기보다 설명용에 가깝다. 모델은 24,000개의 문제를 사용한 반면, Li는 비교 기간 동안 약 1,000개를 풀었기 때문에, 겉보기 속도 우위는 훨씬 더 많은 예시와 자동화된 피드백에 대한 노출에 의존한다는 점을 보여준다.
연구자에게 NousCoder-14B는 코드에 대한 강화학습을 연구하기 위한 이례적으로 검토 가능한 패키지를 제공한다. 팀은 보상 과정을 살펴보고, 샘플링을 수정하며, 유사한 방법이 다른 프로그래밍 작업으로 전이되는지 실험할 수 있다. Apache 2.0 라이선스는 독점 API 조건이나 데이터 처리 정책이 우려되는 환경에서도 모델 평가를 더 쉽게 만들 수 있지만, 실제 배포에는 여전히 적절한 보안 검토가 필요하다.
제품 팀에게 이번 발표는 호스팅된 코딩 에이전트를 대체하기보다는 인프라 스택의 또 다른 선택지에 가깝다. 140억 파라미터 모델은 지연 시간, 예측 가능한 서비스 비용, 커스터마이징, 데이터 상주가 중요할 때 매력적일 수 있다. 하지만 구매자는 LiveCodeBench만으로 결론을 내리기 전에 저장소 규모 작업, 도구 통합, 반복 시도에서의 신뢰성, 자체 코드베이스에서의 성능에 대한 증거가 필요하다.
이번 공개는 AI 코딩의 전략적 분기도 보여준다. Anthropic의 Claude Code는 독점 모델과 워크플로를 중심으로 구축된 제품화된 에이전트 경험을 대표한다. Nous Research는 오픈 웨이트와 재현 가능한 학습 인프라를 강조한다. 이러한 접근은 시간이 지나며 수렴할 수도 있지만, 현재는 서로 다른 구매자 질문에 답하고 있다. 최소한의 설정으로 가장 유능한 경험을 제공할 수 있는 쪽은 누구인가, 그리고 조직이 검토하고 통제할 수 있는 모델과 스택을 제공할 수 있는 쪽은 누구인가.
가장 분명한 후속 신호는 리포지토리 수준의 소프트웨어 작업과 다단계 디버깅에서 NousCoder-14B를 독립적으로 테스트하는 것이다. 팀 자체도 다중 턴 강화학습을 우선순위로 꼽고 있으며, 특히 여러 시도에 걸쳐 컴파일러 오류, 실패한 테스트, 시간 제한 피드백을 활용하도록 모델을 훈련하는 데 중점을 둔다.
연구자들은 또한 Atropos가 이번 공개뿐 아니라 다른 모델과 데이터셋에서도 비슷한 결과를 낼 수 있는지 지켜봐야 한다. 그 밖의 신호로는 응답 길이 제어 개선, 도구 사용 또는 에이전틱 배포에 대한 공개 증거, 합성 프로그래밍 문제 생성의 진전이 있다. 시장 측면에서 핵심 비교는 벤치마크 정확도 자체가 아니라 Claude Code 같은 도구에 대한 실질적 비용과 신뢰성이다.
NousCoder-14B가 중요한 이유는, 시장이 세련된 AI 에이전트에 집중하고 있는 시점에 코딩 모델 개선의 메커니즘을 이례적으로 선명하게 보여주기 때문이다. 점수도 주목할 만하지만, 더 오래 남을 기여는 오픈 강화학습 파이프라인과, 비교적 작은 모델도 검증된 피드백과 신중한 시스템 엔지니어링을 통해 크게 향상될 수 있음을 보여준 데 있을 수 있다.
이번 공개는 또한 코딩 모델 제공업체가 피할 수 없는 한계를 드러낸다. 벤치마크 공급은 한정돼 있는 반면 유용한 소프트웨어 행동은 넓고 상호작용적이다. 오픈 모델이 독점 코딩 에이전트에 경쟁하려면, 고립된 프로그래밍 대회를 넘어 실제 저장소에서 다단계 학습, 더 나은 도구 사용, 신뢰할 수 있는 평가가 필요하다. 지금까지 Nous Research는 진지한 연구 공개를 내놓았지만, 아직 Claude Code의 전체 제품 역량과 맞먹는다는 증거는 없다.
Nous Research는 4일간 학습한 오픈 코딩 모델 NousCoder-14B를 공개하며, Claude Code 같은 독점 도구와의 경쟁을 더욱 치열하게 만들었다.