
NVIDIA는 300억 개 파라미터의 mixture-of-experts 모델인 Nemotron 3.5 Lightning과, 여러 AI 모델 간 요청을 라우팅하는 오픈소스 라이브러리 NeMo Switchyard를 함께 공개했다. 회사는 이 출시가 정확성, 응답 시간, 운영 비용, 배포 제어의 균형을 맞춰야 하는 항상 가동되는 에이전틱 시스템을 위한 것이라고 설명한다.
이번 출시는 NVIDIA가 오픈 모델을 포지셔닝하는 방식의 변화를 보여준다. Lightning을 모든 프런티어 모델의 단독 대체재로 제시하기보다, 더 큰 시스템 안에서 대량 처리 작업을 맡을 수 있는 전문 모델로 설명한다. Switchyard는 에이전트 워크플로의 각 단계를 어떤 모델이 처리할지 결정하도록 설계되어, 더 비싼 모델로 보내는 요청 수를 줄일 수 있다.
Nemotron 3.5 Lightning은 코드 리뷰, 도구 사용, 보안 경고 모니터링, 청구 지원과 같은 특정 워크로드를 겨냥한다. NVIDIA는 더 큰 추론 모델이 작업을 계획하거나 조율하고, 더 작은 전문 모델이 개별 작업을 수행할 수 있다고 말한다. 이러한 아키텍처는 가끔 들어오는 채팅 프롬프트에 응답하는 대신 지속적으로 작동하는 에이전트를 구축하는 개발자들에게 점점 더 중요해지고 있다.
NVIDIA에 따르면 이 모델은 오픈되어 있고 커스터마이즈 가능하다. 조직은 NVIDIA NeMo를 사용해 자체 도메인 데이터, 도구, 워크플로로 포스트 트레이닝할 수 있다. NVIDIA는 또한 코딩 에이전트 기능을 위해 모델을 포스트 트레이닝하는 데 사용된 강화학습 데이터셋 Nemotron-RL-Agentic-Terminal-Pivot도 공개했다.
회사는 Lightning이 최대 4배 빠른 출력 속도와 동급 다른 모델 대비 30% 더 빠른 에이전틱 작업 완료를 제공할 수 있다고 말한다. 이 수치는 NVIDIA가 보고한 성능 주장일 뿐, 제공된 증거에서 독립적으로 검증된 결과는 아니다. 비교 대상과 테스트 조건은 공개된 발표에서 자세히 설명되지 않았으므로, 구매자는 자신의 프롬프트, 도구, 하드웨어로 이점을 검증해야 한다.
NVIDIA는 이 모델이 NVIDIA RTX PC, DGX Spark, DGX Station, Jetson 시스템, RTX PRO 워크스테이션, 데이터센터 및 클라우드 환경에서 실행될 수 있다고 밝힌다. 이 범위는 민감한 데이터를 다루거나 모든 요청을 호스팅 API로 보내는 대신 기존 인프라를 활용하려는 팀에게 중요하다.
NeMo Switchyard는 에이전트 개발의 실질적인 문제를 다룬다. 서로 다른 작업에는 종종 서로 다른 모델이 필요하지만, 이러한 결정을 수동으로 관리하는 것은 큰 통합 부담이 될 수 있다. NVIDIA의 라이브러리는 개발자가 애플리케이션을 다시 작성하지 않아도 조직의 오픈, 독점, NVIDIA 모델 조합 전반에서 요청을 라우팅할 수 있다.
이 라우터는 품질, 지연 시간, 비용 등의 우선순위에 맞게 조정할 수 있다. 계획에는 프런티어 모델을 사용하고 일상적 실행에는 더 작은 모델을 사용하는 시스템에서, 이 접근법은 모델 선택을 고정된 아키텍처 결정이 아니라 애플리케이션 런타임의 일부로 만들 수 있다.
NVIDIA의 설명은 더 넓은 AI 인프라의 변화를 가리키기도 한다. 에이전트가 하나의 워크플로에서 여러 번 호출을 수행할수록 토큰 사용량과 지연 시간은 빠르게 누적된다. 어려운 요청만 프리미엄 모델로 보내는 라우팅 계층은 단일 모델의 벤치마크 점수를 조금 개선하는 것보다 더 가치가 있을 수 있으며, 특히 고객 지원, 코딩, 보안, 백오피스 자동화에서 그렇다.
Switchyard는 오픈소스 라이브러리로 제공된다. NVIDIA는 Kong AI Gateway, LiteLLM, Nous Research의 Hermes를 포함한 기존 개발자 도구와 플랫폼에 라우팅을 통합하기 위해 생태계 기업들과 협력 중이라고 밝혔다. LangChain도 통합 파트너로 언급되며, Cognition은 NVIDIA 내부 사용을 위해 Devin Desktop에서 단계형 라우터를 테스트했다.
NVIDIA는 내부 벤치마크에서 프런티어 수준의 정확성을 유지하면서 작업 완료 비용을 Opus 4.8 단독 사용의 거의 3분의 1 수준으로 줄였다고 보고한다. 이 벤치마크는 내부적이고 벤더가 통제하는 것이므로, 해당 주장은 일반적인 보장이라기보다 방향성 지표로 보아야 한다. 결과는 모델 풀, 라우팅 정책, 워크로드 혼합, 그리고 조직이 어느 정도의 품질 저하를 수용하는지에 따라 달라진다.
파트너 사례도 추가적인, 그러나 여전히 벤더 제공의, 신호를 제공한다. NVIDIA는 Boomi가 5개 라우팅 기능에서 도메인 라우팅 정확도 100%를 달성했고, 트래픽의 59%를 5배 더 빠른 미세조정 모델로 보내며, 이후 턴의 지연 시간을 21% 줄였다고 말한다. Classmethod는 품질을 유지하면서 초기 비용을 27% 절감했다고 보고했고, Cognition은 모든 요청을 하나의 프런티어 모델로 보내는 것과 비교해 평균 비용을 28% 낮췄다고 보고했다.
다른 인용 결과는 다양하다. NVIDIA는 Cadence가 형식 검증 사용 사례에서 효율을 9.9% 개선했다고 밝힌다. LangChain은 145개의 Deep Agents 멀티턴 작업에서 호출의 7%를 프런티어 모델로 보내 비용을 74% 낮췄지만 정확성은 6% 희생했다고 보고했다. 이 수치들은 라우팅의 핵심 트레이드오프를 보여준다. 절감 효과는 클 수 있지만, 낮은 비용은 정확성, 지연 시간, 워크플로 동작의 변화와 함께 올 수 있다.
NVIDIA는 또한 CrowdStrike, Harvey with Trajectory, CodeRabbit with Baseten, Lila Sciences, Fastino Labs를 Nemotron 3.5 Lightning을 맞춤화하는 조직으로 언급한다. 발표는 독립적인 고객 평가, 생산 규모, 계약 세부사항, 채택 지표를 제공하지 않는다. 따라서 속도, 비용, 고객 성능에 대한 가장 강한 주장은 여전히 NVIDIA와 언급된 파트너의 것이라고 볼 수 있다.
개발자에게 커스터마이즈 가능한 모델과 라우팅 계층의 조합은 단일 공급업체에 대한 의존도를 낮출 수 있다. 팀은 민감하거나 반복적인 작업을 로컬 배포 모델에 맡기고, 더 어려운 경우에는 독점 시스템에 대한 접근을 유지할 수 있다. 이는 개인정보 보호 요구를 지원하고, 반복적인 추론 비용을 낮추며, 엔지니어링 팀이 모델 업데이트를 더 잘 통제하도록 돕는다.
대신 운영 복잡성이 따른다. 라우터는 평균 정확도뿐 아니라 실패 처리, 도구 호출 신뢰성, 컨텍스트 유지, 멀티턴 작업에서의 동작까지 평가되어야 한다. 겉보기에는 작은 정확도 하락도 에이전트가 워크플로에서 수십 번의 결정을 내릴 때는 중요한 문제가 될 수 있다. 조직은 또한 왜 특정 요청이 특정 모델로 라우팅되었는지, 그리고 그 결정이 결과를 개선했는지 설명하는 가시성이 필요하다.
기업 구매자에게 Switchyard의 가치는 상호운용성과 거버넌스에 달려 있다. 서로 다른 벤더의 모델 간 라우팅은 종속을 줄일 수 있지만, 보호·모니터링·감사해야 할 구성 요소도 더 많아진다. 라이선스가 허용하는 범위에서 학습 데이터와 기법을 공개하겠다는 NVIDIA의 강조는 연구자와 거버넌스 팀이 모델을 조사하는 데 도움이 될 수 있지만, 공개만으로 생산 환경의 신뢰성이 입증되는 것은 아니다.
이번 출시로 AI 애플리케이션 스택을 둘러싼 경쟁도 더욱 선명해진다. 모델 제공업체들은 이제 원시 성능뿐 아니라 추론 주변의 제어 평면, 즉 라우팅, 파인튜닝, 배포 위치, 비용 관리까지 경쟁하고 있다. NVIDIA는 하드웨어 생태계와 NeMo 소프트웨어를 통해 로컬 PC부터 클라우드 인프라까지 이 레이어들을 연결하고 있다.
첫 번째 신호는 코딩, 보안, 기업 도구 사용 워크로드에서 Nemotron 3.5 Lightning을 독립적으로 시험하는 것이다. 유사한 크기의 오픈 모델과의 비교도 포함되어야 한다. 공개 평가는 NVIDIA의 속도 주장이 다른 하드웨어와 긴 컨텍스트 에이전트 작업에서도 유지되는지 명확히 해줄 것이다.
개발자들은 또한 NeMo Switchyard가 생산 프레임워크에 얼마나 널리 등장하는지, 특히 LiteLLM이나 Kong 같은 통합이 기존 애플리케이션의 설정 비용을 낮추는지 주목해야 한다. 라우팅 실패, 정확성 트레이드오프, 모니터링 기능에 대한 증거는 표면적인 절감액보다 더 유용하다.
마지막으로 기업 도입은 배포 경제성에 달려 있다. 중요한 질문은 로컬 및 온프레미스 실행이 호스팅 대안과 경쟁할 수 있는지, 도메인 정확도를 위해 얼마나 많은 포스트 트레이닝이 필요한지, 인프라·평가·거버넌스 비용을 포함한 뒤에도 모델 라우팅이 신뢰할 만한 절감을 제공하는지이다.
NVIDIA의 발표는 인프라에 대한 베팅으로서 가장 중요하다. 에이전틱 애플리케이션은 하나의 범용 모델이 아니라 조율된 모델 전문가들로 구성될 수 있다. Nemotron 3.5 Lightning은 커스터마이즈 가능한 전문가를 제공하고, NeMo Switchyard는 그것을 언제 사용할지에 대한 런타임 결정을 다룬다.
기회는 설득력이 있지만, 증거는 대부분 NVIDIA가 보고한 것이다. 개발자에게 중요한 실제 시험은 라우팅이 고립된 벤치마크 비용을 낮추는지 여부가 아니라, 배포·개인정보 보호·모델 운영을 더 쉽게 관리하면서 엔드투엔드 작업 신뢰성을 유지하는지 여부다.
NVIDIA는 기업용 AI 에이전트의 비용, 지연 시간, 배포 마찰을 낮추기 위한 효율적인 오픈 모델과 라우팅 라이브러리를 출시했다.