
NVIDIA는 NeMo Switchyard를 여러 모델을 사용해야 하는 AI 에이전트를 위한 오케스트레이션 계층으로 내세우고 있다. 회사는 기술 블로그에서 개별 요청, 에이전트 단계, 또는 작업 단계별로 성능, 비용, 지연 시간, 인프라 조건에 따라 선택된 모델로 보낼 수 있는 SDK와 라우팅 프레임워크를 설명했다.
이번 발표는 커지고 있는 엔지니어링 문제를 다룬다. 모든 에이전트 동작에 프런티어 모델을 사용하면 추론 비용과 지연 시간이 증가할 수 있고, 반대로 더 작은 모델에 전적으로 의존하면 작업 품질이 떨어질 수 있다. NVIDIA의 접근 방식은 모델 선택을 고정된 애플리케이션 설정이 아니라 런타임 의사결정으로 보는 것이다.
NeMo Switchyard는 라우팅 로직을 최종적으로 요청을 처리하는 모델 엔드포인트와 분리한다. 게시글에서 switchyard-libsy로 식별된 공급자 비종속 SDK는 요청을 표현하고, 사용 가능한 모델 대상들을 정의하며, 선택된 공급자에 대한 호출을 관리한다.
각 대상은 의미적 이름을 가지며, 클라이언트 구성은 그 이름을 공급자 엔드포인트와 모델 식별자에 매핑한다. 이 설계는 개발자가 에이전트 애플리케이션 전반의 라우팅 로직을 다시 작성하지 않고도 배포 또는 모델 제공업체를 바꿀 수 있게 한다. NVIDIA는 또한 개발자가 자체 라우팅 알고리즘과 맞춤 데이터를 제공할 수 있다고 밝혔다.
런타임에 라우터는 모델을 선택하기 전에 요청과 그 맥락을 평가할 수 있다. 라우팅은 전체 요청에 대해 한 번만 일어날 수도 있고, 다중 턴 상호작용의 각 단계마다, 또는 하나의 작업의 서로 다른 단계에 걸쳐 일어날 수도 있다. 적절한 설계는 오류 허용도, 지연 시간, 처리량, 배포 복잡성 같은 요소에 따라 달라진다.
이는 분류, 추론, 도구 사용, 그리고 일상적인 후속 작업을 결합하는 AI 에이전트에 특히 중요하다. 이러한 단계가 반드시 같은 모델 능력을 요구하는 것은 아니며, 비용 프로필도 상당히 다를 수 있다.
NVIDIA는 라우팅 시스템이 사용할 수 있는 신호를 모델 능력, 모델 비용 프로필, 인프라 조건의 세 가지 큰 범주로 나눈다. 능력 신호에는 요청 분류, 추정 난이도, 임베딩, 또는 프롬프트에서 추출된 특징이 포함될 수 있다. 구현에 따라 라우터는 로그 확률, 에이전트 트레이스, 또는 기타 내부 및 출력 관련 정보 같은 모델 수준 신호도 사용할 수 있다.
시스템 신호에는 가격, 지연 시간, 부하, 오류 상태가 포함된다. 이들은 이론적으로 가장 강력한 모델이 사용 불가, 느림, 비쌈, 또는 높은 실패율을 보일 경우 운영상 최선의 선택이 아닐 수 있기 때문에 중요하다. 에이전트 워크플로에서는 인프라가 사용자에게 보이지 않고 애플리케이션의 컨텍스트를 깨지 않는 핸드오프도 지원해야 한다.
따라서 이 프레임워크는 단순한 “작은 모델 대 큰 모델”의 단계식 구성을 넘어선다. 라우터는 서브 에이전트마다 서로 다른 모델 풀을 사용하거나, 주제별로 라우팅하거나, 같은 작업의 단계 사이에서 모델을 전환할 수 있다. NVIDIA는 이러한 유연성을 작업과 서비스 시스템의 상태 모두에 반응하는 모델 선택 방법으로 제시한다.
자료에서 가장 강한 성능 근거는 벤더가 보고한 것이다. NVIDIA는 컴퓨터 사용 작업용 벤치마크인 Terminal-Bench Hard에서 평가한 모델 시스템을 통해 이 접근법을 보여준다. 회사의 예시에서 DeepSeek V4는 전체 정확도가 가장 높지만, 특정 작업 그룹에서는 다른 모델이 더 잘 수행한다. 머신러닝과 강화학습 범주에서는 Kimi K2.6, 수학과 과학 범주에서는 Qwen3.5 397B A17B가 더 우수하다.
NVIDIA는 각 작업 그룹을 가장 강한 모델에 할당하면 배포에서 중요한 차원에서 단일 모델 전략보다 나을 수 있다고 주장한다. 또한 모델마다 접근 또는 운영 비용, 지연 시간, 토큰 사용량, 도구 호출 동작이 다르기 때문에 비용과 완료 시간이 선택을 더 복잡하게 만든다고 지적한다.
출처는 LangChain과 Cognition을 포함한 벤치마킹 및 테스트를, 높은 정확도를 유지하면서 비용을 줄이는 라우팅의 예로 언급한다. 그러나 제공된 자료에는 자세한 테스트 조건, 기준 구성, 비율 감소, 독립 검증이 없다. 따라서 이러한 결과는 모든 에이전트 작업에 대한 일반적 보증이 아니라 NVIDIA가 보고한 증거로 받아들여야 한다.
이 점은 중요하다. 라우터 자체가 엔지니어링과 평가 요구사항을 추가하기 때문이다. 잘못된 분류, 오래된 비용 데이터, 부정확한 작업 추정, 또는 신뢰할 수 없는 핸드오프는 요청에 더 적합한 모델을 사용하는 이점을 없앨 수 있다. 팀은 모델 품질과 함께 라우팅 오버헤드와 실패 모드도 측정해야 한다.
개발자에게 NeMo Switchyard는 에이전트의 제어 흐름에 단일 모델을 하드코딩해야 하는 필요를 줄여줄 수 있다. 리서치 어시스턴트, 코딩 시스템, 컴퓨터 사용 에이전트를 만드는 팀은 어려운 추론에는 더 강력한 모델을 남겨두고, 더 단순한 분류나 후속 작업은 더 저렴한 대상에 보낼 수 있다.
공급자 추상화는 빠르게 변하는 모델 포트폴리오를 관리하는 데도 도움이 될 수 있다. 모델 품질, 가격, 가용성, 지연 시간은 서로 독립적으로 변할 수 있어 정적 모델 선택을 유지하기가 어렵다. 의미적 모델 이름을 공급자별 식별자와 분리하면 운영자가 상위 라우팅 정책을 바꾸지 않고도 해당 매핑을 업데이트할 수 있는 지점을 제공한다.
기업 구매자는 자동 비용 절감의 약속보다 거버넌스에 더 주목해야 한다. 프로덕션 라우터는 민감한 요청에 대한 명확한 정책, 모델 선택의 감사 가능성, 폴백 동작, 특정 데이터를 받을 수 있는 공급자에 대한 통제가 필요하다. 또한 단일 모델 호출 성능이 아니라 최종 에이전트 결과에서의 정확도라는 작업별 평가도 필요하다.
경쟁적 의미는 NVIDIA의 SDK를 넘어선다. 모델 라우팅은 애플리케이션과 점점 더 분절되는 모델 시장 사이의 제어 지점이 되고 있다. 신뢰할 수 있는 라우팅, 가시성, 정책 집행, 배포 이식성을 제공하는 공급자는 풀의 모든 모델을 제공하지 않더라도 고객이 모델을 소비하는 방식에 영향을 줄 수 있다.
다음 신호는 홍보성보다 실용적일 것이다. 개발자들은 NeMo Switchyard가 서빙 스택, 에이전트 프레임워크, 프로덕션 관측성 시스템과 어떻게 통합되는지 보여주는 공개 문서와 예제를 찾아봐야 한다. LangChain과 Cognition 테스트의 더 자세한 결과는 특정 작업에서 라우팅이 얼마나 비용이나 지연 시간을 개선하는지 이해하는 데 도움이 될 것이다.
또한 SDK가 강력한 정책 제어, 평가 루프, 모델 폴백, 실시간 인프라 신호를 지원하는지도 중요하다. 이러한 기능이 라우팅이 벤치마크용 기술에 머무를지, 신뢰할 수 있는 프로덕션 인프라가 될지를 결정한다.
마지막으로, 채택은 팀이 서로 다른 공급자의 모델을 공통 풀에 얼마나 쉽게 가져올 수 있는지에 달려 있다. 공급자 비종속 설계는 명시된 목표이지만, 실제 이식성은 인증, 데이터 처리, 도구 호환성, 컨텍스트 한계, 모델 동작 차이로 검증될 것이다.
NVIDIA의 NeMo Switchyard가 주목할 만한 이유는 에이전트 최적화를 모델 선택 경쟁이 아니라 시스템 문제로 보기 때문이다. 핵심 기회는 서비스의 운영 현실을 고려하면서 각 작업 단위에 적절한 모델을 맞추는 데 있다.
이 개념은 설득력이 있지만, 그 가치는 라우팅 품질과 프로덕션 통제에 의해 결정될 것이다. NVIDIA가 더 세부적이고 독립적으로 검증 가능한 결과를 공개하기 전까지, 빌더는 이 프레임워크를 자신의 워크로드에 대해 평가해야 할 아키텍처로 보아야 하며, 다중 모델 라우팅이 트레이드오프 없이 자동으로 비용을 낮춘다는 증거로 받아들여서는 안 된다.
NVIDIA의 NeMo Switchyard는 AI 에이전트 작업을 여러 모델로 라우팅해 프로덕션 워크플로에서 정확도, 지연 시간, 인프라 한계, 추론 비용의 균형을 맞춘다.