AI News

Nvidia가 Nemotron 3.5 Lightning을 공개했다. 이 오픈웨이트 추론 모델은 모든 지능 벤치마크에서 성능을 극대화하기보다, AI 에이전트 워크로드를 더 빠르고 저렴하게 실행하도록 설계됐다.

이 모델은 총 316억 개의 파라미터와, 토큰마다 36억 개의 파라미터만 활성화하는 희소 아키텍처를 결합한다. The Decoder가 보도한 벤치마크에 따르면, Nvidia의 최종 NVFP4 가중치를 사용한 사전 출시 테스트에서 초당 거의 670 토큰에 도달했으며, 이를 통해 처리량이 새로운 Nemotron 3.5 출시의 핵심 특징이 되었다.

개발자들이 가끔 사용하는 챗봇 요청에서 벗어나, 도구 호출, 코드, 중간 추론의 긴 연속을 생성하는 에이전트 시스템으로 이동하고 있는 만큼 이런 포지셔닝은 중요하다. 그런 워크로드에서는 지연 시간, 하드웨어 활용도, 서비스 비용이 모델의 최고 벤치마크 점수만큼 중요할 수 있다.

100만 토큰 컨텍스트를 갖춘 더 작은 활성화 범위

Nemotron 3.5 Lightning은 Nemotron 3 Nano 30B A3B의 후속 모델이며, 이전 모델의 하이브리드 Mamba-Transformer 설계를 유지한다. 총 파라미터 수는 개별 계산에 사용되는 수보다 훨씬 크며, 이는 316억 파라미터의 밀집 모델 전체의 연산 비용을 들이지 않고 더 많은 용량을 제공하기 위한 구조다.

Nvidia는 이 추론 모델을 BF16과 NVFP4 형식으로 제공한다. 후자는 더 낮은 정밀도의 가중치를 사용해 추론에 필요한 메모리와 연산량을 줄인다. The Decoder는 NVFP4가 Artificial Analysis Intelligence Index에서 BF16 버전과 같은 점수를 얻었고, 해당 평가에서 품질 차이는 작았다고 보도했다.

이 모델은 텍스트 전용이며 최대 100만 토큰의 컨텍스트 윈도우를 지원한다. 이 용량은 코딩 에이전트, 문서 중심 워크플로우, 긴 작업 이력을 유지해야 하는 애플리케이션에 유용할 수 있지만, 컨텍스트 길이만으로는 시스템이 매우 긴 입력을 얼마나 효율적이고 안정적으로 처리할지 알 수 없다.

가중치는 Nvidia의 관대한 OpenMDW-1.1 라이선스 하에 제공된다. The Decoder는 또한 DeepInfra, Fireworks, FriendliAI, CoreWeave, GMI Cloud, Nebius, Crusoe 같은 제공업체를 통한 서버리스 접근도 나열했다. 여러 추론 플랫폼에서 이용 가능하다는 점은 자체 Nvidia 인프라를 즉시 운영하지 않고도 모델을 시험해 보려는 팀의 진입 장벽을 낮춘다.

속도가 제품의 핵심 주장, 지능은 경쟁력은 있지만 지배적이지 않다

The Decoder에 따르면 Artificial Analysis는 Nemotron 3.5 Lightning에 Intelligence Index 24점을 부여했다. 이는 OpenAI의 gpt-oss-120b와 같고, 26점을 받은 Nvidia의 Nemotron 3 Super보다 낮다. 이 결과는 Nemotron 3 Nano의 보고 점수 15점보다 9점 향상된 것이다.

이 비교는 Nvidia 접근법의 한계도 보여준다. The Decoder는 Qwen3.6 35B A3B와 Meta의 Muse Glimmer가 각각 32와 35로 더 높은 점수를 기록했다고 보도했다. 인용된 분석에서 속도와 지능의 결합 트레이드오프에서는 여전히 독점 시스템이 앞섰는데, Google의 Gemini 3.5 Flash-Lite는 37점, GPT-5.6 Luna는 52점을 기록한 것으로 전해졌다.

Lightning의 가장 강한 보고 결과는 에이전트 지향 테스트에서 나왔다. GDPval-AA v2에서 Artificial Analysis는 Elo 824를 기록했으며, 이는 gpt-oss-120b의 800과 Nemotron 3 Super의 698보다 높았다. Terminal-Bench v2.1에서는 모델 점수가 전작의 7%에서 24.3%로 올라, gpt-oss-120b의 보고된 26.2%에 근접했다.

이 수치들은 독립적인 벤치마킹 플랫폼에서 나온 것이지만, 제공된 근거에서는 The Decoder의 보도를 통해 제시되며 완전히 독립적으로 재현된 결과 세트로 제시되는 것은 아니다. 따라서 이를 Lightning이 생산 워크로드 전반에서 더 큰 모델을 능가한다는 증거가 아니라 벤치마크 스냅샷으로 봐야 한다. 추론 속도는 하드웨어, 배치 크기, 양자화, 서빙 소프트웨어, 프롬프트 길이, 출력 길이에 따라 크게 달라질 수 있다.

핵심 처리량 수치 역시 최종 NVFP4 가중치를 사용한 사전 출시 테스트에서 나왔다. The Decoder는 Lightning이 Intelligence Index 작업을 약 30초 만에 완료했다고 전했으며, 인용된 비교에서 Qwen3.6 35B A3B는 약 3.5분, Gemma 4 31B는 5.8분이 걸렸다. 이러한 시간은 Nvidia의 목표를 분명히 보여준다. 즉, 기다림의 비용이나 더 큰 모델을 서비스하는 비용이 여러 상호작용에 걸쳐 누적되는 반복적이고 지연에 민감한 작업이다.

이번 출시가 AI 빌더에게 의미하는 것

제품 팀에게 Lightning은 작은 저렴한 모델과, 어려운 추론을 위해 남겨두는 대형 시스템 사이의 중간층이 될 수 있다. 기업은 이를 분류, 도구 선택, 코드 탐색, 문서 검색, 구조화된 실행 같은 일상적인 에이전트 단계에 사용하고, 모호하거나 위험도가 높은 사례는 더 강력한 모델로 넘길 수 있다.

이 아키텍처는 비싼 독점 API로 보내는 요청 수를 줄일 수 있지만, 소형 모델이 해당 워크플로우에서 신뢰성 있게 작동할 때만 가능하다. Terminal-Bench에서의 우위가 곧바로 안정적인 데이터베이스 변경, 금융 분석, 고객 지원 행동, 프로덕션 코드로 이어지지는 않는다. 팀은 실패 복구, 도구 사용 정확도, 환각 비율, 작업이 에스컬레이션을 필요로 하는 빈도를 테스트해야 한다.

희소 설계와 NVFP4 옵션은 배포 경제성에도 영향을 줄 수 있다. 단계당 36억 파라미터를 활성화하면 비슷한 총 규모의 밀집 모델에 비해 연산 수요를 줄일 수 있고, 양자화는 메모리 요구를 낮출 수 있다. 실제 이점은 팀이 호환 가능한 하드웨어와 서빙 인프라를 갖추고 있는지, 그리고 긴 컨텍스트, 배치 처리, 에이전트 오케스트레이션에서 얼마나 오버헤드가 발생하는지에 따라 달라진다.

Nvidia의 더 넓은 전략도 이번 출시에서 드러난다. 회사는 이전부터 활성 파라미터가 100억 미만인 모델이 훨씬 더 큰 시스템 비용의 일부만으로 많은 에이전트 작업을 처리할 수 있다고 주장해 왔다. Lightning은 이런 효율성 주장을 316억 파라미터의 믹스형 설계이면서도 36억 파라미터 활성 경로를 가진 제품으로 구현했다.

Fastino Labs의 관련 출시는 가능한 하위 활용에 대한 초기 신호를 제공한다. StreetInsider는 이 회사가 Nemotron 3.5 Lightning 위에서 에이전트를 사용해 전적으로 후학습한 금융 및 헬스케어 특화 오픈웨이트 모델을 출시했다고 보도했다. 제공된 출처에는 해당 모델의 기술 세부사항, 평가 결과, 채택 수치가 없으므로, 이 발표는 생산 규모 수요의 증거라기보다 생태계 활동의 한 사례로 이해하는 것이 가장 적절하다.

다음에 주목할 점

가장 중요한 후속 검증은 엔드투엔드 에이전트 신뢰성에 대한 독립 테스트다. 개발자는 토큰 처리량이나 벤치마크 점수뿐 아니라, 코딩, 브라우징, 기업용 소프트웨어, 장기 실행 워크플로우 전반에서 완료된 작업을 측정하는 평가를 찾아야 한다.

서비스 경제성도 또 다른 핵심 신호다. 공개 배포는 NVFP4와 희소 활성화가 실제 워크로드에서 의미 있는 절감을 만드는지 보여줄 수 있는데, 특히 모델이 큰 컨텍스트나 많은 동시 사용자를 처리해야 할 때 그렇다. 로컬 배포와 호스팅 추론 사이의 성능 차이도 통제와 운영 단순성을 저울질하는 기업에 중요하다.

Nvidia의 포스트트레이닝 파트너십도 지켜볼 필요가 있다. Artificial Analysis는 CodeRabbit과 Harvey가 Nvidia와 함께 도메인 특화 포스트트레이닝을 진행했다고 보도했다. 더 특화된 변형은 Lightning이 범용 에이전트 모델이 될지, 아니면 좁고 대량 처리용 시스템의 기반이 될지를 결정할 수 있다.

마지막으로, 구매자는 라이선스의 명확성, 도구 지원, 안전 제약 하에서의 모델 동작을 추적해야 한다. 오픈웨이트 모델은 폐쇄형 API보다 검사하고 배포하기 쉽지만, 조직은 여전히 모니터링, 접근 제어, 데이터 처리, 장애 차단에 책임을 져야 한다.

Creati.ai 관점

Nemotron 3.5 Lightning은 Nvidia가 원시 지능 랭킹에서 이기려는 시도가 아니다. 많은 유용한 AI 에이전트가 모든 작업에서 가장 강력한 답보다 빠르고 반복 가능한 실행을 더 필요로 한다는 데 베팅한 것이다.

이 때문에 벤치마크 선두가 여전히 앞서 있는 영역에서도 이번 출시는 전략적으로 중요하다. 보고된 처리량이 일반적인 배포 환경에서도 유지된다면, Lightning은 대량 에이전트 단계에 대한 실용적인 라우팅 옵션을 빌더에게 제공할 수 있다. 최종적인 성공은 파라미터 수보다, 팀이 용납할 수 없는 신뢰성이나 안전 리스크를 추가하지 않으면서 더 낮은 지연 시간과 비용으로 실제 워크플로우를 완료할 수 있는지에 의해 판단될 것이다.

추천

Nvidia의 Nemotron 3.5 Lightning, 빠르고 효율적인 AI 에이전트를 겨냥하다

Nvidia의 Nemotron 3.5 Lightning은 희소 활성화와 양자화를 사용해 빠른 오픈웨이트 추론을 제공하며, 최고 점수보다 대량의 AI 에이전트를 목표로 한다.