NVIDIA가 GitHub에 DOCA AI agent skills를 공개해 코딩 에이전트에 검증된 BlueField 지침과 더욱 안정적인 인프라 코드를 작성할 수 있는 테스트된 경로를 제공합니다.

NVIDIA가 NVIDIA BlueField 데이터 처리 장치용 애플리케이션을 구축할 때 지원되지 않는 API 호출과 하드웨어 관련 오류를 줄일 수 있도록 설계된 DOCA AI agent skills 세트를 GitHub에 공개했습니다. 이번 조치는 범위는 좁지만 영향이 큰 문제를 겨냥합니다. 범용 AI 코딩 에이전트는 인프라 소프트웨어에 필요한 장치별 지식을 갖추지 못한 경우가 많습니다.
이 skills 패키지는 NVIDIA DOCA 소프트웨어 플랫폼 전반의 API, 하드웨어 기능, 빌드 요구사항, 배포 제약에 관한 구조화된 정보를 에이전트에 제공합니다. NVIDIA는 이 접근 방식이 개발자가 BlueField 시스템용 네트워킹, 스토리지, 보안, 텔레메트리 애플리케이션을 구축할 때 수정 사이클을 줄일 수 있다고 말합니다.
NVIDIA DOCA는 BlueField DPU용 애플리케이션 개발을 위한 NVIDIA의 소프트웨어 플랫폼입니다. 가속 네트워킹, AI 지향 스토리지, 실리콘 내장 보안, 텔레메트리, 수명주기 관리 등의 기능을 포함합니다. 새로운 DOCA AI agent skills는 일반적인 학습 데이터만 사용하는 것보다 더 신뢰할 수 있는 기술 기반을 코딩 에이전트에 제공하는 것을 목표로 합니다.
각 skill은 SKILL.md 파일을 중심으로 하는 가볍고 개방적인 형식으로 제공됩니다. NVIDIA에 따르면 파일에는 검증된 API 시그니처, 하드웨어 기능 요구사항, 빌드 컨테이너 제약, 패키지 이름, 알려진 오류 방식이 포함됩니다. skills는 하나의 광범위한 지침 세트가 아니라 특정 DOCA 구성요소나 워크플로에 맞춰 범위가 정해져 있습니다.
예를 들어 DOCA Flow용 skill은 올바른 함수 시그니처와 pkg-config 모듈 이름을 제공하고, 적용되는 빌드 조건과 일반적인 완화 방법도 에이전트에 알려줄 수 있습니다. NVIDIA는 skills가 DOCA Flow, GPUNetIO, PCC, RDMA를 포함한 더 광범위한 DOCA 라이브러리를 다룬다고 말합니다.
이 파일들은 코딩 에이전트 자체를 대체하지 않습니다. NVIDIA는 이를 에이전트가 코드를 생성하거나 배포하기 전에 제안한 코드를 관련 소프트웨어 및 하드웨어 제약과 대조할 수 있게 하는 기계 판독 가능 도메인 지식 계층으로 설명합니다.
NVIDIA는 짧은 질문부터 여러 요구사항이 포함된 구현 작업까지 65개의 DOCA 개발 프롬프트로 에이전트를 테스트했습니다. 회사는 작업별 통과/실패 체크리스트를 기준으로 응답을 평가했습니다.
NVIDIA의 평가에서 skills가 없는 에이전트는 체크리스트 항목의 19%를 충족한 반면, skills를 사용한 에이전트는 65개 프롬프트 전체에서 100%를 충족했습니다. 회사는 지원되지 않는 함수, 잘못된 플래그, 유효하지 않은 이미지 태그가 지원을 받지 않은 응답에서 반복적으로 발생한 문제였다고 밝혔습니다. API 오용은 65개 프롬프트 중 59개에서 나타났다고 보고했습니다.
이 수치는 전문 인프라 작업에 권위 있고 구조화된 컨텍스트를 제공하는 것이 가질 수 있는 가치를 보여줍니다. 하지만 이는 모든 코딩 에이전트나 DOCA 워크플로에 대한 독립적인 평가가 아니라 NVIDIA 자체 벤치마크로 봐야 합니다. 원자료는 테스트에 사용된 모든 모델, 에이전트 구성, 점수 산정 세부사항, 외부 검토자를 밝히지 않았습니다. 따라서 서로 다른 도구와 운영 환경에서 skills가 어떻게 작동할지는 아직 확정할 수 없습니다.
NVIDIA는 BlueField-3 시스템에서 실행되는 Go 기반 RDMA 애플리케이션을 사용한 비교 시연도 진행했습니다. 회사는 skills를 사용한 에이전트가 사용하지 않은 에이전트보다 직접 작성해야 하는 코드가 73% 적었고 하드웨어 명령은 46% 적었다고 말했습니다. 이 역시 시연을 통해 얻은 벤더 보고 결과이며, 일반적인 생산성 연구는 아닙니다.
NVIDIA가 해결하려는 문제는 많은 애플리케이션 수준 코딩 작업보다 인프라 개발에서 더 심각합니다. 잘못 만들어진 함수는 일반적인 소프트웨어 프로젝트에서 눈에 보이는 컴파일 오류를 일으킬 수 있습니다. DPU에서는 잘못된 가정이 장치 지원, 펌웨어 상태, 컨테이너 호환성, 링크 구성 또는 재시작이나 전원 사이클이 필요한 변경과도 관련될 수 있습니다.
NVIDIA는 skills를 통해 에이전트가 코드를 작성하기 전에 장치 지원 여부를 확인하고, 펌웨어 수준의 변경을 수행하기 전에 사전 점검을 적용할 수 있다고 말합니다. 또한 롤백 계획을 안내하고 완전한 전원 사이클이 필요한 상황을 고려할 수 있습니다. 물리적 인프라를 무한히 반복 가능한 개발 환경으로 취급할 수 없는 팀에게 이러한 점검은 중요합니다.
개발자에게 실질적인 이점은 단순히 생성되는 코드 줄 수가 줄어드는 데 있지 않습니다. 더 큰 잠재적 이익은 에이전트의 첫 답변에서 실제 하드웨어에서 작동하는 애플리케이션에 도달하기까지의 사이클 수를 줄이는 것입니다. DOCA Flow 파이프라인을 구축하는 네트워크 엔지니어나 호스트와 DPU 간 워크플로를 구성하는 RDMA 개발자는 만들어진 인터페이스를 수정하는 데 쓰는 시간을 줄이고 동작 검증에 더 많은 시간을 쓸 수 있습니다.
그러나 기업 구매자에게 skills가 테스트, 접근 제어, 사람의 검토 필요성을 없애주는 것은 아닙니다. 기계 판독 가능한 API 설명은 에이전트의 출발점을 개선할 수 있지만, 생성된 코드가 운영 네트워크에 안전하거나 특정 펌웨어 릴리스와 호환되거나 배포 환경의 보안 정책에 적합하다는 것을 보장하지는 않습니다.
NVIDIA는 NVIDIA/skills GitHub 저장소를 통해 DOCA skills를 제공하고 있습니다. 개발자는 선호하는 AI 코딩 도구와 함께 자료를 직접 살펴보고 사용할 수 있습니다. 저장소 기반 모델은 DOCA 인터페이스, 지원 하드웨어, 빌드 환경이 변화할 때 지침을 발전시킬 경로도 제공합니다.
이러한 배포 방식이 중요한 이유는 전문 인프라 에이전트가 자신이 조작하는 소프트웨어와 지침을 계속 일치시킬 때만 유용하기 때문입니다. NVIDIA의 설명은 폭넓은 대화 능력보다 검증된 계약과 하드웨어 요구사항을 강조합니다. BlueField 플랫폼과 DOCA 구성요소가 발전하는 동안 이러한 정확성을 유지하는 일이 필수적입니다.
이번 발표는 AI 지원 개발의 더 넓은 흐름도 보여줍니다. 범용 모델이 모든 전문 시스템을 기억할 것이라고 기대하는 대신, 공급업체가 에이전트가 작업 시점에 불러올 수 있도록 도메인 컨텍스트를 패키징하는 방식입니다. 여기서 도메인은 소비자 애플리케이션 프레임워크가 아니라 잘못된 가정이 배포를 지연시킬 수 있는 하드웨어-소프트웨어 스택입니다.
첫 번째 신호는 NVIDIA 외부의 개발자들이 서로 다른 코딩 에이전트, 모델, DOCA 버전에서 보고된 개선을 재현할 수 있는지 여부입니다. 독립적인 평가를 통해 19% 대 100%라는 체크리스트 격차가 NVIDIA의 프롬프트 세트를 넘어 유지되는지 확인해야 합니다.
팀은 저장소가 BlueField 하드웨어, 펌웨어, 컨테이너 이미지, API 동작의 변화를 얼마나 빠르게 반영하는지도 지켜봐야 합니다. 오래된 skills는 줄이려는 대상인 동일한 안정성 문제를 다시 일으킬 수 있습니다.
세 번째 신호는 시연이 아니라 전체 워크플로에 도입되는지 여부입니다. 초기 코드 생성뿐 아니라 테스트, 디버깅, 롤백, 운영 배포에도 skills가 도움이 된다는 증거가 있다면, 개발자 노력뿐 아니라 운영 위험도 줄이는지 확인할 수 있습니다.
NVIDIA의 이번 출시는 범용 코딩 에이전트의 현실적인 한계에 대한 직접적인 대응입니다. 유창함은 전문 하드웨어 플랫폼에 대한 정확한 지식과 같지 않습니다. NVIDIA는 API와 장치 제약을 구조화된 형식으로 노출함으로써 에이전트 지원을 그럴듯한 코드 생성에서 벗어나 엔지니어링 도구에 더 가깝게 만들려 하고 있습니다.
가장 강한 주장은 여전히 벤더가 통제한 결과이며, skills의 가치는 유지보수, 독립적인 테스트, 배포 안전장치와의 통합에 달려 있습니다. 그럼에도 이 접근 방식은 인프라 공급업체에 실용적인 본보기를 제공합니다. 모델이 일반 학습 데이터에서 중요한 세부사항을 추론하도록 기대하는 대신, 버전이 관리되는 기계 판독 가능한 운영 지식을 에이전트에 제공하는 것입니다.