
AI agents는 재사용 가능한 “skills”에서 더 큰 이득을 얻는다. 이는 그런 지시가 모델의 사실 지식을 크게 넓혀서가 아니라, 신뢰할 수 있는 작업 흐름을 부여하기 때문이라고 프린스턴대학교, UC 샌디에이고 등 연구진의 연구는 말한다.
The Decoder가 보도한 이 연구는 작업별 skills의 유무를 비교한 8,135회의 통제된 테스트 실행에 기반한다. 또한 agent 시스템을 구축하는 팀에게 심각한 한계를 보여준다. skill 라이브러리가 커질수록, agent가 올바른 지시를 검색해낼 가능성은 훨씬 낮아진다. 보고된 테스트에서 검색 정밀도는 5개 skills에서 29.6%였지만 100개에서는 3.3%로 떨어졌다.
개발자들이 기반 모델을 재학습하지 않고 저장된 지시문, 플레이북, 도구 절차를 활용해 AI agents를 개선하는 경우가 늘고 있는 만큼, 이 발견은 중요하다. 이는 핵심 엔지니어링 문제가 단순히 skills를 더 많이 쌓는 것이 아니라, 그것들을 신뢰성 있게 선택하고 적용하는 데 있음을 시사한다.
이 연구의 틀에서 skill은 특정 작업을 완료하기 위한 간결한 지시 집합이다. agent가 따라야 할 행동 순서, 사용해야 할 도구, 수행해야 할 검사, 피해야 할 실수를 설명할 수 있다.
그래서 skill은 일반적인 지식 저장소와 다르다. 새로운 사실을 제공하기보다, agent에게 작업을 수행하는 절차적 경로를 준다. 시스템이 환경을 준비하는 방법, 도구를 올바른 순서로 호출하는 방법, 중간 결과를 검증하는 방법, 최종 출력을 형식화하는 방법 등을 알려줄 수 있다.
연구 결과, 이런 절차적 기반이 skill이 있는 agent가 없는 agent를 앞선 사례의 65.7%를 설명했다. 반면 추가 지식을 직접 제공한 것은 The Decoder의 보도에 따르면 테스트 사례에서 개선의 4.5%만을 설명했다.
빌더 입장에서는 이 차이가 중요하다. 모델이 관련 개념을 이미 알고 있어도, 설정 단계를 건너뛰거나 도구를 잘못 호출하거나 사용할 수 없는 출력을 생성해 실패할 수 있다. 잘 설계된 skill은 열린 요청을 반복 가능한 워크플로로 바꿔 이런 실행 오류를 줄일 수 있다.
이 결과는 또한 skills가 모델 재학습의 매력적인 대안이 된 이유를 설명해 준다. 팀은 모델 가중치를 바꾸지 않고도 절차를 업데이트하고, 검증 단계를 추가하고, 반복되는 예외를 인코딩할 수 있다. 그러면 제품과 내부 프로세스가 바뀔 때 agent의 행동을 더 쉽게 수정할 수 있다.
연구팀은 8,000회가 넘는 실행에서 관련 skill의 유무에 따른 동일한 작업의 agent 행동을 비교했다. 이런 통제된 설정은 agent가 작업을 완료했다는 일화적 시연보다 더 강력한데, skill 자체의 기여에 초점을 맞추기 때문이다.
다만 보고된 증거는 모든 agent 아키텍처나 워크로드에 대한 보장이 아니라 연구 결과로 읽어야 한다. 공개된 보도는 실험에 사용된 모든 모델, 벤치마크 작업, 검색 시스템을 명시하지 않는다. 따라서 65.7%와 4.5% 수치는 절차적 이점과 사실적 이점의 보편적 분할이 아니라, 연구에서 테스트한 조건을 설명한다.
skills는 새로운 실패 모드도 만들었다. 약 10%의 경우, agent가 유용한 플레이북을 기계적으로 적용하거나 맞지 않는 상황에서 사용한 것으로 보고됐다. 따라서 skill은 한 종류의 오류를 줄이는 동시에 다른 오류를 만들 수 있다. agent가 작업에 다른 접근이 필요하다는 점을 인식하지 못한 채 지시를 지나치게 문자 그대로 따르는 것이다.
연구는 또한 정확히 일치하는 skill이 항상 필요한 것은 아님을 보여준다. 관련 skill이 agent를 돕기에 충분한 구조를 제공할 수 있다. 이런 유연성은 실무에서 유용할 수 있지만, 평가를 더 복잡하게 만든다. 팀은 올바른 skill이 있는지뿐 아니라, 비슷하거나 부분적으로 관련된 skill이 부적절한 행동을 유발하지 않는지도 시험해야 한다.
가장 강한 경고는 검색이다. 테스트된 라이브러리가 5개 항목에서 100개로 늘어나자, 보고된 적중률은 29.6%에서 3.3%로 떨어졌다. The Decoder는 특히 비슷하게 들리는 선택지들이 선택을 더 어렵게 만들었다고 전한다.
이는 AI agents에 스케일링 문제를 만든다. 작은 라이브러리는 비교적 단순한 매칭으로 관리할 수 있지만, 운영 시스템은 서로 다른 팀, 소프트웨어 도구, 권한, 예외 사례를 포괄하는 수백 또는 수천 개의 skills를 쌓을 수 있다. 그러면 agent가 관련 지시와 근접한 대안을 구분하지 못하면, 더 많은 범위가 오히려 시스템의 신뢰성을 떨어뜨릴 수 있다.
문제는 검색 품질에만 국한되지 않는다. skill 이름, 설명, 메타데이터 모두 검색이 제대로 작동하는지에 영향을 준다. 잘 구분되지 않은 절차는 모델과 전통적 검색 시스템 모두에게 구별하기 어려울 수 있다. 큰 라이브러리에는 오래되었거나 겹치는 지시가 포함될 수 있어, agent가 기술적으로는 그럴듯하지만 운영상 잘못된 워크플로를 선택할 가능성이 높아진다.
따라서 skill 관리는 라이프사이클 문제가 된다. 절차를 만드는 것은 첫 단계일 뿐이다. 팀은 skills를 테스트하고, 버전 관리하고, 우선순위를 매기고, 폐기하고, 검색하는 메커니즘도 필요하다. 보도된 연구 결론은 더 나은 자기학습 agent가 저장된 경험을 더 많이 모으는 것이 아니라, 그것을 만들고 찾고 적용하는 더 신뢰할 수 있는 방법을 필요로 한다는 것이다.
제품 팀에 대한 즉각적인 교훈은 skills를 일반적인 프롬프트 부가물이 아니라 실행 가능한 운영 절차로 다뤄야 한다는 점이다. 유용한 skill은 사전 조건, 도구 순서, 점검 지점, 그리고 agent가 멈추거나 도움을 요청해야 하는 조건을 명시해야 한다.
평가는 전체 체인을 측정해야 한다. agent는 관련 skill을 검색해도 잘못 사용할 수 있고, 벤치마크에 우연히 매우 명확한 일치가 들어 있어서만 작업을 완료할 수도 있다. 테스트는 검색 정확도, 절차 준수, 부적절한 skill 적용, 적절한 skill이 없을 때의 복구를 각각 따로 추적해야 한다.
기업 배포는 추가적인 거버넌스 질문을 낳는다. skills는 접근 절차, 고객 지원 정책, 금융 워크플로, 내부 데이터 처리 규칙을 인코딩할 수 있다. agent가 잘못된 것을 검색하면 실패는 단순한 나쁜 답변을 넘어, 잘못된 행동을 유발하거나 정보를 잘못된 프로세스에 노출시킬 수 있다. 라이브러리가 커질수록 버전 관리, 소유권, 감사 로그가 실질적 요구사항이 된다.
이 결과는 무분별한 축적보다 선별적 라이브러리를 선호한다. 성공한 상호작용을 모두 장기 기억에 추가하면 겉보기 능력은 늘어날 수 있지만 검색은 더 나빠질 수 있다. 제품 팀은 중복 skills를 통합하고, 절차 간 경계를 더 명확히 하며, skill을 사용하면 안 되는 때를 설명하는 명시적 부정 조건을 추가해 더 나은 결과를 얻을 수 있다.
모델 공급자와 agent 플랫폼 개발자에게 이 연구는 작업 맥락, 도구 상태, 절차적 유사성을 이해하는 검색 시스템을 가리킨다. 또한 백업 동작의 가치를 높인다. 자신감이 낮거나 여러 skills가 비슷해 보일 때, agent는 기계적으로 선택하기보다 보류하거나, 명확화 질문을 하거나, 더 좁은 검색을 실행해야 한다.
다음 신호는 후속 연구가 통제된 작업 밖에서 더 크고 다양한 skill 라이브러리를 시험하는지 여부다. 고객 지원, 코딩, 연구, 기업 운영에서의 결과는 보고된 검색 저하가 얼마나 널리 적용되는지 보여줄 것이다.
개발자들은 또한 agent 프레임워크가 전용 skill 레지스트리, 버전 관리, 평가 스위트, 신뢰도 인식 검색을 추가하는지 지켜봐야 한다. 이런 기능은 시장이 skills를 정적 프롬프트 파일이 아니라 관리되는 소프트웨어 구성 요소로 보고 있음을 뜻한다.
또 하나의 시험은 시스템이 거의 관련 있는 skill을 거부하도록 배울 수 있는지다. 기계적 적용의 보고된 사례들은 거절, 명확화, 에스컬레이션을 검색만큼 중요하게 만든다. 신뢰할 수 있는 agents는 어떤 절차를 사용할지뿐 아니라, 어떤 저장된 절차도 안전하게 적용할 수 없는 때가 언제인지 알아야 한다.
이 연구는 agent의 능력은 단순히 기억을 더한다고 해서 선형적으로 늘어난다는 가정에 유용한 교정을 제공한다. skills는 실행을 명시할 때 가장 가치 있어 보이지만, 라이브러리가 커지면 그 장점이 선택 문제로 바뀔 수 있다. AI 빌더에게는 검색 품질과 절차적 경계가 모델의 순수한 추론 능력만큼 중요할 수 있다.
증거가 시사하는 실용적 아키텍처는 선별 가능하고 검증 가능해야 한다. 작고 명확히 정의된 skill 세트, 명시적 사전 조건과 중단 조건, 검색과 오용에 대한 지속적 평가, 그리고 지시가 충돌하거나 맞지 않을 때의 안전한 백업이 그것이다. agent가 이런 절충을 안정적으로 관리할 수 있게 되기 전까지, skills를 더 추가하는 일은 범위를 넓히는 동시에 일관성을 조용히 낮출 수 있다.
프린스턴대와 UC 샌디에이고의 연구는 AI agents의 skills가 지식보다 실행을 더 개선하지만, 라이브러리가 커질수록 검색이 무너진다고 밝혔다.