Google Research의 WikiSkill은 AI 에이전트가 실패와 성공의 기록을 보존하도록 해, 기본 모델을 재학습하지 않고도 반복 작업 성능을 개선한다.

Google Research가 WikiSkill을 공개했다. 이 프레임워크는 무엇이 잘됐고 무엇이 실패했는지를 보존함으로써 AI 에이전트가 반복 작업에서 더 나아지도록 돕기 위해 설계됐다. 모델의 파라미터를 업데이트하는 대신, 이 시스템은 실행 경험을 영속적인 위키형 지식 기반에 기록하고 선택된 교훈을 재사용 가능한 지침으로 전환한다.
이 접근법은 오늘날 AI 에이전트의 핵심 약점을 겨냥한다. 한 번의 실행에서 수집된 정보가 작업이 끝나면 종종 버려지기 때문이다. 보고된 연구에서 WikiSkill은 여러 벤치마크에서 상당한 향상을 보였지만, 이는 상용 제품 출시나 독립적으로 검증된 배포가 아닌 연구 평가 결과라는 점이 중요하다.
WikiSkill은 에이전트의 작업 공간을 세 계층으로 구성한다. Raw Layer는 도구 호출과 그 결과를 포함한 완전한 실행 추적을 보관한다. The Decoder가 전한 연구 설명에 따르면, 이 자료는 변경 불가능하며 이후 분석에 사용되는 증거를 제공한다.
Wiki Layer는 이러한 추적을 구조화된 지식으로 요약한다. 여기에는 반복되는 실패 패턴, 성공한 전략, 이전 시도에서 얻은 교훈을 기록할 수 있다. 에이전트가 사용하는 활성 지침과 달리, 이 계층은 시간이 지나도 지속되고 확장되도록 설계됐다.
Skill Layer에는 에이전트가 실제로 사용하는 절차적 지침이 들어 있다. 이 지침은 “Agent Skills”로 패키징되어, 모델의 학습 가중치를 바꾸지 않고도 시스템이 작업에 접근하는 방식을 바꿀 수 있다. 업데이트로 성능이 떨어지면 스킬은 롤백할 수 있으며, 기본 위키에는 시도했던 내용의 기록이 남는다.
이 워크플로는 경험 수집과 지침 업데이트를 분리한다. 추론 에이전트가 작업을 수행하고 추적 기록을 만든다. “Wiki Maintainer”가 그 추적을 분석하고, “Skill Proposer”가 축적된 정보를 바탕으로 변경을 제안한다. 이후 게이팅 메커니즘이 별도의 검증 세트에서 제안을 평가한다. 제안된 스킬이 도움이 되지 않으면 거부되지만, 실패한 실험은 향후 제안을 위해 계속 활용 가능하다.
이 설계는 모델 내부의 지속 학습보다는 지속적인 외부 메모리와 반복적인 프롬프트 또는 워크플로 최적화에 더 가깝다. The Decoder는 기반 모델이 배포 후 실제로 학습하는 것은 아니며, 대신 시스템이 더 나은 지침을 작성하고 이후 실행에서 이를 불러온다고 지적했다.
연구진은 수학적 추론, 웹 검색, 스프레드시트 조작, 문서 질의응답, 가상 환경에서의 상호작용 작업 등 다섯 영역에서 WikiSkill을 평가했다. 보고된 모델에는 여러 Qwen 변형, Gemma-4-31B, Gemini-3.5-Flash가 포함됐다.
The Decoder가 인용한 연구 결과에 따르면, WikiSkill은 Gemini-3.5-Flash의 평균 점수를 49.5%에서 68.1%로 끌어올렸다. Qwen-3.6-27B는 같은 비교에서 39.4%에서 63.3%로 증가했다. 일부 개별 작업에서는 향상이 더 컸다. Gemini-3.5-Flash는 LiveMath에서 33.0%에서 72.6%로, SpreadSheet에서는 50.5%에서 76.6%로 올랐다.
이는 연구 벤치마크에 대한 주장일 뿐, WikiSkill이 실제 운영 환경에서도 같은 향상을 보장한다는 증거는 아니다. 평가에는 독립 실행 3회의 평균이 사용된 것으로 보고됐고, 프레임워크는 연구에서 다른 스킬 진화 방법과 비교됐다. 제공된 자료만으로는 전체 실험 설정, 운영 비용, 또는 변화하는 실제 데이터에서 시스템이 어떻게 동작하는지 충분히 판단할 수 없다.
성능은 작업별로도 달랐다. 수학과 스프레드시트 작업에서는 가장 큰 개선이 나타났지만, 긴 문서 컨텍스트를 다루는 OfficeQA에서는 이점이 훨씬 적었다. 연구진은 작은 모델의 약한 결과를 부분적으로, 긴 컨텍스트 전반에서 진화된 다단계 검색 전략을 실행하는 데 어려움을 겪기 때문이라고 설명했다. 그런 경우 모델은 때때로 기본 행동으로 되돌아갔다.
결과는 지속 메모리가 모델의 능력 한계를 없애지 못함을 시사한다. 시스템이 유용한 절차를 성공적으로 문서화하더라도, 특히 그 절차가 많은 단계, 긴 컨텍스트 창, 여러 도구 상호작용을 포함할 경우 이를 안정적으로 실행하지 못할 수 있다.
AI 빌더에게 WikiSkill은 에이전트가 같은 종류의 작업을 반복해서 마주할 때마다 재학습하는 대신 쓸 수 있는 실용적인 대안을 제시한다. 코딩 보조, 연구 에이전트, 스프레드시트 작업 담당자는 검증된 절차를 보존하고, 실패한 도구 호출을 기록하며, 작업 흐름을 점진적으로 개선할 수 있다. 메모리가 구조화되고 선택적으로 검색된다면, 모든 교훈을 점점 커지는 시스템 프롬프트에 넣을 필요를 줄일 수 있다.
Wiki Layer와 Skill Layer의 분리는 특히 운영 시스템에서 중요하다. 팀은 완전한 감사 추적을 유지하면서 검증된 지침만 라이브 동작에 영향을 주게 할 수 있다. 롤백은 프롬프트나 에이전트 정책을 직접 편집하는 것보다 실험 위험을 낮춰주지만, 여전히 Maintainer와 게이팅 과정의 품질이 나쁜 교훈이 활성 스킬 세트에 들어갈지 결정한다.
이 프레임워크는 모델 경제성에도 영향을 줄 수 있다. 연구에 따르면 WikiSkill을 사용하는 작은 모델이 일부 상황에서는 프레임워크 없이 더 큰 모델과 비슷한 성능을 낼 수 있다. 이 패턴이 테스트한 벤치마크 밖에서도 유지된다면, 기업은 지속 스킬을 활용해 추론 비용을 줄이거나 더 어려운 사례에 큰 모델을 남겨둘 수 있다. 다만 이 결론은 조건부다. 출처는 추적 저장, 유지보수, 검증 실행, 추가 모델 호출을 포함한 전체 시스템 비용을 제시하지 않는다.
전이 가능성도 또 다른 장점이다. 보고된 연구에서는 한 모델이 개발한 스킬이 다른 모델에서 사용될 수 있었고, 때로는 수신 모델이 스스로 만든 스킬보다 더 좋은 성능을 보이기도 했다. 그러나 전이가 보편적이지는 않았기 때문에, 조직은 성공한 절차가 그대로 옮겨질 수 있다고 가정하기보다 각 모델, 각 작업, 각 도구 환경에 맞춰 스킬을 테스트해야 한다.
엔터프라이즈 AI 팀에게 가장 중요한 운영 질문은 거버넌스다. 에이전트 실패의 지속 기록은 신뢰성을 높일 수 있지만, 잘못된 결론, 민감한 정보, 오래된 절차도 보존할 수 있다. 보고된 게이팅 메커니즘은 성능 저하를 다루지만, 개인정보 보호, 승인, 보안을 반드시 해결하는 것은 아니다. 실제 배포에서는 무엇이 위키에 들어갈지, 누가 이를 검토할 수 있을지, 누적된 지식이 언제 만료될지에 대한 통제가 필요하다.
다음 신호는 Google Research가 WikiSkill에 대한 더 자세한 기술 정보, 코드, 또는 더 광범위한 평가를 공개하는지 여부다. 그런 자료는 프레임워크의 연산 오버헤드, 메모리 요구 사항, 검증 설계, 분포 변화에 대한 동작을 더 명확히 하는 데 도움이 된다.
빌더는 더 오래 실행되는 에이전트와 덜 구조화된 엔터프라이즈 워크플로에서도 결과를 주시해야 한다. 현재 증거는 수학과 스프레드시트 작업에서 가장 강하고, 긴 컨텍스트 문서 작업에서는 약하다. 고객지원 운영, 소프트웨어 저장소, 다중 사용자 환경에서 테스트하면 이 방법이 벤치마크 에피소드를 넘어 일반화되는지 알 수 있다.
또 다른 질문은 도구, 웹사이트, 데이터 형식이 바뀌어도 지속 스킬이 계속 유용한가 하는 점이다. 한 인터페이스에서 배운 절차는 애플리케이션 업데이트 후 해로워질 수 있다. 따라서 스킬의 연식, 출처, 롤백 빈도, 오래된 메모리 탐지에 관한 지표는, 제목에 나올 만한 작업 정확도만큼이나 중요하다.
WikiSkill이 주목할 만한 이유는 지속 학습을 해결해서가 아니라, 에이전트의 가장 눈에 띄는 한계 중 하나에 대해 규율 있는 우회책을 제시하기 때문이다. 이 프레임워크는 경험을 엔지니어링 자산으로 취급한다. 추적 기록을 보존하고, 교훈을 요약하고, 변경을 제안하고, 배포 전에 테스트하는 방식이다.
이 패턴은 AI 에이전트를 만드는 팀에 유망하지만, 보고된 향상은 초기 연구 증거로 읽어야 한다. 실제 운영에서 어려운 부분은 어떤 교훈을 신뢰할지, 어느 정도의 메모리를 유지할지, 그리고 에이전트가 낡거나 잘못된 전략을 반복하는 데 점점 더 능숙해지지 않도록 어떻게 막을지 결정하는 일이다.