OpenAI는 Basis, Clay, Exa Labs가 AI 에이전트를 활용해 반복 가능한 작업을 자동화하면서도 맥락, 테스트, 사람의 감독을 유지하는 방식을 조명한다.

OpenAI는 기업 AI 도입의 새로운 국면을 가리키고 있다. 기업들이 질문에 답하는 어시스턴트를 넘어 반복 가능한 워크플로를 실행하는 AI 에이전트로 이동하고 있다는 것이다. 새로운 OpenAI News 보고서에서 회사는 Basis, Clay, Exa Labs를 온보딩, 계정 관리, 개발자 통합에 에이전트를 내장한 조직의 사례로 소개한다.
이 보고서는 중요한 변화가 단순히 AI 사용량의 증가가 아니라고 주장한다. 그것은 정의된 트리거, 회사 컨텍스트에 대한 접근, 연결된 도구, 측정 가능한 결과, 그리고 명시적인 인간 검토를 갖춘 성공적인 실험을 반복 가능한 운영 프로세스로 바꾸는 일이다. 이 구분은 AI를 개인 생산성 도구로 남겨둘지, 아니면 업무 운영 방식의 일부로 만들지 결정하는 기업 구매자에게 중요하다.
OpenAI의 부가 Enterprise Signals 분석에 따르면, AI 사용 상위 10% 기업은 이제 전형적인 기업보다 활성 사용자 1인당 출력 토큰을 8.3배 더 생성하며, 1월의 2.6배에서 확대됐다. OpenAI는 이 격차 확대를 선도적 조직이 에이전트를 내부 맥락과 도구에 연결하고, 더 실질적인 작업을 위임하며, 효과적인 워크플로를 더 쉽게 반복할 수 있게 만들고 있다는 증거로 제시한다.
이 수치들은 벤더가 보고한 것이며, 그것만으로 더 많은 토큰 출력이 더 나은 비즈니스 성과로 이어진다는 것을 보여주지는 않는다. OpenAI 자체 가이드도 조직이 활동량을 가치의 대리 지표로 삼기보다 완료된 작업, 품질, 비용, 사이클 타임, 위험, 예외, 검토 노력 등을 측정해야 한다고 인정한다.
실용적인 모델은 소프트웨어용 직무기술서에 더 가깝다. 팀은 무엇이 작업을 시작하는지, 에이전트가 어떤 정보와 권한을 필요로 하는지, “완료”가 무엇을 의미하는지, 어떤 증거를 만들어야 하는지, 그리고 어디에서 사람이 인계받아야 하는지를 정의한다.
회계법인을 위한 AI 에이전트를 구축하는 Basis에서 OpenAI는 직원 온보딩이 2시간에서 30분으로 줄었다고 말한다. 새 직원들은 Codex와 회사별 온보딩 스킬에 접근할 수 있는데, 이는 특정 워크플로를 위한 재사용 가능한 지침과 리소스의 집합으로 설명된다. 에이전트는 회사 개념을 소개하고 통합 설정을 완료하며, 새로운 예외가 나타날 때 HR이 스킬을 업데이트한다.
이 사례는 일회성 시연이 어떻게 재사용 가능한 프로세스로 바뀔 수 있는지를 보여준다. 워크플로에는 트리거, 알려진 단계, 도구 접근권, 완료 조건이 있다. 사람 직원은 비정상적이거나 민감한 사례를 위해 남아 있지만, 온보딩이 더 이상 한 사람의 가용성에 전적으로 의존하지는 않는다.
Clay는 영업에 다른 패턴을 적용한다. OpenAI에 따르면 회사는 지속적인 작업 공간과 계정마다 전용 서브에이전트를 사용한다. 이 서브에이전트들은 1차 자료를 검토하고 밤사이 딜 폴더를 업데이트한다. 그런 다음 조정 에이전트가 고객 질문에 답하거나 구매 위원회에서 빠진 구성원을 식별하는 등의 일일 우선순위를 생성한다.
Clay는 이 프로세스가 GTM 엔지니어 1인당 밤샘 받은 편지함 분류 시간을 약 1시간 절약한다고 말한다. 이는 회사의 주장이지, 독립적으로 검증된 생산성 연구는 아니다. 운영상 의미는 지원 증거에 있다. 영업 담당자는 조치하기 전에 권고의 근거가 되는 원자료를 검토할 수 있고, 계정 맥락은 다른 권한 있는 팀도 계속 이용할 수 있다.
Exa Labs는 검색 API를 위한 “Exa everywhere” 목표를 추구하기 위해 에이전트를 활용한다. OpenAI는 Codex가 잠재적 통합을 모니터링하고, Slack과 Notion 같은 시스템에서 맥락을 수집하며, 풀 리퀘스트를 만들고, 테스트를 실행하고, 주간 업데이트를 준비한다고 말한다. 또한 공지 초안을 작성할 수도 있지만, 어떤 기회가 중요한지와 회사가 외부에 무엇을 약속해야 하는지는 사람이 결정한다.
이 워크플로는 Basis 사례보다 실행에 더 가깝지만, 여전히 테스트와 검토에 의해 제한된다. 에이전트는 기회를 발견에서 테스트된 산출물까지 가져갈 수 있지만, 최종적인 비즈니스 또는 관계 결정을 내리지는 않는다.
이 보고서에서 가장 강한 증거는 서술적이다. OpenAI는 세 스타트업이 특정 워크플로를 어떻게 구조화했는지 문서화한다. 성과 수치는 회사 자체 또는 OpenAI의 분석에 기반하며, 출처는 독립적 검증, 기업 간 비교 가능한 기준선, 또는 동일한 결과가 대기업에 전이될 것이라는 증거를 제공하지 않는다.
그럼에도 사례들은 반복되는 설계 선택을 보여준다. Basis는 안정적인 프로세스를 재사용 가능한 스킬로 형식화한다. Clay는 에이전트에게 시간에 따라 변하는 작업을 위한 지속적 맥락과 갱신 주기를 제공한다. Exa는 신호를 도구, 테스트, 검토와 연결한 뒤에야 어떤 것이든 프로덕션이나 외부 대상에 도달하게 한다.
OpenAI는 또한 도입 6개월 후 초기 경력 직원들이 임원보다 주당 13개의 메시지를 더 보냈다는 연구를 인용한다. 회사는 이 발견을 근거로 일상 업무에 가장 가까운 직원들이 새로운 애플리케이션을 시험할 여지를 가져야 한다고 주장한다. 그 결론은 타당하지만, 실험이 지속적인 가치를 만들려면 팀이 기본 프로세스, 증거, 통제, 책임을 포착해야 한다.
AI 빌더에게 이 보고서는 어려운 제품 문제는 모델 역량만이 아님을 재확인시킨다. 그것은 워크플로 설계다. 에이전트는 올바른 소스에 대한 신뢰할 수 있는 접근, 권한 경계, 평가 방법, 예외 처리, 사람에게 명확한 인계가 필요하다. 이러한 요소가 없으면 자동화는 활동을 늘리면서도 책임 소재를 더 찾기 어렵게 만들 수 있다.
기업에게는 광범위한 자동화 프로그램을 시도하기보다 하나의 중요한 워크플로부터 시작하라는 시사점이 있다. 후보 작업은 피드백을 만들 만큼 자주 반복되어야 하고, 재설계를 정당화할 만큼 중요해야 한다. 리더는 책임자를 지정하고, 기준선을 설정하며, 비즈니스 성과와 에이전트 작업을 검토하는 운영 부담 모두를 추적해야 한다.
사례들은 또한 배포를 점진적으로 확장해야 하는 이유를 보여준다. 계정 활동을 요약하는 에이전트는 나중에 조치를 추천하거나, 변경을 준비하거나, 풀 리퀘스트를 열 수 있다. 단계가 올라갈수록 권한, 증거, 테스트, 의사결정 권한의 중요성도 커진다. 에이전트가 어떤 행동을 수행할 수 있다는 사실이, 승인 없이 그렇게 해야 한다는 뜻은 아니다.
다음 신호는 OpenAI나 소개된 회사들이 토큰 사용량과 절감 시간 주장 이상의 독립적인 결과 데이터를 공개하는지 여부가 될 것이다. 기업 구매자들은 오류율, 예외 빈도, 검토 부담, 에이전트 맥락 유지 비용을 포괄하는 더 명확한 평가 방법도 주시해야 한다.
제품 팀은 Codex와 유사한 도구들이 권한, 감사 추적, 재사용 가능한 스킬, 시스템 간 테스트에 대해 더 강력한 제어를 갖추는지 살펴봐야 한다. 에이전트가 권고에서 제한된 실행으로 이동하는 사례가 더 많아지면, 그 패턴이 홍보가 아니라 운영으로 자리 잡고 있음을 뜻할 것이다.
OpenAI의 보고서는 AI 에이전트가 일관된 기업 이익을 제공한다는 증거로 읽기보다, 워크플로 설계 사례 연구로 읽을 때 가장 유용하다. Basis, Clay, Exa Labs는 같은 운영 원칙의 서로 다른 버전을 보여준다. 맥락, 도구, 증거, 인간의 판단을 함께 설계할 때 자동화는 더 가치 있어진다.
AI 네이티브 기업의 경쟁 과제는 성공적인 에이전트 실험을 통제력을 잃지 않고 얼마나 빨리 유지보수 가능한 시스템으로 바꿀 수 있느냐는 것이다. 책임, 권한, 평가, 검토 지점을 문서화하는 팀이, 직원들이 모델에게 얼마나 많이 시키는지만으로 도입을 측정하는 팀보다 실행을 확장하는 데 더 유리할 것이다.