AI News

OpenAI는 AI 에이전트를 소프트웨어 개발을 넘어 회계사, 투자자, 의사, 운영팀, 그리고 컴퓨터 기반으로 일하는 다른 사람들의 일상적인 업무 흐름으로 확장하려 하고 있다. 최신 시도인 ChatGPT Work는 모델을 업무 도구에 연결해 단순히 질문에 답하는 대신 여러 단계의 작업을 완료하도록 요청한다.

이 확장은 전략적으로 중요하지만, 초기 증거는 어려운 채택 문제를 가리킨다. TechCrunch는 OpenAI 직원들이 자사의 에이전트형 코딩 도구를 매우 높은 비율로 사용하고 있지만, 외부 구독자들의 사용은 제한적이라고 보도했다. 이 격차는 능력 있는 에이전트를 만드는 것이 과제의 일부에 불과하며, 엔지니어링 밖의 사람들에게 이해 가능하고, 제어 가능하며, 신뢰할 수 있게 만드는 것이 시장이 기술 초기 채택자를 넘어 성장할 수 있는지를 결정할 수 있음을 시사한다.

ChatGPT Work는 에이전트를 코딩 너머로 확장한다

TechCrunch에 따르면 ChatGPT Work는 지난달 출시되었으며 OpenAI의 월 20달러 구독 등급에서 이용할 수 있다. 이 제품은 소스 코드나 명령줄 도구를 다루지 않을 수도 있는 사용자를 위해 설계된, 회사의 코딩 에이전트 Codex의 더 넓은 버전으로 설명된다.

핵심 제안은 기존 디지털 업무 공간에 대한 접근이다. OpenAI의 데스크톱 애플리케이션은 이메일, Slack, Notion, Figma 및 기타 애플리케이션과 연결될 수 있어 에이전트가 여러 시스템에서 정보를 수집하고 행동할 수 있게 한다. TechCrunch가 언급한 예로는 주간 지표 보고서 작성, 스프레드시트를 계획 도구로 전환, 투자 리서치 수집, 업무 대화에서 차트 생성 등이 있다.

이 접근은 ChatGPT Work를 Claude Code, Perplexity AI의 브라우징 에이전트, 그리고 단일의 고립된 채팅 안이 아니라 사용자의 기존 소프트웨어 전반에서 작동하는 다른 AI 에이전트와 같은 넓은 범주에 위치시킨다. OpenAI는 주변 제품이 도구, 권한, 작업 계획의 복잡성을 처리할 수 있다면 범용 에이전트가 많은 직업에 도움이 될 수 있다고 베팅하고 있다.

회사의 제품 리더들은 이 변화를 대화형 지원에서 자율 실행으로의 이동으로 설명한다. 이는 OpenAI의 입장이지, 서로 다른 업무 환경에서 시스템이 얼마나 안정적으로 작동하는지에 대한 독립적으로 검증된 평가가 아니다.

채택 격차가 핵심 시험대다

문제를 보여주는 가장 강력한 증거는 OpenAI 지원 연구를 TechCrunch가 인용한 사용 데이터다. 6월에 OpenAI 직원의 98%가 Codex를 사용한 반면, 조직 구독자는 17%, 개인 구독자는 1% 미만이었다고 전해진다.

이 수치는 공급사 지원 자료이며 전체 시장을 독립적으로 측정한 것으로 보아서는 안 된다. 그럼에도 내부적 친숙함과 외부적 채택 사이의 거리를 보여준다. OpenAI 엔지니어는 코딩 에이전트가 기존 프로세스에 자연스럽게 들어맞는 환경에서 일한다. 대부분의 다른 사용자는 먼저 무엇을 위임할지, 어떻게 맥락을 제공할지, 결과를 어떻게 검토할지를 이해해야 한다.

OpenAI 엔지니어링 리더 Andrew Ambrosino는 TechCrunch에, 회사가 처음에는 비엔지니어 직원들이 Codex에 어려움을 겪는 모습을 봤다고 말했다. 제품이 코드 변경과 빈 diff 같은 기술적 개념을 드러냈기 때문이다. 이후 팀은 에이전트를 사용하는 데 필요한 전문 지식의 양을 줄이기 위해, 경험을 더 범용적으로 만드는 작업을 해왔다.

이 또한 OpenAI가 눈에 띄는 제어 장치와 워크플로 버튼에 집중하는 이유를 설명한다. 기술에 능숙한 사용자는 프롬프트만으로 적절한 기능을 호출할 수 있지만, 일반 사용자는 그런 기능이 존재하는지조차 모를 수 있다. Ambrosino는 일부 제어 장치는 결국 사라지더라도, 채택 초기에는 발견 가능성이 중요하다고 주장했다.

더 많은 접근은 더 많은 위험을 만든다

에이전트에 업무 시스템 접근권을 주는 것은 안전 문제도 바꾼다. 모델은 더 이상 사용자가 검토할 텍스트만 생성하는 것이 아니다. 사적 메시지를 읽고, 기록을 가져오고, 문서를 업데이트하고, 캘린더 이벤트를 만들고, 여러 애플리케이션을 넘나들며 행동할 수 있다.

Ambrosino는 문서를 준비하는 동안 에이전트가 사적 다이렉트 메시지에서 정보를 가져와 그 정보가 공유되면 안 된다는 점을 이해하지 못할 위험이 있다고 인정했다. 그는 TechCrunch에 제품을 테스트하는 자신의 업무에서 그 위험을 감수한다고 말했지만, 그런 결과를 경험한 적은 없다고 덧붙였다.

그 일화는 문제가 해결되었다는 증거가 아니다. 기업 구매자에게 중요한 질문은 접근을 애플리케이션, 프로젝트, 데이터 유형, 사용자 역할별로 제한할 수 있는지, 행동에 승인이 필요한지, 관리자가 에이전트가 무엇을 보고 무엇을 바꿨는지 감사할 수 있는지 여부다. 제공된 자료는 ChatGPT Work가 이러한 각 제어를 어떻게 처리하는지 보여주지 않는다.

제품은 또한 이동해야 하는 소프트웨어 자체의 신뢰성 문제에 직면한다. 많은 비즈니스 시스템은 자율 에이전트를 위해 설계되지 않았고, 일관성 없는 인터페이스, 불완전한 기록, 모호한 권한은 겉보기에는 단순한 작업도 어렵게 만들 수 있다. 형편없이 포맷된 캘린더를 한 번 성공적으로 추출하는 에이전트는 유용하지만, 기업 시스템은 수천 개의 다양한 사례에서 예측 가능하게 작동해야 한다.

이 베팅이 AI 빌더와 구매자에게 중요한 이유

OpenAI에게 더 넓은 에이전트 채택은 더 긴 시간의 작업이 더 많은 추론 자원을 소비하기 때문에 모델의 가치와 사용량을 높일 수 있다. 더 중요한 것은 AI 에이전트가 지식 노동의 훨씬 더 큰 비중을 지원하려면 회사가 소프트웨어 엔지니어링을 넘어 더 많은 직업에 도달해야 한다는 점이다.

이미 더 좁은 워크플로를 둘러싸고 경쟁이 형성되고 있다. TechCrunch에 따르면 Harvey는 법률 업무에 집중하고, Clay는 영업 관련 프로세스를 겨냥한다. 이들 회사는 모델 비의존적 전략을 사용해 성능이나 비용이 바뀔 때 다른 기반 모델을 선택할 수 있다. 반대로 OpenAI는 하나의 소비자용 제품을 많은 기능에서 유용하게 만들려 하고 있다.

이는 빌더에게 트레이드오프를 만든다. 범용 에이전트는 여러 특화 도구를 구매하고 통합해야 할 필요를 줄일 수 있지만, 수직형 제품은 더 나은 권한, 용어, 검토 프로세스, 도메인 특화 신뢰성을 제공할 수 있다. ChatGPT Work를 평가하는 제품팀은 넓은 비서의 편리함과 집중된 시스템의 제어성 및 예측 가능성을 비교해야 한다.

채택 수치는 사용자 경험이 모델 능력만큼 중요할 수 있음을 시사한다. 엔지니어는 구성, 기술적 피드백, 가끔의 디버깅을 감내할 수 있다. 반면 금융, 커뮤니케이션, 운영 사용자는 명확한 작업 경계, 눈에 보이는 출처, 되돌릴 수 있는 작업, 그리고 에이전트가 확신이 없을 때의 간단한 에스컬레이션을 더 필요로 한다.

다음에 주목할 점

첫 번째 신호는 ChatGPT Work의 사용량이 OpenAI의 더 넓은 ChatGPT 사용자층에 비해 어떤지다. TechCrunch는 공동 앱이 2,000만 명에게 사용되고 있다고 보도하는 반면, OpenAI는 온라인에서 10억 명 이상이 ChatGPT에 프롬프트를 입력한다고 말한다. 이 비교는 같은 조건의 채택 지표는 아니지만, 회사가 직면한 과제의 규모를 보여준다.

기업 구매자들은 활성 사용량, 작업 완료율, 오류율, 권한 제어, 감사 로그, 그리고 사용자가 개입해야 하는 빈도에 대한 공개 정보를 주시해야 한다. OpenAI가 이런 세부 사항을 공개한다면, 실제 워크플로 채택과 호기심에 기반한 시험을 구분하기 쉬워질 것이다.

시장 또한 사용자가 범용 에이전트를 선호하는지, Harvey와 Clay 같은 특화 제품을 선호하는지 지켜봐야 한다. 또 다른 중요한 신호는 OpenAI가 고객에게 기존 소프트웨어 스택을 재구성하거나 민감한 데이터에 대한 광범위한 접근을 받아들이게 하지 않고도 에이전트를 유용하게 만들 수 있는지 여부다.

Creati.ai 관점

OpenAI의 소식은 단순히 또 다른 비서를 추가하는 것보다, 자율성이 직장 내에서 정상적인 상호작용이 될 수 있는지 시험하는 데 가깝다. ChatGPT Work는 채팅 인터페이스의 실제 한계를 다룬다. 사용자는 종종 답변을 작성하는 것뿐 아니라 여러 시스템에 걸쳐 정보와 행동을 조율하는 도움이 필요하다.

하지만 대중적 채택은 자율성 그 자체가 아니라 제한된 자율성에 달려 있다. 빌더와 기업은 무엇에 접근했는지 설명하고, 중요한 순간에 승인을 요청하며, 지시나 데이터가 모호할 때 안전하게 실패하는 제품을 선호할 가능성이 높다. OpenAI는 AI 에이전트를 비엔지니어에게 가져가려는 야망을 보여줬다. 다음 질문은 그 제품 설계가 실제로 행동할 허가를 얻을 수 있느냐다.

추천

OpenAI는 모든 워크플로에 AI 에이전트를 넣으려 한다. 대중적 채택은 여전히 불확실하다

OpenAI는 ChatGPT Work로 ChatGPT 에이전트를 코딩 너머로 확장하고 있지만, 외부 채택이 낮다는 점은 일반 사용자에게 여전히 신뢰, 통제, 안내가 필요함을 보여준다.