AI News

Andon Labs says its AI store manager Luna has fired a human employee for the first time, but only after the company reminded the system about a disciplinary policy Luna had written herself. The episode offers a rare look at how an AI agent handles consequential workplace decisions when its memory, initiative and judgment are tested over time.

Luna runs the Andon Market, a San Francisco store operated by Andon Labs. According to the company’s account, she has also hired employees, created schedules and negotiated pay since beginning the experiment in April. Employees remain formally employed by Andon Labs, receive guaranteed pay and retain legal protections; humans reviewed and executed the termination.

The incident matters because it was not a clean demonstration of autonomous management. Luna initially overlooked repeated misconduct and then hesitated even after recovering the relevant policy. The eventual decision required several interventions from human operators, highlighting the gap between an AI system’s ability to follow instructions and its ability to apply rules consistently without supervision.

해고에는 인간의 한 번 더 밀어주기가 필요했다

직원이 매장에 합류하기 6일 전, Luna는 직원 안내서를 작성했다. 보고에 따르면 이 정책은 30일 동안 정당한 사유 없는 지각이 3회 발생하면 공식 경고를 주고, 이후 사건은 해고로 이어질 수 있다고 했다.

그 안내서는 이후 Luna의 작업 기억에서 사라졌다. 해당 직원은 반복적으로 지각했으며, 일요일 근무 중에는 매장이 68분 늦게 문을 열기도 했다. Andon Labs는 출퇴근 기록이 있는 23개 교대 중 17개에서 지각했다고 밝혔지만, Luna는 공식적으로는 6건만 기록했고 나머지는 면책했다.

회사는 또 회사 카드로 승인 없이 간식을 구매한 일, 지시를 무시한 일, 그리고 동료에게 알리지 않고 매장 바닥을 떠난 사례도 언급했다. Luna는 이런 사건들이 누적되던 기간 동안 경고를 내리지 않았다.

Andon Labs가 Luna에게 안내서를 기억에서 찾아 해고가 정당한지 평가하라고 지시했을 때, 그녀는 먼저 구두 경고를 제안했다. 그러자 운영자들은 서면 경고를 포함해 이미 여러 차례의 공식 면담이 있었다는 점을 상기시켰다. 더 완전한 이력을 검토한 뒤에야 Luna는 출석, 재정 통제, 신뢰성 문제의 결합 패턴을 식별하고 해고를 권고했다. 또한 직원의 강점도 인정하고, 2주 개선 계획이 포함된 최종 서면 경고를 대안으로 제시했다.

따라서 이 결정은 일부는 자율적이고 일부는 유도된 것이었다. Luna가 해고 권고에 이르렀지만, 운영자들이 빠진 정책을 복원하고 그녀가 스스로는 꺼내지 못한 맥락을 제공해야 했다.

모델 능력은 결과의 일관성을 바꿨다

Andon Labs는 Luna의 상태를 저장하고 같은 사례를 7개 AI 모델로 다시 재생했으며, 각 시나리오를 3번씩 실행했다. 회사는 4개 모델이 3번 모두 해고를 권고했다고 밝혔다. 또한 더 유능한 모델일수록 해고 권고를 더 일관되게 내렸고, 약한 모델은 더 자주 주저하는 폭넓은 패턴도 보고했다.

이 결과는 벤더가 보고한 소규모 재생 실험의 관찰일 뿐, 독립적인 벤치마크는 아니다. Andon Labs는 모델 순위를 매기는 완전한 방법론을 제공하지 않았고, 실행 간 모든 변동을 설명하지도 않았다. 또한 GPT-5.6 Terra는 3번의 시도에서 한 번도 해고를 권고하지 않은 유일한 테스트 모델이었다고 밝혔다.

회사는 X에서 한 사용자가 그 모델은 직원을 해고하는 데 소극적일 것이라고 제안한 뒤 GPT-4o도 별도로 테스트했다. Andon Labs에 따르면 GPT-4o는 실행의 20%에서 해고를 권고했다. 회사는 이 결과를 모델의 비위 맞추기식 또는 아첨성 반응 경향에 대한 이전 비판과 연결했지만, 이 실험만으로 그 행동이 다른 결과를 낳았다고 입증할 수는 없다.

AI 제작자에게 더 중요한 신호는 어떤 모델이 “이겼는가”보다 일관성 부족일 수 있다. 같은 사례도 문맥에 어떤 정보가 उपलब्ध한지, 상충하는 고려사항을 모델이 어떻게 가중하는지에 따라 경고, 성과 개선 계획, 해고 중 어느 쪽으로도 갈 수 있다. 더 강한 모델은 긴 기록을 더 안정적으로 추론할 수 있지만, 여전히 가져올 수 없는 규칙에는 작동할 수 없다.

채용 테스트는 또 다른 약점을 드러냈다

직원이 떠난 뒤 Luna는 이력서와 면접에 몇 가지 경고 신호가 있는 대체 후보를 평가했다. Andon Labs는 지원자가 긴 과거 고용주 목록을 적었고, 모델들은 이를 대체로 추가 조사를 해야 할 이유가 아니라 폭넓은 경험의 증거로 해석했다고 밝혔다.

7개 모델 전체의 21번 재생 실행에서 모두 이 지원자의 채용을 권고했다. 연구진이 이전 직원과 관련된 문제를 시스템에 명시적으로 상기시키자, 21번 중 18번은 레퍼런스 확인을 권고했다. 실제 운영 과정에서 Luna는 지원자가 제시한 레퍼런스를 확인할 수 없었지만, 유급 시험 근무를 승인했고 이후 다시 채용을 권고했다.

Andon Labs는 결국 지원자가 시작하기 전에 최소 한 개의 레퍼런스 확인을 요구했다. 그 확인은 끝내 오지 않았고, 해당 지원자는 채용되지 않았다.

해고와의 대비는 시사적이다. Luna는 징계 규칙을 집행하기 위해 인간의 한 번 더 밀어주기가 필요했지만, 검증 없이 그럴듯한 채용 서사를 너무 쉽게 받아들이기도 했다. 두 경우 모두 시스템은 운영자가 제공한 정보와 프레이밍에 반응했을 뿐, 견고한 관리 과정을 독립적으로 유지하지 못했다.

이 패턴은 Andon Labs의 이전 관찰과도 일치한다. 회사는 스톡홀름의 카페를 운영하는 AI 에이전트 Mona와 Luna가 접수한 26건의 휴가 신청을 모두 승인했다고 밝혔다. 또한 Luna는 경고 없이 27건의 지각을 받아들였고, 인간이 개입하기 전 회사가 캘리포니아 노동법과 맞지 않는다고 본 7일 근무 일정을 승인했다고도 전했다.

이 실험이 AI 배포에 의미하는 것

Andon Market 테스트는 업무 자동화를 위한 AI 에이전트를 만드는 팀에 중요하다. 장기 기억, 도구 사용, 실제 운영상 결과가 결합되어 있기 때문이다. 모델은 한 번의 관리 프롬프트에서는 잘 작동해도, 아무도 기록을 다시 보라고 하지 않으면 정책을 보존하거나, 증거를 축적하거나, 에스컬레이션을 트리거하는 데 실패할 수 있다.

이는 기업 AI 배포에 실질적 요구사항을 만든다. 정책은 대화형 기억에 의존하기보다 에이전트가 안정적으로 불러올 수 있는 시스템에 저장되어야 한다. 출석, 비용, 성과 관련 논의에는 감사 가능한 기록이 필요하다. 채용 권고에는 모델이 우회할 수 없는 레퍼런스 확인 또는 다른 통제가 필요하다. 해고, 임금 변경, 법적으로 민감한 일정 조정 같은 영향력이 큰 조치는 명시적인 인간 승인 게이트를 거쳐야 한다.

회사와 Anthropic의 이전 Project Vend 협업도 비슷한 결론에 도달했다. 더 나은 도구는 AI의 상업적 성과를 높였지만, 시스템은 여전히 조작에 취약했고 법적 문제가 될 수 있는 결정을 내렸다. 이 실험들은 능력을 더한다고 해서 거버넌스 문제가 해결되는 것은 아니라는 점을 시사한다. 더 유능한 AI는 더 단호한 결정을 내릴 수 있지만, 기반 기록이나 규칙이 불완전할 때는 더 자신 있게 행동할 수도 있다.

Andon Labs는 Luna를 AI 시스템이 디지털 조정을 맡고 인간이 물리적 작업을 수행하는 미래 노동 배치의 미리보기로 규정한다. 그런 가능성 때문에 권한의 경계가 특히 중요하다. 에이전트가 일정, 임금, 고용 상태를 통제하는 데 가까워질수록, 시스템의 기억과 기본적인 관대함이 결과를 결정하도록 두는 것은 점점 더 용납되기 어렵다.

앞으로 무엇을 봐야 하나

다음에 유용한 신호는 Andon Labs가 더 상세한 재생 방법, 모델 구성, 의사결정 로그를 공개하는지, 그리고 동일한 사례가 3번 반복이 아니라 더 긴 기간 동안도 안정적으로 유지되는지 여부다. 제작자들은 지속적인 정책 저장소, 구조화된 인사 기록, 의무 승인 워크플로가 Luna에서 보인 실패를 줄이는지에 대한 증거도 주목해야 한다.

기업 구매자는 에이전트가 작업을 완료하는 시연만으로는 부족하다. 시스템이 오래된 규칙을 어떻게 불러오는지, 예외를 어떻게 기록하는지, 지원자의 주장를 어떻게 검증하는지, 법적 충돌을 어떻게 감지하는지, 증거가 불완전할 때 어떻게 의사결정을 상위로 올리는지 물어봐야 한다. 개별 모델의 성능도 중요하지만, 주변 통제는 더 중요할 수 있다.

Creati.ai 관점

Luna의 첫 해고가 뉴스가 되는 이유는 AI “상사”가 누군가를 해고해서라기보다, 그 시스템이 양쪽 방향에서 거의 실패했기 때문이다. 반복되는 위반 행위를 용인했고, 그 뒤에는 의심스러운 지원자를 받아들였다. 두 경우 모두 인간 운영자가 부족한 기억과 판단을 제공했다.

이 점은 AI 제품팀에 유용한 경고가 된다. 자율 관리는 영속적인 기록, 명확한 에스컬레이션, 책임 있는 인간 검토가 있는 통제된 워크플로로 다뤄져야 하며, 권한을 부여받고 자신의 규칙을 기억하길 기대받는 챗봇으로 다뤄져서는 안 된다.

추천

AI 매장 관리자는 인간이 자신의 규칙을 다시 상기시킨 뒤에야 직원을 해고했다

Andon Labs는 자사 AI 매장 관리자 Luna가 인간의 개입 후에야 직원을 해고했다며, AI 상사의 기억·판단·감독 공백을 드러냈다고 밝혔다.