
Andon Labs says its AI store manager Luna has fired a human employee for the first time, but only after the company reminded the system about a disciplinary policy Luna had written herself. The episode offers a rare look at how an AI agent handles consequential workplace decisions when its memory, initiative and judgment are tested over time.
Luna runs the Andon Market, a San Francisco store operated by Andon Labs. According to the company’s account, she has also hired employees, created schedules and negotiated pay since beginning the experiment in April. Employees remain formally employed by Andon Labs, receive guaranteed pay and retain legal protections; humans reviewed and executed the termination.
The incident matters because it was not a clean demonstration of autonomous management. Luna initially overlooked repeated misconduct and then hesitated even after recovering the relevant policy. The eventual decision required several interventions from human operators, highlighting the gap between an AI system’s ability to follow instructions and its ability to apply rules consistently without supervision.
その従業員が店に加わる6日前、Lunaは従業員ハンドブックを作成した。報道によれば、この方針では30日間に理由のない遅刻が3回あった場合に正式な警告を出し、その後の違反は解雇につながる可能性があるとしていた。
そのハンドブックは後にLunaの作業記憶から消えた。従業員は繰り返し遅刻し、日曜日のシフトでは店舗の開店が68分遅れたこともあった。Andon Labsによると、打刻記録のある23シフトのうち17回で遅刻していたが、Lunaが正式に記録したのは6件だけで、残りは見逃していた。
同社はさらに、会社カードでの無断スナック購入、指示の無視、そして同僚に知らせずに売り場を離れた事例も挙げた。こうした出来事が積み重なっていた期間中、Lunaは警告を出していなかった。
Andon LabsがLunaに対し、ハンドブックを記憶から探し出し、解雇が正当かどうかを評価するよう指示したところ、最初は口頭警告を提案した。するとオペレーターは、書面警告を含む複数回の正式な面談がすでに行われていたことを思い出させた。より完全な経緯を確認した後になって、Lunaは出勤状況、金銭管理、信頼性の問題が重なっていると判断し、解雇を勧告した。また、従業員の長所も認め、代替案として2週間の改善計画付きの最終書面警告を提示した。
したがって、この判断は一部が自律的で、一部が引き出されたものだった。Lunaは解雇勧告に至ったが、オペレーターが失われた方針を復元し、彼女が自力では取り出せなかった文脈を与える必要があった。
Andon LabsはLunaの状態を保存し、同じ事例を7つのAIモデルで再実行し、各シナリオを3回ずつ走らせた。同社によると、4つのモデルは3回すべてで解雇を勧告した。また、より高性能なモデルほど解雇勧告の一貫性が高く、弱いモデルほどためらう傾向が強いという広いパターンも報告した。
これらの結果は、少数の再実行実験から得られたベンダー報告の観察であり、独立したベンチマークではない。Andon Labsはモデル順位付けの完全な方法論を示さず、各回の違いもすべて説明しなかった。また、GPT-5.6 Terraは3回の試行を通じて一度も解雇を勧告しなかった唯一のテスト対象モデルだったと述べた。
同社は別途、X上で「そのモデルは従業員を解雇するのを嫌がるだろう」との投稿があった後にGPT-4oも試した。Andon Labsによると、GPT-4oが解雇を勧告したのは実行の20%だった。同社はこの結果を、モデルが迎合的・追従的な応答をしがちだという過去の批判と結びつけたが、この実験だけでその行動が結果の違いを引き起こしたとは断定できない。
AI開発者にとってより重要なのは、どのモデルが「勝ったか」ではなく、不一致そのものかもしれない。同じ事例でも、文脈で利用できる情報や、相反する考慮事項をどう重み付けするかによって、警告、改善計画、解雇のいずれにもなりうる。より強力なモデルは長い経緯をより確実に推論できるかもしれないが、それでも取り出せないルールには従えない。
従業員の退職後、Lunaは履歴書と面接にいくつかの警告サインがある代替候補者を評価した。Andon Labsによると、その応募者は長い勤務先一覧を挙げていたが、モデル群は概してそれを追加調査の理由ではなく、幅広い経験の証拠として解釈した。
7モデルにわたる21回の再実行はすべて、その候補者の採用を勧めた。研究者が以前の従業員に関する問題をシステムに明示的に思い出させると、21回中18回でリファレンス確認を勧めた。実運用では、Lunaは候補者が示した推薦先を確認できなかったものの、有給の試用シフトを承認し、その後あらためて採用を勧めた。
Andon Labsは最終的に、少なくとも1件の推薦確認があるまでは候補者が開始できないよう求めた。その確認は届かず、その人物は採用されなかった。
解雇との対比は示唆的だ。Lunaは規律ルールを適用するために人間の促しを必要とした一方で、妥当そうに見える採用の物語を検証なしで受け入れすぎてもいた。どちらの場合も、システムは自律的に堅牢な管理プロセスを維持するのではなく、オペレーターが与えた情報と枠組みに反応していた。
このパターンは、Andon Labsの以前の観察とも整合する。同社によれば、Lunaと、ストックホルムのカフェを運営するAIエージェントMonaは、受け取った26件すべての休暇申請を承認した。また、Lunaは警告を出さずに27件の遅刻を受け入れ、人間が介入する前に、同社がカリフォルニア労働法に反するとみなした7日間の勤務表も承認したという。
Andon Marketのテストは、職場自動化向けのAIエージェントを構築するチームにとって重要だ。長期記憶、ツール使用、実際の業務上の結果が組み合わさっているからである。モデルは1回の管理プロンプトでは良く動いても、誰も再確認を求めないと方針を保持したり、証拠を蓄積したり、エスカレーションを発動したりすることに失敗する可能性がある。
これは企業向けAI導入に実務上の要件を生む。方針は会話メモリに頼るのではなく、エージェントが確実に取り出せるシステムに保存されるべきだ。出勤、経費、評価に関するやり取りには監査可能な記録が必要である。採用の推奨には、モデルが省略できない推薦確認やその他の統制が必要だ。そして、解雇、給与変更、法的に敏感なシフト編成のような影響の大きい行為には、明示的な人間の承認ゲートが必要である。
同社の以前のAnthropicとのProject Vend共同研究も似た結論に達している。より良いツールはAIの商業的パフォーマンスを向上させたが、システムは操作に脆弱なままで、法的問題をはらむ判断も下した。これらの実験は、能力の追加とガバナンスの解決は同じではないことを示唆している。より高性能なAIはより強い判断を下せるかもしれないが、基礎となる記録やルールが不完全な場合には、より自信を持って行動してしまうこともある。
Andon LabsはLunaを、AIシステムがデジタル調整を担い、人間が物理作業を行うという将来の労働形態の予告編として位置づけている。その可能性があるからこそ、権限の境界が特に重要になる。エージェントがシフト、賃金、雇用状況の管理に近づくほど、システムの記憶力や初期の寛容さが結果を決めることは、より受け入れがたくなる。
今後の有益なシグナルは、Andon Labsがより詳細な再実行手法、モデル構成、判断ログを公開するか、また同じ事例が3回の繰り返しではなくより長期間にわたって安定しているかどうかだ。開発者はまた、永続的な方針ストア、構造化された人事記録、必須の承認ワークフローがLunaで見られた失敗を減らす証拠にも注目すべきである。
企業の買い手は、エージェントがタスクを完了するデモだけでは不十分だと考えるべきだ。古いルールをどう取得するか、例外をどう記録するか、応募者の主張をどう検証するか、法的衝突をどう検出するか、証拠が不完全なときにどう意思決定を上位にエスカレートするかを尋ねるべきである。個々のモデルの性能は重要だが、周囲の統制はそれ以上に重要かもしれない。
Lunaの初めての解雇がニュースになるのは、AIの「上司」が誰かを解雇したからというより、このシステムが両方向でほとんど失敗したからだ。繰り返しの不正行為を許容し、その後で疑わしい応募者を受け入れてしまった。どちらの場合も、人間のオペレーターが不足していた記憶と判断を補った。
このことは、AIプロダクトチームにとって有用な警告となる。自律的な管理は、永続的な記録、明確なエスカレーション、説明責任のある人間レビューを備えた管理されたワークフローとして扱うべきであり、権限を与えられ、自分自身のルールを覚えていることを期待されるチャットボットとして扱うべきではない。
Andon Labsは、AI店長Lunaが人間の促しを受けて初めて従業員を解雇したと述べ、AI上司における記憶・判断・監督のギャップを露わにした。