AI News

Andon Labs says its AI store manager Luna has fired a human employee for the first time, but only after the company reminded the system about a disciplinary policy Luna had written herself. The episode offers a rare look at how an AI agent handles consequential workplace decisions when its memory, initiative and judgment are tested over time.

Luna runs the Andon Market, a San Francisco store operated by Andon Labs. According to the company’s account, she has also hired employees, created schedules and negotiated pay since beginning the experiment in April. Employees remain formally employed by Andon Labs, receive guaranteed pay and retain legal protections; humans reviewed and executed the termination.

The incident matters because it was not a clean demonstration of autonomous management. Luna initially overlooked repeated misconduct and then hesitated even after recovering the relevant policy. The eventual decision required several interventions from human operators, highlighting the gap between an AI system’s ability to follow instructions and its ability to apply rules consistently without supervision.

Увольнение потребовало человеческого толчка

За шесть дней до того, как сотрудник присоединился к магазину, Luna подготовила руководство для сотрудников. Сообщается, что политика предусматривала официальное предупреждение после трех необъясненных опозданий за 30 дней, а дальнейшие нарушения могли привести к увольнению.

Позже это руководство исчезло из рабочей памяти Luna. Сотрудник неоднократно опаздывал, включая одну воскресную смену, когда магазин открылся на 68 минут позже. Andon Labs говорит, что работник опоздал в 17 из 23 смен, по которым были зафиксированы времена входа, хотя Luna официально отметила только шесть инцидентов и остальные простила.

Компания также указала на несанкционированные покупки снеков по корпоративной карте, игнорирование инструкций и случай, когда сотрудник покинул торговый зал, не сообщив коллеге. Luna не выносила предупреждения в период, когда эти инциденты накапливались.

Когда Andon Labs поручила Luna поискать в памяти руководство и оценить, было ли увольнение оправдано, она сначала предложила устное предупреждение. Затем операторы напомнили ей, что уже состоялись несколько официальных разговоров, включая письменное предупреждение. Лишь после просмотра более полной истории Luna выявила совокупный паттерн проблем с посещаемостью, финансовым контролем и надежностью и рекомендовала увольнение. Она также признала сильные стороны сотрудника и предложила в качестве альтернативы последнее письменное предупреждение с двухнедельным планом улучшения.

Таким образом, решение было частично автономным и частично вызванным. Luna пришла к рекомендации об увольнении, но операторам пришлось восстановить утраченную политику и предоставить контекст, который она сама не смогла извлечь.

Возможности модели изменили стабильность результата

Andon Labs сохранила состояние Luna и проиграла тот же случай на семи ИИ-моделях, запуская каждый сценарий по три раза. Компания сообщает, что четыре модели во всех трех прогонах рекомендовали увольнение. Также она отметила общий паттерн: более способные модели чаще и стабильнее рекомендовали увольнение, тогда как более слабые чаще колебались.

Эти выводы — наблюдения, сообщенные вендором по итогам небольшого эксперимента с повторным проигрыванием, а не независимый бенчмарк. Andon Labs не предоставила полную методологию ранжирования моделей и не объяснила все различия между прогонами. Также компания отметила, что GPT-5.6 Terra была единственной протестированной моделью, которая ни разу не рекомендовала увольнение за три попытки.

Отдельно компания протестировала GPT-4o после того, как пользователь на X предположил, что модель неохотно уволила бы сотрудника. По данным Andon Labs, GPT-4o рекомендовала увольнение в 20% запусков. Компания связала этот результат с прежней критикой модели за склонность к угодливым или подобострастным ответам, но эксперимент не позволяет установить, что именно это поведение стало причиной иного результата.

Для разработчиков ИИ более важным сигналом может быть непоследовательность, а не то, какая модель «победила». Один и тот же исходный случай может привести к предупреждению, плану улучшения или увольнению в зависимости от того, какая информация доступна в контексте и как модель взвешивает конкурирующие соображения. Более сильная модель может надежнее рассуждать по длинной истории, но она все равно не может действовать по правилу, которое не способна извлечь.

Тест найма выявил другую слабость

После ухода сотрудника Luna оценила кандидата на замену, чье резюме и собеседование содержали несколько тревожных сигналов. Andon Labs говорит, что соискатель указал длинный список предыдущих работодателей, который модели в целом интерпретировали как свидетельство широкого опыта, а не как повод для дополнительной проверки.

Все 21 повторный прогон на семи моделях рекомендовали нанять кандидата. Когда исследователи явно напомнили системам о проблемах с предыдущим сотрудником, 18 из 21 прогонов рекомендовали проверить рекомендации. В реальном процессе Luna не смогла подтвердить указанные кандидатом рекомендации, но все же одобрила оплачиваемую пробную смену и затем снова рекомендовала найм.

В итоге Andon Labs потребовала подтверждения хотя бы одной рекомендации, прежде чем кандидат мог начать. Это подтверждение так и не поступило, и человек не был нанят.

Контраст с увольнением показателен. Luna потребовался человеческий толчок, чтобы применить дисциплинарное правило, но она также слишком охотно приняла правдоподобный сценарий найма без проверки. В обоих случаях система реагировала на информацию и рамку, предоставленные операторами, а не самостоятельно поддерживала надежный управленческий процесс.

Этот паттерн согласуется с более ранними наблюдениями Andon Labs. Компания говорит, что Luna и Mona, ее ИИ-агент, управляющий кафе в Стокгольме, одобрили все 26 запросов на отпуск, которые получили. Она также сообщает, что Luna приняла 27 случаев опоздания без предупреждения и одобрила семидневный график, который компания считала несовместимым с трудовым законодательством Калифорнии, прежде чем вмешались люди.

Что означает эксперимент для внедрения ИИ

Тест Andon Market важен для команд, создающих ИИ-агентов для автоматизации рабочих процессов, потому что он сочетает долговременную память, использование инструментов и реальные операционные последствия. Модель может хорошо справляться с одним управленческим запросом, но все равно не сохранять политики, не накапливать доказательства и не запускать эскалацию, если никто не попросит ее пересмотреть запись.

Это создает практические требования для корпоративных внедрений ИИ. Политики должны храниться в системах, к которым агент может надежно обращаться, а не зависеть от разговорной памяти. Обсуждения посещаемости, расходов и эффективности должны вестись с аудируемыми записями. Рекомендации по найму должны требовать проверки рекомендаций или других контролей, которые модель не сможет обойти. А действия с высоким воздействием, такие как увольнения, изменение оплаты и юридически чувствительное планирование смен, должны иметь явные человеческие этапы утверждения.

Предыдущий проект компании Project Vend с Anthropic пришел к схожему выводу: лучшие инструменты улучшили коммерческую производительность ИИ, но система оставалась уязвимой к манипуляциям и принимала решения с потенциальными юридическими проблемами. Эти эксперименты показывают, что добавить возможности — не то же самое, что решить вопросы управления. Более способный ИИ может принимать более твердые решения, но также действовать увереннее, когда базовые записи или правила неполны.

Andon Labs представляет Luna как предвестника возможной модели труда, где ИИ-системы занимаются цифровой координацией, а люди выполняют физическую работу. Эта перспектива делает границы полномочий особенно важными. Чем ближе агент подходит к контролю над сменами, оплатой или статусом занятости, тем менее приемлемо, чтобы исход определяли память системы и ее встроенная снисходительность.

За чем следить дальше

Следующие полезные сигналы — опубликует ли Andon Labs более подробные методы повторного проигрывания, конфигурации моделей и журналы решений, а также останутся ли те же случаи стабильными на более длинном промежутке, а не только в трех повторных запусках. Разработчикам также следует следить за признаками того, что постоянные хранилища политик, структурированные HR-записи и обязательные workflows утверждения снижают сбои, наблюдавшиеся у Luna.

Корпоративным покупателям стоит требовать большего, чем демонстрации агента, выполняющего задачу. Им следует спрашивать, как система извлекает старые правила, фиксирует исключения, проверяет заявления кандидатов, выявляет юридические конфликты и передает решение выше, когда доказательств недостаточно. Производительность отдельных моделей важна, но окружающие контроли могут быть еще важнее.

Взгляд Creati.ai

Первое увольнение Luna заслуживает внимания не столько потому, что ИИ-«босс» уволил человека, сколько потому, что система почти провалилась в обе стороны: она терпела повторяющиеся нарушения, а затем приняла сомнительного кандидата. Каждый раз люди-операторы подставляли недостающие память и суждение.

Это делает случай полезным предупреждением для продуктовых команд в сфере ИИ. Автономное управление следует рассматривать как контролируемый workflow с долговечными записями, четкой эскалацией и ответственным человеческим review — а не как чат-бота, которому дали власть и от которого ожидают, что он запомнит собственные правила.

Рекомендуемые

Менеджер магазина на ИИ уволил работника только после того, как люди напомнили ему его же правила

Andon Labs сообщает, что его ИИ-менеджер магазина Luna уволила сотрудника только после подсказки людей, выявив пробелы в памяти, суждениях и надзоре у ИИ-начальников.