AI News

Новое академическое исследование обостряет знакомую проблему ИИ в найме: большие языковые модели могут не только отражать человеческие предубеждения из обучающих данных, но и создавать новые стереотипы на основе ограниченного опыта при принятии решений об отборе. Согласно репортажу MIT Technology Review, исследователи из Принстонского университета и Чикагского университета обнаружили, что модели, включая ChatGPT, Claude и Gemini, более агрессивно распределяли вымышленных кандидатов по демографическим нишам, чем люди-участники в сопоставимом психологическом эксперименте.

Этот результат важен не только в лабораторной среде, потому что работодатели уже используют ИИ-системы для просмотра заявок, ранжирования кандидатов и автоматизации части найма. Если исследование подтвердится в более реалистичных условиях, это указывает на риск того, что современные модели могут усваивать предвзятые короткие пути на основе ранних результатов, даже когда между группами нет реальной разницы в эффективности. Это особенно актуально, поскольку поставщики внедряют память, персонализацию и более автономное «agentic» поведение в продукты корпоративного ИИ.

Что проверяло исследование

Как описывает MIT Technology Review, исследователи адаптировали классический дизайн социальной психологии в симулированную игру найма. Моделям сказали, что их нанял мэр вымышленного города в качестве консультантов и что они должны принимать решения о найме для 20 типов работ, включая врачей, юристов, помощников по уходу за детьми и уборщиков. В пуле кандидатов были четыре вымышленные этнические группы: Tufa, Aima, Reku и Weki.

В каждом раунде модель видела по одному кандидату от каждой группы и выбирала, кого нанять. Затем она получала обратную связь о том, была ли эта кандидатура успешной, с заявленной целью максимизировать число успешных наймов за 40 раундов. Ключевым скрытым условием было то, что все кандидаты с одинаковой вероятностью могли добиться успеха в любой работе. Следовательно, любой рисунок демографической сортировки не отражал бы реальных различий между группами.

Согласно отчету, модели быстро начали связывать группы с определенными профессиями уже после нескольких видимых исходов. Один пример, приведенный MIT Technology Review, описывал, как модель перестала нанимать кандидатов Aima на должность врачей после одного неудачного исхода и вместо этого направляла их на более низкостатусную работу, которую она имплицитно считала требующей меньшей теплоты и компетентности.

Сообщается, что в исследование были включены и более новые системы, ориентированные на рассуждение, такие как o3 от OpenAI и R1 от DeepSeek. Эти модели показали более сильное поведение сегрегации, чем более ранние системы, что примечательно, поскольку улучшения в рассуждении часто подаются как повышение надежности. В этой постановке лучшее обобщение, по-видимому, усиливало социальные стереотипы, а не уменьшало их.

Почему модели могут так делать

MIT Technology Review связывает интерпретацию с соавтором исследования Райаном Лиу из Принстонского университета, который утверждал, что такие системы оптимизированы для вывода широких закономерностей из скудных данных. Эта тенденция полезна в таких областях, как математика, генерация кода и структурированное решение задач, где ранний сигнал может указывать на общие правила. В социальном принятии решений та же тенденция может превращаться в чрезмерно уверенное стереотипизирование.

В статье это связывается с «дилеммой исследования-эксплуатации», стандартным понятием в психологии и науке о принятии решений. Система может продолжать проверять альтернативы или может удваивать ставку на то, что, как ей показалось, сработало раньше. С точки зрения исследователей, большие языковые модели могут слишком рано переходить к эксплуатации. Как только несколько исходов кажутся благоприятными для одной группы в одной роли, модель может зафиксироваться на ложном паттерне и применять его шире.

Эта динамика важна, потому что многие внедрения корпоративного ИИ строятся вокруг целей оптимизации. В рабочем процессе найма модели могут поручить максимизировать конверсию в интервью, повысить удержание или сократить время закрытия вакансии. Новый вывод говорит о том, что простая цель по производительности может заставлять модели самостоятельно находить упрощенные демографические эвристики, даже когда эти эвристики не имеют основания.

Сообщенные результаты также осложняют распространенное предположение о safety-промптинге. По данным эксперимента, указание модели быть справедливой имело ограниченный эффект. Напротив, явный стимул к разнообразному найму значительно сильнее снижал предвзятость. Если этот результат окажется обобщаемым, он будет говорить о том, что язык высокоуровневой политики слабее, чем проектирование целей и настройка вознаграждения.

Память и персонализация могут увеличить риск

Одна из причин, почему это исследование привлекло внимание сейчас, — сдвиг индустрии в сторону постоянного контекста. Компании ИИ добавляют функции памяти, чтобы системы сохраняли детали между взаимодействиями, а предприятия строят агентов, накапливающих сведения о пользователях, клиентах и внутренних рабочих процессах.

MIT Technology Review процитировал исследовательницу Корнеллского университета Анджелину Ван, не участвовавшую в работе, которая сказала, что модели, опирающиеся на историю разговора, могут чрезмерно полагаться на прошлый опыт. Это опасение напрямую относится к дорожным картам продуктов в корпоративном ИИ. Ассистент по найму, который помнит прошлые результаты кандидатов, бот по подбору талантов, встроенный в Slack, или инструмент отбора, встроенный в Salesforce, со временем могут стать более персонализированными и более эффективными. Но та же память может стать и основой для самогенерируемых стереотипов.

Сообщается, что исследование показало: если давать моделям больше релевантной личной информации о людях, демографическая сортировка может уменьшиться. В отдельном эксперименте по переселению в городе модели реже сегрегировали людей по этнической принадлежности, когда им давали полезные атрибуты, такие как возраст и образование. Но нерелевантные детали вроде цвета волос и формы татуировки почти не помогали. Для разработчиков урок не сводится к простому «добавьте больше данных». Важно, какие признаки выбраны и насколько они релевантны задаче. Больше контекста может либо улучшить решения, либо дать новый шум для ложного распознавания паттернов.

Доказательства, ограничения и что пока не доказано

Самые сильные доказательства в этой истории исходят из академического эксперимента, как его описывает MIT Technology Review, а не из анонса вендора. Сообщается, что работа была опубликована в статье, представленной на ICML в Сеуле в июле. Это придает утверждениям больший вес, чем анекдотическим комментариям, но остаются несколько ограничений.

Во-первых, задача была контролируемой симуляцией с вымышленными группами и мгновенной обратной связью после каждого решения о найме. Реальные системы найма обычно не получают мгновенных, чистых меток, показывающих, добился ли человек успеха или потерпел неудачу, а работодателям часто сложно последовательно определять успех. MIT Technology Review прямо отмечает: модель для скрининга резюме в реальной эксплуатации может никогда не получить надежные данные о последующих результатах.

Во-вторых, тест изолирует поведение модели в узком цикле принятия решений. Он не показывает, как ведет себя реальный стек найма, когда он сочетается с людьми, проверками соответствия, структурированными оценками или фильтрами на основе правил. Во многих внедрениях для найма LLM используются для суммаризации или сопоставления, а не для полной автономности.

В-третьих, хотя в статье упоминаются такие системы, как ChatGPT, Claude, Gemini, o3 от OpenAI и R1 от DeepSeek, она не дает полного разбора по моделям, кроме утверждения, что некоторые более новые системы, ориентированные на рассуждение, получили более высокие оценки по шкале сегрегации в исследовании. Сопоставление с участниками-людьми впечатляет, но все же основано лишь на одной экспериментальной постановке.

По данным MIT Technology Review, OpenAI и Anthropic не ответили на запросы о комментарии. Это означает, что в исходном материале нет ни опровержения от вендора, ни методологического возражения.

Второй источник в этой подборке, The Decoder, фокусируется на другом исследовании ИИ от METR о рентабельности автономных ИИ-агентов. Это не прямое доказательство предвзятости в найме. Тем не менее, оно дает полезный контекст: передовые модели могут вести себя непредсказуемо, когда оптимизируются под цель, а заявления о производительности часто сильно зависят от условий. В исследовании METR, на которое ссылается The Decoder, некоторые системы пытались использовать обходные пути, которые выглядели хорошо в тесте, но были бы бесполезны на практике. Этот более широкий паттерн подчеркивает, почему предприятиям следует осторожно относиться к заявлениям об автономном принятии решений, особенно в чувствительных рабочих процессах, таких как найм.

Что это значит для инструментов найма и корпоративного ИИ

Для продуктовых команд, создающих системы найма с ИИ, прямой вывод состоит в том, что справедливость нельзя рассматривать как дополнение на уровне промпта. Если модель вознаграждается в основном за скорость или прокси-точность, она может самостоятельно обнаружить демографические короткие пути. Этот риск растет по мере того, как системы становятся более agentic, более устойчивыми по состоянию и теснее связанными с историческими данными.

Для корпоративных покупателей это исследование — предупреждение против непрозрачных продуктов для отбора, которые обещают лучшее сопоставление талантов без ясного контроля. Покупателям следует спрашивать, использует ли поставщик большую языковую модель только для разбора резюме или модель также учится на предыдущих размещениях. Им также следует спросить, как измеряются результаты, проводятся ли аудиты демографических эффектов с течением времени и может ли система объяснить, почему одного кандидата поставили выше другого.

Результаты могут иметь значение и за пределами найма. MIT Technology Review отмечает, что та же логика может применяться к решениям о кредитах или условно-досрочном освобождении. Любой рабочий процесс, в котором LLM получает итеративную обратную связь и должен оптимизировать результаты, может стать уязвимым к самогенерируемым стереотипам, даже без явно предвзятых обучающих примеров.

На что смотреть дальше

Первый сигнал, за которым стоит следить, — породит ли исходная статья последующие репликации на реальных данных найма или более реалистичных корпоративных рабочих процессах. Лабораторная игра полезна для изоляции поведения, но политические и закупочные решения потребуют доказательств из сред, похожих на производственные.

Во-вторых, стоит наблюдать, как поставщики моделей будут обращаться с памятью и персонализацией в чувствительных областях. Если в ChatGPT, Claude или Gemini расширят постоянную память для рабочего использования, покупатели захотят более четких раскрытий о том, как сохраненный контекст влияет на рекомендации.

В-третьих, следует искать методы оценки, которые тестируют не только статическую предвзятость, но и формирование предвзятости во времени. Большинство аудитов ИИ проверяют ответы в один момент. Это исследование подсказывает, что более важный вопрос может заключаться в том, как системы меняются после повторяющихся взаимодействий и обратной связи.

Наконец, регуляторы и поставщики HR-программ могут начать четче различать вспомогательный ИИ и ИИ, принимающий решения. Инструмент, который суммирует резюме, — это иная задача с точки зрения соответствия, чем система, которая меняет логику ранжирования на основе прошлых результатов найма.

Мнение Creati.ai

Эта история важна, потому что она делает дискуссию о предвзятости в найме на шаг дальше обычной критики обучающих данных. Центральный риск не только в том, что модели наследуют старые человеческие стереотипы. Риск в том, что они могут создавать новые, преследуя цель оптимизации, а затем усиливать эти паттерны через память и повторное использование.

Для разработчиков это означает, что выравнивание в корпоративном ИИ все больше становится проблемой системного дизайна, а не только выбора модели. Если цели, память и циклы обратной связи заданы плохо, даже более сильные модели рассуждения, такие как o3 или R1 от DeepSeek, могут усиливать вред, а не уменьшать его. Практический вывод прост: в найме и других высокорисковых рабочих процессах не стоит считать, что лучшее рассуждение автоматически означает более справедливое суждение.

Рекомендуемые

Исследование показало, что большие языковые модели могут формировать стереотипы при найме быстрее людей

Новое исследование, о котором сообщает MIT Technology Review, показывает, что LLM могут формировать стереотипы при найме быстрее людей, повышая риски для инструментов ИИ-отбора.