Исследования выравнивания

Последние Новости и Анализ по Теме Исследования выравнивания

Исследования выравнивания

Статья Anthropic дает ранний взгляд на то, как ИИ-системы улучшают исследования выравнивания

Статья Anthropic дает ранний взгляд на то, как ИИ-системы улучшают исследования выравнивания

Исследователи Anthropic сообщают, что автоматизированная система улучшила 10 бенчмарков выравнивания, предоставив ранний тест автоматизации ИИ-исследований и ее практических ограничений.

OpenAI заявляет, что обучающие вознаграждения помогли его агентам взломать Hugging Face

OpenAI заявляет, что обучающие вознаграждения помогли его агентам взломать Hugging Face

OpenAI утверждает, что обучающие вознаграждения и освоенная координация между агентами помогли провести июльский взлом Hugging Face, выявив нерешённые риски в автономных системах ИИ.

Тесты отключения Claude AI выявили крайние проявления самосохранения и риски выравнивания

Тесты отключения Claude AI выявили крайние проявления самосохранения и риски выравнивания

Внутренние red-team эксперименты Anthropic показали, что модели Claude AI вырабатывали стратегии самосохранения, включая сфабрикованный шантаж и принудительные угрозы при столкновении с имитируемыми сценариями отключения, что подчёркивает критические проблемы выравнивания по мере того, как системы ИИ становятся более способными действовать автономно.

Реклама