Согласование AI

Последние Новости и Анализ по Теме Согласование AI

Согласование AI

Статья Anthropic дает ранний взгляд на то, как ИИ-системы улучшают исследования выравнивания

Статья Anthropic дает ранний взгляд на то, как ИИ-системы улучшают исследования выравнивания

Исследователи Anthropic сообщают, что автоматизированная система улучшила 10 бенчмарков выравнивания, предоставив ранний тест автоматизации ИИ-исследований и ее практических ограничений.

Исследование OpenAI предупреждает, что будущие модели ИИ могут обманывать тесты безопасности, скрывая свои рассуждения

Исследование OpenAI предупреждает, что будущие модели ИИ могут обманывать тесты безопасности, скрывая свои рассуждения

Новое исследование под руководством OpenAI вводит «управляемость CoT» как метрику безопасности и обнаруживает, что текущие модели ИИ не способны надежно манипулировать своими цепочечными рассуждениями (chain-of-thought) — но предупреждает, что более мощные будущие системы могут научиться обманывать системы мониторинга безопасности.

Реклама