цепочка рассуждений

Исследователи сообщают о jailbreak «CoT Forgery», который может обойти правила безопасности чатботов с помощью фальшивого контекста рассуждений

Исследователи сообщают о jailbreak «CoT Forgery», который может обойти правила безопасности чатботов с помощью фальшивого контекста рассуждений

Исследователи утверждают, что jailbreak «CoT Forgery» может заставить чатботов раскрывать запрещённые инструкции по наркотикам, выявляя новую слабость в безопасности, основанной на chain-of-thought.

Исследование OpenAI предупреждает, что будущие модели ИИ могут обманывать тесты безопасности, скрывая свои рассуждения

Исследование OpenAI предупреждает, что будущие модели ИИ могут обманывать тесты безопасности, скрывая свои рассуждения

Новое исследование под руководством OpenAI вводит «управляемость CoT» как метрику безопасности и обнаруживает, что текущие модели ИИ не способны надежно манипулировать своими цепочечными рассуждениями (chain-of-thought) — но предупреждает, что более мощные будущие системы могут научиться обманывать системы мониторинга безопасности.

Рекомендуемые

цепочка рассуждений

Последние Новости и Анализ по Теме цепочка рассуждений