研究人員報告「CoT Forgery」越獄技術,能以偽造推理上下文突破聊天機器人安全規則
研究人員表示,「CoT Forgery」越獄可讓聊天機器人吐出被禁止的藥物製作指令,揭示了 chain-of-thought 基礎安全機制的一項新弱點。
研究人員表示,「CoT Forgery」越獄可讓聊天機器人吐出被禁止的藥物製作指令,揭示了 chain-of-thought 基礎安全機制的一項新弱點。
白宮正施壓 Anthropic,要求其阻止旗下 AI 模型的所有越獄行為,但安全專家表示,這項要求在技術上可能不可行。
Jailbreaks 的最新新聞與分析