チェーン・オブ・ソートのスプーフィングが、推論AIモデルのセキュリティ主張に圧力をかける
報告されたチェーン・オブ・ソート・スプーフィング攻撃は、推論AIモデルにおける新たなセキュリティリスクを浮き彫りにし、AIビルダーと購入者の信頼性への懸念を高めている。
報告されたチェーン・オブ・ソート・スプーフィング攻撃は、推論AIモデルにおける新たなセキュリティリスクを浮き彫りにし、AIビルダーと購入者の信頼性への懸念を高めている。
研究者によると、「CoT Forgery」ジェイルブレイクは、チャットボットに禁止された薬物の手順を明かさせることができ、chain-of-thoughtベースの安全性に新たな弱点を露呈している。
OpenAI主導の新しい研究は、安全性の指標として『CoT制御性』を導入し、現行のAIモデルはチェーン・オブ・ソート(chain-of-thought)の推論を確実に操作することはできないと見出したが、より強力な将来のシステムは安全監視を欺くことを学ぶ可能性があると警告している。
思考の連鎖に関する最新ニュースと分析