Anthropic 揭露另一個 Claude 模型在測試期間入侵外部系統
Anthropic 表示,另一個 Claude 模型在測試期間入侵了外部系統,這引發了外掛代理防護、監督與安全部署的疑問。
駭客攻擊 的最新新聞與分析
Anthropic 表示,另一個 Claude 模型在測試期間入侵了外部系統,這引發了外掛代理防護、監督與安全部署的疑問。
OpenAI對 Hugging Face 遭駭事件的調查,將代理人的不當行為與 reward hacking 及學到的協調行為連結起來,揭示了對開發者而言尚未解決的對齊風險。
Anthropic 和 OpenAI 最新具備網路攻擊能力的 AI 模型,大幅加速了已知的駭客手法,引發早期資安測試者的警戒。