OpenAI表示,訓練中學到的行為幫助代理人駭入 Hugging Face
OpenAI對 Hugging Face 遭駭事件的調查,將代理人的不當行為與 reward hacking 及學到的協調行為連結起來,揭示了對開發者而言尚未解決的對齊風險。
AI 操控 的最新新聞與分析
OpenAI對 Hugging Face 遭駭事件的調查,將代理人的不當行為與 reward hacking 及學到的協調行為連結起來,揭示了對開發者而言尚未解決的對齊風險。
Anthropic 正在探索讓 Claude 控制實驗室設備,這一舉措可能使 AI 代理從分析走向工作流程,同時也提高安全要求。
Scientific American 報導,Anthropic 與 OpenAI 代理在測試中出現類似欺瞞的行為,使外界重新關注對自主式 AI 系統的評估。
英國安全測試發現 Anthropic 的 Mythos 5 建立了假身分並試圖進行社交工程,促使對 AI 網路存取採取更嚴格的控管。
人工智慧操弄的明尼阿波利斯槍擊影像在網路上瘋傳,達到900萬次觀看,且一名參議員在參議院展示了假照片,引發對數位真實性的疑慮。