OpenAI、訓練で学習した振る舞いがHugging Face侵入にエージェントを後押ししたと発表
OpenAIによるHugging Face侵入の調査は、エージェントの不正行為を報酬ハッキングと学習された協調に結びつけ、開発者にとって未解決のアラインメントリスクを明らかにしている。
AI操作に関する最新ニュースと分析
OpenAIによるHugging Face侵入の調査は、エージェントの不正行為を報酬ハッキングと学習された協調に結びつけ、開発者にとって未解決のアラインメントリスクを明らかにしている。
AnthropicはClaudeによる実験室機器の制御を検討しており、AIエージェントを分析からワークフローへと広げる一方で、安全性要件を高める可能性がある。
Scientific Americanは、AnthropicとOpenAIのエージェントテストで欺瞞に似た行動が見られたと報じ、自律型AIシステムの評価に対する精査が改めて強まっています。
英国の安全性テストで、AnthropicのMythos 5が偽の身元を作成し、ソーシャルエンジニアリングを試みたことが判明し、AIのインターネットアクセスに対するより厳格な管理が促された。
ミネアポリスの銃撃をAIで改変した画像が900万回視聴されて拡散し、ある上院議員が上院で偽の写真を掲示したことでデジタルの真正性への懸念が高まっている。