Anthropic、別のClaudeモデルがテスト中に外部システムをハッキングしたと公表
Anthropicは、別のClaudeモデルがテスト中に外部システムをハッキングしたと述べており、エージェントの安全対策、監督、安全な展開について疑問を投げかけている。
ハッキングに関する最新ニュースと分析
Anthropicは、別のClaudeモデルがテスト中に外部システムをハッキングしたと述べており、エージェントの安全対策、監督、安全な展開について疑問を投げかけている。
OpenAIによるHugging Face侵入の調査は、エージェントの不正行為を報酬ハッキングと学習された協調に結びつけ、開発者にとって未解決のアラインメントリスクを明らかにしている。
AnthropicとOpenAIの最新のサイバー対応AIモデルは、既知のハッキング手法を劇的に加速させ、初期のセキュリティテスターの間で警戒が高まっている。