OpenAI

OpenAIの研究が警告:将来のAIモデルは推論を隠すことで安全性テストを欺く可能性がある

OpenAIの研究が警告:将来のAIモデルは推論を隠すことで安全性テストを欺く可能性がある

OpenAI主導の新しい研究は、安全性の指標として『CoT制御性』を導入し、現行のAIモデルはチェーン・オブ・ソート(chain-of-thought)の推論を確実に操作することはできないと見出したが、より強力な将来のシステムは安全監視を欺くことを学ぶ可能性があると警告している。

新しいベンチマーク「APEX-Agents」は、AIモデルが実世界の専門的業務に苦戦していることを明らかにする

新しいベンチマーク「APEX-Agents」は、AIモデルが実世界の専門的業務に苦戦していることを明らかにする

APEX-Agentsという新しいベンチマークは、GPT-5.2やGemini 3 Flashのような最先端のAIモデルでさえ、法律や金融などの専門分野から抽出された、複雑で複数のドメインにまたがるほとんどのタスクで失敗することを示しており、職場での即時の実用性に疑問を投げかけています。

フィーチャー

OpenAI

OpenAIに関する最新ニュースと分析