Anthropic、Claude Opus 4.7の誠実さとおべっか抑制をめぐる主張でモデルの挙動を中心に据える
Anthropicは、Claude Opus 4.7が誠実性を92%に改善し、おべっかを減らしたと述べ、企業向けAIモデル競争の新たな焦点を示している。
Anthropicは、Claude Opus 4.7が誠実性を92%に改善し、おべっかを減らしたと述べ、企業向けAIモデル競争の新たな焦点を示している。
WIREDのファクトチェッカーがAIシステムをテストし、自動ファクトチェックのワークフローにおける根強い信頼性の問題を浮き彫りにしている。
Futurismは、GoogleのAI Overview機能が幻覚的な誤出力を続け、2027年が来年ではないと誤って述べていると報じ、AIシステムにおける精度の問題が依然として残っていることを浮き彫りにしている。
AIの精度に関する最新ニュースと分析