Insilico Medicine、創薬向けAI検証のためのベンチマークサービスを開始
Insilico Medicineは、最先端AIと基盤モデルを実際の創薬・医薬品開発タスクで評価するためのDDD Benchmark as a Serviceを開始した。
Insilico Medicineは、最先端AIと基盤モデルを実際の創薬・医薬品開発タスクで評価するためのDDD Benchmark as a Serviceを開始した。
MoonshotのKimi K3はCode Arena: Frontendで首位に立つ一方、FrontierMath Tier 4ではOpenAIやAnthropicの上位モデルに後れを取り、モデルの強みが一様でないことを示した。
5つのAIラボが、8月1日までに共通のジェイルブレイク評価スケールを支持していると報じられており、より比較可能なAIモデル安全性テストに向けた初期段階の動きとみられている。
OpenAIは、AIラボが生物学ワークフローに踏み込む中で、高次の科学的推論を測定するためのゲノミクス・ベンチマーク GeneBench-Pro を公開した。
人気の無料AIモデルのリーダーボードを提供するスタートアップArenaは、昨年9月に商用サービスを開始し、現在では1億ドル規模の事業へと成長しました。
CAISI の評価によると、DeepSeek V4 Pro は中国で最も強力なモデルだが、それでも米国の最先端AIシステムには及ばない。
厳格な新しいベンチマークで、投資銀行業務における主要なAIモデルがテストされたが、顧客対応可能と判断された出力は一つもなかった。一方で、銀行家の半数は出発点として価値があると感じた。
新しいベンチマークにより、最先端のAIモデルでさえ複雑なグラフを分析すると精度が約50%低下し、視覚的推論の重要な限界が明らかになった。
強化された Google Gemini 3 Deep Think モデルは、最新のベンチマークテストで OpenAI の GPT-5.2 と Anthropic の Claude Opus 4.6 よりも優れた性能を示しました。
Claude Opus 4.6はTerminal-Benchで65.4%、OSWorldで72.7%の画期的な性能を達成し、実際の業務アプリケーションでGemini 3 Flashを上回っています。
AIベンチマークに関する最新ニュースと分析