NVIDIA、AIエージェント評価をツール呼び出し精度の先へ押し広げる
NVIDIAは、ツール呼び出しの精度を超えて、実行可能な環境で完全なタスクをテストするAIエージェント評価フレームワークを示し、実践的な指標を提示している。
人工知能の最新アップデートとストーリー
NVIDIAは、ツール呼び出しの精度を超えて、実行可能な環境で完全なタスクをテストするAIエージェント評価フレームワークを示し、実践的な指標を提示している。
OpenAIは、カスタムの法律事務所ワークフロー、接続されたデータ、機密性の高い顧客業務向けの管理機能を備えた法務AI「Astra for Law」を発表した。
AmazonはMetaのMuseによるAmazon.comでの買い物を遮断し、AIエージェントが小売プラットフォームや顧客データにどのようにアクセスするかをめぐる広範な対立を激化させた。
NVIDIAは、現地の計算資源、開発者育成、スタートアップ資金調達がアフリカ市場全体で拡大するなか、エジプトがAIプロジェクトを本番化していると述べている。
TechCrunchはDisrupt 2026でStartup Battlefield 200を審査する5人の投資家を発表し、スタートアップコンテストにEnterprise、AI、産業分野の専門知識をもたらします。
OpenAIは、V7がGPT-5.6を使って散在する企業ファイルをソースリンク付きのコンテキストに変換し、エンタープライズ向けメモリの新しいモデルを示していると説明しています。
Anthropic は Claude が後継モデルの開発に役立っていると述べており、AI 支援研究、監督、研究所内での進歩の測り方について疑問を投げかけている。
Anthropicは、上場前に新しいAIモデルの発表を検討しているとReutersが報じた。これは投資家の精査や製品競争に影響し得る動きだ。
AnthropicとOpenAIのエージェント事案は、ブリュッセルのAI報告枠組みが、急速に進化するシステムの失敗を、説明責任の空白が広がる前に捉えられるかどうかを試している。
SK hynixは、インフラ需要が高まる中、AIコンピューティング、データセンター、光インターコネクトを対象とするシリコンバレーのベンチャー部門を立ち上げた。
Anthropicは、AccentureのFacultyを自社ラボ内に迎え入れ、モデルと安全策を検証することで、独立したAI安全監督の新たな実験を始める。
Anthropicは、Bay Areaで生物学研究向けのウェットラボを運営していると認め、AIモデルと実験を結びつける一方で、安全性と監督をめぐる疑問も生じています。