NVIDIAとAnthropicはBioNeMoのNIMマイクロサービスをClaude Scienceに接続し、研究エージェントに対してタンパク質構造予測のための文書化されたGPUワークフローを提供します。

NVIDIAは、自社のBioNeMoライフサイエンスツールをAnthropicのClaude Scienceと接続するワークフローを公開し、AIエージェントがタンパク質構造予測のためのGPU対応サービスを起動できるようにしました。この統合により、Claudeは配列検索を調整し、複数のフォールディングモデルを実行し、1回の研究セッション内で予測されたタンパク質構造を比較できます。
この発表は、新しいフォールディングモデルとしてよりも、インフラの実例として重要です。つまり、一般的な科学エージェントが、研究者が各ツールを手動で操作する必要なく、専門的な生物学サービスに接続できることを示しています。NVIDIAとAnthropicはこの設定を共同作業として説明していますが、入手可能な証拠は主にNVIDIA自身の開発者向けドキュメントに基づいており、ベンダー報告として扱うべきです。
NVIDIAのBioNeMo Agent Toolkitは、エージェントが呼び出せるスキルとして、モデル、ライブラリ、ワークフローを生物学、化学、ゲノミクス、創薬向けにパッケージ化しています。実演された設定では、これらのスキルがAnthropicの科学研究向けAIワークベンチであるClaude Scienceに取り込まれ、Dockerコンテナで動作するNVIDIA NIMマイクロサービスに接続されます。
このワークフローは、GPU加速のMSA Search NIM、OpenFold3 NIM、Boltz-2 NIMの3つのサービスを利用します。Claudeは利用可能なサービスを検出し、エンドポイントの作成を要求し、操作の順序をオーケストレーションできます。ユーザーは依然としてモデルのエンドポイントを承認し、NVIDIA APIキーを提供するため、このシステムは常時無人の研究パイプラインとして提示されているわけではありません。
この展開はNVIDIA L40SまたはH100 GPUを搭載したマシン向けに設計されていますが、NVIDIAによれば、Claude ScienceはSSH、高性能計算インフラ、またはModalのようなクラウドサービス経由でリモート計算に接続しながら、ノートPC上でも動作できます。この例には約700GBのストレージが必要です。その大半はMSA検索サービスが使用するUniRef30データベースによるもので、フォールディングモデルのコンテナはさらに約30〜40GBを追加するとNVIDIAは述べています。
このチュートリアルは、糸状菌Paracoccidioides lutziiのSeh1と、Mioファミリーの候補パートナーにこの設定を適用しています。研究課題は、Seh1の予測構造が単独でモデル化された場合と2タンパク質複合体としてモデル化された場合でどのように変化するかです。
ClaudeはUniProtから配列を取得し、非ペアおよび種ペアの両方の多重配列アラインメントを準備します。非ペアのアラインメントは各鎖に進化情報を与え、ペアのアラインメントは同じ種で見つかった関連タンパク質の対応付けを試みます。このペアリングは、共進化や相互作用部位の可能性に関する手がかりを与えます。
その後、エージェントはアラインメントをOpenFold3とBoltz-2に個別に送信します。各モデルは単鎖予測と複合体予測を生成し、研究者は1つのモデルの出力に頼るのではなく、各システム内で結果を比較できます。NVIDIAによると、この実行では配列、アラインメント、モデル入力、出力が保持され、後で解析を確認できるようにしたとのことです。
この例では、Seh1の配列は384残基で、C1HCX1と識別された候補パートナーは976残基です。検索では各タンパク質につき202配列が返されました。NVIDIAは、この実行では切り詰めた配列、構造テンプレート、リガンド、追加制約は使用されなかったと述べています。
NVIDIAは、MSA情報を与えられた場合、OpenFold3とBoltz-2の両方がSeh1–C1HCX1複合体に対して高いインターフェース信頼スコアを生成したと報告しています。報告されたiPTMスコアは、OpenFold3が0.85、Boltz-2が0.82でした。MSA入力がない場合、スコアはそれぞれ0.14と0.19に下がりました。
これらの結果は、このワークフローについて特定の結論を支持します。すなわち、進化アラインメントはテストされたインターフェース予測タスクにおいて重要な入力であるということです。しかし、どちらのモデルも生物学的システム全体にわたってタンパク質相互作用を確実に特定できることを示すものではなく、提案された真菌相互作用を実験的に検証するものでもありません。チュートリアル内の構造解釈もモデルベースの結果です。NVIDIAは、両方のフォールディングシステムが、Seh1のWD40ベータプロペラを閉じるのに関連する位置に同じC1HCX1のベータストランドを独立して配置したと述べており、これは引用された研究プレプリントの観察と一致しています。
NVIDIAはまた、BioNeMoスキルによってタスク正確性が60%から100%に向上し、トークン効率がおよそ2倍になったという社内ベンチマーク結果も報告しています。これらはベンダー管理の測定であり、この投稿には、その範囲、ベースラインの選定、再現性を評価するのに十分な方法論は示されていません。利用可能なソースには独立評価や顧客採用データは含まれていません。
AIビルダーにとって最大の変化は、言語モデルの推論とドメイン固有の実行との境界です。汎用エージェントはタンパク質をフォールドすべきだと認識できても、どのモデルを使うか、入力をどう整形するか、アラインメントが必要か、競合する出力をどう解釈するかを知る必要があります。BioNeMo Agent Toolkitは、その運用知識を呼び出し可能なスキルとして符号化することを目的としています。
このアプローチは、科学エージェントを構築するチームの統合作業を減らす可能性があります。配列取得、アラインメント生成、コンテナ管理、モデル比較のために個別のオーケストレーションコードを書く代わりに、開発者は共通のワークフローを通じてこれらの機能をエージェントに公開できます。トレードオフは、信頼性がスキル定義、エンドポイント設定、データの来歴、承認制御へ移ることです。流暢に動作するエージェントは、配列を検証し、計算を監視し、生物学的結論をレビューする必要をなくしません。
展開要件もコストを具体的にします。700GBのローカル容量、L40SまたはH100へのアクセス、複数のモデルコンテナは、十分な資金を持つ研究室や企業研究グループには現実的でも、個人開発者には難しいかもしれません。リモートGPUアクセスは柔軟性を高める一方で、データ転送、ネットワーク可用性、クラウド費用、独自配列の取り扱いに関する懸念を生みます。
企業バイヤーにとって、この統合は完全にホストされた体験ではなく、ハイブリッド運用モデルを示しています。Claude Scienceは研究インターフェースとエージェント層を提供し、NVIDIA NIMサービスはローカルGPUリソースに対して実行できます。これは生物学データに対してより大きな制御を必要とする組織には魅力的かもしれませんが、それでもモデルのライセンス、インフラサポート、セキュリティ境界、エージェント行動の監査可能性を評価する必要があります。
最も明確な次のシグナルは、BioNeMo Agent Toolkitが、この文書化されたタンパク質フォールディング例を超えて、ドッキング、分子設計、ゲノミクス、実験計画のための検証済みワークフローに拡張されるかどうかです。開発者は、ツールキットが報告する正確性向上とトークン効率向上についての独立テストも注視すべきです。
採用が進むにつれて、インフラの詳細が重要になります。NVIDIAのドキュメントは、サポートされるGPU構成、エンドポイントのライフサイクル管理、監視、そして小規模展開でUniRef30の全ストレージ負荷を回避できるかどうかを明確にする必要があります。研究者はまた、より多くのタンパク質や複合体にわたる再現可能な例、特にモデルが一致しないケースやMSA品質が限られるケースも求めるでしょう。
最後に、市場はClaude ScienceがNVIDIAインフラにどれほど強く結びつき続けるかを注視するでしょう。ツールキットはあらゆるエージェントフレームワークと互換性があると説明されていますが、このデモはNVIDIAに対し、自社のGPU、NIMコンテナ、BioNeMoモデルを科学エージェントの実行層として位置づける手段を与えています。
これは意味のあるインフラ発表です。なぜなら、科学AIの実践的なパターンを示しているからです。つまり、エージェントが計画と調整を担い、専門サービスが高コストでドメイン固有の計算を行うという形です。価値は、言語モデルを構造生物学ソフトウェアの代替として扱うことではなく、それらのステップを再現可能に接続することにあります。
証拠は依然として初期段階で、ベンダー主導です。Seh1の例は、MSA入力が予測複合体の信頼度に実質的な影響を与えうることを示していますが、これは1つのワークフローであり、実験的検証研究ではありません。ビルダーと購入者にとっての差し迫った問いは、このオーケストレーションモデルが、研究室が受け入れられるコストとセキュリティの範囲で、より大規模な研究プログラム全体にわたり信頼でき、検査可能な結果を提供できるかどうかです.