NVIDIA bringt BioNeMo-Protein-Folding-Workflows zu Claude Science

NVIDIA und Anthropic verbinden BioNeMo-NIM-Mikrodienste mit Claude Science und geben Forschungsagenten einen dokumentierten GPU-Workflow für die Vorhersage von Proteinstrukturen.

AI News

NVIDIA hat einen Workflow veröffentlicht, der seine BioNeMo-Lebenswissenschafts-Tools mit Anthropic’s Claude Science verbindet und es einem KI-Agenten ermöglicht, GPU-gestützte Dienste für die Vorhersage von Proteinstrukturen zu starten. Die Integration erlaubt es Claude, Sequenzsuchen zu koordinieren, mehrere Folding-Modelle auszuführen und vorhergesagte Proteinstrukturen innerhalb einer einzigen Forschungssitzung zu vergleichen.

Die Ankündigung ist weniger als neues Folding-Modell bedeutend denn als Infrastrukturbeispiel: Sie zeigt, wie ein allgemeiner wissenschaftlicher Agent mit spezialisierten Biologie-Diensten verbunden werden kann, ohne dass Forschende jedes Tool manuell bedienen müssen. NVIDIA und Anthropic beschreiben das Setup als Zusammenarbeit, doch die verfügbaren Belege stammen primär aus NVIDIA-eigener Entwicklerdokumentation und sollten als vom Anbieter berichtet betrachtet werden.

Claude Science mit BioNeMo-Diensten verbinden

NVIDIAs BioNeMo Agent Toolkit bündelt Modelle, Bibliotheken und Workflows für Biologie, Chemie, Genomik und Arzneimittelentwicklung als Fähigkeiten, die ein Agent aufrufen kann. In dem demonstrierten Setup werden diese Fähigkeiten in Claude Science importiert, Anthropics KI-Arbeitsumgebung für wissenschaftliche Forschung, und mit NVIDIA-NIM-Mikrodiensten verbunden, die in Docker-Containern laufen.

Der Workflow nutzt drei Dienste: den GPU-beschleunigten MSA Search NIM, den OpenFold3 NIM und den Boltz-2 NIM. Claude kann die verfügbaren Dienste erkennen, anfordern, dass Endpunkte erstellt werden, und die Abfolge der Operationen orchestrieren. Nutzer genehmigen weiterhin die Modellendpunkte und stellen einen NVIDIA-API-Schlüssel bereit, sodass das System nicht als unbeaufsichtigte Forschungspipeline dargestellt wird.

Die Bereitstellung ist für einen Rechner mit einer NVIDIA-L40S- oder H100-GPU ausgelegt, obwohl NVIDIA sagt, dass Claude Science auch auf einem Laptop laufen kann, während es über SSH, High-Performance-Computing-Infrastruktur oder Cloud-Dienste wie Modal mit Remote-Compute verbunden ist. Das Beispiel erfordert rund 700 GB Speicherplatz. Der größte Teil dieses Bedarfs entfällt laut NVIDIA auf die UniRef30-Datenbank, die vom MSA-Suchdienst verwendet wird, während die Container der Folding-Modelle zusätzlich etwa 30 bis 40 GB belegen.

Ein Workflow für Proteinkomplexe, nicht nur ein Modellaufruf

Das Tutorial wendet das Setup auf Seh1 und einen vorgeschlagenen Mio-Familienpartner aus dem Pilz Paracoccidioides lutzii an. Die Forschungsfrage lautet, wie sich Seh1s vorhergesagte Struktur verändert, wenn es allein modelliert wird im Vergleich zu einem Zweiprotein-Komplex.

Claude ruft die Sequenzen von UniProt ab und bereitet sowohl ungepaarte als auch artspezifisch gepaarte Multiple-Sequence-Alignments vor. Die ungepaarten Alignments liefern für jede Kette evolutionäre Informationen, während das gepaarte Alignment versucht, verwandte Proteine zuzuordnen, die in derselben Art gefunden werden. Diese Paarung kann Hinweise auf Ko-Evolution und mögliche Interaktionsstellen liefern.

Der Agent sendet die Alignments dann unabhängig an OpenFold3 und Boltz-2. Jedes Modell erzeugt eine Einzelkettenvorhersage und eine Komplexvorhersage, sodass die Forschenden die Ergebnisse innerhalb jedes Systems vergleichen können, statt sich auf die Ausgabe nur eines Modells zu verlassen. NVIDIA sagt, dass der Lauf die Sequenzen, Alignments, Modelleingaben und -ausgaben beibehielt, damit die Analyse anschließend überprüft werden konnte.

Im Beispiel ist die Seh1-Sequenz 384 Aminosäuren lang und der vorgeschlagene Partner, identifiziert als C1HCX1, 976 Aminosäuren. Die Suche ergab 202 Sequenzen für jedes Protein. NVIDIA sagt, dass der Lauf keine gekürzten Sequenzen, Strukturvorlagen, Liganden oder zusätzlichen Einschränkungen verwendete.

Was die berichteten Ergebnisse zeigen

NVIDIA berichtet, dass sowohl OpenFold3 als auch Boltz-2 bei Bereitstellung von MSA-Informationen hohe Interface-Vertrauenswerten für den Seh1–C1HCX1-Komplex erzeugten. Die berichteten iPTM-Werte lagen bei 0,85 für OpenFold3 und 0,82 für Boltz-2. Ohne die MSA-Eingabe fielen die Werte jeweils auf 0,14 und 0,19.

Diese Ergebnisse stützen eine spezifische Schlussfolgerung über diesen Workflow: Die evolutionäre Ausrichtung ist eine kritische Eingabe für die getestete Aufgabe der Schnittstellenvorhersage. Sie belegen nicht, dass eines der Modelle Proteininteraktionen über biologische Systeme hinweg zuverlässig identifizieren wird, und sie validieren die vorgeschlagene Pilzinteraktion auch nicht experimentell. Die strukturelle Interpretation im Tutorial ist ebenfalls ein modellbasierter Befund. NVIDIA sagt, dass beide Folding-Systeme unabhängig dieselben C1HCX1-Beta-Stränge an der Position platzierten, die mit dem Schließen von Seh1s WD40-Beta-Propeller assoziiert ist, was mit einer Beobachtung aus dem zitierten Forschungs-Preprint übereinstimmt.

NVIDIA berichtet außerdem interne Benchmark-Ergebnisse, bei denen BioNeMo-Fähigkeiten die Aufgabenkorrektheit von 60 % auf 100 % erhöhten und die Token-Effizienz ungefähr verdoppelten. Dies sind vom Anbieter kontrollierte Messungen; der Beitrag liefert nicht genug Methodik, um ihren Umfang, die Auswahl der Basislinie oder die Reproduzierbarkeit zu beurteilen. In den verfügbaren Quellen sind keine unabhängige Bewertung und keine Kundennutzungsdaten enthalten.

Warum die Integration für Entwickler und Forschungsteams wichtig ist

Für KI-Entwickler ist die wichtigste Veränderung die Grenze zwischen Sprachmodell-Argumentation und domänenspezifischer Ausführung. Ein Agent für allgemeine Zwecke kann erkennen, dass ein Protein gefaltet werden sollte, muss aber dennoch wissen, welches Modell zu verwenden ist, wie die Eingaben zu formatieren sind, ob eine Ausrichtung erforderlich ist und wie konkurrierende Ausgaben zu interpretieren sind. Das BioNeMo Agent Toolkit soll dieses Betriebswissen als aufrufbare Fähigkeiten kodieren.

Dieser Ansatz könnte den Integrationsaufwand für Teams reduzieren, die wissenschaftliche Agenten bauen. Statt separaten Orchestrierungscode für Sequenzabruf, Generierung von Alignments, Containerverwaltung und Modellvergleich zu schreiben, können Entwickler diese Fähigkeiten einem Agenten über einen gemeinsamen Workflow bereitstellen. Der Kompromiss besteht darin, dass die Zuverlässigkeit in die Fähigkeitsdefinitionen, die Endpunktkonfiguration, die Datenherkunft und die Genehmigungskontrollen verlagert wird. Ein flüssig agierender Agent ersetzt nicht die Notwendigkeit, Sequenzen zu validieren, Rechenressourcen zu überwachen oder biologische Schlussfolgerungen zu prüfen.

Auch die Bereitstellungsanforderungen machen die Kosten konkret. Ein lokaler Speicherbedarf von 700 GB, Zugang zu einer L40S oder H100 und mehrere Modellcontainer mögen für ein gut finanziertes Labor oder eine Unternehmensforschungsgruppe praktikabel sein, für einzelne Entwickler jedoch schwierig. Der Remote-Zugriff auf GPUs kann die Flexibilität erhöhen, bringt aber Bedenken hinsichtlich Datenübertragung, Netzverfügbarkeit, Cloud-Kosten und dem Umgang mit proprietären Sequenzen mit sich.

Für Unternehmenskunden verweist die Integration auf ein hybrides Betriebsmodell statt auf eine vollständig gehostete Erfahrung. Claude Science liefert die Forschungsoberfläche und die Agentenschicht, während NVIDIA-NIM-Dienste gegen lokale GPU-Ressourcen laufen können. Das könnte Organisationen ansprechen, die mehr Kontrolle über biologische Daten benötigen, aber sie müssen dennoch Modelllizenzen, Infrastrukturunterstützung, Sicherheitsgrenzen und die Nachvollziehbarkeit von Agentenaktionen bewerten.

Worauf als Nächstes zu achten ist

Das klarste Folgesignal wird sein, ob das BioNeMo Agent Toolkit über dieses dokumentierte Protein-Folding-Beispiel hinaus in validierte Workflows für Docking, molekulares Design, Genomik oder Versuchsplanung expandiert. Entwickler sollten auch unabhängige Tests der berichteten Korrektheits- und Token-Effizienzgewinne des Toolkits beobachten.

Mit wachsender Akzeptanz werden Infrastrukturdaten wichtig. NVIDIAs Dokumentation sollte unterstützte GPU-Konfigurationen, das Lebenszyklusmanagement von Endpunkten, Monitoring und die Frage klären, ob kleinere Bereitstellungen die volle UniRef30-Speicherlast vermeiden können. Forschende werden außerdem reproduzierbare Beispiele über mehr Proteine und Komplexe hinweg wünschen, insbesondere Fälle, in denen Modelle uneinig sind oder die MSA-Qualität begrenzt ist.

Schließlich wird der Markt beobachten, wie eng Claude Science an NVIDIAs Infrastruktur gekoppelt bleibt. Das Toolkit wird als mit jedem Agenten-Framework kompatibel beschrieben, doch diese Demonstration gibt NVIDIA die Möglichkeit, seine GPUs, NIM-Container und BioNeMo-Modelle als Ausführungsschicht für wissenschaftliche Agenten zu positionieren.

Creati.ai-Perspektive

Dies ist eine bedeutende Infrastrukturankündigung, weil sie ein praktikables Muster für wissenschaftliche KI demonstriert: Ein Agent übernimmt Planung und Koordination, während spezialisierte Dienste die teure, domänenspezifische Berechnung durchführen. Der Wert liegt darin, diese Schritte reproduzierbar zu verbinden, nicht darin, das Sprachmodell als Ersatz für Software der Strukturbiologie zu behandeln.

Die Belege sind weiterhin früh und vom Anbieter geprägt. Das Seh1-Beispiel zeigt, dass MSA-Eingaben die vorhergesagte Komplexvertrauenswürdigkeit erheblich beeinflussen können, aber es handelt sich um einen einzelnen Workflow und nicht um eine experimentelle Validierungsstudie. Für Entwickler und Käufer ist die unmittelbare Frage, ob dieses Orchestrierungsmodell zuverlässige, überprüfbare Ergebnisse über größere Forschungsprogramme hinweg zu einem Kosten- und Sicherheitsprofil liefern kann, das Labore akzeptieren können.

Anzeigen