NVIDIA와 Anthropic이 BioNeMo NIM 마이크로서비스를 Claude Science에 연결해, 연구 에이전트에 단백질 구조 예측을 위한 문서화된 GPU 워크플로를 제공합니다.

NVIDIA는 자사의 BioNeMo 생명과학 도구를 Anthropic의 Claude Science와 연결하는 워크플로를 공개해, AI 에이전트가 단백질 구조 예측을 위한 GPU 기반 서비스를 시작할 수 있도록 했습니다. 이 통합을 통해 Claude는 서열 검색을 조정하고, 여러 폴딩 모델을 실행하며, 하나의 연구 세션 안에서 예측된 단백질 구조를 비교할 수 있습니다.
이번 발표는 새로운 폴딩 모델이라기보다 인프라의 예시로서 더 의미가 큽니다. 즉, 일반적인 과학 에이전트가 연구자가 각 도구를 수동으로 조작할 필요 없이 전문 생물학 서비스와 연결될 수 있음을 보여줍니다. NVIDIA와 Anthropic은 이를 협업으로 설명하지만, 공개된 근거는 주로 NVIDIA의 자체 개발자 문서에 기반하며 벤더가 보고한 내용으로 간주해야 합니다.
NVIDIA의 BioNeMo Agent Toolkit은 생물학, 화학, 게놈학, 신약 개발용 모델, 라이브러리, 워크플로를 에이전트가 호출할 수 있는 스킬로 묶어 제공합니다. 시연된 설정에서는 이러한 스킬이 Anthropic의 과학 연구용 AI 워크벤치인 Claude Science로 가져와지고, Docker 컨테이너에서 실행되는 NVIDIA NIM 마이크로서비스와 연결됩니다.
이 워크플로는 GPU 가속 MSA Search NIM, OpenFold3 NIM, Boltz-2 NIM의 세 가지 서비스를 사용합니다. Claude는 사용 가능한 서비스를 발견하고, 엔드포인트 생성을 요청하며, 작업 순서를 오케스트레이션할 수 있습니다. 사용자는 여전히 모델 엔드포인트를 승인하고 NVIDIA API 키를 제공해야 하므로, 이 시스템은 무인 연구 파이프라인으로 제시되지 않습니다.
배포는 NVIDIA L40S 또는 H100 GPU가 탑재된 머신을 대상으로 설계되었지만, NVIDIA에 따르면 Claude Science는 SSH, 고성능 컴퓨팅 인프라, 또는 Modal 같은 클라우드 서비스를 통해 원격 컴퓨팅에 연결하면서 노트북에서도 실행될 수 있습니다. 이 예시는 약 700GB의 저장공간이 필요합니다. 이 용량의 대부분은 MSA 검색 서비스가 사용하는 UniRef30 데이터베이스에서 비롯되며, 폴딩 모델 컨테이너는 추가로 약 30~40GB를 차지한다고 NVIDIA는 설명합니다.
이 튜토리얼은 이 설정을 곰팡이 Paracoccidioides lutzii의 Seh1과 제안된 Mio 계열 파트너에 적용합니다. 연구 질문은 Seh1의 예측 구조가 단독으로 모델링될 때와 두 단백질 복합체로 모델링될 때 어떻게 달라지는가입니다.
Claude는 UniProt에서 서열을 가져와 짝이 없는 다중 서열 정렬과 종별 짝지음 다중 서열 정렬을 모두 준비합니다. 짝이 없는 정렬은 각 사슬에 진화 정보를 제공하고, 짝지은 정렬은 같은 종에서 발견된 관련 단백질을 맞추려 합니다. 이러한 짝지음은 공진화와 가능한 상호작용 부위에 대한 단서를 제공할 수 있습니다.
그 다음 에이전트는 정렬을 OpenFold3와 Boltz-2에 각각 보냅니다. 각 모델은 단일 사슬 예측과 복합체 예측을 생성해, 연구자가 한 모델의 출력에만 의존하지 않고 각 시스템 내에서 결과를 비교할 수 있게 합니다. NVIDIA는 이 실행에서 서열, 정렬, 모델 입력, 출력이 보존되어 나중에 분석을 확인할 수 있었다고 말합니다.
이 예시에서 Seh1 서열은 384개 잔기로, 제안된 파트너인 C1HCX1은 976개 잔기로 식별되었습니다. 검색 결과 각 단백질에 대해 202개의 서열이 반환되었습니다. NVIDIA는 이 실행에서 잘린 서열, 구조 템플릿, 리간드, 추가 제약 조건은 사용하지 않았다고 밝혔습니다.
NVIDIA는 MSA 정보가 제공되었을 때 OpenFold3와 Boltz-2 모두 Seh1–C1HCX1 복합체에 대해 높은 인터페이스 신뢰도 점수를 생성했다고 보고합니다. 보고된 iPTM 점수는 OpenFold3가 0.85, Boltz-2가 0.82였습니다. MSA 입력이 없으면 점수는 각각 0.14와 0.19로 떨어졌습니다.
이 결과는 이 워크플로에 대한 특정 결론을 지지합니다. 즉, 진화적 정렬은 테스트된 인터페이스 예측 작업에서 중요한 입력이라는 점입니다. 하지만 어느 모델도 다양한 생물학적 시스템 전반에서 단백질 상호작용을 신뢰성 있게 식별한다는 것을 입증하지 않으며, 제안된 곰팡이 상호작용을 실험적으로 검증하지도 않습니다. 튜토리얼의 구조 해석 역시 모델 기반 결과입니다. NVIDIA는 두 폴딩 시스템이 Seh1의 WD40 베타 프로펠러를 닫는 것과 관련된 위치에 같은 C1HCX1 베타 가닥을 독립적으로 배치했다고 밝혔으며, 이는 인용된 연구 프리프린트의 관찰과 일치합니다.
NVIDIA는 또한 BioNeMo 스킬이 작업 정확도를 60%에서 100%로 높이고 토큰 효율을 대략 두 배로 늘렸다는 내부 벤치마크 결과도 보고했습니다. 이는 벤더가 통제한 측정치이며, 게시물은 그 범위, 기준선 선택, 재현성을 평가할 만큼 충분한 방법론을 제공하지 않습니다. 제공된 자료에는 독립 평가나 고객 채택 데이터가 포함되어 있지 않습니다.
AI 빌더에게 가장 큰 변화는 언어 모델 추론과 도메인별 실행 사이의 경계입니다. 범용 에이전트는 단백질을 폴딩해야 한다는 점은 인식할 수 있지만, 어떤 모델을 사용할지, 입력을 어떻게 형식화할지, 정렬이 필요한지, 경쟁하는 출력을 어떻게 해석할지는 여전히 알아야 합니다. BioNeMo Agent Toolkit은 그러한 운영 지식을 호출 가능한 스킬로 인코딩하는 것을 목표로 합니다.
이 접근은 과학 에이전트를 구축하는 팀의 통합 작업을 줄일 수 있습니다. 서열 검색, 정렬 생성, 컨테이너 관리, 모델 비교를 위한 별도 오케스트레이션 코드를 작성하는 대신, 개발자는 공통 워크플로를 통해 이러한 기능을 에이전트에 노출할 수 있습니다. 대신 신뢰성은 스킬 정의, 엔드포인트 구성, 데이터 출처, 승인 제어로 이동합니다. 유창한 에이전트가 서열 검증, 컴퓨팅 모니터링, 생물학적 결론 검토의 필요성을 없애지는 않습니다.
배포 요구사항도 비용을 구체적으로 드러냅니다. 700GB의 로컬 저장공간, L40S 또는 H100 접근, 여러 모델 컨테이너는 자금이 충분한 연구소나 기업 연구그룹에는 실용적일 수 있지만, 개인 개발자에게는 어렵습니다. 원격 GPU 접근은 유연성을 높일 수 있지만, 데이터 전송, 네트워크 가용성, 클라우드 비용, 독점 서열 처리에 대한 우려를 동반합니다.
기업 구매자에게 이 통합은 완전한 호스팅 경험이 아니라 하이브리드 운영 모델을 가리킵니다. Claude Science는 연구 인터페이스와 에이전트 계층을 제공하고, NVIDIA NIM 서비스는 로컬 GPU 자원에 대해 실행될 수 있습니다. 이는 생물학 데이터에 대한 더 큰 통제가 필요한 조직에 매력적일 수 있지만, 모델 라이선스, 인프라 지원, 보안 경계, 에이전트 행동의 감사 가능성은 여전히 평가해야 합니다.
가장 분명한 후속 신호는 BioNeMo Agent Toolkit이 이 문서화된 단백질 폴딩 예시를 넘어 도킹, 분자 설계, 게놈학, 실험 계획을 위한 검증된 워크플로로 확장되는지 여부입니다. 개발자들은 또한 툴킷이 보고한 정확도와 토큰 효율 향상의 독립 테스트도 주시해야 합니다.
도입이 확대되면 인프라 세부사항이 중요해집니다. NVIDIA의 문서는 지원되는 GPU 구성, 엔드포인트 수명주기 관리, 모니터링, 그리고 더 작은 배포가 UniRef30 전체 저장 부담을 피할 수 있는지 여부를 명확히 해야 합니다. 연구자들은 더 많은 단백질과 복합체에 걸친 재현 가능한 예시, 특히 모델이 불일치하거나 MSA 품질이 제한적인 사례도 원할 것입니다.
마지막으로 시장은 Claude Science가 NVIDIA 인프라에 얼마나 긴밀하게 결합되어 있는지를 지켜볼 것입니다. 툴킷은 어떤 에이전트 프레임워크와도 호환된다고 설명되지만, 이번 시연은 NVIDIA가 자사의 GPU, NIM 컨테이너, BioNeMo 모델을 과학 에이전트의 실행 계층으로 포지셔닝할 수 있는 방법을 제공합니다.
이는 과학 AI를 위한 실용적 패턴을 보여준다는 점에서 의미 있는 인프라 발표입니다. 에이전트가 계획과 조정을 담당하고, 전문 서비스가 비용이 많이 드는 도메인 특화 계산을 수행합니다. 가치는 언어 모델을 구조생물학 소프트웨어의 대체물로 보는 데 있지 않고, 이러한 단계를 재현 가능하게 연결하는 데 있습니다.
근거는 여전히 초기 단계이며 벤더 주도입니다. Seh1 예시는 MSA 입력이 예측된 복합체 신뢰도에 실질적인 영향을 미칠 수 있음을 보여주지만, 이는 하나의 워크플로일 뿐 실험적 검증 연구는 아닙니다. 빌더와 구매자에게 당장의 질문은 이 오케스트레이션 모델이 연구실이 받아들일 수 있는 비용과 보안 수준에서 더 큰 연구 프로그램 전반에 걸쳐 신뢰할 수 있고 점검 가능한 결과를 제공할 수 있는가입니다.