GPT-5.6 Sol이 MIT 연구진의 양자 컴퓨팅 실험 자동화를 어떻게 돕고 있는가

OpenAI는 GPT-5.6 Sol과 Codex가 MIT 큐비트를 자율적으로 보정해 반복적인 실험실 작업을 줄이는 동시에, 잡음이 많은 데이터에서 AI 에이전트의 한계를 드러냈다고 말한다.

AI News

OpenAI는 Codex를 통해 실험실 소프트웨어와 연결된 GPT-5.6 Sol이 MIT의 6큐비트 칩에서 일상적인 측정을 자율적으로 수행하고 분석했다고 밝혔다. 이 실험은 양자 컴퓨팅에서 AI 에이전트의 실용적 활용 가능성을 보여준다. 즉, 길고 반복적인 보정 작업을 맡기고 연구자는 실험 설계와 해석에 집중할 수 있게 하는 것이다.

이 작업은 MIT의 Engineering Quantum Systems Group, 즉 EQuS의 대학원생 Beatriz Yankelevich가 수행했다. OpenAI의 설명에 따르면, 시스템은 측정 매개변수를 선택하고 하드웨어를 작동시키며, 생성된 데이터를 평가하고, 측정을 더 다듬을지 다음 단계로 결과를 넘길지 결정했다.

이 결과가 AI 시스템이 최첨단 양자 연구를 독립적으로 수행할 수 있다는 증거는 아니다. 오히려 모델을 기존의 실험실 제어 소프트웨어에 연결해, 엄격하게 정의된 워크플로에서 인간의 감독을 줄일 수 있음을 보여준다. OpenAI는 또한 측정에서 약하거나 잡음이 많은 신호가 나오면 시스템이 어려움을 겪었으며, 이로 인해 현재 자동화가 확장될 수 있는 범위가 제한된다고 보고했다.

큐비트 보정을 에이전트 워크플로로 전환하기

이번 실험은 초전도 큐비트를 대상으로 했는데, 이는 희석 냉동기에서 절대영도에 가깝게 냉각되고 마이크로파 신호로 제어된다. 칩이 설치되고 실험실 전자장비에 연결되면 연구자는 주로 소프트웨어를 통해 이를 운영하므로, 이 환경은 AI가 제어하는 워크플로에 비교적 자연스럽다.

보정에는 서로 의존하는 측정이 포함된다. 연구자는 각 큐비트의 전이 주파수를 찾아야 하고, 제어와 판독에 사용되는 마이크로파 펄스를 조정해야 하며, 큐비트가 양자 정보를 얼마나 오래 유지하는지도 측정해야 한다. 한 측정의 결과는 다음 측정에 사용되는 매개변수에 영향을 줄 수 있다. 큐비트 특성은 드리프트할 수 있고, 물리적 효과로 인해 결과가 일관되지 않을 수도 있다.

Yankelevich는 Codex에 개별 실험을 어떻게 실행하고 평가할지 설명하는 측정 특화 기술을 부여했다. 이후 GPT-5.6 Sol은 그 지침과 칩의 목표값을 사용해 매개변수를 선택하고 시스템을 작동시켰다. 신호가 명확할 때, OpenAI에 따르면 에이전트는 최소한의 개입으로 표준 절차를 완료했다.

그 절차에는 큐비트 전이 주파수 찾기, 제어 및 판독 펄스 보정, 정보 유지 시간 측정이 포함됐다. 이러한 단계는 연구 기준으로는 일상적이지만, 팀이 많은 칩을 특성화할 때는 여전히 며칠이 걸릴 수 있다. EQuS는 제조 성능 평가 과정의 일부로 표준 칩을 제작한다.

이 증거가 보여주는 것, 그리고 보여주지 않는 것

이 이야기에서 가장 강한 주장은 독립적 평가나 동료심사 논문이 아니라 OpenAI의 공식 사례 연구에서 나온 것이다. 회사는 EQuS가 현재 일상적인 측정을 위해 에이전트를 정기적으로 사용하고 있으며, Yankelevich가 밤새 몇 시간 동안 또는 클린룸에서 일하는 동안 에이전트를 돌려둘 수 있다고 보고한다.

따라서 이러한 채택 신호는 공급자 보고에 해당한다. 출처는 성공률, 사람 주도의 보정과의 상세 비교, 총 절감 시간, 컴퓨팅 비용, 실패 빈도를 제공하지 않는다. 또한 동일한 워크플로가 다른 칩 설계, 실험실 제어 시스템 또는 덜 표준화된 실험으로 직접 이전될 수 있는지도 입증하지 않는다.

OpenAI의 자체 설명에는 중요한 한계도 포함되어 있다. GPT-5.6 Sol은 신호가 약하거나 잡음이 많을 때 적절한 매개변수를 찾는 데 더 오래 걸렸고, 때로는 숙련된 연구자의 안내가 필요했다. 회사는 어려운 경우 숙련된 연구자가 여전히 현재 모델보다 더 빨리 효과적인 보정 설정을 식별할 수 있다고 말한다.

이 차이는 중요하다. 이 실험은 정의된 조건에서 유용한 자율성을 보여주지만, 물리 시스템이 예상치 못하게 작동할 때 인간의 감독이 필요 없다는 뜻은 아니다. 모델은 측정 절차를 따르고 코드를 작성하거나 수정할 수 있지만, 왜 실험이 비정상적인 결과를 냈는지 반드시 이해하는 것은 아니다.

이 실험이 AI 빌더와 실험실에 중요한 이유

AI 빌더에게 중요한 설계 패턴은 범용 모델과 도메인 특화 도구 계층의 연결이다. Codex는 냉동기나 칩에 무제한 접근하는 자유로운 비서로 제시되지 않았다. 개별 측정을 위한 기술을 부여받았고, 실험을 조정하는 소프트웨어를 호출할 수 있었다. 이런 구성은 에이전트에게 구조화된 행동 공간을 제공하고, 연구자가 작업을 점검하거나 방향을 바꿀 수 있는 기회를 만든다.

실험실 팀에게 즉각적인 이점은 일상 운영 감시에 쓰는 시간을 줄일 수 있다는 점이다. 연구자는 반복 측정을 위임하고, 결과를 원격으로 확인하며, 실행이 수정되거나 새로운 방향이 필요할 때 개입할 수 있다. 원칙적으로 이는 연구자가 항상 조작 장치 앞에 있을 필요 없이 야간이나 병렬 실험을 더 실용적으로 만들 수 있다.

이 워크플로는 과학 소프트웨어에서 에이전트의 더 넓은 역할도 시사한다. Yankelevich는 OpenAI에 측정, 이론, 칩 설계를 아우르는 인프라를 구축했으며, 여러 에이전트가 서로 다른 문제를 맡을 수 있다고 말했다. 출처는 생산성 영향을 수치화하지 않지만, 각 보정 단계를 수작업으로 진행하기보다 결과 해석, 실험 계획, 코드 검토 쪽으로 연구자의 시간이 이동하고 있음을 설명한다.

기업 및 연구 구매자에게는 모델 접근의 새로움보다 신뢰성이 더 중요하다. 어떤 배포든 하드웨어 제어 권한, 모델 결정 로그 기록, 안전하지 않은 매개변수 선택에 대한 보호장치, 애매한 결과를 사람에게 넘기는 명확한 절차가 필요하다. 실험이 더 비싸거나 취약할수록 불투명한 실패는 더 받아들이기 어렵다.

다음에 주목할 점

다음에 유용한 신호는 여러 칩과 여러 실험실에서의 완료율, 개입 빈도, 시간 절감에 대한 독립적 측정일 것이다. 또한 이러한 시스템이 단지 새 매개변수로 측정을 다시 시도하는 데 그치지 않고 비정상적 행동을 조기에 인식할 수 있는지도 중요하다.

연구자와 구매자는 네 가지 측면에서 증거를 주목해야 한다. 익숙하지 않은 칩 설계로의 이전 가능성, 잡음이 많거나 드리프트하는 조건에서의 성능, 더 많은 실험실 제어 플랫폼과의 통합, 그리고 장시간 실험에서 에이전트를 운영하는 비용이다. 에이전트가 왜 특정 측정을 선택했는지, 그리고 언제 사람이 개입했는지를 보여주는 상세 로그는 특히 가치가 클 것이다.

또 하나의 시험은 에이전트가 새로운 실험을 지원하되, 과제가 지나치게 좁아져 인간이 여전히 과학적 추론의 대부분을 수행하게 되는 상황을 피할 수 있는지이다. OpenAI는 Yankelevich가 새로운 실험에서 더 좁은 목표를 위해 에이전트를 사용하면서도, 코드 작성·테스트·수정 능력에는 더 많이 의존한다고 말한다. 이는 고무적이지만, 이번 사례 연구는 아직 밀접한 전문가 개입 없이 이루어진 자율적 발견이나 검증된 연구 결과를 보여주지는 않는다.

Creati.ai 관점

이 이야기는 AI가 양자 실험을 해결했다는 증거라기보다, 특수한 환경에서의 워크플로 자동화 사례로 이해하는 것이 가장 좋다. GPT-5.6 Sol은 프로세스가 소프트웨어로 제어되고 반복적이며, 알려진 측정 목표에 의해 제한될 때 가장 유용해 보인다. 많은 과학 워크플로가 바로 이런 고비용의 반복 작업 구간을 포함하고 있기 때문에 이는 중요한 배포 대상이다.

더 어려운 질문은 이런 시스템이 일상 운영과 과학적 판단의 경계에서 어떻게 행동하느냐는 것이다. OpenAI의 설명은 잡음이 많은 데이터가 여전히 전문가의 지도를 필요로 한다고 솔직하게 밝힌다. 빌더에게는 이것이 인간 에스컬레이션, 실험 로그, 좁게 범위가 설정된 도구 권한을 핵심 제품 기능으로 만든다. 사후 기능이 아니라. 상업적·연구적 가치는 에이전트가 상당한 시간을 절약하면서도 실험실의 가장 중요한 결정을 검토하기 더 어렵게 만들지 않는지에 달려 있다.

광고