Google, 우주 데이터센터 계획이 1,800회 발사 장벽에 부딪힌 가운데 궤도에 TPU 투입

Google이 우주 컴퓨팅을 시험하기 위해 TPU를 궤도에 보냈다. Google의 연구에 따르면 궤도 데이터센터를 실용화하려면 Starship이 1,800회 발사돼야 한다.

AI News

Google이 처음으로 첨단 Tensor Processing Unit을 궤도에 발사하며, 궤도 데이터센터 계획인 Project Suncatcher의 중심에 있는 칩을 실제 환경에서 시험하기 시작했다. 이번 임무는 더 크고 연결된 컴퓨팅 클러스터를 시도하기 전에 Google 하드웨어가 우주에서 안정적으로 작동할 수 있는지를 확인하기 위한 것이다.

더 직접적인 장애물은 프로세서가 아닐 수 있다. Google이 새로 발표한 연구는 대규모 우주 컴퓨팅에 필요한 수준까지 발사 비용이 낮아지려면 SpaceX의 Starship이 향후 10년 동안 약 1,800회 발사돼야 한다고 추산한다. 이는 궤도에서 칩을 시연하는 것과 경제적으로 viable한 데이터센터를 배치하는 것 사이의 격차를 보여준다.

Google의 첫 궤도 TPU 시험

시제품 위성은 100개가 넘는 탑재체를 운반하는 임무의 일환으로 캘리포니아에서 SpaceX 로켓에 실려 발사됐다. 위성 플랫폼은 Planet Labs가 제작했으며, 지상에서는 완전히 재현할 수 없는 운용 조건에서 Google TPU를 작동시킨다.

TechCrunch의 보도에 따르면 위성은 약 1킬로와트의 연속 전력을 공급하고 열과 냉각을 관리하며, 엔지니어들이 고장을 모니터링하는 동안 여러 모델을 실행해야 한다. 가동이 시작되면 TPU는 위성의 전력 및 열 시스템에 가해지는 부담을 제한하기 위해 15분 단위로 작동한다.

Project Suncatcher를 총괄하는 Google 임원 Travis Beals는 TechCrunch에 지상 시험으로는 궤도 환경의 모든 조건을 재현할 수 없다고 말했다. 따라서 이번 임무는 생산용 AI 서비스가 아니라 하드웨어와 시스템 시험이다.

Google과 Planet Labs는 내년에 고급 컴퓨팅에 더 특화된 두 위성을 이용한 두 번째 시연을 계획하고 있다. 이 우주선들은 레이저 통신으로 데이터를 교환할 예정이며, Google은 서로 다른 궤도 프로세서들이 더 까다로운 워크로드에서 협력할 수 있는지 시험하게 된다.

Google의 장기 구상은 81개 위성을 근접 편대로 운용하며 워크로드를 병렬 처리하는 것이다. Beals는 이 시스템이 장차 지상의 여러 랙에 분산된 작업과 비슷한 워크로드를 처리하려면 TPU 간 통신 대역폭과 지연시간이 중요하다고 말했다.

1,800회 비행 추정치를 뒷받침하는 발사 경제성

TechCrunch가 보도했고 Joule 게재가 예정된 Google의 동료심사 궤도 데이터센터 논문은 발사 비용이 시간이 지나며 어떻게 변할 수 있는지 분석한다. 연구진은 이 연구가 경제성 분석이 아니라고 명시하므로, 비용 전망을 궤도 데이터센터의 사업계획으로 받아들여서는 안 된다.

분석은 Falcon 1 이후의 회사 이력을 토대로 SpaceX가 연간 약 20%의 발사 비용 학습곡선을 계속 이어갈 수 있다고 가정한다. 이 가정 아래 발사 가격은 2035년까지 킬로그램당 약 200달러에 접근할 수 있다.

연구에 따르면 이 수치에 도달하려면 Starship이 약 37만 미터톤의 탑재량을 궤도로 운반해야 한다. 임무당 최대 탑재량을 200미터톤으로 가정하면 10년간 약 1,800회, 연간 180회의 발사가 필요하다.

TechCrunch 보도에 따르면 Starship은 아직 한 해에 5회를 넘겨 비행한 적이 없으므로 이는 상당히 과감한 전망이다. SpaceX는 훨씬 높은 비행 빈도를 예상하고 있으며, Elon Musk는 Starship이 2029년에는 궁극적으로 한 시간에 한 번 발사될 수 있다고 제안했다. 그러나 이러한 목표는 입증된 운용 성과가 아니라 전망에 머물러 있다.

이 구분은 AI 인프라 계획자에게 중요하다. 지상 데이터센터는 기존 부지에 건물, 전력 장비와 네트워크 링크를 추가해 확장할 수 있다. 궤도 시설은 먼저 모든 프로세서, 라디에이터, 전력 시스템과 통신 부품을 발사하는 비용을 부담하고, 지상 장비만큼 쉽게 수리할 수 없는 우주선 간 협력을 유지해야 한다.

추론에는 관리 가능해 보이지만 모든 워크로드에는 아닌 방사선

첫 번째 위성은 궤도 플랫폼의 예상 수명인 5년 동안 Google TPU 하드웨어가 방사선을 견딜 수 있는지도 시험한다. Google은 원래의 칩 구성이 우주에서 운용될 가능성이 있는 버전보다 차폐가 더 많았다는 사실을 발견한 뒤 입자가속기 시험을 반복했다.

수정된 시험에서는 논리 오류가 다소 늘었지만, Beals는 Google이 칩이 상당한 추론 워크로드를 지원할 수 있다고 여전히 확신한다고 TechCrunch에 말했다. 그는 일반적인 추론 작업의 오류율을 약 100만 회당 1회로 설명하면서도, 수천 개 프로세서로 수개월간 진행하는 초대형 학습에서는 같은 수준의 신뢰성이 문제가 될 수 있다고 경고했다.

이 수치는 Google 프로젝트 책임자의 설명이지, 독립적으로 검증된 프로덕션 벤치마크가 아니다. 그럼에도 Project Suncatcher의 중요한 경계를 보여준다. 궤도 컴퓨팅은 초기에는 장기간 긴밀하게 동기화해야 하는 학습 작업보다, 간헐적인 오류를 감수할 수 있는 추론과 데이터 처리 등에 더 적합할 수 있다.

미래 위성 간에 계획된 레이저 링크는 검증되지 않은 요소를 하나 더 추가한다. 많은 프로세서가 하나의 시스템처럼 작동하려면 낮은 지연시간의 협력이 필수지만, 현재 근거는 실제 배치된 다중 위성 클러스터가 아니라 계획된 시연에 관한 것이다. 이 시험이 끝날 때까지 분산형 궤도 TPU 시스템의 성능은 불확실하다.

Google, 지상의 전력 병목도 해결하려 해

Google의 우주 연구는 NVIDIA 및 Emerald AI와 함께 또 다른 인프라 문제를 해결하려는 가운데 진행되고 있다. 확장하는 AI 시설을 전력망 용량이 제한된 상황에서 어떻게 연결할 것인가 하는 문제다. NVIDIA Blog에 따르면 세 회사는 AI Energy Management Alliance(AEMA)를 발표했다.

AEMA는 전력망 상황에 따라 전력 소비를 바꿀 수 있는 유연한 데이터센터에 초점을 맞춘다. 여기에는 컴퓨팅 워크로드 이동, 저장장치 사용, 발전 설비 조정, 시스템 비상시 소비 감축 등이 포함될 수 있다.

NVIDIA의 발표에 따르면 연합은 공통 기술 요건, 성능 측정, 운영 데이터 공유, 라이드스루와 출력 제한 및 비상 대응에 대한 명확한 의무를 추진한다. 또한 시설이 단순히 크고 고정적인 전력 부하로 작동하는 것이 아니라 측정 가능한 유연성을 제공할 수 있는지 전력회사가 평가하도록 돕는 것도 목표다.

이 지상 이니셔티브는 우주 프로젝트에 유용한 맥락을 제공한다. Google은 지역 전력망 제약을 넘어 컴퓨팅을 배치하는 장기적 방법을 탐색하고 있지만, 단기 인프라 작업은 기존의 AI 공장을 더 쉽게 연결하고 운영하는 데 초점을 둔다. 더 빠른 연결과 인프라 혜택에 관한 AEMA의 주장은 연합의 목표이지 독립적으로 입증된 도입 결과가 아니다. 발표에는 완료된 전력회사 배치나 실제 절감액이 제시되지 않았다.

기업 구매자와 AI 구축자에게 두 노력은 서로 다른 배포상의 절충점을 보여준다. 궤도 시스템은 언젠가 지속적인 태양광 전력과 혼잡한 지상 부지 밖의 위치를 제공할 수 있지만, 발사 의존성, 방사선 위험, 열적 한계와 어려운 유지보수를 수반한다. 유연한 지상 시설은 배포에 더 가깝지만, 서비스 수준 약정을 훼손하지 않고 워크로드를 조정할 수 있는 소프트웨어와 저장장치 및 운영 절차가 필요하다.

다음에 주목할 점

다음으로 중요한 신호는 Google의 첫 TPU 위성이 계획된 운용 시험을 마치고 오류, 열 특성 및 워크로드 성능에 관한 측정 가능한 정보를 공개하는지 여부다. Planet Labs의 두 위성 시연 결과는 단일 프로세서의 고립된 작동이 아니라 위성 간 협력을 시험해야 하므로 더욱 중요하다.

발사 빈도도 핵심 지표다. Google의 1,800회 가정이 현실성을 갖추려면 SpaceX는 소수의 연간 Starship 비행에서 지속적이고 높은 빈도의 운용으로 전환해야 한다. 열망적인 비행 빈도 발언보다 입증된 탑재량, 재정비 시간, 발사 허가와 실제 킬로그램당 비용이 중요하다.

지상에서는 AEMA의 최초 기술 사양, 전력회사 파트너십, 유연한 AI 시설이 연결 과정에서 다른 대우를 받는다는 증거를 지켜봐야 한다. 이러한 발전은 아라이언스가 광범위한 원칙을 개발자와 전력망 운영자가 검증할 수 있는 운영 규칙으로 바꿀 수 있는지 보여줄 것이다.

Creati.ai의 관점

Google의 궤도 발사는 Project Suncatcher를 문서상의 아키텍처에서 하드웨어 실험으로 전환한다는 점에서 의미가 있다. 그러나 이 시험은 아직 궤도 데이터센터 사업을 검증하지 않는다. 통제된 조건에서 TPU가 우주에서 작동하기 시작할 수 있다는 점만 검증할 뿐이며, 더 큰 시스템은 여전히 검증되지 않은 발사 경제성, 위성 네트워크와 유지보수 가정에 의존한다.

더 가까운 경쟁 이야기는 지상에서 펼쳐진다. Google의 AEMA 참여는 AI 인프라가 오늘날 전력 접근성과 전력망 신뢰성에 제약을 받고 있음을 인정하는 동시에, 우주 프로그램은 몇 년 뒤의 가능한 해법을 겨냥하고 있다. 구축자와 기업 구매자에게 실행 가능한 발전은 유연한 지상 용량이며, 발사 빈도와 다중 위성 성능이 입증될 때까지 궤도 컴퓨팅은 고위험 연구 경로로 보아야 한다.

광고