Google 已將 TPU 送入軌道以測試太空運算,而其研究顯示,Starship 需要發射 1,800 次,軌道資料中心才可能具備實用性。

Google 首次將先進的 Tensor Processing Unit 發射至軌道,開始對其 Project Suncatcher 軌道資料中心計畫核心晶片進行實地測試。這項任務旨在確認 Google 硬體能否可靠地在太空運作,之後公司才會嘗試更大型、彼此連接的運算叢集。
眼前更直接的障礙可能不是處理器。Google 最新發表的研究估計,SpaceX 的 Starship 在未來十年需要發射約 1,800 次,才能將足夠的有效載荷送入軌道,讓發射價格接近大規模太空運算所需的水準。這項預測凸顯了「證明晶片能在軌道運作」與「在軌道部署具經濟可行性的資料中心」之間的差距。
原型衛星搭乘 SpaceX 火箭從加州發射升空,是一項攜帶超過 100 個有效載荷的任務之一。Planet Labs 建造了衛星平台,該平台將在地面無法完全重現的操作條件下運行 Google TPU。
根據 TechCrunch 對這項任務的報導,衛星必須提供約一千瓦的持續電力、管理熱量與冷卻,並在工程師監控故障的同時執行一系列模型。TPU 啟用後將以 15 分鐘為一個運作週期,以限制對衛星電力與熱控系統造成的壓力。
負責監督 Project Suncatcher 的 Google 高層 Travis Beals 告訴 TechCrunch,地面測試無法重現軌道環境的所有條件。因此,這項任務是硬體與系統測試,而不是生產環境中的 AI 服務。
Google 與 Planet Labs 計畫明年進行第二次示範,使用兩枚更針對先進運算而設計的衛星。預計這些太空船會透過雷射通訊交換資料,讓 Google 測試分離的軌道處理器能否在更高負載的工作任務上協同運作。
Google 的長期構想是讓 81 枚衛星以緊密編隊飛行,並平行處理工作負載。Beals 表示,如果未來系統要處理相當於地面多個機架所分擔的工作負載,TPU 之間的通訊頻寬與延遲將十分重要。
Google 關於軌道資料中心的同儕審查論文由 TechCrunch 報導,並預定刊登於 Joule,內容研究發射成本可能如何隨時間變化。研究人員明確表示,這不是經濟可行性研究,因此其中的成本預測不應被視為軌道資料中心的商業計畫。
這項分析假設 SpaceX 能根據自 Falcon 1 以來的公司歷史,繼續維持每年約 20% 的發射成本學習曲線。在此假設下,到 2035 年發射價格可能接近每公斤 200 美元。
研究指出,要達到這一數字,Starship 必須將約 37 萬公噸的有效載荷送入軌道。若假設每次任務最大載荷為 200 公噸,十年內就需要約 1,800 次發射,也就是每年 180 次。
對一款根據 TechCrunch 報導、尚未曾在單一年份飛行超過五次的載具而言,這是相當高的預測。SpaceX 曾預測高得多的飛行頻率,而 Elon Musk 也曾表示,Starship 最終可能在 2029 年達到每小時發射一次。不過,這些仍是預測,而非已證明的營運表現。
這項區分對 AI 基礎設施規劃者很重要。地面資料中心可以透過在現有地點增加建築、電力設備與網路連線來擴展。軌道設施則必須先支付每個處理器、散熱器、電力系統與通訊元件的發射費用,之後還要維持太空船之間的協同,而這些太空船不像地面設備那麼容易維修。
第一枚衛星也在測試 Google TPU 硬體能否在軌道平台預期五年的壽命期間承受輻射。Google 發現原始晶片配置的遮蔽程度高於可能在太空運作的版本後,重新進行了粒子加速器測試。
修訂後的測試產生了略多的邏輯錯誤,但 Beals 告訴 TechCrunch,Google 仍相信這些晶片能支援大量推論工作負載。他將一般推論操作的錯誤率描述為約每百萬次一次,同時警告,對於使用數千個處理器、持續數月的超大型訓練工作而言,同等程度的可靠性會造成問題。
這些數據來自 Google 專案主管的說法,並非經獨立驗證的生產環境基準測試。不過,它們仍界定了 Project Suncatcher 的重要界線:軌道運算初期可能更適合推論、資料處理,以及能容忍偶發錯誤的其他工作負載,而不是長時間、嚴格同步的訓練工作。
未來衛星之間規畫的雷射鏈路又引入了另一個尚未驗證的元素。當許多處理器作為單一系統運作時,低延遲協同至關重要,但目前的證據涵蓋的是計畫中的示範,而不是已部署的多衛星叢集。在測試完成前,分散式軌道 TPU 系統的效能仍不確定。
Google 的太空研究正值公司與 NVIDIA、Emerald AI 合作處理另一項基礎設施問題之際:如何將不斷擴大的 AI 設施連接至供電受限的電網。根據 NVIDIA Blog 的文章,三家公司宣布成立 AI Energy Management Alliance(AEMA)。
AEMA 的重點是能根據電網狀況調整用電量的彈性資料中心。該聯盟提出多種可能機制,包括轉移運算工作負載、使用儲能、協調配套發電,以及在系統緊急情況下減少用電。
NVIDIA 的公告表示,該聯盟將推動共同的技術要求、效能衡量、營運資料共享,以及更清楚的持續運轉、限電和應急回應義務。它也希望協助公用事業評估一項擬議設施是否能提供可量化的彈性,而不是只作為大型固定電力負載運作。
這項地面計畫為太空專案提供了有用的背景。Google 正探索一種最終能將運算放置在當地電網限制之外的方法,但其近期基礎設施工作是讓傳統的 AI 工廠更容易連接與運作。AEMA 關於加快併網和基礎設施效益的說法,是聯盟的目標,而不是經獨立證明的採用成果;公告沒有指出已完成的公用事業部署,也沒有量化已實現的節省。
對企業買家和 AI 建置者而言,這兩項工作代表不同的部署取捨。軌道系統未來可能提供持續的太陽能電力,以及遠離擁擠地面站點的位置,但也會帶來對發射的依賴、輻射風險、熱限制和維護困難。彈性地面設施更接近部署,但需要能在不損害服務等級承諾的情況下調整工作負載的軟體、儲能和操作流程。
下一個重要訊號將是 Google 的首枚 TPU 衛星是否完成計畫中的操作測試,並公布有關錯誤、熱行為和工作負載效能的可量化資訊。Planet Labs 的雙衛星示範結果將更具意義,因為它們應該測試衛星間的協調,而不只是單一處理器的獨立運作。
發射頻率是另一項關鍵指標。在 Google 提出的 1,800 次發射假設變得可信之前,SpaceX 必須從每年少量的 Starship 飛行,轉向持續且高頻率的運作。經證明的有效載荷能力、整備時間、發射許可,以及每公斤的實際成本,都會比對飛行頻率的理想化表述更重要。
在地面,觀察者應留意 AEMA 首批技術規格、與公用事業的合作,以及彈性 AI 設施在併網時獲得不同待遇的證據。這些進展將顯示該聯盟能否把廣泛原則轉化為開發者與電網營運商可以驗證的操作規則。
Google 的軌道發射之所以重要,是因為它將 Project Suncatcher 從紙上架構轉變為硬體實驗。但這項測試尚未驗證軌道資料中心的商業模式。它只驗證了 TPU 能在受控條件下開始於太空運作,而更大的系統仍取決於尚未證實的發射經濟學、衛星網路與維護假設。
較近期的競爭故事發生在地面。Google 參與 AEMA,承認 AI 基礎設施目前受到電力取得和電網可靠性的限制;其太空計畫則瞄準數年後的一種可能解決方案。對建置者和企業買家而言,彈性地面容量是可立即採取行動的發展方向;在發射頻率和多衛星效能獲得證明之前,軌道運算應被視為高風險研究路徑。