DeepSeek, 내몽골에서 추론용 16만 칩 Huawei 클러스터 추진 보도

DeepSeek이 AI 추론용으로 16만 개의 Huawei 칩 클러스터를 계획 중인 것으로 알려지며, Nvidia 하드웨어 의존도를 줄이려는 중국의 대규모 시도를 시사한다.

AI News

DeepSeek이 내몽골의 한 데이터센터에 최소 16만 개의 Huawei AI 프로세서를 배치할 계획이라고 보도됐다. 이 프로젝트가 완성되면 지금까지 알려진 Huawei 칩 클러스터 중 최대 규모가 될 수 있다. The Decoder가 인용한 보도에 따르면 제안된 시스템은 모델 훈련이 아니라 추론에 사용될 예정이며, 이는 Nvidia 하드웨어에 대한 제약 속에서 중국 AI 기업들이 인프라를 구축하는 방식에 있어 잠재적으로 중요한 변화를 의미한다.

이 계획의 중심은 Huawei의 차세대 Ascend-950DT 프로세서다. 제공된 증거에는 이것이 완료된 주문이나 운영 중인 배치, 또는 DeepSeek이나 Huawei의 공개 확인 발표로 제시되어 있지 않다. 오히려 보도들은 칩 생산 제약과 고대역폭 메모리 부족 때문에 납품까지 1년 이상 걸릴 수 있는 구상 단계의 구축으로 설명한다.

훈련용 슈퍼컴퓨터가 아닌 대규모 추론 시스템

추론과 훈련의 구분은 이 이야기의 핵심이다. 훈련은 모델이 데이터로부터 학습하는 동안 많은 수의 가속기를 통해 지속적인 처리가 필요하다. 추론은 훈련된 모델이 사용자 요청에 응답하고, 콘텐츠를 생성하며, 애플리케이션용 작업을 수행하는 생산 단계다.

제안된 DeepSeek 클러스터는 보도에 따르면 추론 워크로드에 집중할 예정이다. The Decoder는 Bloomberg 보도를 인용해 DeepSeek이 더 무거운 훈련 워크로드에는 계속 Nvidia 하드웨어를 사용하고 있다고 전했다. 이는 이 프로젝트가 DeepSeek의 컴퓨팅 인프라 전체를 즉시 대체하는 것은 아님을 시사한다. 대신 훈련이 끝난 모델을 서비스하기 위한 대규모 국내 플랫폼을 만들게 된다.

그럼에도 최소 16만 개의 프로세서는 상당한 규모의 배치다. 효과적으로 납품되고 연결된다면, 이 시스템은 대규모 모델 접근을 지원하고 운영 서비스에서 수입 가속기에 대한 회사의 의존을 줄일 수 있다. 다만 실제 성능은 프로세서 수 이상으로 좌우된다. 네트워킹, 소프트웨어 호환성, 전력, 냉각, 메모리 용량, 클러스터 관리가 모두 사용 가능한 성능에 영향을 미친다.

Huawei의 공급 제약이 당장의 장애물

보도된 일정은 불확실하다. The Decoder는 생산 한계와 메모리 부족을 이유로 Huawei가 전체 물량을 1년 이상 제공하지 못할 수 있다고 전했다. 이 단서 때문에 이 발표는 DeepSeek의 조달 계획이면서 동시에 공급망 역량에 관한 이야기이기도 하다.

AI 가속기는 프로세서와 해당 워크로드 사이에서 데이터를 빠르게 이동시키기 위해 고대역폭 메모리에 의존한다. 보도에 따르면 중국 CXMT는 AI 프로세서에 쓰이는 메모리 기술인 HBM3E 소량 생산을 시작했지만, 이미 HBM4를 대량 생산하고 있는 Samsung, SK Hynix, Micron에 비해 여전히 몇 년 뒤처져 있다.

이러한 비교는 대규모 국산 가속기 프로젝트가 빠르게 확장되기 어려운 이유를 보여준다. Huawei가 프로세서를 설계하고 조립할 수 있더라도, 충분한 첨단 메모리와 패키징 역량을 확보할 수 있느냐가 16만 칩 계획이 실제 운영 클러스터가 될지, 아니면 장기 목표로 남을지를 결정할 수 있다. 제공된 증거는 확정된 납기일, 최종 시스템 구성, 또는 제안된 전체 수량이 계약상 확보되었는지를 입증하지 않는다.

증거가 확인하는 것과 그렇지 않은 것

제공된 세 보도는 핵심 주장에 대해 일치한다. DeepSeek은 16만 칩 규모의 Huawei 배치 계획과 연결되어 있으며, 목표 위치는 내몽골이다. CNBC TV18과 tech-ish.com은 이 계획을 Nvidia 제품이 중국에서 계속 제약을 받는 상황에서 Nvidia 의존을 줄이기 위한 노력으로 해석한다. The Decoder는 제안된 칩 종류, 추론 전용 역할, 공급 병목, 그리고 훈련용 Nvidia 지속 사용에 대해 더 자세히 설명한다.

그러나 이 증거는 기업의 공개 발표나 기술 사양이 아니라 언론 보도다. 여기 제공된 어느 출처도 Huawei가 전체 주문을 수락했는지, 건설이 완료되었는지, 또는 클러스터가 시험 단계에 들어갔는지를 확인하지 않는다. 또한 이것이 알려진 최대 Huawei 칩 클러스터가 될 것이라는 주장도 독립적으로 검증된 업계 순위가 아니라 보도된 비교다.

이 구분은 AI 구매자와 연구자에게 중요하다. 계획된 프로세서 수만으로는 처리량, 요청당 비용, 가동 시간, DeepSeek이 사용하는 소프트웨어 스택과의 호환성을 알 수 없다. 이러한 결과는 시스템이 납품되고 운영 조건에서 벤치마크된 후에야 평가할 수 있다.

이 프로젝트가 AI 개발자와 기업에 중요한 이유

DeepSeek 입장에서는 추론을 Huawei 하드웨어로 옮기면 중국 내 공급과 배치 용량에 대한 통제력을 높일 수 있다. 또한 서비스 비용과 가용성을 Nvidia 조달, 수출 통제, 수입 시스템 접근에 덜 의존하게 만들 수 있다. 하지만 이 규모의 추론 이전은 소프트웨어 최적화, 모델 변환, 스케줄링 변경, 그리고 Huawei의 하드웨어·소프트웨어 생태계 전반에 걸친 광범위한 테스트를 요구할 수 있다.

기업 AI 팀에게 제안된 클러스터는 더 넓은 조달 교훈을 보여준다. 가속기 다변화는 단순히 다른 칩을 사는 문제가 아니다. 팀은 컴파일러 지원, 추론 프레임워크, 메모리 대역폭, 네트워킹, 관측 가능성, 대체 하드웨어의 가용성을 포함한 전체 플랫폼을 평가해야 한다.

이 프로젝트는 또한 중국 AI 산업이 직면한 서로 다른 병목을 보여준다. 수출 제한은 국산 가속기에 대한 수요를 촉진할 수 있지만, 수요만으로는 첨단 메모리 부족이나 제조 제약을 해결할 수 없다. Huawei가 대규모로 공급할 수 있는지, 그리고 DeepSeek이 그 클러스터에서 경쟁력 있는 추론 성능을 달성할 수 있는지가 헤드라인의 프로세서 수보다 더 의미 있는 정보가 될 것이다.

다음에 주목할 점

가장 분명한 후속 신호는 이 프로젝트가 내부 계획이 아니라 확정 주문으로 존재한다는 DeepSeek이나 Huawei의 확인이다. 건설 진행 상황, 납품 일정, 실제 설치된 Ascend-950DT 칩 수에 대한 보도가 나오면 제안된 규모에 도달하고 있는지 알 수 있다.

기술 공개도 equally 중요하다. Nvidia 시스템과 비교한 추론 처리량, 지연 시간, 전력 사용, 비용의 독립 측정을 주목해야 한다. 소프트웨어 스택, 모델 지원, 네트워킹 설계, 메모리 구성에 대한 세부 사항은 이 클러스터가 실제 워크로드를 효율적으로 처리할 수 있는지를 보여줄 것이다.

마지막으로 CXMT의 HBM3E 공급과 Huawei의 생산량은 중국이 개별 배치를 넘어 국산 AI 인프라를 확장할 수 있는지를 보여줄 것이다. 공급이 계속 제한된다면 DeepSeek 프로젝트는 Nvidia 기반 시스템의 근시일 대체재라기보다 장기 용량 계획이 될 수 있다.

Creati.ai 관점

DeepSeek의 보도된 계획이 중요한 이유는 AI 인프라 의존을 두 단계로 나누기 때문이다. 중국은 가장 까다로운 훈련 워크로드에는 계속 Nvidia 시스템을 사용하면서, 대규모 추론은 국산 가속기로 옮길 수 있다. 이는 AI 스택 전반에서 Nvidia를 대체하는 것보다 좁은 형태의 대체이지만, 추론 수요가 지속적인 소비자 서비스와 기업 배치에는 여전히 중요할 수 있다.

이 이야기는 제안된 칩 수가 아니라 납품과 운영 결과로 판단해야 한다. Huawei의 공급 능력, DeepSeek의 배치, 독립적인 성능 데이터가 더 명확해지기 전까지는 16만 프로세서 수치는 큰 보도상 야심으로 보는 것이 가장 적절하다. 동시에 중국의 국산 AI 하드웨어 생태계가 전략 계획에서 신뢰할 수 있는 생산 인프라로 확장될 수 있는지를 시험하는 사례이기도 하다.

광고