AI News

AMD가 캐나다 AI 스타트업 Taalas를 인수한다. 이번 거래를 통해 칩 제조사는 AI 모델의 아키텍처와 학습된 파라미터를 특화된 추론 실리콘에 직접 내장할 수 있는 기술을 확보하게 된다. 이 접근법은 특정 모델에 대해 상당히 빠른 서빙을 약속하지만, 각 칩을 특정 모델에 묶어 두며 모델이 바뀔 때 유연성을 제한한다.

The Decoder가 보도한 이번 인수는 AMD의 Instinct GPU와 함께 더 넓은 시스템 수준의 AI 워크로드 제공의 일부로 Taalas의 기술을 배치하게 된다. 거래는 통상적인 규제 승인 절차를 거쳐야 하며, 공개된 보도에는 매입 가격이나 예상 종료 시점이 언급되지 않았다.

AMD가 Taalas를 인수하는 이유

Taalas는 2023년 토론토에서 설립됐고, 2월 스텔스 모드를 벗어나며 AI 추론 스택의 일부를 소프트웨어에서 하드웨어로 옮기는 아키텍처를 공개했다. 회사는 모델 가중치를 실행 시점에 범용 가속기에 로드하는 대신, 그 가중치를 칩 안에 직접 구축한다.

이 설계는 생성형 AI의 핵심 비용 중 하나인 대규모 반복 서빙 문제를 해결할 수 있다. 추론 워크로드는 같은 모델을 수천만 번 또는 수백만 번 실행하는 경우가 많아, 성능과 에너지 효율이 광범위한 프로그래밍 가능성보다 중요할 때 특화 하드웨어가 매력적이다.

The Decoder에 따르면 AMD는 Taalas의 기술을 독립 제품군으로 취급하기보다 자사 가속기 로드맵에 통합할 계획이다. AMD AI 부문 수석 부사장 Vamsi Boppana는 이번 인수가 AMD의 AI 포트폴리오를 강화한다고 말했다. Taalas 공동 창업자 Ljubisa Bajic는 AMD가 스타트업에 필요한 규모와 시장 도달력을 제공한다고 말했다.

이런 발언은 전략적 이유를 설명하지만, Taalas의 설계가 얼마나 빨리 AMD의 상용 시스템에 적용될지, 어떤 고객과 모델이 먼저 지원될지는 보여주지 않는다.

속도와 유연성의 절충

Taalas의 방식은 범용 GPU와 많은 프로그래밍 가능한 AI 가속기에서 쓰는 접근법과 근본적으로 다르다. 기존 가속기는 소프트웨어로 여러 모델을 실행할 수 있어, 운영자는 가중치를 업데이트하거나 아키텍처를 바꾸거나 같은 하드웨어에서 여러 모델을 제공할 수 있다. 모델별 실리콘은 그 유연성 일부를 포기하는 대신 더 좁고 잠재적으로 더 빠른 실행 경로를 제공한다.

The Decoder는 Taalas의 데모 칩이 Llama 3.1-8B를 실행하며 사용자당 초당 16,000개가 넘는 토큰을 기록했다고 보도했다. 이 수치는 토큰 생성 속도가 챗봇, 코딩 도구, 실시간 기업용 에이전트 같은 대화형 애플리케이션에 직접 영향을 주기 때문에 주목할 만하다. 그러나 이는 데모 결과일 뿐, 출하 중인 AMD 제품의 증거나 워크로드 전반에 대한 표준화된 비교는 아니다.

모델 고정은 운영상 질문도 낳는다. 새 모델 출시, 파인튜닝, 토크나이저, 또는 아키텍처 변경은 새 칩 설계나 다른 하드웨어 구성을 요구할 수 있다. 따라서 구매자에게 Taalas 접근법의 가치는 작업 부하가 특화 하드웨어를 정당화할 만큼 안정적인지, 그리고 인퍼런스당 비용이 유연성 상실을 상쇄하는지에 달려 있다.

무엇이 입증되고 무엇이 입증되지 않았나

공개된 보도에서의 상세한 제품 및 거래 정보는 특화된 AI 추론 칩을 개발하는 캐나다 스타트업으로 Taalas를 식별한 The Decoder에서 나왔다. 해당 보도는 전략적 발언도 AMD의 Boppana와 Taalas의 Bajic에게 돌렸다.

16,000토큰 이상의 결과는 The Decoder가 보도한 공급업체 데모 주장이다. 공개된 증거는 테스트 설정, 배치 크기, 전력 소비, 지연 시간 분포, 소프트웨어 스택, 비교 하드웨어를 제공하지 않는다. 이러한 누락 때문에 결과가 실제 생산 경제성에 어떻게 반영되는지 판단하기 어렵다.

별도의 Yahoo Finance Canada 기사에서는 AMD 인수 소식 이후 Nvidia 주가 움직임에 초점을 맞췄지만, 제공된 자료에는 전체 기사 본문이 없었다. 따라서 시장 반응은 투자자 관심에 대한 보도된 해석으로만 볼 수 있으며, AMD의 거래나 경쟁 영향에 대한 상세한 평가로 보기는 어렵다.

The Decoder는 또한 Google이 Gemini를 위해 유사한 접근을 연구하고 있다고 보도했다. 이 주장은 공개된 증거상 Google의 확인된 제품 발표가 아니라 보도 형태로 제시되었으므로, 유사한 하드웨어가 배치 준비가 됐다는 증거로 간주해서는 안 된다.

AI 개발자와 구매자에 대한 시사점

AMD에게 Taalas는 더 크고 더 빠른 범용 가속기를 제공하는 경쟁을 넘어 AI 포트폴리오를 확장할 수 있다. Instinct GPU는 여전히 학습, 파인튜닝, 다양한 추론 워크로드에 유용하며, 모델별 실리콘은 모델이 생산 단계에 들어간 뒤 예측 가능하고 대량의 서빙을 겨냥할 수 있다.

이 조합은 클라우드 제공업체, 모델 개발자, 안정적인 트래픽 패턴을 가진 대기업에 의미가 있다. 한 모델을 지속적으로 운영하는 구매자는 지연 시간을 낮추거나 활용률을 높일 수 있다면 전용 추론 용량을 선호할 수 있다. 반면 모델을 자주 바꾸는 연구팀과 제품팀은 고정 기능 설계를 관리하기 더 어렵다고 느낄 수 있다.

이번 인수는 AI 추론의 경제성을 둘러싼 경쟁도 더 치열하게 만들 수 있다. 핵심 질문은 최대 토큰 처리량뿐 아니라 칩 생산, 배포, 소프트웨어 통합, 모델 업데이트, 메모리, 네트워킹, 유휴 용량을 반영한 총 유용 응답당 비용이다. AMD는 Taalas 하드웨어가 이러한 전체 시스템 계산에 어떻게 들어맞는지 보여줘야 한다.

AI 애플리케이션 개발자에게 이 기술은 결국 대화형 제품에서 빠른 응답을 더 현실적으로 만들 수 있지만, 애플리케이션과 특정 모델 버전의 결합을 더 강하게 만들 수도 있다. 팀은 하나의 가속기가 모든 워크로드를 처리할 수 있다고 가정하기보다, 실험용 모델과 운영용 모델을 위한 별도의 서빙 경로를 계획해야 할 수 있다.

다음에 주목할 점

첫 신호는 AMD가 Instinct 로드맵 내에서 Taalas 기술의 제품 일정, 아키텍처 세부사항, 통합 계획을 제시하는지 여부가 될 것이다. 구매자는 또한 보도된 데모 결과만 믿기보다 지연 시간, 처리량, 전력 사용, 토큰당 비용을 다루는 독립 벤치마크를 찾아야 한다.

다른 중요한 신호로는 규제 승인, 처음 지원되는 모델, 칩을 업데이트하거나 재구성할 수 있다는 증거, 모델을 특수한 형식으로 옮기는 소프트웨어 도구가 있다. 고객 배포는 현재의 인수 발표보다 상업적 준비 상태를 훨씬 더 강하게 보여줄 것이다.

Google이 Gemini와 관련해 진행 중이라고 보도된 작업도 주목할 만한 또 다른 움직임이지만, 모델별 실리콘으로의 더 넓은 업계 전환에 대한 결론을 내리기 전에는 Google의 확인과 기술적 세부사항이 필요하다.

Creati.ai 관점

AMD의 Taalas 인수는 AI에서 덜 보이는 병목, 즉 실험 단계를 지난 확립된 모델을 효율적으로 서빙하는 문제를 겨냥한다는 점에서 전략적으로 흥미롭다. 수요가 예측 가능할 때 특화 실리콘은 매력적일 수 있지만, 그 가치는 헤드라인상의 처리량만이 아니라 모델 안정성과 시스템 수준의 경제성에 달려 있다.

현재로서는 이번 거래를 프로그래밍 가능한 가속기를 대체하는 것이 아니라 AMD의 선택지를 넓히는 것으로 보는 것이 가장 적절하다. 회사의 실행력이 Taalas의 이례적으로 빠르지만 모델에 묶인 접근을 GPU의 실용적 보완재로 만들지, 아니면 선택된 추론 워크로드를 위한 고성능 틈새로 남게 할지를 결정할 것이다.

추천

AMD, 모델별 AI 실리콘을 가속기 로드맵에 추가하기 위해 Taalas 인수

AMD가 캐나다 스타트업 Taalas를 인수해 모델별 추론 실리콘을 가속기 로드맵에 추가하고, GPU와 함께 더 빠른 AI 서빙을 목표로 한다.