AI News

Google DeepMind는 텍스트 확산 모델이 반드시 새로운 대규모 사전학습을 필요로 하지는 않는다는 점을 보여줬다. The Decoder가 다룬 기술 보고서에서 회사는 기존 Gemma 4-26B-A4B를 원래 모델의 학습 토큰 예산의 10% 미만으로 DiffusionGemma로 전환한 방법을 설명한다.

이 시스템은 하나씩 토큰을 확정하는 대신 최대 256개 토큰 블록을 병렬로 생성한다. Nvidia H100에서 Google은 초당 약 1,500토큰의 처리량을 보고한다. 중요한 트레이드오프가 있다. DiffusionGemma는 전체적인 벤치마크 품질에서는 여전히 이전의 자기회귀 모델보다 뒤처지지만, 이 접근법은 연구자와 제품 팀에게 텍스트 확산 실험을 더 저렴하게 시도할 길을 열어줄 수 있다.

새로운 사전학습이 아니라 개조

기존의 자기회귀 언어 모델은 이미 생성된 토큰을 바탕으로 다음 토큰을 예측하며 응답을 순차적으로 만든다. DiffusionGemma는 다른 경로를 택해, 잡음이 섞인 텍스트 블록을 반복적으로 정제해 출력이 사용할 수 있는 상태가 되도록 한다. 이 방식은 언어에 적용되기는 하지만, 개념적으로는 이미지 확산 시스템에 더 가깝다.

Google DeepMind는 확산 전용으로 새 모델을 설계하고 학습하는 대신 Gemma 4를 출발점으로 삼았다. 첫 번째 학습 단계에서는 손상된 텍스트 블록을 복원하는 방법을 모델에 가르쳤다. 두 번째 단계는 강화학습과 샘플러 증류를 결합했으며, Google은 이를 SD·RL이라고 부른다. 강화학습은 응답 개선에 사용됐고, 샘플러 증류는 추론 시 필요한 정제 단계 수를 줄였다.

이 설계 선택이 보고서의 핵심 뉴스다. 이는 기존 언어 모델이 다른 생성 메커니즘의 기반이 될 수 있음을 시사하며, 대체 아키텍처를 탐색하는 데 필요한 비용과 시간을 낮출 가능성이 있다. 다만 이런 개조가 처음부터 확산용으로 학습된 모델과 일관되게 맞먹을 것이라는 의미는 아니다.

병렬 생성은 속도를 가져오지만 조건이 있다

보고서에 따르면 SD·RL은 적응된 시스템 내에서 추론 벤치마크 결과를 평균 10점 향상시키는 동시에, 계산 단계당 처리되는 토큰 수를 거의 4배 늘렸다. 또한 Google에 따르면 DiffusionGemma의 응답은 약 50% 더 짧아, 속도 주장에 추가적으로 기여한다.

이 모델은 확산 스타일 생성과 원래의 단어 단위 모드 사이를 전환할 수 있다고 한다. 이런 유연성은 구조화된 작업에는 반복적 정제를, 순차 생성이 더 신뢰할 수 있는 곳에는 전통적인 디코딩을 적용하도록 앱을 구성할 수 있게 해줄 수 있다.

가장 강력한 성능 수치는 여전히 벤더가 제공한 것이다. The Decoder는 DiffusionGemma가 단일 사용자 조건의 H100에서 초당 약 1,500토큰에 도달한다고 말한다. 동시성이 높아질수록 이점은 줄어든다. 약 32개의 동시 요청에서는 표준 언어 모델이 처리량 면에서 따라잡는다고 한다. 따라서 배포 설계는 헤드라인 속도 수치만큼 중요하다.

증거, 개선점 및 알려진 약점

Google의 보고서는 병렬 정제가 유용할 수 있는 몇 가지 작업을 제시한다. 수학 예시에서 확산 모델은 보이는 출력을 최종화하기 전에 답을 발전시킬 수 있어, 나중에 수정 문장을 덧붙이는 대신 초기 실수를 바로잡을 수 있다. 보고서는 또한 최소한의 미세조정 후 스도쿠 성능이 약 85%에 이르며, 베이스 모델은 이 과제를 실패한다고 설명한다.

구조화된 출력은 특히 실용적인 활용 사례가 될 수 있다. Google은 최종 구조의 상당 부분이 이미 입력에 의해 제약될 때 JSON 생성과 코드 수정을 2~3회의 정제 단계로 완료할 수 있다고 말한다. 이 결과는 유망하지만, 독립 평가가 아니라 모델의 기술 보고서에 나온 과제별 주장이다.

보고서는 중요한 한계도 기록한다. DiffusionGemma는 반복 루프에 빠질 수 있으며, 때로는 개별 단어를 되풀이한다. 모델의 학습 단계는 상대적으로 짧았고, SD·RL 단계는 최대 품질보다 낮은 계산 요구를 우선했다. 아키텍처, 데이터 및 기타 설정이 Gemma 4에서 그대로 이어졌기 때문에, 확산 생성에 최적이 아닐 수 있다.

The Decoder는 또한 멀티모달 작업에서 모델이 추론 섹션을 끝맺지 못하는 경우가 있어, 실제 답변을 반영하지 않을 수도 있는 이유로 측정 점수가 낮아진다고 보도한다. 전체 성능은 여전히 자기회귀 베이스 모델보다 낮으며, Google은 이를 부분적으로 개조 전략과 제한된 추가 학습 탓으로 돌린다.

빌더와 엔터프라이즈 팀에 주는 의미

AI 빌더에게 DiffusionGemma는 기존 언어 모델을 완전히 대체하는 최종 제품이라기보다 구체적인 연구 출발점을 제공한다. 저지연 비서, 제약된 생성, 대화형 시스템을 탐구하는 팀은 병렬 정제가 허용할 수 없는 반복이나 정확도 문제를 일으키지 않으면서 응답 시간을 줄일 수 있는지 시험할 수 있다.

경제성은 작업 부하의 형태에 달려 있다. 단일 사용자 애플리케이션은 보고된 처리량의 혜택을 가장 크게 볼 수 있는 반면, 동시성이 높은 서비스는 더 작은 이점을 볼 수 있다. 팀은 초당 토큰 수만 보지 말고 총 지연 시간, 정제 단계 수, 가속기 활용률, 수정률도 측정해야 한다.

구조화된 워크플로우는 자유형 추론보다 이 접근법에 더 즉각적으로 맞아 보인다. JSON 생성, 코드 수정, 그리고 입력 제약이 강한 다른 작업은 더 적은 노이즈 제거 반복만 필요할 수 있다. 반대로, 꾸준히 높은 추론력이나 다듬어진 장문 답변에 의존하는 애플리케이션은 확산 전용 학습이 품질을 개선할 때까지 원래의 자기회귀 모델을 선호할 수 있다.

Hugging Face에서 Apache 2.0으로 제공된다는 점은 실험 장벽을 낮춘다. The Decoder는 Interfaze가 이미 이를 다국어 음성 인식에 사용하고 있다고 보도했으며, 다른 연구 프로젝트는 대화형 방사선 보고서 생성을 탐구하고 있다. 이는 초기 도입 신호이지 광범위한 상용 배포의 증거는 아니며, उपलब्ध한 출처는 성능이나 규모에 대한 독립적인 세부 정보를 제공하지 않는다.

다음에 주목할 점

다음의 중요한 신호는 텍스트 확산 전용으로 학습된 모델이 개조된 시스템과의 품질 격차를 좁힐 수 있는지 여부다. 연구자들은 단일 요청 벤치마크만이 아니라 현실적인 동시 워크로드에서 DiffusionGemma를 테스트해야 한다.

추가 평가는 반복 실패, 구조화 출력의 유효성, 추론 정확도, 그리고 완료된 작업당 에너지 또는 비용을 살펴봐야 한다. 또한 특화된 미세조정이 코딩, 음성 인식, 기업 문서 생성에서 신뢰할 만한 향상을 가져오는지도 확인할 필요가 있다.

Google의 이전 Gemini Diffusion 시연은 회사가 이 접근법을 계속 탐구하고 있음을 보여주지만, DiffusionGemma는 명시적으로 실험적이라고 설명된다. 따라서 이 모델의 가치는 표준 언어 모델을 즉시 대체하는 데서보다, 독립 연구와 맞춤형 적응을 얼마나 빠르게 가능하게 하느냐에서 더 많이 평가될 수 있다.

Creati.ai 관점

DiffusionGemma가 중요한 이유는 텍스트 확산을 적응 문제로 다시 정의하기 때문이다. 이미 확립된 모델로 시작하면 실험은 더 쉬워지지만, 순차 디코딩용으로 만들어진 아키텍처와 학습 레시피를 재사용하는 한계도 드러난다.

제품 팀에게 실질적인 질문은 병렬 생성이 보편적으로 더 빠른지 여부가 아니다. 특정 워크플로우가 정확도와 출력 신뢰성을 유지하면서 더 적은 정제 단계의 이점을 얻을 만큼 구조화되어 있는지다. DiffusionGemma는 비교적 낮은 진입 비용으로 그 질문을 시험할 수 있는 방법을 제공하지만, 벤치마크 격차와 동시성 제한은 자기회귀 모델 대체에 대한 광범위한 주장보다 워크로드 수준의 신중한 평가가 필요함을 시사한다.

추천

DiffusionGemma는 기존 언어 모델을 더 빠른 텍스트 생성을 위해 재활용할 수 있음을 보여준다

Google DeepMind는 Gemma 4를 학습 비용의 일부만 들여 DiffusionGemma로 적응시켰으며, 벤치마크 품질을 포기하는 대신 더 빠른 병렬 텍스트 생성을 얻었다.