
Alibaba의 Qwen 팀이 다음 모델 아키텍처의 미리보기로 Qwen3.8-Flash-Next를 공개하고 있다. 이는 대규모 모델 수준의 성능을 훨씬 낮은 연산 요구사항으로 제공하도록 설계된 멀티모달 mixture-of-experts 시스템이다. 이번 발표가 중요한 이유는 특히 코딩 에이전트, 오피스 자동화, 기타 대량 워크로드에서 비용 효율성을 모델 공급자 간 경쟁의 중심으로 끌어올리기 때문이다.
The Decoder의 보도에 따르면 Qwen3.8-Flash-Next는 총 1,250억 개의 파라미터를 포함하지만, 토큰마다 60억 개만 활성화한다. 이 모델은 기존 Qwen3 라인의 또 다른 점진적 출시가 아니라, Qwen4를 위해 계획된 아키텍처의 초기 모습으로 제시된다.
Qwen 팀은 이 모델이 학습 비용의 약 9분의 1 수준으로 Qwen3.7-Plus보다 더 나은 결과를 낸다고 말한다. 이러한 수치와, 생산용 Qwen3.8-Flash 버전에 대해 보도된 가격은 공급자 주장일 뿐이며, 독립적으로 검증된 성능 또는 비용 벤치마크로 간주해서는 안 된다.
Qwen3.8-Flash-Next는 mixture-of-experts 설계를 사용한다. 임의의 토큰에 대해 전체 파라미터 중 작은 부분 집합만 사용되므로, Alibaba는 매 요청마다 전체 계산 비용을 지불하지 않고도 큰 총 용량을 가진 모델을 내세울 수 있다.
이 아키텍처에는 510억 파라미터의 N-gram 임베딩 레이어도 포함된다. The Decoder는 이 구성 요소를 자주 등장하는 단어 묶음을 별도의 항목으로 저장하는 일종의 구문 사전으로 설명한다. Qwen에 따르면 이 레이어는 GPU에 모든 메모리를 유지해야 하는 대신 일반 시스템 RAM에서 작동할 수 있어, 비교적 적은 추가 비용으로 하드웨어 부담을 줄일 수 있다.
이 모델은 262,144 토큰의 기본 컨텍스트 윈도우를 지원하며, YaRN을 사용하면 그 윈도우를 100만 토큰까지 확장할 수 있다고 전해진다. 이러한 용량은 소프트웨어 저장소, 긴 비즈니스 문서, 다단계 에이전트 워크플로에 유용할 수 있지만, 컨텍스트 윈도우 지원만으로 모델이 받아들인 모든 토큰에 대해 안정적으로 추론할 수 있음을 입증하는 것은 아니다.
기술 보고서는 GitHub에서 확인할 수 있고, 모델 가중치는 Hugging Face와 ModelScope에 등록되어 있다. Alibaba는 또한 QwenCloud용 Qwen3.8-Flash를 준비하고 있다. 보도된 가격은 입력 토큰 100만 개당 0.16달러, 출력 토큰 100만 개당 0.47달러이며, Qwen 팀에 따르면 API는 곧 출시될 예정이다.
Alibaba가 공개한 비교는 Qwen3.8-Flash-Next를 DeepSeek-V4-Flash 및 Anthropic의 Claude Opus 4.6과 맞붙인다. 두 모델 모두 원자료에서 훨씬 더 크거나 비싼 구성을 가진 것으로 설명된다. Qwen 모델은 테스트한 대부분의 과제에서 우위를 보인 것으로 전해진다.
가장 강한 결과로 보고된 것은 에이전트형 코딩과 업무 생산성 분야다. Alibaba의 비교에 따르면 Qwen3.8-Flash-Next는 DeepSWE에서 58.7, SWE-bench Pro에서 62.5를 기록했다. 이러한 벤치마크는 AI 시스템이 소프트웨어 프로젝트를 자율적으로 점검하고 수정할 수 있는지를 측정하도록 설계됐다. 생산성 중심 평가에서는 CoWorkBench에서 73.9를 기록해 DeepSeek-V4-Flash의 45.1을 앞섰고, JobBench에서는 55.7로 Qwen3.7-Plus의 27.6을 앞섰다.
보고된 점수는 과학적 추론과 경쟁 프로그래밍에서는 더 근접하다. GPQA Diamond에서 91.7, LiveCodeBench v6에서 91.9를 기록했다. Claude Opus 4.6은 어렵고 학제적인 질문에 초점을 둔 테스트인 Humanity’s Last Exam에서 여전히 우위를 유지한 것으로 전해진다.
이 비교는 독립 평가자가 아니라 Alibaba가 제공한 것이다. 그럼에도 Qwen3.8-Flash-Next가 어떤 작업에 최적화되었는지에 대한 방향성 있는 유용한 근거를 제공할 수 있지만, 벤치마크 설계, 프롬프트, 모델 설정, 구현 방식 모두 결과에 영향을 미칠 수 있다. 실제 운영 성능은 지연 시간, 도구 사용, 장애 복구, 배포 팀의 주변 시스템 품질에 달려 있다.
개발자에게 핵심 기회는 단순히 또 다른 모델에 접근하는 것이 아니다. 토큰 사용량과 반복 호출이 예산을 좌우하는 워크로드에서 비교적 저렴한 모델을 사용할 수 있다는 가능성이다. 코딩 보조, 저장소 분석, 문서 처리, 고객 지원 자동화, 내부 업무 도구 등은 모델 요청을 수천 번 또는 수백만 번 발생시킬 수 있어, 토큰당 가격과 출력 효율이 핵심 설계 제약이 된다.
보도된 QwenCloud 가격은 호스팅 API와 자체 관리형 배포 사이를 선택하는 팀에게 더 선명한 비교 기준도 제공한다. Hugging Face와 ModelScope의 Qwen3.8-Flash-Next 가중치는 조직에 인프라와 데이터 처리에 대한 더 큰 통제권을 줄 수 있지만, 토큰마다 60억 파라미터만 활성화된다고 해도 1,250억 파라미터 모델을 운영하는 일은 여전히 중대한 운영 과제다. 희소 활성화는 계산량을 줄일 수 있지만 메모리, 네트워크, 서빙, 신뢰성 문제를 없애지는 못한다.
이 모델이 소프트웨어와 오피스 업무에 초점을 맞추는 것으로 보이는 점은 팀이 이를 평가하는 방식에도 영향을 줄 수 있다. 코딩 에이전트 벤치마크에서 좋은 성과를 내는 모델은 버그 수정과 저장소 탐색에 유용할 수 있지만, 실운영 구매자는 독점 코드, 권한 경계, 도구 호출, 롤백 절차에 대한 동작을 테스트해야 한다. 기업용 AI에서는 시스템의 오류율과 감독 요구가 절감 효과를 상쇄하지 않을 때에만 낮은 토큰 비용이 의미가 있다.
이번 출시는 이미 더 낮은 가격대로 이동 중인 시장에 압박을 더한다. The Decoder는 Qwen3.8-Flash-Next가 Alibaba의 플래그십 Qwen3.8-Max보다 성능은 낮지만 가격은 약 12분의 1이라고 보도했다. 이 격차가 실제 워크로드에서도 유지된다면, 모델 공급자들은 하나의 모델이 모든 사용 사례를 맡도록 기대하기보다 프리미엄 추론 시스템과 저가 고처리량 모델을 점점 더 분리할 수 있다.
첫 번째 신호는 Qwen3.8-Flash가 보도된 가격대로 QwenCloud를 통해 널리 제공되는지, 그리고 실제 지연 시간이 비용 제안과 맞아떨어지는지 여부다. 개발자들은 또한 코딩, 오피스 자동화, 긴 컨텍스트 검색, 도구 사용 신뢰성에 대한 독립 평가도 지켜봐야 한다.
Qwen4 로드맵도 중요한 후속 과제다. Qwen3.8-Flash-Next는 아키텍처 미리보기로 설명되므로, 향후 출시에서는 N-gram 임베딩 레이어와 기타 희소 모델 기법이 Alibaba의 주력 모델의 안정적인 일부가 되는지 여부가 드러날 것이다. 모델 서빙 결과는 벤치마크 점수 못지않게 중요하다. GPU 메모리 사용량, 시스템 RAM 요구사항, 처리량, 확장 동작이 이 아키텍처가 Alibaba 자체 인프라 밖에서도 경제적인지를 결정할 것이다.
마지막으로, 기업 구매자는 호스팅 버전과 다운로드 버전 모두에 대한 라이선스, 데이터 통제, 지역별 제공 여부, 지원 조건을 추적해야 한다. 이러한 세부 사항이 이 모델이 실험 단계를 넘어 규제 대상 또는 업무 핵심 워크플로로 이동할 수 있을지 결정할 것이다.
Qwen3.8-Flash-Next가 중요한 이유는 Alibaba가 모든 경쟁자를 넘어섰다고 주장해서가 아니라, 효율성 자체를 제품 이야기로 만들었기 때문이다. 코딩과 오피스 업무를 겨냥한 희소하고 저비용 모델은 팀이 가장 비싼 최첨단 시스템에 기본적으로 의존하지 않고도 더 많은 에이전트 단계, 더 넓은 평가, 더 잦은 자동화를 실행하게 해줄 수 있다.
이 주장들은 여전히 외부 검증이 필요하며, 낮은 활성화 수가 자동으로 낮은 총 배포 비용으로 이어지지는 않는다. 하지만 Qwen의 아키텍처가 실제 워크플로에서 비슷한 신뢰성을 제공한다면, 경쟁 우위는 총 파라미터 수에서 모델이 유용한 작업을 얼마나 싸고 얼마나 일관되게 수행할 수 있는지로 이동할 수 있다.
Alibaba의 Qwen 팀이 학습 및 추론 비용을 줄이도록 설계된 희소 모델로 Qwen4를 예고하며, 코딩과 오피스 워크플로를 겨냥하고 있다.