알리바바의 Qwen3.8-Omni-Flash는 오디오-비디오 처리와 에이전트 도구를 Gemini Flash보다 훨씬 낮은 가격에 제공해 멀티모달 모델 경쟁을 격화시키고 있다.

알리바바의 Qwen 팀은 오디오와 비디오를 함께 처리하고, 도구를 실행하며, 긴 컨텍스트를 다룰 수 있는 AI 에이전트를 위한 멀티모달 모델인 Qwen3.8-Omni-Flash를 공개했다. 이번 출시는 기능과 가격 모두에서 구글의 Gemini 3.8 Flash와 정면으로 맞붙는 것으로, Qwen은 일부 오디오-비디오 벤치마크에서 유사한 결과를 상당히 낮은 API 요금으로 얻었다고 보고했다.
가장 즉각적인 상업적 이야기는 가격 차이다. The Decoder는 Qwen3.8-Omni-Flash의 비용이 입력 토큰 100만 개당 0.15달러, 출력 토큰 100만 개당 0.47달러라고 보도했는데, 이는 Gemini 3.8 Flash의 초기 가격인 각각 0.75달러와 3.75달러에 비해 훨씬 낮다. 이 모델은 Qwen Studio, Qwen Cloud, 그리고 API를 통해 제공되며, 개발자들은 테스트와 배포를 위한 여러 진입점을 갖게 된다.
이 비교는 주로 Qwen의 자체 성능 주장에 기반하고 있으며, 클러스터의 두 번째 출처는 독립 검증을 위한 전체 기사 본문을 제공하지 않는다. 따라서 제품의 उपलब्ध성과 공개된 가격은, 멀티모달 워크로드 전반에서 구글의 모델과 동등하다는 주장보다 더 분명하다.
Qwen은 Qwen3.8-Omni-Flash를 AI 에이전트를 위해 특별히 설계한 첫 번째 멀티모달 모델이라고 설명한다. 오디오와 비디오를 별도의 입력으로 취급하는 대신, 이 모델은 이를 함께 해석하고, 결합된 신호로부터 결론을 도출하며, 작업을 완료하기 위해 도구를 호출하도록 고안되었다.
보도에서 언급된 예시에는 브이로그 편집, 짧은 영상 번역, 영화 요약 등이 있다. 이는 단순한 질의응답이 아니라 워크플로 수준의 활용 사례다. 시스템은 발화를 식별하고, 시각적 사건을 이해하고, 타이밍이나 화자 맥락을 보존한 뒤, 외부 도구를 호출해 편집되었거나 주석이 달린 출력을 생성해야 할 수 있다.
The Decoder에 따르면 이 모델은 100만 토큰의 컨텍스트 윈도우도 지원한다. 이러한 용량은 긴 녹화물, 대규모 영상 노트 모음, 또는 소스 미디어와 방대한 지시문 및 참고 자료를 결합하는 애플리케이션에서 중요할 수 있다. 다만 큰 컨텍스트 윈도우가 긴 영상에 대한 신뢰할 만한 추론을 보장하는 것은 아니며, 개발자들은 여전히 자신의 미디어로 검색 품질, 지연 시간, 출력 일관성을 직접 테스트해야 한다.
Qwen은 이 모델을 Qwen-MM-Plugins와 함께 제공하고 있는데, 이는 비디오 편집, 화자 인식, PDF 비디오 노트 같은 작업을 위한 오픈소스 구성 요소 집합이다. 이 플러그인들은 Claude Code, Gemini CLI, Qwen Code와 함께 사용할 수 있다고 설명된다. Qwen-Live Harness는 카메라와 마이크를 통한 실시간 상호작용을 지원하도록 설계되었다.
보도된 API 요금은 대량의 미디어를 처리하는 애플리케이션에 의미 있는 차이를 만든다. Qwen은 오디오 입력의 비용을 시간당 0.01달러 미만으로 추정한다. 또한 초당 1프레임으로 샘플링한 오디오 포함 720p 비디오의 비용을 응답 요금을 제외하고 약 0.20달러로 추정한다.
비교해 보면, The Decoder는 Gemini 3.8 Flash의 초기 가격을 입력 토큰 100만 개당 0.75달러, 출력 토큰 100만 개당 3.75달러라고 보도한다. 또한 구글의 요금이 2027년 1월 1일에 두 배로 오를 예정이라고 전한다. 이 기사에는 동등한 오디오 또는 비디오 워크로드에 대한 완전한 비용 모델이 제공되지 않으므로, 토큰 가격 비교를 애플리케이션 전체 비용의 보편적 추정치로 받아들여서는 안 된다.
실제 청구액은 미디어 길이, 프레임 샘플링, 오디오 표현, 출력 길이, 반복 컨텍스트, 도구 호출, 저장, 후처리 등의 요인에 따라 달라진다. 그럼에도 기재된 토큰 요금의 차이는 특히 수많은 시간의 녹화물이나 대규모 비디오 라이브러리를 분석해야 하는 미디어 중심 제품에서 모델 선택에 영향을 줄 수 있다.
더 낮은 가격은 Qwen에게 실험 경쟁의 여지도 준다. 스타트업과 연구팀은 더 저렴한 추론을 사용해 대규모 운영 아키텍처를 확정하기 전에 멀티모달 기능을 시험할 수 있다. 기업 구매자에게 중요한 질문은 모더레이션, 관측 가능성, 재시도, 오류에 대한 인간 검토를 포함한 전체 워크플로에서 이러한 절감이 유지되는지 여부가 될 것이다.
The Decoder는 Qwen3.8-Omni-Flash가 오디오-비디오 작업에서 Gemini 3.8 Flash에 근접한다고 말한다. 그러나 उपलब्ध한 증거에는 전체 벤치마크 표, 테스트 프롬프트, 평가 날짜, 그리고 정확한 Gemini 구성은 제시되지 않는다. 따라서 이 비교는 벤더 또는 미디어가 보도한 성능 주장으로 간주해야 하며, 독립적으로 확립된 전체 순위로 봐서는 안 된다.
벤치마크의 동등성은 작업에 따라 크게 달라질 수도 있다. 짧은 영상 질의응답에서는 잘 작동하는 모델도 긴 녹음에서 화자를 식별하거나, 시간 순서를 유지하거나, 편집 지시를 따르거나, 감독 없이 도구를 사용하는 데서는 덜 신뢰할 수 있다. 모델을 평가하는 개발자들은 대표적인 입력으로 테스트를 재현하고, 실패율, 지연 시간, 완료된 작업당 비용, 필요한 수동 수정의 양을 측정해야 한다.
Startup Fortune의 헤드라인은 이번 출시를 오디오 가격 98% 인하와 오픈 웨이트 공개를 포함한 것으로 설명한다. 제공된 증거에는 전체 기사 본문이 없었기 때문에, 해당 세부 사항은 여기서 독립적으로 검증할 수 없다. 다만 제공된 보도는 Qwen이 자사 클라우드와 API 채널을 통해 모델을 제공하고 있으며, Qwen-MM-Plugins를 오픈소스로 공개했다는 점은 확인해 준다. 모델 웨이트 공개의 범위, 라이선스, 배포 요건에 대해서는 충분한 정보가 없다.
제품 팀에게 Qwen3.8-Omni-Flash는 인식과 행동을 하나의 워크플로에서 결합할 수 있는 모델의 선택지를 넓혀 준다. 예를 들어 영상 지원 제품은 통화를 전사하고, 시각적 맥락을 식별하고, 핵심 장면을 요약하고, 후속 처리를 트리거하면서도 각 단계마다 완전히 분리된 모델을 유지하지 않아도 된다.
이러한 통합은 오케스트레이션을 단순화할 수 있지만, 위험도 집중시킨다. 같은 모델이 화자를 잘못 듣고, 시각적 이벤트를 놓치고, 그 잘못된 해석에 따라 행동한다면 오류는 워크플로 전체로 빠르게 확산될 수 있다. 팀에는 명확한 도구 권한, 결과에 중대한 영향을 주는 행동에 대한 사람의 승인, 그리고 각 결정의 근거가 되는 오디오-비디오 증거를 보존하는 로그가 필요하다.
Qwen Studio와 Qwen Cloud를 통한 제공은 평가 장벽을 낮춘다. 플러그인 생태계는 Claude Code, Gemini CLI, Qwen Code 같은 코딩 에이전트를 이미 사용하는 개발자들의 통합 작업도 더 줄여줄 수 있다. 기업 도입은 제공된 보도에서 다루지 않은 데이터 거주, 보존 정책, 서비스 수준 약속, 보안 검토, 상업적 지원 등 추가 요소에 달려 있다.
구글 입장에서는 이번 발표가 Gemini Flash에 가격 압박을 더한다. 추론 경제성이 어떤 미디어 기능이 실현 가능한지를 결정하는 카테고리이기 때문이다. Qwen에게는 낮은 요금만으로는 부족하다. 개발자들은 벤치마크 점수와 함께 신뢰성, 도구, 문서, 용량, 운영 예측 가능성을 비교할 것이다.
다음으로 유용한 신호는 Qwen3.8-Omni-Flash와 Gemini 3.8 Flash에 대해 작업 정의, 미디어 크기, 샘플링 방법, 전체 비용 계산을 공개하는 독립 평가가 될 것이다. 그런 테스트에는 장편 비디오, 잡음이 많은 오디오, 다국어 음성, 화자 귀속, 도구 실행, 오류 복구가 포함되어야 한다.
개발자들은 또한 모델의 공식 라이선스와 배포 세부사항도 지켜봐야 하며, 특히 "오픈 웨이트"가 Qwen의 포지셔닝에서 핵심이 된다면 더욱 그렇다. API 할당량, 지역별 제공 여부, 부하 시 지연 시간, 구글의 초기 가격 변경이 제시된 우위가 실제 운영 환경에서도 지속될지 결정할 것이다.
도입 신호는 단순한 모델 호출보다 완성된 워크플로를 보여줄 때 더 의미가 있다. 신뢰할 수 있는 비디오 편집, 회의 분석, 라이브 카메라 상호작용, 문서 연계 미디어 검색을 보여주는 통합은 Qwen의 에이전트 초점이 실제로 유용한 제품으로 이어지는지를 나타낼 것이다.
Qwen3.8-Omni-Flash가 중요한 이유는 단일 벤치마크에서 이긴다고 주장하기 때문이 아니라, 멀티모달 입력, 도구 사용, 공격적인 가격 책정을 하나의 개발자 제안으로 묶었기 때문이다. 이러한 조합은 이전에는 소규모 파일럿에만 제한하던 팀에게 더 풍부한 오디오-비디오 기능을 경제적으로 가능하게 할 수 있다.
도입을 위한 가장 강한 근거는 헤드라인 가격을 넘어서는 증거에 달려 있다. 구매자는 워크로드를 바꾸기 전에 엔드투엔드 작업 품질과 거버넌스 요구사항을 검증해야 하며, 개발자는 낮은 추론 가격이 곧바로 총 운영 비용 절감으로 이어진다고 가정하지 말고 통제된 실험을 위한 유망한 후보로 이 모델을 봐야 한다.