Alibaba, Qwen3.8-Omni-Flash 출시, 여러 성능이 Gemini 3.8 Flash에 근접

📅 2026-09-18

요약:

Alibaba의 Qwen 팀은 최근 오디오 및 비디오 이해와 AI 에이전트 기능을 결합한 차세대 네이티브 풀모달 모델 Qwen3.8-Omni-Flash를 출시했습니다.

이 모델은 텍스트, 이미지, 오디오, 비디오의 4가지 입력 형식을 지원하며 100만 개의 토큰에 대한 컨텍스트 창을 제공합니다. 이전 세대 Qwen3.5-Omni-Plus와 비교하여 Qwen 관계자는 29개 벤치마크 테스트의 평균 점수가 25% 이상 증가했으며 오디오 및 오디오 및 비디오 처리 비용을 크게 줄였다고 주장합니다.

1789705181_banner-latest.en.webp

Qwen3.8-Omni-Flash의 가장 큰 변화 중 하나는 단순히 음성 인식, 이미지 인식 및 기타 기능을 결합하는 것이 아니라 모델 수준에서 다양한 유형의 정보를 기본적으로 처리한다는 것입니다. Alibaba는 이를 사용하여 모델이 오디오 및 비디오 콘텐츠를 "이해"하거나 "이해"할 수 있을 뿐만 아니라 이 정보를 이해한 후 작업을 추가로 계획하고 도구를 호출하고 실제 작업을 완료할 수 있기를 희망합니다.

오디오 기능 측면에서는 Qwen3.8-Omni-Flash의 성능이 특히 뛰어납니다. Qwen이 공개한 데이터에 따르면 이 모델은 일부 오디오 벤치마크 테스트에서 Gemini 3.8 Flash를 능가했습니다. 예를 들어 WildClawBench-MM 다중 모드 도구 호출 테스트에서 Qwen3.8-Omni-Flash는 71.0점을 얻었고 Gemini 3.8 Flash는 58.9점을 얻었습니다. DailyOmni 테스트에서 Qwen은 85.1점을 얻었고 Gemini는 84.0점을 얻었습니다. SpotSoundBench에서는 두 사람이 각각 67.2점과 39.7점을 기록했습니다. MMAU 테스트에서는 81.8점과 76.9점을 기록했습니다.

다중 화자 회의 음성 인식도 이번 업그레이드의 핵심입니다. Qwen이 공개한 AliMeeting 테스트 데이터에 따르면 Qwen3.8-Omni-Flash의 스피커 오류율 DER은 3.35, 스피커 속성이 있는 단어 오류율 cpWER은 17.18인 반면, 이전 세대 Qwen3.5-Omni-Plus는 각각 88.11과 89.61입니다. 이는 이번 테스트에서 새 모델이 크게 변경되었음을 의미합니다.

그러나 Qwen3.8-Omni-Flash가 모든 프로젝트에서 Gemini 3.8 Flash보다 앞서는 것은 아닙니다. 예를 들어 AgenticVBench 테스트에서 Gemini 3.8 Flash는 45.0점을 얻었고 Qwen은 36.8점을 얻었습니다. OmniGAIA에서는 각각 78.6점과 74.0점을 기록했습니다. 일부 영상 이해 테스트에서도 Gemini는 우위를 유지했습니다. 따라서 Qwen의 "제미니 접근"에 대한 강조는 전체 오디오 및 오디오 및 비디오 기능에 더 많이 반영되며 모든 다중 모드 프로젝트에서 전반적인 선두를 의미하지는 않습니다.

Qwen3.8-Omni-Flash의 또 다른 중요한 변화는 가격입니다. Qwen은 오디오 입력에 대한 시간당 예상 비용이 이전 모델에 비해 98% 이상 감소했으며 오디오 및 비디오 입력에 대한 시간당 비용이 93% 이상 감소했다고 말합니다. 공식 계산 방식에 따르면 소위 '시간당' 비용은 2분 분량의 자료 처리 비용에 30을 곱하여 계산되며, 영상은 720p, 초당 1프레임의 입력 조건을 채택합니다.

Alibaba Cloud가 발표한 현재 국제 지역 가격은 백만 개의 토큰 입력당 US$0.15이고, 캐시에 적중되는 입력 토큰은 US$0.016이며, 백만개당 출력 토큰은 US$0.47입니다. 중국 본토와 기타 일부 지역의 가격은 다를 수 있습니다. 오디오 및 비디오를 모델 입력으로 직접 사용할 수 있으므로 이 가격 구조는 회의 녹음, 긴 오디오 분석, 비디오 검토, 자막 생성 및 대량의 미디어 콘텐츠 처리와 같은 시나리오에 특히 적합합니다.

1백만 개의 토큰 컨텍스트 창은 이러한 이점을 더욱 증폭시킵니다. Qwen3.8-Omni-Flash의 최대 입력 길이는 992,000 토큰에 가깝고, 사고 모드의 최대 입력 길이는 약 984,000 토큰이며, 최대 출력 길이는 131,000 토큰에 이릅니다. 이는 개발자가 과거처럼 자주 프레임을 분할하고 추출할 필요 없이 초대형 오디오 또는 비디오 콘텐츠를 모델에 직접 넘겨 처리할 수 있으며, 여러 모델을 사용하여 각각 음성 인식, 시각적 이해 및 텍스트 추론을 완료할 수 있음을 의미합니다.

Alibaba Cloud의 공식 정보에 따르면 Qwen3.8-Omni-Flash는 113개 언어 및 방언의 오디오 입력을 처리할 수 있으며 공간 오디오 분석을 지원합니다. 관련 매개변수를 통해 모델은 2채널 스테레오 및 4채널 공간 오디오를 처리할 수 있습니다. 동시에 이 모델은 함수 호출, 네트워크 검색, 컨텍스트 캐싱 및 기타 기능을 지원하며 보다 복잡한 에이전트 워크플로에서 직접 사용할 수 있습니다.

응용 방향 측면에서 Qwen 팀은 이번에 '지능형 전달'에 중점을 둡니다. 예를 들어 모델은 긴 비디오를 분석하고, 주요 콘텐츠를 찾고, 추가 도구를 호출하여 비디오 편집, 콘텐츠 구성, 회의 요약, 자막 생성 등의 작업을 완료할 수 있습니다. Qwen은 또한 다중 모드 에이전트 개발을 위한 Qwen-MM-Plugins를 발표했으며 개발자가 오디오 및 비디오 입력을 기반으로 지능형 에이전트 애플리케이션을 더욱 구축할 수 있도록 Qwen-Live-Harness를 출시할 계획입니다.

이전 세대 Qwen3.5-Omni와 비교하여 이번 업그레이드의 초점은 전통적인 의미의 인식 정확도를 향상시키는 것뿐만 아니라 오디오 및 비디오 AI가 사용되는 방식을 바꾸려는 것입니다. 과거에는 다중 모드 애플리케이션에서 일반적으로 비디오 프레임을 추출하고 오디오를 복사한 다음 처리를 위해 다른 결과를 언어 모델에 전달해야 했습니다. Qwen3.8-Omni-Flash는 이러한 링크를 가능한 한 기본 전체 모드 모델로 통합하려고 시도하고 100만 개의 토큰 컨텍스트를 사용하여 더 긴 원본 콘텐츠를 직접 처리합니다.

Qwen3.8-Omni-Flash는 현재 Alibaba Cloud Bailian을 통해 서비스를 제공하고 있으며 베이징, 싱가포르, 홍콩, 중국, 도쿄, 일본, 독일 프랑크푸르트, 미국 버지니아 등의 지역을 지원합니다. 모델 자체는 일부 Qwen 이전 모델처럼 가중치를 직접 열지 않습니다. Alibaba는 이번에 지원되는 다중 모드 플러그인 및 관련 개발 도구를 주로 공개합니다.

전반적으로 이번 Qwen3.8-Omni-Flash 업데이트의 핵심은 모델 실행 점수를 향상시키는 것뿐만 아니라 동시에 베이스 비디오 처리 비용을 줄이고 컨텍스트 규모를 확장하며 오디오 및 비디오 이해를 도구 호출과 결합하는 것입니다. 특히 오디오 입력 비용이 98% 이상 절감됐다. 실제 사용 비용이 공식 계산 수준에 도달할 수 있다면 장기 회의 녹음, 팟캐스트, 라이브 방송, 동영상 자료에 대한 대규모 자동 분석이 쉬워지고 Qwen과 Google Gemini 등 다중 모드 모델 간의 경쟁이 더욱 심화될 것입니다.

관련 태그

관련 글

댓글

0/500
Captcha (click to refresh)
댓글 없음