Qwen 3.8 Omni Flash

46 minutes ago 1

Qwen3.8-Omni-Flash는 텍스트, 이미지, 오디오, 비디오를 입력받아 콘텐츠 이해부터 작업 계획, 도구 호출, 결과물 제작까지 수행하는 네이티브 옴니모달 모델로, 100만 토큰 컨텍스트를 지원함 Qwen 공개 평가에서 이전 Qwen3.5-Omni-Plus보다 29개 평가 평균 점수가 25% 이상 상승했으며, 시간당 오디오 입력 API 가격은 98% 이상, 시청각 입력 가격은 93% 이상 낮아짐 장시간 영상에서 질문에 필요한 구간을 스스로 찾아 검증하는 에이전트 방식의 이해를 지원하며, OmniVideoBench에서 정확도를 63.4에서 67.8로 높이고 질의당 토큰 사용량을 약 45.7% 줄임 영상 제작과 업무 실행을 연결해 뮤직비디오 제작, 단편 드라마 번역과 더빙, 장편 영화 해설, 회의 후속 작업, 영상 기반 문서와 재사용 가능한 에이전트 스킬 생성을 지원함 별도 모델 Qwen3.8-Omni-Flash-Realtime은 실시간 시청각 스트림을 받으며 응답하고 도구를 실행하며, 발음 연습, 공간 음향 기반 탐색, 업무 지식과 규칙을 적용한 대화에 활용할 수 있음 모델과 비용 변화 Qwen3.8-Omni-Flash 는 Qianwen AI Platform에서 사용할 수 있으며, 코딩, 텍스트 기반 지식 업무, GUI 조작을 바탕으로 오디오와 비디오 중심의 에이전트 작업을 확장함 텍스트, 이미지, 오디오, 비디오 입력과 100만 토큰 컨텍스트를 지원함 동일 규모의 텍스트 전용 모델과 비슷한 텍스트 성능을 유지하면서 옴니모달 성능을 개선함 Qwen 공개 평가에서 Qwen3.5-Omni-Plus 대비 29개 평가 평균 점수가 25% 이상 상승함 Qwen은 시청각 성능이 Gemini 3.8 Flash에 근접하고, 전반적인 오디오 성능은 이를 넘어선다고 밝힘 평가 범위에는 음성 인식, 음성 번역, 소리와 음악 이해, 시청각 추론, 설명 생성, 상호작용, 멀티모달 에이전트 작업이 포함됨 시간당 API 입력 가격은 이전 모델보다 오디오 98% 이상, 시청각 93% 이상 인하됨 시간당 가격은 2분 분량 입력 비용의 30배로 추정하며, 시청각 입력은 720p, 초당 1프레임을 기준으로 함 비교에서 Gemini 3.8 Flash는 media_resolution=high, Seed 2.0 Lite는 max_frame_tokens=384를 사용하고 나머지 API 설정은 기본값을 사용함 텍스트 입출력 가격 단위는 100만 ...

Read Entire Article