Qwen3.8-Flash-Next: 비용 효율을 높인 Qwen4 선행 아키텍처

3 weeks ago 31

Qwen4에 적용할 설계를 먼저 공개한 멀티모달 MoE 모델로, 125B 본체와 51B N-gram 임베딩 가운데 토큰당 6B 매개변수만 활성화함 GDN과 QSA로 과거 정보를 압축하고 중요한 문맥을 마이크로 블록 단위로 검색해, 1M 토큰에서 Attention Kernel의 Prefill과 Decode를 각각 최대 7.6배·4.9배 가속함 4개 병렬 잔차 경로, 호스트 메모리로 오프로딩할 수 있는 N-gram 임베딩, 개선된 Muon 최적화로 용량·정보 흐름·훈련 안정성을 함께 확장함 Qwen3.7-Plus보다 훈련 비용을 약 1/9로 낮추면서 코딩과 사무 작업 성능을 높였고, 기본 262,144토큰과 YaRN 기반 최대 1M 토큰 문맥을 지원함 가중치는 Hugging Face와 ModelScope에 공개됐으며, QwenCloud의 qwen3.8-flash는 기본 1M 문맥과 내장 도구를 입력·출력 100만 토큰당 각각 $0.16·$0.47에 제공함 Qwen4 아키텍처의 사전 공개 Qwen3.8-Flash-Next는 Qwen4에 적용할 아키텍처를 커뮤니티가 먼저 검토할 수 있도록 가중치를 공개한 멀티모달 MoE 모델임 Qwen3-Next가 Qwen3.5보다 먼저 Gated DeltaNet과 Gated Attention의 혼합 설계를 공개했던 것과 같은 역할을 맡음 당시 설계는 이후 Qwen3.5·Qwen3.6·Qwen3.7·Qwen3.8 시리즈 전반에 적용됨 새 모델은 Attention·잔차 연결·임베딩·최적화 네 영역을 개편해 모델 능력과 계산 효율, 용량, 훈련 안정성을 개선함 모델 본체는 125B 매개변수이고 별도로 51B N-gram 임베딩을 갖추며, 토큰당 활성 매개변수는 6B임 Qwen3.7-Plus와 비교하면 훈련 비용이 약 1/9이면서 코딩과 사무 작업에서 더 높은 성능을 기록함 기본 문맥 길이는 262,144토큰이고 YaRN으로 1,000,000토큰까지 확장할 수 있으며, 세부 설계와 실험은 기술 보고서에서 확인할 수 있음 GDN과 QSA의 장문 문맥 처리 기존 Full Attention은 모든 이전 토큰에 직접 접근하기 때문에 문맥이 길어질수록 계산량과 KV Cache 메모리 접근 비용이 크게 늘어남 전체 레이어 가운데 4분의 3은 Gated DeltaNet(GDN) 으로 과거 정보를 고정 크기 상태에 계속 압축하고, 나머지 4분의 1은 전역 Attention으로 전체 문맥에서 정보를 정확히...

Read Entire Article