Qwen 3.8 27B는 뛰어나지만 기본 설정에서 지나치게 오래 추론함

1 hour ago 7

Alibaba Qwen 연구소의 Qwen 3.8 27B는 Apache 2 라이선스와 비전 기능, 262,144토큰 문맥을 갖췄으며, 17GB 양자화 파일로 노트북에서 코드 작성·도구 호출·이미지 분석을 수행함 기본 추론 강도인 xhigh 는 단순 요청에도 과도하게 작동해, 자전거를 타는 펠리컨 SVG를 만드는 데 추론 22,276토큰과 21분을 소비한 반면 추론을 끄면 같은 작업이 137초에 끝남 사진 속 펠리컨 두 마리의 경계 상자를 정확히 반환하고 좌표 시각화 HTML도 한 번의 프롬프트로 만들었지만, 요청하지 않은 데모 장면까지 추가하는 과잉 설계가 나타남 로컬 코딩 에이전트 Pi에서는 여러 파일을 탐색해 Datasette 인증 구조를 분석하고, JSONL 대화를 Markdown으로 변환하는 Python 도구를 직접 작성·테스트해 긴 문맥과 도구 호출 능력을 입증함 LM Studio에서는 초당 15~30토큰으로 느렸지만 llama.cpp의 다중 토큰 예측을 적용하자 약 72% 빨라졌으며, 실제 사용은 low나 추론 비활성화로 시작해 필요한 작업에서만 강도를 높이는 편이 적합함 17GB로 실행하는 범용 로컬 모델 Qwen 3.8 27B는 Alibaba Qwen 연구소가 공개한 270억 매개변수 비전 LLM으로, Apache 2 라이선스를 적용함 27B급은 적절한 사양의 노트북에서 실행하기 좋은 크기이며, 이전 모델 Qwen 3.6 27B도 인상적인 성능을 보였음 Qwen의 자체 벤치마크에서는 Qwen 3.6 27B뿐 아니라 폐쇄형 가중치 모델 Qwen 3.7-Plus보다도 향상된 결과를 기록함 Qwen 3.7-Plus는 같은 해 5월까지 Qwen의 모든 크기 모델 중에서도 강력한 축에 속했음 다만 자체 측정치이므로 독립 벤치마크를 통한 확인이 남아 있음 테스트에는 128GB M5 Max MacBook Pro와 NVIDIA DGX Spark를 사용함 두 장비 모두 LM Studio와 17GB Q4_K_M 양자화 빌드를 실행함 DGX Spark에서는 llama-server도 직접 시험함 xhigh 기본값이 일으키는 과잉 추론 Qwen 3.8은 비용과 추론 깊이를 조절하는 reasoning_effort 를 공식 지원함 xhigh: 복잡하고 철저한 분석이 필요한 작업용이며 기본값으로 설정됨 medium: 정확도와 속도의 균형을 맞춤 low: 속도와 비용을 우선하는 효율적 추론에 적합함 LM Studio GGUF도 ...

Read Entire Article