Redis 개발자가 만든 ds4, LLM을 로컬에서 실행

5 hours ago 3

DwarfStar 4(ds4) 는 대용량 메모리를 갖춘 Mac, CUDA, ROCm 머신용 C 추론 엔진으로, DeepSeek V4/V4.1 Flash, GLM 5.x, Qwen3.8 Flash Next의 텍스트 및 비전 모델을 지원함 비대칭 2비트 양자화로 라우팅되는 전문가를 압축하면서 중요한 공유 경로의 정밀도를 유지해, 지원하는 MoE 모델을 대상 머신에서 실행할 수 있게 함 CLI, HTTP API, 네이티브 에이전트가 같은 모델 상태와 캐시를 공유하며, SSD에 저장한 긴 프리픽스를 프롬프트 해시로 재개해 재시작 시 전체 프리필을 피할 수 있음 범용 GGUF 실행기가 아니라 소수의 모델 계열과 프로젝트 전용 GGUF에 집중하며, 지원하는 모델 레이아웃을 처음부터 끝까지 검증함 OpenAI 및 Anthropic 스타일 API를 제공해 Codex, Claude Code, OpenCode 같은 코딩 에이전트를 베이스 URL 설정으로 로컬 서버에 연결할 수 있음 모델 지원과 추론 설계 DwarfStar 4는 MIT 라이선스의 C 추론 엔진이며, Metal, CUDA, ROCm을 지원함 지원 모델 계열은 DeepSeek V4/V4.1 Flash, GLM 5.x, Qwen3.8 Flash Next이며 텍스트와 비전 입력을 지원함 Qwen의 64GB 환경 실행 방법은 Qwen3.8 Flash Next 문서에서 확인할 수 있음 DeepSeek V4 Flash는 2,840억 매개변수의 전문가 혼합(MoE) 모델로, ds4는 일반적인 원격 서빙 대신 로컬 실행을 출발점으로 삼음 비대칭 2비트 양자화로 라우팅되는 전문가를 압축하고 중요한 공유 경로의 정밀도를 유지함 범용 GGUF 파일이 아닌 프로젝트 전용 GGUF와 소수의 모델 계열에 집중하며, 지원 레이아웃을 종단 간 검증하고 공식 모델 출력과 대조함 KV 캐시는 긴 프리픽스를 SSD에 저장하고 프롬프트 해시로 재개할 수 있어, 재시작 시 전체 프리필을 다시 수행하지 않아도 되는 경우가 있음 하나의 엔진에서 세 가지 인터페이스가 모델 상태와 캐시를 공유함 ./ds4는 채팅 CLI, ./ds4-server는 로컬 API, ./ds4-agent는 지속적인 코딩 세션을 제공함 텐서 병렬화, 세션 배칭, DSPARK + MTP, 비전 입력을 지원하며, 세부 구조는 아키텍처 문서에서 확인할 수 있음 ds4-server는 OpenAI 및 Anthropic 스타일 API를 제공하며...

Read Entire Article