TurboFieldfare - 모든 M 시리즈 Mac에서 Gemma 4 26B를 2GB RAM으로 실행하는 오픈소스 엔진

4 days ago 16

TurboFieldfare는 전체 14.3GB 모델을 메모리에 올리지 않고 Gemma 4 26B-A4B를 약 2GB의 메모리로 실행해, 8GB Apple Silicon Mac에서도 로컬 추론이 가능함 1.35GB 공유 코어와 FP16 KV 캐시만 상주시킨 뒤 토큰마다 필요한 MoE 전문가 가중치를 SSD에서 스트리밍하며, 16슬롯 LFU 캐시와 병렬 pread로 입출력을 제한함 Gemma 4 26B-A4B는 토큰당 약 3.88B 파라미터를 활성화하며, 측정된 디코딩 속도는 8GB M2 MacBook Air에서 5.1~6.3 tok/s, 24GB M5 Pro에서 31~35 tok/s임 Swift 6.2와 Metal 4로 구현된 전용 런타임이며, 네이티브 Mac 앱·CLI·설치 도구·실험적 OpenAI 호환 서버를 동일한 .gturbo 모델 디렉터리 위에서 제공함 현재 범위는 macOS 26 이상과 최소 8GB RAM을 갖춘 Apple Silicon Mac의 텍스트 전용 추론으로 한정되며, 이미지·음성·영상과 원격 서버 인증·TLS는 지원하지 않음 메모리를 줄이는 실행 구조 TurboFieldfare는 instruction-tuned Gemma 4 26B-A4B를 전체 메모리에 적재하지 않음 1.35GB 공유 코어와 FP16 KV 캐시는 메모리에 유지함 각 토큰에 필요한 routed expert만 SSD에서 Metal이 볼 수 있는 버퍼로 읽음 설치된 텍스트 전용 모델은 약 14.3GB지만, 가중치와 4K KV 캐시가 사용하는 메모리는 약 2GB임 모델은 총 26B 파라미터 가운데 토큰당 약 3.88B 파라미터를 활성화함 가중치는 group 64 기반 MLX affine 4비트를 사용하며, router는 8비트, 공유 및 routed expert는 4비트임 MLX나 llama.cpp를 감싼 구성이 아니라 Gemma 4 26B-A4B에 맞춰 만든 Swift·Metal 전용 런타임임 토큰 생성 과정 각 Transformer 레이어에서 Metal이 상주 가중치로 attention과 router를 계산함 CPU는 router가 선택한 상위 8개 expert ID를 레이어별 16슬롯 LFU 캐시와 대조함 캐시 미스는 제한된 수의 병렬 pread 호출로 채움 SSD 읽기가 진행되는 동안 Metal은 상주하는 shared-expert 분기를 계산함 읽기가 끝나면 shared output과 routed output을 결합함 프롬...

Read Entire Article