코딩 하네스 9종 vs. 노트북

6 days ago 15

동일한 노트북과 로컬 모델을 써도 하네스에 따라 첫 토큰 대기 시간이 llama.cpp 기준 12.2~225.7초로 벌어져, 모델 속도만으로 실제 응답성을 판단하기 어려움 긴 시스템 프롬프트·도구 스키마와 부가 요청은 제한된 로컬 자원을 압박함 — 데이터센터에서 부담이 작은 프리필(prefill)이 노트북에서는 수분의 대기로 이어짐 M4 MacBook Pro 24GB에서 Qwen 3.8 27B 3비트 양자화 모델로 Exercism 과제 8개를 각각 3회 실행함 — 단순한 Python 과제의 통과 수는 성능 순위가 아니며, 체감 처리량도 반복 간 최대 50% 변동함 pi·mini-swe-agent·chad는 시작 부담이 작고, dsh·cline·codex·goose는 초기 부담이 커도 안정적인 접두사 캐시로 이후 대기를 줄임 — crush·opencode는 시작에 3~4분이 걸림 chad는 서버와 에이전트 루프를 같은 프로세스에 둔 MLX 엔진과 DFlash2 조합에서 체감 처리량이 7.9→17.4토큰/초로 높아짐 — 로컬에서는 요청 설계뿐 아니라 추론 엔진과의 결합도 사용 속도를 좌우함 토큰 생성 벤치마크와 실제 응답성의 차이 llama-bench의 토큰/초 수치만으로는 코딩 하네스의 실제 응답성을 알기 어려움 첫 응답을 수분간 기다리거나 작업 도중 정체할 수 있으며, 대부분의 코딩 하네스는 로컬 모델을 염두에 두고 만들어지지 않음 이번 비교는 데이터센터 API를 localhost로 바꿨을 때의 동작을 측정함 실험자는 Apple silicon에서 Qwen 3.8 27B에 맞춰 최적화한 chad를 개발 중이므로 이 이해관계를 감안해야 함 다른 하네스의 설계 품질 자체를 평가하는 실험은 아니며, 용도와 실행 환경의 불일치가 일부 존재함 로컬 모델을 압박하는 세 가지 설계 긴 시스템 프롬프트와 도구 스키마는 모델이 작업을 시작하기 전에 읽어야 할 양을 늘림 읽기 90토큰/초, 생성 10토큰/초를 가정하면 입력 1,000토큰마다 생성 시작 전 약 11초가 추가됨 Qwen 3.8 27B에서 pi의 초기 입력은 2,008토큰, opencode는 18,046토큰임 프리필이 10,000토큰/초 이상인 데이터센터 GPU에서는 약 0.2초 대 1.8초지만, 실험 노트북에서는 약 22초 대 226초가 걸림 제한된 컨텍스트 중 일부를 하네스 자체가 먼저 사용함 사용 가능한 컨텍스트는 메모리 용량과 모델 가중치 크기에 좌우되며, 적당...

Read Entire Article