Claude Code 세션의 가치를 극대화하는 방법

4 hours ago 3

Claude Code는 같은 작업도 컨텍스트 크기와 유지 턴 수, 병렬 컨텍스트 수에 따라 토큰 사용량이 달라지므로 필요한 정보만 세션에 남겨야 함 비용은 모델, 입출력 유형, 프롬프트 캐시에 좌우되며 출력은 입력보다 약 5배 비싸고, 캐시 읽기는 일반 입력 가격의 0.1배임 대화 중간에 /model, /effort, Fast mode를 바꾸면 프롬프트 캐시가 깨질 수 있으므로 세션 시작이나 /clear 직후 설정하는 편이 저렴함 파일은 @-mention으로 첨부하고, 테스트·빌드처럼 출력이 많은 명령은 quiet 옵션을 적용하거나 서브에이전트에서 실행해 불필요한 컨텍스트 누적을 줄일 수 있음 새 작업 전에는 /clear, 같은 작업의 단계가 끝난 뒤에는 /compact를 사용하고, 1시간 캐시 만료 전에 오래 자리를 비울 예정이라면 미리 압축하는 편이 유리함 사용 방식에 따라 달라지는 세션 비용 기존 편집기는 테스트를 한 번 수정하든 여러 번 수정하든 도구 비용이 같았지만, 에이전트 코딩 도구는 동일한 결과도 사용 방식에 따라 토큰 비용이 달라짐 Claude가 필요한 테스트와 구현 파일만 읽으면 몇 턴 안에 수정할 수 있지만, 저장소를 검색하고 여러 파일을 읽으면 그 결과가 이후 모든 요청에 반복해서 포함됨 토큰 효율화의 목적은 무조건 사용량을 줄이는 것이 아니라, 사용한 토큰을 실제로 요청한 작업에 집중시키는 데 있음 세션 비용은 컨텍스트에 들어간 토큰 수, 해당 토큰이 남아 있는 턴 수, 동시에 실행하는 컨텍스트 수에 좌우됨 토큰 가격을 결정하는 요소 모델 크기 큰 모델은 입력과 출력 모두에서 더 많은 연산을 수행하므로 가격이 높음 어렵거나 모호한 문제에는 큰 모델을, 반복적이고 일상적인 작업에는 작은 모델을 사용하는 편이 권장됨 모델과 노력 수준을 선택하는 방법은 Choosing a Claude model and effort level in Claude Code에서 별도로 확인할 수 있음 입력과 출력 토큰 요청 처리는 사전 채우기(prefill) 와 디코딩(decode)의 두 단계로 진행됨 사전 채우기 단계에서는 시스템 프롬프트, CLAUDE.md, 사용자 메시지, 읽은 파일, 실행한 명령의 출력을 입력 토큰으로 처리함 디코딩 단계에서는 사고 과정, 도구 호출, 사용자에게 보이는 텍스트를 한 토큰씩 생성함 200토큰 응답은 모델을 순차적으로 200번 실행하는 형태이며, 디코딩이 GPU를 더 오래 점유해 ...

Read Entire Article