Fable과 ‘공짜 점심’의 종말

4 hours ago 3

Fable의 높은 비용과 접근 정책은 모든 코딩 작업을 최상위 모델에 맡기는 대신, 작업별로 모델을 배치하도록 압박함 과거에는 Moore의 법칙에 따른 성능 향상이 코드 최적화를 대신했지만, 단일 스레드 성능이 정체되면서 병렬화·아키텍처·메모리 지역성을 직접 고려해야 했음 Fable은 뛰어나지만 대부분의 코딩에는 Opus·5.6·K3·GLM도 충분하며, 같은 주에 나온 GLM 5.2의 비용은 Fable의 약 1/9, Opus 5의 약 1/5임 Fable로 설계를 검토하고 구체화한 뒤 좋은 컨텍스트와 작업 지시서를 GLM에 넘기면, 반복적인 코딩을 더 저렴한 모델로 처리할 수 있음 추론 비용이 내려가도 K3와 Qwen 역시 같은 혜택을 받고 하네스도 개선되므로 모델 분업은 지속될 수 있으며, 접근 통제·동적 성능 저하·데이터 보관 의무도 기업과 국가의 선택에 영향을 줌 컴퓨팅의 공짜 점심과 모델 분업 Moore의 법칙이 작동하던 시기에는 18개월 뒤 등장할 CPU가 성능을 두 배로 높여주므로 코드를 극단적으로 최적화할 필요가 적었음 Herb Sutter는 대표적인 에세이에서 이를 공짜 점심이라고 불렀음 2000년대 중반 Moore의 법칙이 둔화되고 특히 단일 스레드 성능이 정체되자, 개발자는 병렬화·아키텍처·메모리 지역성과 작업 배치를 직접 고민하게 됨 Fable 이전에는 코딩 하네스나 컨텍스트 전략을 지나치게 개선할 필요가 적었음 같거나 더 낮은 가격의 새 모델이 등장해 기존 문제 대부분을 덮어줬기 때문임 Fable은 뛰어난 성능을 제공했지만 비용이 높았고, 대부분의 코딩에는 Opus·5.6·K3·GLM도 충분해 어떤 작업을 어느 모델에 맡길지 따져야 하는 상황이 됨 비용·컨텍스트·통제 정책이 만든 변화 Fable과 같은 주에 출시된 GLM 5.2의 비용은 Fable의 약 1/9이며, Opus 5와 비교해도 약 1/5임 일부 작업에서는 품질도 Fable의 1/9 수준일 수 있지만 반복적인 코딩에는 충분함 좋은 컨텍스트를 제공하면 활용도가 높아지며, Fable과 대화해 설계를 검토·구체화한 뒤 작업 지시서를 GLM에 넘길 수도 있음 추론 가격이 내려가더라도 모든 작업을 다시 가장 큰 모델로 보내게 될지는 불확실함 같은 비용 절감 효과가 K3와 Qwen에도 적용됨 더 나은 하네스가 발전할수록 상대적으로 약하지만 여전히 우수한 모델에 충분한 컨텍스트를 제공하기 쉬워짐 Fable의 접근 통제, 동적 성능 저하, 데이터...

Read Entire Article