GLM-5.3 오픈 웨이트, Anthropic·OpenAI 모델을 5분의 1 비용으로 제침

1 hour ago 1

GLM-5.3은 28개 실무 과제를 모두 통과하고 품질 점수 9.3을 받았으며, 전체 비용도 약 $0.28로 gpt-5.5의 약 5분의 1에 그침 평가는 17개 모델에 동일한 프롬프트·API 호출·OpenRouter 스트리밍 경로와 결정론적 자동 채점을 적용한 단일 시험이며, 전체 실행 비용은 약 $30임 gpt-5.5는 96% 통과율과 13.2초의 첫 토큰 시간을 기록했지만 비용은 $1.43이며, sonnet-4-6은 96%·7.5초로 품질과 대기 시간의 절충안임 저비용 작업에는 과제당 $0.0023인 gpt-5.6-luna가 적합하지만 보안 통과율은 33%이며, haiku-4-5는 과제당 $0.0044에 96% 통과율과 0.9초 첫 토큰 시간을 기록함 모델별 시험이 한 번뿐이라 Wilson 95% 신뢰구간이 넓으며, Anthropic 모델의 공급자 측 차단과 gpt-5.6 계열의 jailbreak 실패 같은 하네스·안전성 제약도 함께 고려해야 함 17개 모델의 종합 순위 Ed-o-meter는 학술 지표 대신 실제 사용자가 수행하는 28개 실무 과제를 에이전트의 단위 테스트처럼 평가함 전체 통과율과 Wilson 95% 신뢰구간, 품질 루브릭, 카테고리 통과율, 첫 토큰 시간(TTFT), 전체 비용과 과제당 비용을 함께 비교함 상위권 결과는 다음과 같음 glm-5.3: 100% [88–100], 루브릭 9.3, 16.3초, $0.28 deepseek-v4-pro: 96% [82–99], 8.7, 40.0초, $0.081 gemini-3.6-flash: 96% [82–99], 8.8, 6.6초, $0.48 gpt-5.5: 96% [82–99], 8.7, 13.2초, $1.43 grok-4.5: 96%, 7.7, 4.6초, $0.17 grok-4.6: 96%, 8.8, 14.6초, $0.34 haiku-4-5: 96%, 7.4, 0.9초, $0.12 kimi-k3: 96%, 9.5, 26.4초, $0.93 sonnet-4-6: 96%, 8.9, 7.5초, $1.84 이어 gemini-3.7-flash와 sonnet-5가 93%, glm-5.2가 89%, gpt-5.6-sol·terra와 opus-5가 86%, fable-5와 gpt-5.6-luna가 79%를 기록함 성능 차이가 벌어진 카테고리 평가 순서는 Coding → Data → Realworld → Security → Tool-use로 고정되며, 85% 이상...

Read Entire Article