SlopCodeBench로 본 Opus 5의 장기 코딩 성능

5 days ago 15

요구사항이 단계적으로 추가되는 장기 코딩 벤치마크에서 Opus 5는 17개 체크포인트 중 4개만 엄격 통과해, 지속적인 개입 없이 코드베이스를 발전시키기에는 아직 신뢰하기 어려운 수준임 SlopCodeBench는 체크포인트마다 새 요구사항을 공개하고 이전 회귀 테스트까지 모두 통과해야 성공으로 인정해, 일회성 문제 해결보다 장기 유지보수 능력을 측정함 Opus 5의 엄격 통과율은 24% 로 Opus 4.8과 Sonnet 5의 6%보다 높았지만, 세 모델 모두 쉬움·중간·어려움 문제에서 마지막 체크포인트까지 결함 없이 도달하지 못함 Opus 5는 Opus 4.8보다 함수·호출 가능 단위를 5배, 프로덕션 코드를 약 1.8배 많이 작성했으며, 모든 모델에서 진행할수록 복잡도·장황함·코드 냄새가 증가함 단일 코드 품질 지표보다 누적 명세 전체의 통과율이 유지보수성을 현실적으로 보여주며, 잘 격리된 반복 개발 벤치마크에서 80% 이상을 기록해야 무인 실행에 대한 신뢰가 크게 높아질 수 있음 점진적 요구사항을 측정하는 SlopCodeBench 기존의 복잡한 코딩 벤치마크도 전체 문제를 처음부터 공개하지만, SlopCodeBench는 요구사항을 여러 체크포인트로 나눠 순차적으로 공개함 모델은 이후 어떤 요구사항이 추가될지 모르는 상태에서 기존 코드를 계속 발전시켜야 함 2026년 3월 공개된 원 논문에서 GPT-5.4와 Opus 4.6의 엄격 통과율은 각각 11%와 17% 로, 아직 포화되지 않은 벤치마크임 관련 자료: SlopCodeBench 실행기 SlopCodeBench 문제 모음 실험 구성과 엄격 통과 기준 Opus 4.8, Sonnet 5, Opus 5를 Claude Code 하네스에서 같은 프롬프트로 실행했으며, 체크포인트마다 새 컨텍스트 창을 사용함 쉬움·중간·어려움이 섞인 3개 문제, 총 17개 체크포인트를 선택함 circuit_eval: 쉬움, 8개 database_migration: 중간, 5개 dynamic_config_service_api: 어려움, 4개 모델별로 세 문제를 순차 실행하고 모델 3개를 병렬로 돌려 전체 실험에 약 6시간이 걸림 엄격 통과(strict pass) 는 새 기능 테스트뿐 아니라 이전 체크포인트에서 물려받은 모든 회귀 테스트까지 통과해야 인정함 모델이 체크포인트 1의 코드를 작성하면 평가 하네스가 비공개 블랙박스 테스트를 실행함 체크포인트 2에서는 체크포인트 1과 2의 테스트...

Read Entire Article