요구사항이 단계적으로 추가되는 장기 코딩 벤치마크에서 Opus 5는 17개 체크포인트 중 4개만 엄격 통과해, 지속적인 개입 없이 코드베이스를 발전시키기에는 아직 신뢰하기 어려운 수준임 SlopCodeBench는 체크포인트마다 새 요구사항을 공개하고 이전 회귀 테스트까지 모두 통과해야 성공으로 인정해, 일회성 문제 해결보다 장기 유지보수 능력을 측정함 Opus 5의 엄격 통과율은 24% 로 Opus 4.8과 Sonnet 5의 6%보다 높았지만, 세 모델 모두 쉬움·중간·어려움 문제에서 마지막 체크포인트까지 결함 없이 도달하지 못함 Opus 5는 Opus 4.8보다 함수·호출 가능 단위를 5배, 프로덕션 코드를 약 1.8배 많이 작성했으며, 모든 모델에서 진행할수록 복잡도·장황함·코드 냄새가 증가함 단일 코드 품질 지표보다 누적 명세 전체의 통과율이 유지보수성을 현실적으로 보여주며, 잘 격리된 반복 개발 벤치마크에서 80% 이상을 기록해야 무인 실행에 대한 신뢰가 크게 높아질 수 있음 점진적 요구사항을 측정하는 SlopCodeBench 기존의 복잡한 코딩 벤치마크도 전체 문제를 처음부터 공개하지만, SlopCodeBench는 요구사항을 여러 체크포인트로 나눠 순차적으로 공개함 모델은 이후 어떤 요구사항이 추가될지 모르는 상태에서 기존 코드를 계속 발전시켜야 함 2026년 3월 공개된 원 논문에서 GPT-5.4와 Opus 4.6의 엄격 통과율은 각각 11%와 17% 로, 아직 포화되지 않은 벤치마크임 관련 자료: SlopCodeBench 실행기 SlopCodeBench 문제 모음 실험 구성과 엄격 통과 기준 Opus 4.8, Sonnet 5, Opus 5를 Claude Code 하네스에서 같은 프롬프트로 실행했으며, 체크포인트마다 새 컨텍스트 창을 사용함 쉬움·중간·어려움이 섞인 3개 문제, 총 17개 체크포인트를 선택함 circuit_eval: 쉬움, 8개 database_migration: 중간, 5개 dynamic_config_service_api: 어려움, 4개 모델별로 세 문제를 순차 실행하고 모델 3개를 병렬로 돌려 전체 실험에 약 6시간이 걸림 엄격 통과(strict pass) 는 새 기능 테스트뿐 아니라 이전 체크포인트에서 물려받은 모든 회귀 테스트까지 통과해야 인정함 모델이 체크포인트 1의 코드를 작성하면 평가 하네스가 비공개 블랙박스 테스트를 실행함 체크포인트 2에서는 체크포인트 1과 2의 테스트...
SlopCodeBench로 본 Opus 5의 장기 코딩 성능
5 days ago
15
Related
Karpathy의 펠리컨
4 hours ago
2
실리콘밸리의 창업자 고기 분쇄기
5 hours ago
4
BMW, 구매한 차량 화면에 Spider-Man 광고 배포
6 hours ago
2
RamenHaus
7 hours ago
3
Wikimedia Foundation, 노조 인정 거부하고 노조 저지 전문 로펌 선임
8 hours ago
4
Matrix에서의 일주일
8 hours ago
3
Show HN: 엔지니어를 꿈꾸는 15살인 제가 만든 사이클로이드 감속기
9 hours ago
8
Show GN: 클로드코드 세션 탐색기 만들어 봤습니다.
9 hours ago
4
Tips
click
Trending
Popular
필리핀 “中 관영매체, 필리핀인을 원숭이로 묘사…인종차별”
2 weeks ago
124
北핵실험 연구한 美학자, 中에 20개월째 구금…외교문제 비화
2 weeks ago
104
디노티시아, ICML26서 ‘STAR-KV’ 논문 발표··· ‘KV 캐시 75% 압축에도 성능 보존’
3 weeks ago
62
삼일PwC, AI 기반 '지속가능성 공시 통합 플랫폼' 출시
3 weeks ago
59
© Clint's Theme Park 2026. All rights are reserved










English (US) ·