Anthropic Opus 5 출시

1 week ago 10

Anthropic이 2026년 7월 24일, Claude Opus 5를 공개했습니다. Opus 티어의 "세대 교체급" 개선 모델로, Fable 5(프론티어 모델)에 근접한 지능을 절반 가격에 제공하는 것이 핵심 포지셔닝입니다. 핵심 요약 포지셔닝: Fable 5의 프론티어급 지능에 근접하면서 가격은 절반. Claude Max의 새 기본 모델이자 Claude Pro에서 사용 가능한 가장 강력한 모델로 지정됨. 벤치마크: Frontier-Bench, GDPval-AA 등 코딩·지식노동 평가에서 신규 SOTA 달성. 다만 사이버보안 작업에서는 여전히 Mythos 5(Anthropic 최상위 모델)에 뒤처짐. 코딩 성능: Frontier-Bench v0.1에서 전 모델 중 최고 성능, Opus 4.8 대비 2배 이상 향상(비용은 더 낮음). CursorBench 최고 효율 설정에서는 Fable 5 최고점 대비 0.5% 이내 차이를 절반 비용으로 달성. 지식노동/문제해결: ARC-AGI 3에서 차순위 모델 대비 3배 점수, Zapier AutomationBench에서 차순위 대비 약 1.5배 통과율, OSWorld 2.0(컴퓨터 사용 벤치마크)에서 Fable 5 최고 기록을 3분의 1 수준 비용으로 상회. 과학 연구: 생명과학 전 평가에서 Opus 4.8 대비 개선. 유기화학(분광 데이터로 분자구조 추론)에서 +10.2%p, 단백질 서열-기능 예측에서 +7.7%p. 작업 스타일: 자체 검증·반복 능력이 크게 강화됨. 시각 정보 없이 도면만으로 3D CAD 모델을 코드로 재구성하거나, 커뮤니티 패치가 놓친 근본 원인을 찾아 수정하는 등의 사례가 소개됨. 정렬(Alignment): 자체 행동 감사에서 역대 가장 정렬이 잘 된 모델로 평가됨. Opus 4.8, Sonnet 5, Fable 5보다 기만 행동 비율이 낮고, 비가역적 위험 행동 회피 능력도 최고 수준. 안전성: 생물학·공격적 사이버보안 분야에서는 Mythos 5보다 뒤처짐. 취약점 "탐지"는 Mythos 5와 비슷한 수준이지만 "익스플로잇 개발" 능력은 크게 낮음 (의도적으로 사이버 작업에 대한 학습을 배제한 결과). 안전장치: Fable 5 대비 사이버 분류기 개입이 약 85% 적음. 소스코드 취약점 탐지는 허용하되 바이너리 기반 스캐닝·침투테스트·익스플로잇 생성은 차단. 생물학 관련 요청 중 Fable 5에서 차단되던 것들이 이제 Opus 5로 라우팅됨. 가격...

Read Entire Article