Grok 4.6, AAII 61점으로 비용 효율에서 선두권 진입

5 days ago 7

61점은 GPT-5.6 Sol과 동점이며, Opus 5(63)/Fable 5(62)에 이어 최상위권에 진입 Grok 4.5보다 한 달여 만에 5점 상승했으며, 특히 에이전트 성능에서 Elo 1753으로 Claude Opus 5 다음이고 Qwen3.8 Max/Fable 5와 신뢰구간이 겹치는 수준임 가격은 입력 $2/출력 $6/1M 토큰으로 유지돼 GPT-5.6 Sol($5/$30), Claude Opus 5($5/$25) 보다 크게 저렴. 측정 작업당 비용도 $0.84로 Kimi K3와 같음 장시간 지식 작업인 AA-Briefcase에서는 Fable 5급 Elo 1577을 기록하면서 평균 53턴/0.5B 입력 토큰을 사용해 Claude Opus 5(max)의 103턴/2.0B보다 훨씬 적은 자원으로 작업을 완료함 즉 최고 점수 자체는 Claude Opus 5가 앞서지만, Grok 4.6은 GPT-5.6 Sol급 종합 성능 + 선두권 에이전트 성능 + 낮은 가격을 결합하며 Intelligence 대비 비용 Pareto frontier에 올라섬 모델별 위치 Artificial Analysis Intelligence Index(AAII) 기준 상위권은 Claude Opus 5 63 / Claude Fable 5 62 / Grok 4.6 61 / GPT-5.6 Sol 61 순임 Grok 4.6은 Grok 4.5보다 5점, Grok 4.3보다 23점 상승하며 SpaceXAI를 다시 지능 프런티어에 올려놓음 Kimi K3보다 Intelligence 점수가 약간 높으면서 Artificial Analysis가 측정한 작업당 비용은 동일한 $0.84임 에이전트 작업에서 두드러진 성능 Grok 4.6의 강점은 정적 추론보다 도구를 사용하며 여러 단계를 수행하는 에이전트 작업에서 두드러짐 GDPval-AA v2에서 Elo 1753으로 Claude Opus 5 다음이며, Claude Fable 5/Qwen3.8 Max와는 신뢰구간이 겹침 다중 턴 고객 서비스와 도구 사용을 평가하는 𝜏³-Banking은 50.7% 로 Qwen3.8 Max(51.3%)와 함께 상위 2개 점수임 Terminal-Bench v2.1에서는 88.4% 를 기록해 선두 모델들과 같은 수준임 가격 대비 성능 기본 가격은 Grok 4.5와 같은 입력 $2 / 출력 $6 per 1M tokens임 Claude Opus 5: $5/$25 GPT-5.6 Sol: $5/...

Read Entire Article