Qwen3.8 Max가 도구 사용·계획·자율성·복합 문제 해결을 측정하는 Artificial Analysis Agentic Index에서 종합 최고 모델로 평가됨 Agentic Index는 특정 역량과 산업별 성능을 측정하는 Capability Indices 중 하나로, 총 24개 모델을 비교함 별도 지표인 Intelligence Index v4.1.1은 GDPval-AA v2, 𝜏³-Banking, Terminal-Bench v2.1 등 9개 평가를 결합하며 비용·소요 시간·출력 토큰도 함께 비교함 모델 외에도 코딩 에이전트, 이미지·영상·음성, 개방성, API 속도·지연 시간과 제공자별 엔드포인트 정확도를 독립적으로 평가함 모델을 선택할 때는 지능 점수뿐 아니라 작업당 비용, 실행 시간, 출력 속도, 가중치 공개 여부와 실제 엔드포인트의 정확도 보존 수준까지 함께 확인할 수 있음 Qwen3.8 Max와 Agentic Index Qwen3.8 Max는 8월 5일 새 언어 모델 평가 대상으로 추가됐으며, Hacker News 제목 기준 Agentic Index 종합 1위에 오름 Artificial Analysis Agentic Index는 에이전트 워크플로에서 나타나는 도구 사용, 계획, 자율성, 복합 문제 해결 성능을 측정함 총 24개 모델이 포함되며, 추론 모델은 전구 아이콘으로 구분됨 금융·회계, 전략·운영, 법률, 의료, 엔지니어링, 경제학과 함께 특정 역량과 산업을 평가하는 Capability Indices에 속함 Intelligence Index v4.1.1 Artificial Analysis Intelligence Index v4.1.1은 독립적으로 실행한 9개 평가를 결합함 GDPval-AA v2: 현실에서 경제적 가치가 있는 직무 과제 𝜏³-Banking: 에이전트형 도구 사용 Terminal-Bench v2.1: 에이전트형 코딩과 터미널 사용 SciCode: 코딩 Humanity's Last Exam: 추론과 지식 GPQA Diamond: 과학적 추론 CritPt: 물리학 추론 AA-Omniscience: 지식과 환각 AA-LCR: 긴 문맥 추론 대시보드는 전체 595개 모델 가운데 선택된 26개 모델을 지능, 비용, 시간, 출력 토큰 기준으로 비교함 모델은 공개 가중치, 상업적 사용이 제한된 공개 가중치, 독점 모델로 구분되며 입력 유형과 국가별 필터도 제공함 가중치가 공개됐더라도 상업적 이...
Qwen3.8 Max, Agentic Index 종합 1위
5 days ago
17
Related
OpenAI 윤리 책임자, 합류 1년도 안 돼 퇴사
1 hour ago
0
Mojo 1.0 정식 출시
1 hour ago
0
코드가 아니라 아이디어를 통제하라
2 hours ago
0
LLM Evals에 대해 알아야 할 모든 것
3 hours ago
2
Xirp - Spotify가 만든 조직 컨텍스트 기반 AI 코딩 환경
3 hours ago
2
코드 리뷰도 배워야 하는 기술이다
3 hours ago
2
GNOME Shell이 꿈꾸는 차세대 디자인
3 hours ago
2
Tips
click
Trending
Popular
필리핀 “中 관영매체, 필리핀인을 원숭이로 묘사…인종차별”
3 weeks ago
151
北핵실험 연구한 美학자, 中에 20개월째 구금…외교문제 비화
4 weeks ago
123
© Clint's Theme Park 2026. All rights are reserved










English (US) ·