2.8조 매개변수 Kimi K3는 가중치만 1.5TB가 넘지만, 8× AMD MI355X 한 노드에서 실행해 총 952 tok/s와 단일 스트림 118 tok/s를 달성함 B300의 총 처리량은 약 1.65배 높지만 MI355X의 GPU 시간당 가격이 약 2.4배 저렴해, 달러당 처리량은 48 tok/s/$로 B300의 33 tok/s/$를 앞섬 GPU당 288GB VRAM을 갖춘 MI355X는 가중치와 100만 토큰 KV 캐시를 한 노드에 담는 반면, 192GB B200은 두 노드 TP16 구성이 필요해 디코드 경로에서 노드 간 all-reduce 비용이 발생함 외부 블록 확산 초안 모델을 이용한 추측 디코딩으로 단일 스트림 성능을 약 2.2배 높였고, AITER MLA의 헤드 수 제약은 12개를 16개로 제로 패딩해 우회함 새 커널을 만들지 않고 PyTorch 함수와 형상 보정만으로 ROCm 문제를 해결했으며, 높은 HBM 용량이 초대형 모델 서빙의 실질적인 비용·성능 우위로 이어짐 초대형 오픈소스 모델의 메모리 요구량 DeepSeek V4-Pro와 GLM5.2가 Opus에 가까운 지능 수준에 도달하면서 오픈소스 모델이 폐쇄형 모델의 비용 효율적인 대안으로 부상함 Kimi K3는 Fable/Sol 수준의 지능을 목표로 하며, 최근 오픈소스 모델의 급격한 대형화를 보여줌 GLM5.2는 753B, DeepSeek V4-Pro는 1.6T, Kimi K3는 2.8T 매개변수를 가짐 Kimi K3는 100만 토큰용 KV 캐시를 할당하기 전부터 1.5TB가 넘는 VRAM이 필요함 8개 GPU로 구성된 B200 노드 하나에는 Kimi K3가 들어가지 않아, GPU당 288GB VRAM을 갖춘 B300 노드나 B200 두 노드의 TP16 구성이 필요함 AMD MI355X도 GPU당 288GB VRAM을 제공하며, 평균적으로 B300보다 약 2.4배, B200보다 약 1.7배 저렴함 AMD는 느린 커널과 추론 프레임워크의 초기 지원 부족이 제약이지만, Kimi K3에는 출시 당일부터 지원이 제공돼 필요한 최적화 작업이 줄어듦 MI355X·B200·B300 성능 비교 1,024토큰 입력과 400토큰 출력 벤치마크에서 8× MI355X TP8은 노드당 952 tok/s, 단일 스트림 118 tok/s를 기록함 2×8 B200 TP16은 두 노드 전체에서 498 tok/s, 노드당 약 249 tok/s, 단일 스트림 90 tok...
AMD MI355X에서 Kimi K3를 실행해 B300보다 높은 달러당 성능 달성
1 hour ago
1
Related
Qwen3.8-Max: 코딩과 협업의 새로운 기준
28 minutes ago
0
“이 여성을 짓밟아라”: eBay 괴롭힘 캠페인은 어떻게 5,600만 달러 배상으로 이어졌나
1 hour ago
1
LLM 생성 코드를 직접 다시 입력해 인지 부채 막기
1 hour ago
0
DS와 MLE가 함께 일하는 법
2 hours ago
2
웹앱과 AI
3 hours ago
1
Show GN: Reccoo – 윈도우 소리를 녹음해 주는 귀여운 픽셀 친구
4 hours ago
2
64비트 어셈블리의 기술
4 hours ago
2
Google이 RSS 피드 확산을 무너뜨리는 데 기여한 과정(2023)
5 hours ago
1
Tips
click
Trending
Popular
필리핀 “中 관영매체, 필리핀인을 원숭이로 묘사…인종차별”
2 weeks ago
126
北핵실험 연구한 美학자, 中에 20개월째 구금…외교문제 비화
2 weeks ago
104
디노티시아, ICML26서 ‘STAR-KV’ 논문 발표··· ‘KV 캐시 75% 압축에도 성능 보존’
3 weeks ago
62
삼일PwC, AI 기반 '지속가능성 공시 통합 플랫폼' 출시
3 weeks ago
59
© Clint's Theme Park 2026. All rights are reserved










English (US) ·