AMD MI355X에서 Kimi K3를 실행해 B300보다 높은 달러당 성능 달성

1 hour ago 1

2.8조 매개변수 Kimi K3는 가중치만 1.5TB가 넘지만, 8× AMD MI355X 한 노드에서 실행해 총 952 tok/s와 단일 스트림 118 tok/s를 달성함 B300의 총 처리량은 약 1.65배 높지만 MI355X의 GPU 시간당 가격이 약 2.4배 저렴해, 달러당 처리량은 48 tok/s/$로 B300의 33 tok/s/$를 앞섬 GPU당 288GB VRAM을 갖춘 MI355X는 가중치와 100만 토큰 KV 캐시를 한 노드에 담는 반면, 192GB B200은 두 노드 TP16 구성이 필요해 디코드 경로에서 노드 간 all-reduce 비용이 발생함 외부 블록 확산 초안 모델을 이용한 추측 디코딩으로 단일 스트림 성능을 약 2.2배 높였고, AITER MLA의 헤드 수 제약은 12개를 16개로 제로 패딩해 우회함 새 커널을 만들지 않고 PyTorch 함수와 형상 보정만으로 ROCm 문제를 해결했으며, 높은 HBM 용량이 초대형 모델 서빙의 실질적인 비용·성능 우위로 이어짐 초대형 오픈소스 모델의 메모리 요구량 DeepSeek V4-Pro와 GLM5.2가 Opus에 가까운 지능 수준에 도달하면서 오픈소스 모델이 폐쇄형 모델의 비용 효율적인 대안으로 부상함 Kimi K3는 Fable/Sol 수준의 지능을 목표로 하며, 최근 오픈소스 모델의 급격한 대형화를 보여줌 GLM5.2는 753B, DeepSeek V4-Pro는 1.6T, Kimi K3는 2.8T 매개변수를 가짐 Kimi K3는 100만 토큰용 KV 캐시를 할당하기 전부터 1.5TB가 넘는 VRAM이 필요함 8개 GPU로 구성된 B200 노드 하나에는 Kimi K3가 들어가지 않아, GPU당 288GB VRAM을 갖춘 B300 노드나 B200 두 노드의 TP16 구성이 필요함 AMD MI355X도 GPU당 288GB VRAM을 제공하며, 평균적으로 B300보다 약 2.4배, B200보다 약 1.7배 저렴함 AMD는 느린 커널과 추론 프레임워크의 초기 지원 부족이 제약이지만, Kimi K3에는 출시 당일부터 지원이 제공돼 필요한 최적화 작업이 줄어듦 MI355X·B200·B300 성능 비교 1,024토큰 입력과 400토큰 출력 벤치마크에서 8× MI355X TP8은 노드당 952 tok/s, 단일 스트림 118 tok/s를 기록함 2×8 B200 TP16은 두 노드 전체에서 498 tok/s, 노드당 약 249 tok/s, 단일 스트림 90 tok...

Read Entire Article