Windows에서 AMD GPU로 CUDA 실행하기

4 days ago 14

ZLUDA와 AMD HIP/ROCm을 조합해, NVIDIA CUDA용 Windows 프로그램을 AMD GPU에서 실행할 수 있도록 설치/진단/실행 스크립트를 제공하는 프로젝트 GPU와 드라이버를 확인하고 필요한 구성 요소를 내려받은 뒤, 대상 프로그램에 호환 DLL과 실행 경로를 설정하는 과정을 자동화함 Radeon RX 9060 XT에서 CUDA용 LibTorch를 사용하는 강화학습 모델의 추론과 학습을 실제로 완료했으며, 비공개 DLL 없이 공식 배포물만으로 재현할 수 있음 현재 검증된 GPU는 RX 9060 XT뿐이며, 다른 AMD GPU는 자동으로 감지되더라도 실제 실행까지 보장하지 않음 모든 CUDA 프로그램을 지원하는 것은 아니며, 검증 환경에서는 cuDNN을 사용할 수 없어 이를 요구하는 모델이나 일부 CUDA 확장은 동작하지 않을 수 있음 호환성 구조와 검증 범위 CUDA for AMD on Windows는 CUDA 대상 Windows 연산 애플리케이션을 위한 재현 가능한 환경이며, CUDA 지원 LibTorch를 사용하는 워크로드도 포함함 실행 경로는 ZLUDA가 CUDA 대상 애플리케이션과 AMD GPU 사이의 호환 계층을 담당하는 구조임 CUDA 애플리케이션 → ZLUDA → cuBLAS/cuSPARSE/cuFFT 호환 계층 → rocBLAS/hipBLASLt/rocSPARSE/HIP → AMD GPU로 이어짐 현재 검증 기준 장치는 Radeon RX 9060 XT, 아키텍처는 gfx1200/RDNA4임 스캐너가 다른 Windows HIP 아키텍처 계열을 인식해도 미검증 후보로 분류하며, 장치 감지가 워크로드 실행을 입증하지는 않음 AMD의 Windows 하드웨어 범위는 공식 시스템 요구사항에서 확인할 수 있음 공식 배포 구성으로 완료한 학습 검증 비공개 DLL이나 복구한 DLL 없이 공식 업스트림 배포물만으로 검증했으며, 기준 버전은 다음과 같음 ZLUDA v6-preview.69 AMD HIP SDK 6.4 LibTorch 2.3.0 + cu118 실제 파라미터 2,216,347개인 PPO 네트워크가 CUDA 장치로 노출되는 환경에서 순전파/추론, PPO 학습, 옵티마이저 작업을 완료함 저장소가 생성한 런타임으로 검증 반복 한 회에서 65,536 타임스텝을 처리함 프로젝트 개발 계기가 된 것과 같은 CUDA 대상 LibTorch 학습 워크로드를 사용했으며, 세부 검증은 검증 문서에서 확인...

Read Entire Article