OpenArch - 현대 LLM 아키텍처의 PyTorch 구현 모음

1 hour ago 1

OpenArch는 현대 오픈소스 LLM 아키텍처를 처음부터 직접 구현한 PyTorch 학습용 저장소로, 아키텍처마다 읽기 쉬운 단일 파일을 제공함 가독성과 학습을 우선하며, 어텐션 유형, 정규화, 계층 구성, MoE 라우팅, 위치 인코딩 같은 구조적 선택을 나란히 비교할 수 있게 함 GPT-2 XL, Llama 3, DeepSeek R1, Qwen 3, Kimi K2 등 여러 텍스트 모델과 멀티모달 모델 PaliGemma가 순전파 실행 가능한 상태이며, 일부 모델은 구현 중임 LLM Architecture Gallery의 72개 아키텍처를 전체 구현 대상으로 삼으며, 미구현 모델 추가, 구조 문서화, 공식 가중치를 이용한 출력 비교 테스트 등의 기여를 모집함 프로덕션 라이브러리 대체가 목적은 아님을 명시하며, 실제 서비스에는 공식 구현이나 transformers 사용을 권장함 읽고 비교하기 위한 아키텍처 구현 OpenArch는 Sebastian Raschka의 LLM Architecture Gallery에 수록된 모델 아키텍처를 직접 작성한 PyTorch 코드로 구현함 원본 논문, 기술 보고서, 참조 config.json, Sebastian Raschka와 Machine Learning Mastery의 해설을 바탕으로 작성함 아키텍처마다 읽기 쉬운 파일 하나에 구조적 선택을 명시해 비교하기 쉽게 함 공식 모델 저장소는 속도, 샤딩, 하위 호환성을 최적화하므로 코드를 읽기 어려울 수 있음 이 저장소는 성능보다 가독성을 우선하며, transformers나 다른 프로덕션 라이브러리와 경쟁하지 않음 비교하려는 구조적 차이 현대 LLM은 공통 골격을 공유하지만, 다음과 같은 세부 설계 선택이 다름 어텐션: MHA, GQA, MQA, MLA, 슬라이딩 윈도, 선형 어텐션/DeltaNet 하이브리드를 비교함 정규화: pre-norm, post-norm, QK-Norm, sandwich norm, RMSNorm을 구분함 위치 인코딩: RoPE, NoPE, partial RoPE, YaRN을 비교함 디코더 유형: 밀집형과 희소 MoE, 공유 전문가 유무, Mamba/어텐션 하이브리드를 구분함 학습 기법: 다중 토큰 예측, 잠재 전문가, 게이트 어텐션을 살펴봄 순전파 실행이 가능한 모델 아래 모델은 순전파 실행 가능으로 표시돼 있음 기본 어텐션과 GQA 계열의 텍스트 모델을 구현함 GPT-2 XL 1.5B: 절대 위치 인코딩과 ...

Read Entire Article