OpenAI는 자체 LLM으로 Jalapeño 칩을 어떻게 설계했나

1 week ago 23

OpenAI는 자체 LLM으로 첫 AI 가속기 Jalapeño의 설계를 가속했으며, 초기 아키텍처 구상부터 첫 실리콘까지 20개월 미만, 첫 RTL부터 제조용 설계 확정까지 9개월이 걸림 프로젝트 기간 평균 100명 미만의 OpenAI 팀이 시스템 설계를 맡고, Broadcom이 게이트 이후 물리 설계와 생산을 담당했으므로 개발 속도를 OpenAI나 AI만의 성과로 볼 수는 없음 프런트엔드는 소프트웨어와 유사한 코드를 하드웨어 기술 언어로 변환하는 XLS를 중심으로 구성해, 언어와 코드 처리에 강한 LLM의 장점을 활용함 내부 AI 모델로 DeepSeek 어텐션 커널을 최적화한 결과, 약 40시간 만에 이론적 성능 한계 대비 달성률이 0.31%에서 88.94% 로 높아짐 차세대 설계에서는 검증과 물리 설계에 AI 활용을 확대할 계획이지만, 엔지니어가 작업을 주도하고 최종 판단을 내리며 칩 설계의 완전 자동화를 목표로 하지는 않음 Jalapeño의 성능과 개발 일정 OpenAI는 2026년 8월 25일, 첫 AI 가속기 Jalapeño를 전면 공개함 4비트 연산 성능은 최대 13.4페타플롭스이며, 232GB 메모리에 초당 15.4TB 대역폭으로 접근함 연산 다이에 HBM4 스택 6개와 I/O 칩렛을 결합하며, 칩 2,048개로 구성된 포드에 배치하도록 설계됨 OpenAI가 인용한 벤치마크에서는 현재 사용하는 Nvidia GB300 대비 프롬프트 입력부터 마지막 토큰 출력까지의 지연을 최대 3.6배 단축하면서 전력도 덜 소비함 다만 OpenAI의 추론 인프라에 광범위하게 배치된 뒤에도 이 수치가 실제 성능 향상으로 이어질지는 아직 확인되지 않음 초기 아키텍처 구상부터 첫 실리콘까지 20개월 미만이 걸림 칩의 논리를 정의하는 레지스터 전송 수준 코드인 RTL을 처음 작성한 시점부터, 완성된 설계를 제조에 넘기는 테이프아웃까지는 9개월이 걸림 OpenAI 하드웨어 부사장 Richard Ho에 따르면, 모델은 엔지니어가 더 빠르게 작업하고 더 많은 설계 경로를 탐색하도록 돕지만 작업 주도권과 최종 판단은 엔지니어에게 있음 소규모 팀과 Broadcom의 역할 분담 OpenAI 설계팀은 프로젝트 기간 평균 100명 미만이었으며, 2세대와 3세대 설계를 추진하는 현재도 약 100명 규모임 시스템 설계뿐 아니라 소프트웨어와 공급망 인력을 포함한 수치이며, 협력사 Broadcom 인력은 제외됨 OpenAI는 추론 가속기, 메모리...

Read Entire Article