무한 파라미터 LLM: 실시간 데이터로 가중치 생성 및 적응

1 week ago 18

Infinite-Parameter LLM은 사용자 제공 사실, 수정 사항 등 실시간 상호작용 데이터를 프롬프트에만 두지 않고, 추론 중 가중치에 반영하는 아키텍처 제안임 작은 하이퍼네트워크가 공유 기반 네트워크에 적용할 저랭크 가중치 변화량을 생성하므로, MoE처럼 모든 전문가 가중치를 저장할 필요가 없음 잠재 코드를 한 번 읽고 고정하는 대신 베이지안 믿음 분포를 유지하고 온라인으로 갱신해, 세션이 진행되는 동안 유효 가중치가 계속 적응하도록 설계함 무한 파라미터는 고정된 저장 공간에서 연속적인 코드로 생성할 수 있는 유효 가중치 집합을 뜻하며, 무한한 지식 저장 능력이나 사전학습의 대체를 뜻하지 않음 검증 대상은 동일한 예산에서 가중치에 담은 지식과 행동이 프롬프트에 담은 경우보다 유리한지이며, 제공된 초록과 서론에는 평가 프로토콜만 있고 실험 결과는 없음 정적 학습 데이터에서 실시간 상호작용으로 스케일링 법칙에 따르면 언어 모델의 역량은 학습 데이터, 파라미터, 연산량과 함께 예측 가능하게 증가함 Kaplan 등의 2020년 연구와 Hoffmann 등의 2022년 연구는 데이터를 모델 역량의 핵심 입력으로 다룸 Villalobos 등의 2024년 연구는 공개된 인간 생성 텍스트가 대략 2026~2032년 사이에 소진될 것으로 전망함 반면 배포된 모델과 에이전트가 만드는 상호작용 데이터는 빠르게 늘고 있음 사용자 질문, 제공 문서, 수정 사항, 에이전트가 관찰한 결과가 여기에 해당함 이 데이터는 실제 추론 과정에서 생기며, 모델이 현재 사용자와 과제에 유용해지는 데 필요한 정보를 담고 있음 기존의 동결된 모델은 이런 데이터를 사용하더라도 가중치 자체는 바뀌지 않음 검색, 긴 문맥, 퓨샷 예시, 시스템 프롬프트는 지식과 행동 지침을 문맥 창에 넣고 요청마다 다시 읽게 함 에이전트 하네스, 도구 오케스트레이션, 외부 메모리도 네트워크 밖에서 데이터를 관리함 제안의 초점은 주변 도구가 아니라 아키텍처와 가중치 갱신 규칙임 추론 중 새로운 지식과 행동을 저렴하게 받아들이고, 중요한 정보를 유지할 수 있는 가중치가 필요함 MoE에서 가져온 동적 가중치와 제거하려는 제약 전문가 혼합(Mixture-of-Experts, MoE) 은 많은 전문가 하위 네트워크를 저장하고 토큰마다 일부만 활성화함 DeepSeek-V3는 6,710억 개 파라미터를 보유하지만 토큰당 370억 개만 활성화함 Mixtral, Qwen3, Kimi...

Read Entire Article