자기회귀 확산으로 시장 데이터를 생성할 수 있을까?

7 hours ago 2

Jane Street의 연구 인턴 프로젝트는 미래 가격 하나를 예측하는 대신, 시장 이벤트와 발생 시점까지 생성하는 자기회귀 확산 모델을 실험함 시장 데이터에는 연속적인 수치와 이산적인 행동이 섞여 있어, 완전 연속형 확산 모델만으로는 특정 가격과 시간에 확률이 집중되는 불연속성을 제대로 다루기 어려웠음 초기 DDPM 설정에서는 잡음 제거 궤적이 발산했지만, 플로 매칭(flow matching) 으로 전환한 뒤에는 별도의 복잡한 조정 없이도 잘 작동함 이벤트 범주를 세분화하거나 확률질량이 집중된 지점을 부드럽게 만드는 원자 평활화(atom smoothing) 를 적용해 생성 데이터의 분포와 현실성을 개선함 모델은 아직 현실적인 시장 데이터 생성기로 쓰기에 정확도가 부족하며, 범주형 예측과 확산의 역할 분담, 변수 표현과 평활화 방법이 핵심 설계 과제로 남음 가격 예측을 넘어 시장 이벤트 생성으로 기존 정량 금융 모델은 주문 추가, 취소, 체결 같은 이벤트 흐름을 받아 종목의 미래 가격을 예측하는 경우가 많지만, 생성 모델은 상대적으로 드묾 이벤트 수준 생성 모델은 가격의 점 추정값뿐 아니라 호가장 이벤트와 거래소 도착 시점까지 합성해 더 풍부한 미래 전개를 만들 수 있음 시장 데이터에는 이산적 행동과 연속적 수치가 함께 존재함 주문을 추가하거나 제거하는 행동은 이산적이지만, 가격은 가능한 값이 매우 많아 사실상 연속적으로 보이고 이벤트 도착 시점도 연속적임 기존 가격보다 한 틱 유리하게 주문하는 ‘pennying’은 두 틱 개선보다 훨씬 흔하며, 주문은 정수 초 시점 부근 등에 몰려 도착함 연구 인턴 Kavish는 데이터를 연속형으로 취급했을 때 어디서 문제가 생기는지 탐색하고자 자기회귀 확산 모델을 구축함 확산과 플로 매칭은 이미지, 영상, 로보틱스, 오디오 등 순차적이고 다중 모드를 갖는 데이터에 활용되는 도구임 모델 구조는 Autoregressive Image Generation without Vector Quantization에서 착안함 데이터와 인코더-확산기 구조 미국 주식 데이터 4년치를 사용했으며, 각 행에는 타임스탬프, 가격, 이벤트 종류와 기타 정보가 담김 다음 이벤트의 특성을 생성한 뒤 이를 흐름에 추가하는 방식으로 자기회귀 생성을 수행함 인과 마스킹 Transformer 인코더가 각 위치의 잠재 임베딩을 만들고, 작은 이벤트 종류 예측 헤드가 다음 이벤트를 체결 또는 최우선 매수/매도호가 갱...

Read Entire Article