요약
제인 스트리트 인턴이 시장 이벤트를 하나씩 만들어 내는 자기회귀 확산 모델을 시험했습니다.
퀀트 트레이딩 회사 제인 스트리트가 2026년 여름 인턴 프로젝트를 소개하는 연재의 한 편입니다. 연구 인턴 카비시는 가격 하나를 예측하는 대신 주문·취소·체결 같은 이벤트 흐름 자체를 생성하는 모델에 도전했습니다.
왜 중요한가
- 이벤트를 직접 생성하면 가격 예측값 하나보다 풍부한 미래 시나리오를 펼쳐 볼 수 있습니다.
- 시장 데이터에는 이산적인 행동과 거의 연속적인 값이 섞여 있습니다. 이 둘을 어떻게 나눠 다룰지가 핵심 설계 문제로 드러났습니다.
핵심 내용
- 미국 주식 4년치 데이터로 학습했고, 트랜스포머가 이벤트 종류를 고르면 확산 헤드가 가격·시간 간격을 만듭니다.
- 처음 쓴 DDPM(대표적인 확산 학습 방식)은 발산했고, 플로 매칭(직선 경로를 학습하는 방식)으로 바꾸자 잘 작동했습니다.
- 체결이 이벤트의 8%뿐인데 과하게 예측되자 호가 변화를 20개 범주로 쪼갰지만, 손이 많이 가고 확장이 어려웠습니다.
- 0초 간격처럼 한 값에 몰린 분포를 매끄럽게 펴서 다루는 방식이 판별기 시험에서 훨씬 실제 같은 샘플을 냈습니다.
- 다만 아직 실제를 대신할 만큼 정확하지 않고, 먼 미래까지 이어 생성할수록 품질이 떨어집니다.
HN 반응
- 이산도 연속도 아닌 데이터에 확산 모델을 적용한 설명이 좋았다는 평가와, 시장 데이터는 개별 주문의 합이라 애초에 연속이 아니라는 반론이 함께 나왔습니다.
- 어떤 모델이든 시장이 그 통찰을 흡수해 정확도를 잃는다는 회의론이 나왔고, 거래 모델의 수명이 평균 18개월쯤이라는 경험담이 덧붙었습니다.
진짜 볼만한 건 이산적이지도 연속적이지도 않은 시계열 데이터에 확산 모델을 적용한 이 훌륭한 해설입니다. 확산 모델이 여러 분야에 적용되는 모습은 볼 때마다 흥미롭습니다. 확산 언어 모델도 마찬가지고요.
시장 데이터가 연속적이라고 말하는 사람이 어떻게 있는지 이해가 안 가요. 시장 데이터는 이산적인 주문과 체결이 모인 집계일 뿐이잖아요. 눈을 가늘게 뜨고 보면 연속적으로 보일 수는 있어도, 연속적인 건 아니죠.
(네, 기사는 읽었습니다)
기사에서 처음과 끝에 이 얘기를 합니다.
"하지만 시장 데이터는 어떤 종류의 데이터일까? ... 연속적일까, 이산적일까? 시장 데이터에는 두 가지 특징이 다 있는 것 같다. 호가창은 시장 참여자가 대기 주문을 내거나 거두는 일련의 차례를 거치며 변해 가므로, 행동 공간이 이산적인 것은 분명하다. 그런데도 주문의 가장 중요한 매개변수들, 이를테면 가격은 경우의 수가 워낙 많아서 사실상 연속적으로 보인다. ...
이런 복잡함을 탐구하는 방법 하나는 데이터를 연속적인 것처럼 다루고 어디서 무너지는지 살펴보는 것이다."
"프로젝트 기간 대부분은 근본적인 문제 하나와 씨름하는 데 쓰였다. 시장 데이터는 완전히 연속적이지도, 완전히 이산적이지도 않다는 것이다."
저는 시장 체계의 창발적 속성이기 때문에 연속적이라고 생각합니다. 어떤 영상에서 시장 구조가 "진짜"인지 알아보려고 시장을 모델링해 본 사람이 있어요. 처음에는 고전했는데 호가창을 추가하자 헤드앤숄더, 불 플래그, 더블 탑 같은 구조와 패턴이 나타났습니다. 영상 제목은 이겁니다.
"I made a Market Simulation to see if Patterns are Real" (패턴이 진짜인지 확인하려고 시장 시뮬레이션을 만들었다), 제작자 Krafer
https://www.youtube.com/watch?v=oWheof70O9g
여전히 잘 모르겠네요. 모델이 연속적인 방식으로 근사할 수는 있겠지만, 실제 호가창은 언제나 이산적입니다. 창발이라고 해서 그게 달라지지도 않고요.
저는 시장이 돌아가는 방식에 본래 있는 불연속성을 다루려고 여러 범주를 가지고 실험해 본 점이 좋았습니다. 범주가 달라지면 적용할 수 있는 모델과 데이터 조건 설정도 달라지니까요. 데이터와 범주를 사람이 직접 조정해야 한다는 점은 쓰라린 교훈(bitter lesson)을 건드리는 부분이라고 생각합니다. 더 범용적인 모델이라면 잠재 공간에서 범주를 스스로 찾아내도록 학습될 테니까요.
이런 글들에 공통된 패턴은 설명 가능하고 지연 시간을 낮출 가능성이 있는 모델을 찾는다는 점 같습니다. kann fpga 프로젝트처럼요. 더 범용적이고 불투명한 분류기도 어쩌면 작동할 수는 있겠지만, 돈을 벌려면 필요한 속도와 위험 제약 안에서는 작동하기 어려울 겁니다.
제가 요점을 완전히 놓쳤다면 죄송합니다. 제 분야가 전혀 아니라서요.
기사를 읽은 사람은 당신 말고는 저뿐인 것 같네요.
다른 사람들도 읽었을 수 있어요. 그냥 주제에서 살짝 벗어난 얘기를 하기로 한 거겠죠.
커뮤니티 가이드라인에는 주제를 지켜야 한다거나 기사에 나온 내용만 얘기해야 한다는 말이 없습니다.
대신 이런 내용은 있어요.
https://news.ycombinator.com/newsguidelines.html
왜 그렇게 생각하세요?
다들 제목만 보고 그냥 댓글을 달고 넘겨짚으니까요.
시장을 안정적으로 정확하게 맞히는 모델은 있을 수 없습니다. 정확한 모델이 있으면 시장이 그 모델의 통찰을 반드시 흡수하고, 결국 그 통찰은 더 이상 맞지 않게 되니까요.
트레이딩 모델의 유통기한이라고도 하죠. 제가 듣고 배운 바로는 현역 트레이딩 모델의 유효 수명은 평균 18개월쯤입니다. 그 뒤에는 나머지 시장이 적응해 버려서 우위가 사라집니다.
소문이 사실이라면 "느린" 헤지펀드 몇 곳의 모델은 5년 넘게 쓸모 있고 수익도 냅니다. 다만 그런 모델은 거래소에서 매매하는 데 쓰이는 게 아니라 펀더멘털 분석 쪽에 더 의존합니다.
꽤 흥미롭게도 대형 은행과 기술 중심 자산운용사 중 일부는 PyData 같은 밋업과 행사를 후원하고, 가끔 자기들이 오픈소스로 공개한 것을 발표하는 시간도 갖습니다. 5년 된 트레이딩 모델의 내부 구조를 상당 부분 공개하는 발표를 볼 수도 있고, 내부 UI나 시각화 라이브러리를 소개할 수도 있습니다. 후자는 더 이상 적극적으로 개발하지 않지만("완성"됐으니까요) 계속 필요해서 유지보수하는 것들이 많습니다.
물론 실제로 돈을 벌어 주거나 우위를 주는 건 논의조차 되지 않습니다.
펀더멘털 분석 모델은 몇 년이 지나도 꽤 일관돼야 할 것 같은데요. 붉은 여왕 상황에는 영향을 받지 않을 테니까요.
네, 실제로 그런 모델이 있습니다.
솔직히 말해서 사람들은 "트레이딩 모델"(그게 뭘 뜻하든)이 "엄청나게 정교"하고 "온갖 복잡한 수학으로 돌아가"야 한다고 생각하는데, 특히 작은 트레이딩 회사의 경우 냉혹한 진실은 훨씬 단순합니다.
트레이딩의 복잡함은 "그 하나의 틈새 초특급 전략"을 만드는 데 있지 않습니다. 오히려 모든 아이디어를 재현 가능한 방식과 절차로 묶어서 되풀이하며 돈을 불려 나가는 데 있습니다.
정확한 모델이면 무조건 다른 참가자들 눈에 띌 만큼 커진다고 가정하시는 거네요.
모델이 그 지경에 이르려면 엄청난 부자가 될 겁니다.
그리고 앞으로도 더 많은 게 계속 나올 가능성이 높아요. 한계까지 가면 우위를 얻기 위해 모델이 내부자 정보를 추론하기 시작할 겁니다. 예를 들어 위성 사진으로 주차장의 차량 수를 세는 건 이제 상식인데, 그게 내부자 정보의 대용물이잖아요.
그러니 중요한 건 모델이라기보다 데이터입니다.
공개된 방법보다 날씨를 더 잘 예측하는 것만으로도 상당한 우위를 얻을 수 있어요.
이런 틈새 정보는 전체 시장 참여자 중 아주 작은 일부에게만 의미가 있고, 거의 눈에 보이지도 않아요.
대단한 인턴십이네요. 글도 꽤 밀도가 높고, 하나같이 유익합니다.
세부 내용이 웃길 만큼 자세한데, 앞으로 올 인턴을 대상으로 쓴 글이라면 납득이 갑니다. 그런데 주문 도착 간격이 왜 정규분포일 거라고 기대하죠? 주문이 하나 들어오면 다른 주문이 들어올 확률이 올라가는 호크스(Hawkes) 과정 같은 게 분명 있을 텐데요. 학생들이 토론하게 만들려는 작은 장치겠죠.
제인 스트리트 인턴들은 여전히 인상적이네요.
『시장을 풀어낸 사나이』[0]에 르네상스 테크놀로지스(RenTech)를 두고 이런 멋진 대목이 있어요.
의역하면 이렇습니다.
"그들은 과거 시장 데이터의 빈틈을 메우려고 갖은 애를 썼다. 시간이 흐르면서 가격 움직임을 워낙 잘 예측하게 되자, 그 빈틈을 채우는 알고리즘까지 만들었다."
알고리즘 트레이딩의 역사에 관심 있으시면 이 책을 강력히 추천합니다.
0 - https://amzn.to/4jNFpOS
0 -
저도 얼마 전에 그 부분을 읽었어요. 이 책 강력 추천합니다!
정말 재밌게 읽은 책이에요! 그런데 요즘 AI가 새로운 수학 문제를 푸는 데 워낙 능숙해지고 있으니 궁금해지네요. 르네상스 테크놀로지스의 기법 일부를 무식하게 힘으로 밀어붙여서 알아낼 수 있지 않을까요? 예를 들어 AI한테 르네상스 직원들이 발표한 연구 논문(과 관련 연구)을 훑게 해서, 각자의 전문 분야를 트레이딩에 어떻게 적용할 수 있을지 알아내고, 실험과 백테스트를 돌려서 뭐가 통하는지 보게 하는 거죠. 아니면 어려운 건 수학보다 데이터와 실행인가요?
저는 르네상스 테크놀로지스를 많이 조사했습니다. 제가 알기로 초기 방식은 그렇게 대단한 비밀이 아니에요. 마르코프 모델링과 NLP 관련 기법이 많았는데, 결국은 시장 데이터로 통계적 모델링을 시도한 몇 안 되는 회사였다는 게 핵심이었다고 봅니다. (에드 소프도 있었죠!)
거기서 채용되었거나 일했던 사람들의 이력은 쉽게 찾아볼 수 있습니다. 또 수년에 걸쳐 조금씩 새어 나온 정보, 단편적인 이야기, 작은 단서도 있고요. 그래도 "이게 그들의 전략이었다"를 어느 정도 정밀하게 추정해 내는 건 거의 불가능할 겁니다. 당신이 맞게 가고 있는지 아닌지 알려 줄 수 있는 사람은 세상에 손에 꼽을 정도일 거예요.
그래도 아주 흥미로운 사고 실험이네요.
아이러니하게도 이 부분이 그들이 제대로 해내는 데 애를 먹은 쪽입니다. 당시에는 프로그래밍이 지금처럼 흔하지 않았거든요.
시장에는 국면이 있고, 국면이 바뀌면 행동이 되돌아갑니다. 그래서 팡팡 튀던 장이 순식간에 얻어맞고 말을 더듬는 장으로 바뀌죠. 예측 모델은 그걸 낚싯바늘째 덥석 물어요.
이미지의 경우 잠재 확산(latent diffusion)은 잠재 공간에서 관련 샘플을 받아 현실적인 이미지를 만들어 낼 수 있는 특수한 디코더를 쓸 때만 작동합니다. 이 디코더는 GAN처럼 학습되고, 픽셀 단위 오차가 아니라 다른 네트워크 등으로 뽑아낸 더 높은 수준의 이미지 특징에 초점을 맞춥니다. 이 문제에도 그런 디코더를 만들었다면 겪은 문제가 해결됐을 것 같아요.
플로 매칭이 DDIM보다 안정적인 이유를 더 알고 싶다면 Heitz 2023을 보세요. 둘이 거의 같다는 점을 잘 설명하는 논문입니다. 다만 DDIM은 노이즈 제거 과정 초반에 발산하는 1/α 항이 있는 미분방정식에 해당하고, 플로 매칭/IADB는 발산하지 않습니다. https://arxiv.org/abs/2305.03486
기사에 나온 이 부분을 말씀하시는 거죠.
"이론적으로 이상적"이라고 할 때는 특정한 의미가 있어요. DDPM 손실은 정보 이론적으로 이미지를 복원하는 데 필요한 오류 정정 비트 수입니다. 노이즈가 아주 낮은 구간에서는 이 값이 특이점으로 발산합니다. 이건 사실 문제가 아닙니다. 어차피 스케줄의 log-SNR은 이미지 양자화 수준(보통 9비트)으로 상한을 두어야 하고, 학습된 상한은 이 값의 10% 이내에 들어오니까요.
플로 매칭이 발산하지 않는 이유는 손실에서 log-SNR 비율을 없애기 때문입니다. 이 비율은 스케줄 전체에서 몇 자릿수에 걸쳐 변할 수 있으니 학습 중에 중요도 샘플링을 해야 합니다. 제 짐작에는 Kavish가 이걸 빠뜨려서 발산한 것 같습니다.
AI로 회사가 계획을 공개하기 훨씬 전에, 채용이나 주문 같은 행동을 보고 그 계획을 추론해 낼 수 있을까요?
스타트업에 VC가 지분을 사기 전에 VC의 관심이 얼마나 되는지 알아낼 수도 있을까요?
그래도 계획이 결과를 결정하지는 않아요. 큰 업종 단위의 움직임만 있을 뿐이죠. 예를 들어 AI를 하겠다고 발표하면 주가가 조금 튀는 경향이 있는데, 그 효과도 점점 줄고 있고요.
정말 흥미로웠고, 짧은 인턴 기간에 해낸 양이 많네요. 공개 회고와 해커뉴스 등장은 말할 것도 없고요. 잘했어요, Kavish!
아니요.