stefan-jansen/machine-learning-for-trading

Code for Machine Learning for Trading, 3rd edition — from data sourcing to live execution.

해결하는 문제

이 프로젝트는 금융 연구 아이디어를 실제 운영 가능한 트레이딩 전략으로 전환할 때 발생하는 복잡성을 해결합니다. 모델 튜닝과 평가 사이의 "evidence boundary"를 탐색하기 위한 규율 있는 프레임워크를 제공하여, 과적합(overfitting), 룩어헤드 편향(lookahead bias), 데이터 누수(data leakage)와 같은 일반적인 함정을 피할 수 있도록 실무자를 돕습니다.

작동 방식

이 리포지토리는 다섯 가지 부분으로 구성된 포괄적인 워크플로우를 따릅니다:

  1. 데이터 인프라: 합성 데이터 생성을 포함한 시장, 펀더멘털 및 대체 데이터 관리.
  2. 리서치 및 피처 엔지니어링: 학습 태스크 정의 및 fractional differencing 및 transformer 기반 embeddings와 같은 기술을 사용하여 원시 데이터를 시그널로 변환.
  3. 모델 개발: gradient boosting (XGBoost, LightGBM)부터 딥 타임시리즈 아키텍처 (PatchTST, Mamba) 및 인과 머신러닝에 이르는 광범위한 툴킷 구현.
  4. 전략 구현: 이벤트 기반 백테스팅을 통한 전략 시뮬레이션, 거래 비용 관리 및 리스크를 고려한 포트폴리오 구축.
  5. 고급 AI: 실행을 위한 강화 학습, 금융 리서치를 위한 RAG 및 멀티 에이전트 시스템 통합.

대상자

실제 시장에서 금융 모델을 개발하고 배포하기 위해 엄격하고 재현 가능한 프로세스가 필요한 퀀트 리서처, 머신러닝 엔지니어 및 알고리즘 트레이더를 위해 설계되었습니다.

주요 특징

  • 9개의 포괄적인 케이스 스터디: ETF, crypto, 주식, 옵션, FX 및 선물 포함.
  • 6개의 프로덕션 지향 Python 라이브러리: 데이터 수집, 피처 엔지니어링, 모델링, 진단, 백테스팅 및 라이브 배포용.
  • 고급 AI 통합: SEC 공시 기반의 RAG 및 자율 멀티 에이전트 리서치 시스템 특징.
  • 방법론적 엄격함: 다중 검정 제어(Deflated Sharpe Ratio) 및 불확실성 추정을 위한 conformal prediction 도구 포함.