Ohse AI LabOHSE AI LAB
FinRL-Meta 앙상블 전략과 개별 전략의 누적 수익 비교 그래프
🤖 AI 연구

AI가 주식 투자를 한다고? — FinRL-Meta로 알아보는 금융 강화학습의 현실

오세에이아이연구소··11분 읽기

AI가 주식 투자를 한다고? \u2014 FinRL-Meta로 알아보는 금융 강화학습의 현실

\u201C로봇이 돈을 벌어다 주면 얼마나 좋을까?\u201D 누구나 한 번쯤 해보는 상상입니다. 그런데 실제로 AI에게 주식 매매를 맡기는 기술이 이미 존재하고, 꽤 진지하게 연구되고 있다는 사실, 알고 계셨나요?

오늘은 2022년 NeurIPS(세계 최고 수준의 AI 학회)에서 발표된 FinRL-Meta라는 연구를 살펴보겠습니다. 이 연구는 \u201CAI한테 투자를 시키는 방법을 체계적으로 정리한 일종의 교과서\u201D라고 할 수 있습니다.


들어가며: 왜 AI 투자가 어려울까?

여러분이 주식 투자를 한다고 생각해 봅시다. 뉴스를 읽고, 차트를 보고, 재무제표를 분석하고\u2026 할 일이 많죠. AI도 마찬가지입니다. 다만 AI는 사람보다 훨씬 빠르게 대량 데이터를 처리할 수 있습니다.

그런데 문제가 있습니다. 금융 데이터에는 세 가지 아주 까다로운 특성이 있어요:

  1. 신호가 약합니다: 주가 변동에는 수천 가지 요인이 얽혀 있어서, \u201C이 패턴이 나타나면 반드시 오른다\u201D 같은 확실한 규칙을 찾기 어렵습니다. 소음(우연한 변동)이 진짜 신호보다 훨씬 큽니다.

  2. 과거에 살아남은 회사만 봅니다: 지금 상장된 회사들의 과거 데이터만 보면, 망한 회사는 빠져 있습니다. 마치 \u201C모든 병원 환자가 건강하다\u201D고 착각하는 것과 비슷한 생존자 편향이 생깁니다.

  3. 과적합의 유혹: AI가 과거 데이터에 너무 잘 맞게 학습하면, 실제 미래에는 작동하지 않습니다. 시험 문제 답을 외운 것과 비슷한 거죠.


무엇이 문제였기까지?

기존에도 AI로 주식 투자를 시도하는 연구는 많았습니다. 하지만 각 연구팀마다:

  • 다른 데이터를 쓰고
  • 다른 환경에서 실험하고
  • 다른 방식으로 성과를 측정해서

\u201C이 방법이 정말 좋은 건지, 아니면 그냥 운이 좋았는지\u201D 비교하기 어려웠습니다. 마치 모든 학교마다 시험 방식이 달라서 전국 성적을 비교할 수 없는 것과 같습니다.


핵심 아이디어: 표준화된 \u201CAI 투자 훈련장\u201D을 만들자

FinRL-Meta 연구팀은 \u201CAI 투자 에이전트를 훈련하고 테스트할 수 있는 표준 환경\u201D을 만들었습니다.

쉽게 말하면, 학생(AI)이 공부(훈련)하고 시험(테스트)볼 수 있는 체계적인 교실을 만든 겁니다.

그림: FinRL-Meta 프레임워크 전체 구조. 데이터 수집부터 AI 학습, 실전 테스트까지 3단계로 나뉘어 있습니다.

이 프레임워크는 크게 세 층으로 이루어져 있습니다:

1단계: 데이터 층 (Data Layer)

주식, 암호화폐, 외환, ETF, 선물 등 다양한 금융 데이터를 자동으로 수집하고 정리합니다. 뉴스 감성 분석이나 기업 재무 데이터 같은 부가 정보도 포함됩니다.

2단계: 환경 층 (Environment Layer)

AI가 \u201C연습\u201D할 수 있는 가상 시장을 만듭니다. 실제 시장처럼 가격이 움직이고, 거래 비용이 발생하고, 포트폴리오를 관리할 수 있는 시뮬레이터입니다.

3단계: 에이전트 층 (Agent Layer)

실제로 투자 결정을 내리는 AI 에이전트가 있습니다. PPO, A2C, DDPG 같은 다양한 강화학습 알고리즘을 쓸 수 있고, 여러 에이전트를 조합하는 앙상블 전략도 가능합니다.


결과 \u2014 무엇을 알아냈나?

가장 흥미로운 결과부터 말씀드릴게요.

앙상블 전략이 이겼습니다

하나의 AI 에이전트만 쓰는 것보다, PPO + A2C + DDPG 세 가지를 조합한 앙상블 전략이 가장 좋았습니다.

전략Sharpe Ratio연간 수익률
앙상블 (PPO+A2C+DDPG)1.5325.9%
A2C 단독1.3723.3%
DJIA 지수 (시장 평균)1.3219.7%

여기서 Sharpe Ratio는 \u201C위험 대비 수익\u201D을 나타내는 지표입니다. 높을수록 좋습니다. 1.53이면 \u201C위험 1단위를 감수했을 때 수익 1.53단위를 얻었다\u201D는 뜻으로, 상당히 양호한 수준입니다.

그림: 앙상블 전략(빨간색)이 개별 전략과 시장 지수 대비 꾸준히 높은 누적 수익을 보여주는 그래프입니다. 시간이 지남에 따라 격차가 벌어지는 것을 볼 수 있습니다.

거래 비용은 0.1%로 가정

성과 수치는 거래할 때마다 0.1%의 비용이 든다고 가정한 결과입니다. 현실의 거래 비용은 이보다 클 수 있다는 점, 기억해 주세요.

VIX로 위기 감지

VIX(공포 지수라고도 불리는 시장 변동성 지표)가 급등하면 AI가 자동으로 보수적으로 변하는 \u201C크래시 컨트롤\u201D 기능도 내장되어 있습니다. 마치 비가 오면 자동으로 와이퍼가 작동하는 것과 비슷합니다.


한계와 주의점 \u2014 솔직하게 말씀드립니다

이 연구가 인상적이지만, 몇 가지 중요한 한계가 있습니다:

1. 시뮬레이션과 현실의 간격

가상 환경에서 아무리 잘해도, 실제 시장은 다릅니다. 실제 시장에서는 내 매매가 가격에 영향을 미치고(시장 충격), 정보에 지연이 있고, 예상치 못한 사건이 발생합니다.

2. 과적합 위험

AI가 과거 데이터에 너무 잘 맞게 학습하면, 미래에는 작동하지 않을 수 있습니다. 연구팀도 이 문제를 인정하고 있습니다.

3. 생존자 편향

상장폐지된 회사가 데이터에서 빠져 있어서, 수익률이 실제보다 높게 나올 수 있습니다.

4. 거래 비용 단순화

0.1% 고정 가정은 현실의 복잡한 거래 비용 구조를 단순화한 것입니다. 대량 매매 시 시장 충격 비용은 훨씬 클 수 있습니다.


그래서 투자/실무엔?

긍정적 측면

  • 전략 프로토타이핑에 유용: \u201C이 아이디어가 시장에서 통할까?\u201D를 빠르게 테스트해볼 수 있는 환경을 제공합니다.
  • 앙상블 접근 검증: 여러 AI 전략을 조합하면 단일 전략보다 안정적이라는 것을 체계적으로 보여줍니다.
  • GPU 가속: 1000개 이상의 코어를 활용한 병렬 시뮬레이션으로, 수많은 전략을 동시에 탐색할 수 있습니다.

주의할 점

  • 절대 \u201C자동으로 돈 버는 기계\u201D가 아닙니다. 이 프레임워크는 \u201C연습장\u201D이지, 실전 수익을 보장하지 않습니다.
  • 실제 자본을 투입하기 전에 반드시 아웃오브샘플 검증(학습에 안 쓴 데이터로 테스트)을 해야 합니다.
  • Paper trading(모의 거래) 기능이 내장되어 있으므로, 충분한 모의 테스트 후 실전 전환을 권장합니다.

함께하기

ohselab은 자본 시장의 효율성과 AI 기반 투자 전략을 연구합니다.

  • \uD83C\uDF10 ohselab.com \u2014 연구 소개 및 상담
  • \uD83D\uDCE7 구독을 통해 최신 연구 소식을 받아보세요

더 알아보기

  • 원 논문: arXiv:2211.03107 \u2014 NeurIPS 2022 Datasets and Benchmarks Track
  • 5차원 평가 점수: Composite 79.7 (A등급)
  • 분과: C2 \u2014 강화학습/최적화
  • 관련 키워드: 금융 강화학습, DRL, 포트폴리오 최적화, 앙상블 전략, 시장 환경

AI 기술이 궁금하신가요?

오세에이아이연구소의 AI 연구와 제품에 대해 문의해주세요.

문의하기

관련 글