Ohse AI LabOHSE AI LAB
체계적 리스크 예측을 어떻게 검증할까? — 다목적 유도 가능성으로 백테스트를 가능하게 만든 연구
🤖 AI 연구

체계적 리스크 예측을 어떻게 검증할까? — 다목적 유도 가능성으로 백테스트를 가능하게 만든 연구

오세랩··8분 읽기

체계적 리스크 예측을 어떻게 검증할까? — 다목적 유도 가능성으로 백테스트를 가능하게 만든 연구

"우리 모델이 맞는지 어떻게 알 수 있을까?" — 이 질문에 대답할 수 없었던 리스크 관리의 치명적 약점을 해결한 논문이 있습니다.


들어가며: 일기예보와 리스크 예측의 공통점

일기예보가 "내일 비가 올 확률 70%"라고 했는데 비가 오지 않았다면, 그 예보가 틀렸다고 말할 수 있을까요? 사실 한 번의 결과만으로는 판단하기 어렵습니다. 하지만 같은 예보를100번 반복했을 때 실제로 비가 온 날이70%정도였다면, 그 예보는상당히 정확하다고 할 수 있죠.

금융에서도비슷한 문제가 있습니다. "이 포트폴리오의 체계적 리스크는 이 정도다"라고 예측했는데, 실제로 시장이 폭락했을 때 그 예측이 맞았는지 어떻게 검증할까요? 이게 바로 백테스트(backtesting)라는 과정인데, 생각보다 훨씬 어려운 문제입니다.


무엇이 문제였나: 검증할 수 없는 리스크 지표

금융에서 널리 쓰이는 체계적 리스크 지표들이 있습니다:

  • CoVaR: 한 금융기관이 위기에 처했을 때 시장 전체의 VaR이 어떻게 변하는지
  • MES(Marginal Expected Shortfall): 시장이 하락할 때 특정 자산의 기대 손실
  • CoES: CoVaR의 확장版으로, 조건부 기대 shortfall을 측정

이 지표들은2008년 금융위기 이후 규제 당국과 금융기관에서 널리 사용되고 있습니다. 그런데 여기에 근본적인 통계적 문제가 숨어 있었습니다.

"유도 가능성(elicitability)"이란 무엇인가

쉽게 말해, 어떤 통계량이 "유도 가능하다"는 것은 그 값을 예측한 모델의好坏를 숫자로 평가할 수 있다는 뜻입니다.

예를 들어, 평균(mean)은 유도 가능합니다. 예측값과 실제값의 차이를 제곱해서 평균내면 되니까요(평균제곱오차). 분위수(quantile)도 유도 가능합니다. asymmetric scoring function이라는 도구가 있거든요.

그런데 CoVaR, MES 같은 체계적 리스크 지표들은 유도 가능하지 않습니다. 이게 무슨 뜻이냐면, 두 모델 A와 B가 있을 때 "A가 B보다 낫다"고 통계적으로 말할 수 있는 적절한 방법이 없다는 겁니다.

更糟糕的是,这些指标甚至还不是 "식별 가능한(identifiable)" 것도 아니었습니다. 식별 가능하지 않다는 것은, 같은 데이터에서 参数 값이 여러 개 나올 수 있다는 뜻입니다.

결국: 체계적 리스크 모델의 예측이 맞는지 검증할 수 있는 통계적 방법이 없었다는 겁니다. 규제 당국이这些指标에 기반해 자본 요구량을 설정하고 있었는데, 그 지표들을 평가할 방법이 없었다는 것은상당히 심각한 문제입니다.


핵심 아이디어: 다목적 유도 가능성

이 논문의 핵심 아이디어는 간단하지만 강력합니다:

"하나의 지표를 직접 평가하는 대신, 두 개의 관련 지표를 동시에 평가하자."

这就是 다목적 유도 가능성(multi-objective elicitability) 이라는 개념입니다.

구체적으로, CoVaR 같은 지표는单独로는 유도 가능하지 않지만, (VaR, CoVaR)这样的 쌍으로 묶으면 평가할 수 있습니다. 두 개의 점수를 결합한 2차원 scoring function을 만들고, 여기에 사전순(lexicographic order)을 적용하는 거죠.

비유를 들어보겠습니다. 한 학생의 "실력"을 하나의 숫자로 평가하기 어렵지만, (국어 점수, 수학 점수)这样的 쌍으로는 비교할 수 있습니다. "국어 점수가 같으면 수학 점수로 비교한다"这样的规则이 사전순입니다.

Diebold-Mariano 검정의扩展

이 프레임워크를 기반으로, 저자들은 기존의 Diebold-Mariano형 검정을 2차원으로扩展합니다. Diebold-Mariano 검정은 두 예측 모델의 성능差异가 통계적으로 유의미한지检验하는 널리 쓰이는방법인데, 이걸 2차원 점수에서도 사용할 수 있게 만든 겁니다.

更实用的是,저자들은 交通灯(traffic-light) 접근법을 제안합니다. 이는 규제 당국이 쉽게理解하고사용할 수 있는 방법으로, 검정 결과를三种颜色으로 분류합니다:

  • 녹색: 모델이 적절히 작동하고 있음
  • 노란색: 경계 — 주의가 필요함
  • 빨간색: 모델이 부적절함 — 수정이 필요함

Basel II/III에서 사용하는 것과비슷한 접근법이지만, 이번에는 统计学적 근거가 확실히 뒷받침됩니다.


결과 — 무엇을 알아냈나

저자들은 이 방법을 DAX 30(독일)과 S&P 500(미국) 수익률 데이터에 적용해 실증 검증을 했습니다.

핵심발견:

  1. 실제로 작동한다: 이론적으로 제안한 방법이 실데이터에서 의미 있는결과를 낸다.
  2. 규제에 적용 가능하다: traffic-light 접근법이 현행 규제 프레임워크와 호환된다.
  3. 규제 개선 제안: 실증 분석을 바탕으로 규제 당국에具体的인 개선建议을 제시한다.

이 논문은 Journal of Business & Economic Statistics에 게재될 정도로 학술적으로도 인정받았습니다 (28페이지 본문 + 25페이지 부록).


한계와 주의점

완벽한 해결책은 아닙니다:

  • 사전순의 의존성: 2차원 점수의 순서(哪个를 먼저 볼지)가 결과에 영향을 줄 수 있습니다. "국어 먼저 vs 수학 먼저"의选择에 따라 평가가 달라질 수 있다는 거죠.
  • 검정력(power): 샘플 크기가 작을 때 실제로 불량한 모델을 잘 잡아낼 수 있는지에 대한 분석이 더 필요합니다.
  • 다른 지표들: CoVaR之外의 다른 체계적 리스크 지표(예: SRISK, DCC 등)에도 같은框架이 잘 작동하는지 추가연구가 필요합니다.

그래서 투자/실무엔?

이연구의 시사점은 명확합니다:

리스크 모델의 검증이 가능해진다. 지금까지많은金融机构이사용해 온 체계적 리스크 모델이 실제로 맞는지 검증할 수 있는 방법이 없었습니다. 이 연구가提供하는框架은 그 문제를解决합니다.

실무 적용 포인트:

  • 포트폴리오 수준의 체계적 리스크 모니터링에서 예측 모델의 신뢰성을统计学적으로 검증
  • 리스크 한도 설정과 자본 배분의 근거로 활용
  • 규제报告에서交通灯방법을 통해 결과를 명확하게 커뮤니케이션

특히자기자본을 운용하는 입장에서는, 리스크 모델의 예측이 맞는지 확인하는 것이 곧 자본 효율성과 직결됩니다. 모델이 틀렸는데 맞다고 믿고 있다면, 실제 리스크보다 적게资本을持有하고 있을 수 있기 때문입니다.


함께하기

퀀트 투자와AI 기반 리스크 관리에 관심이 있으시면:

  • 🌐 ohselab.com에서更多信息
  • 📧 뉴스레터 구독으로 최신연구 업데이트 받기
  • 🐦 소셜 미디어 팔로우로 커뮤니티 참여

더 알아보기

  • 원 논문: arXiv:2104.10673 — Fissler & Hoga, Journal of Business & Economic Statistics (2023)
  • 5차원 점수: 혁신성 74 / 적용성 82 / 엄밀성 67 / 재현성 35 / 통찰력 78 (Composite: 69.2)
  • 티어: A

참고: 오늘 수집된기타值得关注的 논문

논문티어Composite분과
TradeR: Deep Hierarchical RL for Trade ExecutionA66.8알고리즘 트레이딩
Optimal bidding in electricity auctionsA66.3시계열 계량경제학
Dynamic portfolio with Merton ModelA65.8포트폴리오 최적화
Estimating Future VaRA65.6리스크 관리
Efficient Hedging Frontier with DNNA65.5포트폴리오 최적화

TradeR框架: 계층적强化学习을사용해 거래 실행에서 재앙과 놀람을最小化하는 구조도. 시장 가격 전이와 에너지 기반 놀람估计을结合한다.

AI 기술이 궁금하신가요?

오세에이아이연구소의 AI 연구와 제품에 대해 문의해주세요.

문의하기

관련 글