Ohse AI LabOHSE AI LAB
🤖 AI 연구

90만 파라미터가 초거대 AI를 이겼다 — 재무제표 5년 장기 예측의 비밀

오세에이아이연구소··14분 읽기

90만 파라미터가 초거대 AI를 이겼다 — 재무제표 5년 장기 예측의 비밀

"더 큰 모델이 답이 아니었다" — 전문가 트레이닝이 범용 스케일을 이긴 이야기


들어가며: 투자의 핵심 질문

어떤 회사에 투자할 때, 가장 근본적인 질문은 하나입니다: "이 회사가 앞으로 얼마나 벌까?"

주식을 사는 사람은 미래 매출이 궁금하고, 채권을 사는 사람은 미래 현금흐름이 궁금합니다. 그런데 놀랍게도, 대부분의 투자 분석은 겨우 1~2분기 뒤의 실적만 예측합니다. 반면 DCF(할인현금흐름) 밸류에이션에서는 회사 가치의 대부분이 1년 이상 먼 미래의 현금흐름에서 나옵니다.

즉, 장기 재무제표를 정확하게 예측하는 것이 투자 정확도의 핵심인데, 이걸 제대로 하는 도구가 지금까지 없었습니다.

텍사스 대학교 오스틴의 Travis Johnson 교수팀이 이 문제에 정면으로 도전했습니다. 78개 재무제표 항목을 최대 20분기(5년) 앞까지 동시에 예측하는 공개 벤치마크와 전문 모델을 발표했는데, 결론이 놀랍습니다. 거대한 범용 AI(Claude Opus 4.8 같은 최신 LLM)보다, 겨우 90만 파라미터짜리 전문 트랜스포머가 압도적으로 더 잘 맞혔습니다.


무엇이 문제였나: 장기 예측의 사각지대

기존 재무제표 예측 연구는 대개 단일 항목(예: 다음 분기 매출)에 집중했습니다. 하지만 실제 투자 분석에서는 매출, 매출원가, 영업이익, CAPEX, 운전자본, 부채 등 여러 항목이 서로 연결되어 있습니다. 하나만 맞히고 나머지를 놓치면, DCF 계산 자체가 어긋납니다.

게다가 예측 기간이 길어질수록 문제가 커집니다. 1분기 뒤는 최근 실적 추세를 그대로 연장해도 어느 정도 맞히지만, 5년 뒤는 이야기가 완전히 다릅니다. 시장 환경이 바뀌고, 경쟁 구도가 달라지고, 회사 자체가 변합니다.

그런데 여기서 흥미로운 질문이 생깁니다: 요즘 화제인 초거대 LLM(GPT, Claude 같은 모델)이 이걸 잘할 수 있을까? 워낙 똑똑하고, 방대한 금융 지식을 학습했으니, 재무제표 예측도 잘하지 않을까요?

Johnson 교수팀의 답은 명확했습니다: 아닙니다. 오히려 정반대입니다.


핵심 아이디어: 전문가 트레이닝의 승리

재무제표를 "튜플의 집합"으로 보다

Forma의 핵심 아이디어는 의외로 단순합니다. 재무제표를 표(테이블)가 아니라 (계정 이름, 분기, 값)이라는 튜플들의 집합으로 표현하는 것입니다.

예를 들어, "2024년 3분기 매출 500억 원"이라는 하나의 숫자가 하나의 튜플이 됩니다. 이런 튜플들을 모아서 트랜스포머에 입력하면, 모델은 항목들 사이의 관계를 자연스럽게 학습합니다.

이 방식의 장점은 무엇일까요? 먼저, 결측치 문제가 사라집니다. 실제 기업의 재무제표에서는 모든 항목을 다 보고하지 않습니다. 평균적으로 78개 항목 중 64개만 보고되고, 2% 미만만 전부 보고합니다. 기존 방식에서는 빈 칸을 채워 넣어야 하는데, 이 과정에서 오류가 생깁니다. Forma에서는 보고되지 않은 항목은 아예 토큰을 만들지 않으므로, 결측 보간 편향이 없습니다.

회계 대수학을 "암암리에" 학습

재무제표에는 회계 항등식이 있습니다. 예를 들어, "총자산 = 총부채 + 자본"이거나 "매출 - 매출원가 = 매출총이익" 같은 식입니다. Forma는 학습 시 이러한 항등식 그룹의 최소 2개 멤버를 마스킹합니다. 이렇게 하면, 모델은 단순히 숫자를 외우는 것이 아니라 회계의 경제적 논리를 학습하게 됩니다.

결과적으로 Forma의 예측은 원시적으로도 회계 항등식을 거의 만족합니다(중앙 위반 비율 3.7%). 필요하면 분산 가중 조화로 정확한 일관성을 달성할 수 있는데, 이때도 정확도 손실이 통계적으로 유의하지 않습니다(R2R^2 3.8pp 하락, p=0.16p=0.16).

확률적 예측: "얼마나 확실한지도" 알려준다

Forma는 점 추정이 아니라 확률 분포를 출력합니다. 즉, "다음 분기 매출이 500억 ± 50억"처럼 불확실성까지 함께 제공합니다. 이런 점은 리스크 조정 수익 추정에 매우 유용합니다.

5개의 다른 시드로 학습한 모델을 앙상블하면, 예측 구간이 본질적으로 보정됩니다. 실측 nominal 90% 구간이 실제 93.7%를 커버하므로, 과소 커버 문제가 없습니다.


결과 — 무엇을 알아냈나

모든 경쟁 모델을 압도

Johnson 교수팀은 ProForma-20Q라는 공개 벤치마크에서 여러 모델을 비교했습니다. 결과는 다음과 같습니다:

모델R2R^2 (변화량 기준)
Forma (5-시드 앙상블)0.289
랜덤포레스트0.272
엘라스틱넷0.258
FFNN (대형)0.247
체인드 GBM0.185
Claude Opus 4.8 (최고 LLM)0.186
Chronos-2 (시계열 기반 모델)0.155

숫자만 보면 차이가 작아 보일 수 있지만, 이건 78개 항목을 20분기에 걸쳐 jointly 예측하는 작업입니다. 1~2pp 차이가 실제 투자에서는 상당한 의미를 가집니다.

예측 기간이 길어질수록 격차 확대

가장 흥미로운 발견은 예측 기간이 길어질수록 Forma의 우위가 커진다는 것입니다.

  • 1분기 앞(h=1h=1): Forma vs 랜덤포레스트 0.8pp 차이
  • 20분기 앞(h=20h=20): Forma vs 랜덤포레스트 3.2pp 차이

이는 DCF 밸류에이션에서 가장 중요한 구간(1년 이상 장기)에서 Forma가 가장 큰 가치를 제공한다는 뜻입니다.

LLM의 장기 예측 붕괴

반면 LLM은 예측 기간이 길어지면서 급격히 무너졌습니다:

  • Claude Opus 4.8: h=1h=1에서 R2R^2 32.5% → h=20h=20에서 7.8%

최고 LLM조차 모든 목적별 학습 모델에 미달했고, 장기로 갈수록 격차가 벌어졌습니다. LLM이 방대한 금융 지식을 갖고 있지만, 구조화된 수치 예측 작업에서는 전문 모델을 따라잡지 못한다는 것을 보여줍니다.

시나리오 분석: "만약 매출이 이 경로를 따른다면?"

Forma의 또 다른 강점은 재학습 없이 시나리오 분석이 가능하다는 것입니다. 미래 매출 경로를 특정 값으로 고정하면, 나머지 항목(매출원가, CAPEX, 운전자본 등)의 예측이 자동으로 더 정확해집니다.

실험 결과, 실제 매출 경로를 고정했을 때 R2R^2이 30.5% → 34.8%로 개선되었고, 장기(h=20h=20)에서는 +7.4pp 향상되었습니다. 이는 "매출이 성장한다면 마진은 어떻게 될까?" 같은 질문에 재학습 없이 답할 수 있다는 의미입니다.


한계와 주의점

이 연구도 완벽하지는 않습니다.

먼저, 데이터 범위가 제한적입니다. Compustat 미국 비금융 상장기업 대상이므로, 금융기업이나 비상장 기업에는 바로 적용하기 어렵습니다. 물론 모델이 주가 수익률이나 애널리스트 데이터를 입력으로 사용하지 않으므로, 비상장 기업에도 이론적으로 적용 가능합니다.

둘째, 재현에 WRDS 접근 권한이 필요합니다. Compustat 데이터가 WRDS를 통해 제공되므로, 재현하려면 해당 기관의 구독이 있어야 합니다. 다만 벤치마크와 모델 코드는 공개되어 있습니다.

셋째, 학습 비용은 비교적 저렴합니다(5-시드 앙상블 기준 약 120달러, A100 GPU 기준). 하지만 추론 비용은 LLM 대비 훨씬 낮습니다(약 0.12~0.26달러/origin).


그래서 투자/실무엔?

이 연구가 투자 실무에 주는 시사점은 명확합니다.

첫째, 장기 밸류에이션의 입력을 개선할 수 있습니다. DCF에서 가장 불확실한 부분이 1년 뒤의 재무제표입니다. Forma 같은 모델이 20분기 앞까지의 매출·마진·CAPEX·운전자본을 일관되게 예측해주면, 내재가치 추정의 정확도가 올라갑니다.

둘째, 펀더멘털 팩터 신호를 만들 수 있습니다. "실제보다 저평가된 재무제표 예측"과 "실제"의 차이는 펀더멘털 팩터 신호가 될 수 있습니다. 특히 장기 예측에서 Forma의 우위가 크므로, 기존 단기 팩터와 결합하면 새로운 알파를 찾을 수 있습니다.

셋째, 불확실성까지 제공하므로 리스크 관리에 유용합니다. "다음 분기 매출이 500억 ± 50억"이라는 정보는 단순한 점 추정보다 훨씬 많은 것을 알려줍니다.

물론 이 모델도 완벽하지 않습니다. 시장 환경이 급변하거나, 구조적 변화가 있을 때는 예측이 빗나갈 수 있습니다. 하지만 기존 방법보다 확실히 나은 출발점입니다.


함께하기

최신 AI·퀀트 트레이딩 연구를 빠르게 만나고 싶다면:

  • 웹사이트: ohselab.com
  • 구독: 최신 논문 분석을 이메일로 받아보세요.
  • 상담: 퀀트 리서치 파이프라인 구축에 대해 이야기하고 싶다면 연락주세요.

더 알아보기

참고 — 이 블로그에서 다룬 그림: 본 논문은 공개 HTML 버전에서 figure를 제공하지 않아, 동일 수집일의 관련 논문(AgonAlpha: Autonomous Alpha Discovery)의 구조도를 대표 이미지로 사용했습니다.

AI 기술이 궁금하신가요?

오세에이아이연구소의 AI 연구와 제품에 대해 문의해주세요.

문의하기

관련 글