1. 인과관계(Causality)란 무엇인가?

단순히 A와 B가 같이 움직이는 것(상관관계)이 아니라, “A를 바꾸면 B도 변하는가?”를 따지는 것이다. 단순히 패턴을 찾는 것(머신러닝)을 넘어, 어떤 행동을 해야 목표를 달성할지 판단하기 위해 필요하다.

  • 정의

    • 하나의 사건, 상태, 객체(원인)가 다른 것(결과)의 생성에 기여하는 영향력이다.
    • 원인은 결과에 부분적으로 책임이 있으며, 결과는 원인에 부분적으로 의존한다.
    • 단순한 연관성(Association, Linked to)과는 다르며, ‘증가시킨다’, ‘감소시킨다’와 같은 변화를 의미한다.
  • 왜 공부하는가?

    • 과학(Science)의 정의 자체가 일반적인 진리나 법칙(Laws)의 작동을 다루는 지식 체계이며, 여기서 법칙은 곧 인과적 메커니즘을 의미한다.
    • 자연과학뿐만 아니라 사회과학, 경제학, 공중보건, 그리고 정밀한 제어가 필요한 공학(Engineering)에서도 필수적이다.
  • AI/ML/DS와의 관계

    • Machine Learning
      • 주로 상관관계(Correlation, )를 학습한다.
      • 하지만 연관성은 인과성이 아니다.
    • Artificial Intelligence
      • 목표 달성을 위해 행동(Action)을 취하는 에이전트(예: 강화학습)를 다루므로 인과적 사고가 필요하다.
    • Data Science
      • 데이터로부터 인과적 결론을 도출하는 것이 중요하다.

2. Pearl의 인과 계층 (Causal Hierarchy)

Judea Pearl 교수가 제시한 인과관계의 3단계 계층이다.

  1. Level 1: 관측 (Associational/Observational)

    • 보는 것
    • “서로 관련이 있는가?”
    • (상관관계)
  2. Level 2: 개입 (Interventional/Experimental)

    • 하는 것
    • “내가 이것을 하면 어떻게 되는가?”
    • (도구 사용, 실험)
  3. Level 3: 반사실 (Counterfactual)

    • 상상하는 것
    • “만약 내가 다르게 했더라면 어떻게 되었을까?”
    • (상상, 후회)
    • 이게 가장 어렵고 중요하다.

3. 심슨의 역설 (Simpson’s Paradox)

관찰된 데이터만으로는 잘못된 결론을 내릴 수 있음을 보여주는 대표적인 사례이다. 숨겨진 요인(교란 변수)이 데이터를 왜곡했기 때문이다.

  • 사례: 신장 결석(Kidney Stone) 환자에게 처방 A와 B 중 어느 것이 더 효과적인가?

    • 전체 데이터: 처방 B의 성공률이 더 높아 보임
    • 그룹별 데이터 (결석 크기 작음/큼): 각 그룹에서는 처방 A의 성공률이 더 높음
  • 원인

    • 결석 크기(Stone Size)가 처방 선택과 치료 결과 모두에 영향을 미치는 교란 변수(Confounding Variable)로 작용했기 때문이다.
    • (의사들이 상태가 심각한 큰 결석 환자에게 처방 A를 더 많이 사용함)
  • 해결

    • 무작위 배정(Randomized): 처방을 무작위로 결정하면(), 결석 크기가 처방 선택에 영향을 주지 못하므로 진정한 인과 효과(A가 더 좋음)를 파악할 수 있다.
  • 교훈

    • 인과 분석은 데이터만으로는 불가능하며 배경지식(Subject-matter knowledge)이 필요하다.
    • 동일한 데이터라도 인과 구조가 다르면 다르게 분석해야 한다.
    • 순수하게 통계적인 규칙만으로는 인과 분석을 수행할 수 없다.

4. 인과 추론의 형식화 (Formalizing Causality)

현실의 인과관계를 수학적으로 모델링하기 위한 두 가지 주요 프레임워크가 있다.

A. 잠재적 결과 프레임워크(PO)

둘 중 하나만 경험한다. 나머지 하나는 알 수 없다. 이를 결측치(Missing Data) 문제로 보고 푼다.

  • 잠재적 결과 프레임워크(Potential Outcome Framework, PO)

    • Neyman과 Rubin에 의해 발전됨 (Neyman-Rubin Causal Model)
  • 핵심 개념

    • 잠재적 결과 (): 각 개체(Unit)에 대해 처치(Treatment)를 받지 않았을 때의 결과 와 받았을 때의 결과 이 존재한다고 가정한다.
  • 인과 추론의 근본적 문제 (Fundamental Problem of Causal Inference)

    • 현실에서는 각 개체에 대해 하나만 관측할 수 있다. 나머지 하나는 결측치(Missing Data)가 된다.
    • 따라서 인과 추론은 본질적으로 결측 데이터 문제(Missing Data Problem)로 볼 수 있다.

B. 구조적 인과 모델(SCM)

변수들의 관계를 그래프(화살표)로 그린다. do(⋅) 연산으로 그래프에서 특정 원인을 강제로 고정했을 때의 파급 효과를 계산한다.

  • 구조적 인과 모델(Structural Causal Model, SCM)

    • Judea Pearl에 의해 발전됨
  • 핵심 개념

    • 구조적 방정식: 변수들 간의 관계를 결정론적 함수로 표현한다. () 여기서 는 부모 변수(직접적 원인), 는 외생 변수(노이즈)이다.
    • 인과 그래프 (Causal Diagram/DAG): 변수 간의 인과관계를 화살표로 시각화한다.
  • 개입 (Intervention) - 연산자

    • 는 변수 를 특정 값으로 강제로 고정하는 행위이다.
    • 그래프 상에서는 로 들어오는 모든 화살표를 제거하고 의 값을 로 고정하는 것으로 표현된다. 이는 관찰(Seeing)과 개입(Doing)의 차이를 명확히 보여준다.
  • 특징: 데이터 생성 과정을 구조적으로 모델링하며, 반사실적 추론과 개입을 명시적으로 지원한다.