요약

  • 정형 데이터는 어디에나 있지만
  • 이질적 특징·결측·소규모·불균형·도메인 특수성 때문에 비전·언어와는 다른 접근이 필요하다.

1. 정형 데이터(Tabular Data)란?

  • 행(row)과 열(column)으로 구성된 2차원 구조의 데이터이다.
  • 각 행은 하나의 관측치(sample/record)를, 각 열은 측정된 속성(feature)을 나타내며, 특정 열 하나가 예측 대상인 타깃(label)이 된다.

1.1. 정형 데이터의 특징

정형 데이터가 이미지·텍스트와 다르게 모델링이 까다로운 이유는 다음 특성들 때문이다.

  • 이질적 특징 유형(Heterogeneous features)

    • 한 행 안에 수치형, 범주형, 이진형, 날짜형, 텍스트 등
    • 통계적 성질이 전혀 다른 특징이 섞여 있어 픽셀 같은 동질적 데이터보다 처리가 어렵다.
  • 공간·순서 구조 없음

    • 열의 순서가 임의적이라(“age”와 “salary”를 바꿔도 의미 불변),
    • 모델이 특징 순서에 불변(permutation-invariant)해야 한다.
  • 작거나 중간 규모의 데이터셋

    • 보통 수천 행 수준이라 데이터 효율성이 중요하고, 강한 귀납적 편향을 가진 트리 앙상블이 선호된다.
    • 과적합 방지와 일반화가 핵심이다.
  • 결측치가 흔함

    • 센서 고장, 응답 누락, 출처 차이 등으로 발생하며 모델이 불완전한 입력에 견뎌야 한다.
  • 잡음 있는 불완전한 레이블

    • 사람의 비일관성, 규칙 변화, 누설(leakage) 위험이 있어 시간 순서를 존중한 평가가 필요하다.
  • 클래스 불균형 (Imbalance)

    • 사기 탐지·질병 진단처럼 소수 클래스가 1% 미만일 수 있어, 정확도 외의 적절한 지표가 필요하다.
    • 특정 클래스에 대한 많은 데이터를 무조건 얻을 수가 없다.
  • 도메인 다양성과 제한된 도메인 지식

    • 중요한 특징 상호작용이 알려져 있지 않거나 도메인 특수적이라,
    • 데이터로부터 관계를 학습하고 허위 단서(spurious shortcut)를 피해야 한다.

1.2. 정형 데이터의 주요 과제(Task)

  • 예측(지도학습)

    • 회귀 또는 분류
    • (예: 신용 점수 산정)
  • 이상 탐지

    • 드문 비정상 레코드 식별
    • 대개 비지도
    • (예: 카드 사기 탐지)
  • 군집화

    • 레이블 없이 유사 레코드 그룹화
    • (예: 고객 세분화)
    • k-means·GMM·DBSCAN 등
  • 표 질의응답(Table QA)

    • 자연어 질문 + 표 → 답변, LLM으로 실현 가능해짐
  • 합성 데이터 생성

    • 통계 성질은 유지하되 개인정보 보호
    • (예: 의료 데이터 공유)

2. 머신러닝 파이프라인

데이터 수집 → EDA → 전처리 → 모델링 → 평가 → 배포·모니터링의 흐름을 가진다.

  1. 데이터 수집

    • 신뢰할 수 있는 출처
    • 여러 테이블 결합
    • 외부 데이터 활용
    • 재현성 문서화
  2. EDA (Exploratory Data Analysis; 탐색적 데이터 분석)

    • 요약 통계
    • 결측 패턴 (결측치; Missing Value)
    • 분포
    • 상관관계
    • 이상치(Outlier)·불균형 파악
  3. 전처리

    • 모델이 학습 가능한 형태로 변환
    • 데이터 누설 방지를 위해
      • 학습 데이터에만 fit하고
      • 검증/테스트에는 transform만 적용
  4. 모델링

    • 선형/로지스틱 회귀 (해석 가능 베이스라인)
    • → 트리 앙상블 (XGBoost, LightGBM, CatBoost)
    • → 딥러닝·파운데이션 모델 (LLM, TabPFN)
  5. 평가

    • held-out 테스트셋, 교차검증, 과제에 맞는 지표 선택
  6. 배포·모니터링

    • 학습-배포 간 일관성 유지
    • 데이터/개념 드리프트·성능 저하·공정성 추적 후 필요시 재학습

2.1. 정형 데이터 전처리

특징이 이질적이라 전처리가 특히 중요하다.

  • 결측치 처리

    • 삭제
    • 상수 채움(“Unknown”)
    • 통계적 대치(평균·중앙값·최빈값)
    • 모델 기반 대치(k-NN)
    • 트리 모델의 자체 지원
  • 범주형 인코딩

    • One-Hot(단순, 순서 미부여, 고차원 문제)
    • Ordinal(자연 순서 있을 때)
    • Target(범주별 평균 타깃값)
    • Embedding(벡터 학습)
  • 수치형 변환

    • 스케일링(표준화, Min-Max), 분포 변환(로그·분위수), 비닝(이산화)
    • 트리 모델은 스케일에 불변
  • 특징 공학(Feature Engineering)

    • 집계, 비율(부채비율 등), 시간차, 날짜 분해, 상호작용(가격×수량), 도메인 특화 변수(BMI 등)
    • 때로 모델 선택보다 중요

2.2. 평가(Evaluation)

정형 ML은 하이퍼파라미터에 민감하고 데이터가 작아 평가가 모델 선택만큼 중요하다.

  • 교차검증(CV) + 하이퍼파라미터 최적화(HPO)

    • 최종 평가는 held-out 테스트셋으로
    • 흔한 함정은 학습-테스트 오염과 단일 검증셋 과적합
  • 평가 지표

    • 회귀는 MAE/MSE/R², 이진 분류는 정확도·정밀도·재현율·F1, 임계값 독립 지표로 AUC-ROC·AUC-PR
    • 불균형 데이터에서는 AUC-PR이 더 유용
  • 문제에 맞는 지표 선택

    • 사기 탐지→PR-AUC, 의료 스크리닝→재현율, 스팸 필터→정밀도
    • 최선의 지표는 오류의 실제 비용을 반영하는 것

3. 해석가능성(Interpretability)

  • 예측 성능만으로는 부족하며 “왜 그런 예측을 했는가”를 이해해야 한다.
  • 전역적으로 어떤 특징이 중요한지, 지역적으로 특정 샘플의 예측 이유는 무엇인지를 본다.
  • 주요 기법은 Permutation Importance(특징 셔플 후 성능 저하 측정)와 SHAP(특징 기여도, 트리 모델에 특히 효율적)이다.

4. 도구·데이터셋 및 로드맵

  • 도구: NumPy, Pandas, scikit-learn, Optuna(AutoML), PyTorch 등
  • 데이터셋: Kaggle, UCI, OpenML, AI Hub
  • 향후 강의: 고전 ML → 딥 아키텍처 → 표현 학습 → LLM과 정형 데이터 → 새 패러다임 TabPFN