Supplementary Materials
인공지능
LG AI연구원 9기 - Supervised Learning
LG AI연구원 9기 - Tabular ML
요약
- 정형 데이터는 어디에나 있지만
- 이질적 특징·결측·소규모·불균형·도메인 특수성 때문에 비전·언어와는 다른 접근이 필요하다.
1. 정형 데이터(Tabular Data)란?
- 행(row)과 열(column)으로 구성된 2차원 구조의 데이터이다.
- 각 행은 하나의 관측치(sample/record)를, 각 열은 측정된 속성(feature)을 나타내며, 특정 열 하나가 예측 대상인 타깃(label)이 된다.
1.1. 정형 데이터의 특징
정형 데이터가 이미지·텍스트와 다르게 모델링이 까다로운 이유는 다음 특성들 때문이다.
-
이질적 특징 유형(Heterogeneous features)
- 한 행 안에 수치형, 범주형, 이진형, 날짜형, 텍스트 등
- 통계적 성질이 전혀 다른 특징이 섞여 있어 픽셀 같은 동질적 데이터보다 처리가 어렵다.
-
공간·순서 구조 없음
- 열의 순서가 임의적이라(“age”와 “salary”를 바꿔도 의미 불변),
- 모델이 특징 순서에 불변(permutation-invariant)해야 한다.
-
작거나 중간 규모의 데이터셋
- 보통 수천 행 수준이라 데이터 효율성이 중요하고, 강한 귀납적 편향을 가진 트리 앙상블이 선호된다.
- 과적합 방지와 일반화가 핵심이다.
-
결측치가 흔함
- 센서 고장, 응답 누락, 출처 차이 등으로 발생하며 모델이 불완전한 입력에 견뎌야 한다.
-
잡음 있는 불완전한 레이블
- 사람의 비일관성, 규칙 변화, 누설(leakage) 위험이 있어 시간 순서를 존중한 평가가 필요하다.
-
클래스 불균형 (Imbalance)
- 사기 탐지·질병 진단처럼 소수 클래스가 1% 미만일 수 있어, 정확도 외의 적절한 지표가 필요하다.
- 특정 클래스에 대한 많은 데이터를 무조건 얻을 수가 없다.
-
도메인 다양성과 제한된 도메인 지식
- 중요한 특징 상호작용이 알려져 있지 않거나 도메인 특수적이라,
- 데이터로부터 관계를 학습하고 허위 단서(spurious shortcut)를 피해야 한다.
1.2. 정형 데이터의 주요 과제(Task)
-
예측(지도학습)
- 회귀 또는 분류
- (예: 신용 점수 산정)
-
이상 탐지
- 드문 비정상 레코드 식별
- 대개 비지도
- (예: 카드 사기 탐지)
-
군집화
- 레이블 없이 유사 레코드 그룹화
- (예: 고객 세분화)
- k-means·GMM·DBSCAN 등
-
표 질의응답(Table QA)
- 자연어 질문 + 표 → 답변, LLM으로 실현 가능해짐
-
합성 데이터 생성
- 통계 성질은 유지하되 개인정보 보호
- (예: 의료 데이터 공유)
2. 머신러닝 파이프라인
데이터 수집 → EDA → 전처리 → 모델링 → 평가 → 배포·모니터링의 흐름을 가진다.
-
데이터 수집
- 신뢰할 수 있는 출처
- 여러 테이블 결합
- 외부 데이터 활용
- 재현성 문서화
-
EDA (Exploratory Data Analysis; 탐색적 데이터 분석)
- 요약 통계
- 결측 패턴 (결측치; Missing Value)
- 분포
- 상관관계
- 이상치(Outlier)·불균형 파악
-
전처리
- 모델이 학습 가능한 형태로 변환
- 데이터 누설 방지를 위해
- 학습 데이터에만 fit하고
- 검증/테스트에는 transform만 적용
-
모델링
- 선형/로지스틱 회귀 (해석 가능 베이스라인)
- → 트리 앙상블 (XGBoost, LightGBM, CatBoost)
- → 딥러닝·파운데이션 모델 (LLM, TabPFN)
-
평가
- held-out 테스트셋, 교차검증, 과제에 맞는 지표 선택
-
배포·모니터링
- 학습-배포 간 일관성 유지
- 데이터/개념 드리프트·성능 저하·공정성 추적 후 필요시 재학습
2.1. 정형 데이터 전처리
특징이 이질적이라 전처리가 특히 중요하다.
-
결측치 처리
- 삭제
- 상수 채움(“Unknown”)
- 통계적 대치(평균·중앙값·최빈값)
- 모델 기반 대치(k-NN)
- 트리 모델의 자체 지원
-
범주형 인코딩
- One-Hot(단순, 순서 미부여, 고차원 문제)
- Ordinal(자연 순서 있을 때)
- Target(범주별 평균 타깃값)
- Embedding(벡터 학습)
-
수치형 변환
- 스케일링(표준화, Min-Max), 분포 변환(로그·분위수), 비닝(이산화)
- 트리 모델은 스케일에 불변
-
특징 공학(Feature Engineering)
- 집계, 비율(부채비율 등), 시간차, 날짜 분해, 상호작용(가격×수량), 도메인 특화 변수(BMI 등)
- 때로 모델 선택보다 중요
2.2. 평가(Evaluation)
정형 ML은 하이퍼파라미터에 민감하고 데이터가 작아 평가가 모델 선택만큼 중요하다.
-
교차검증(CV) + 하이퍼파라미터 최적화(HPO)
- 최종 평가는 held-out 테스트셋으로
- 흔한 함정은 학습-테스트 오염과 단일 검증셋 과적합
-
평가 지표
- 회귀는 MAE/MSE/R², 이진 분류는 정확도·정밀도·재현율·F1, 임계값 독립 지표로 AUC-ROC·AUC-PR
- 불균형 데이터에서는 AUC-PR이 더 유용
-
문제에 맞는 지표 선택
- 사기 탐지→PR-AUC, 의료 스크리닝→재현율, 스팸 필터→정밀도
- 최선의 지표는 오류의 실제 비용을 반영하는 것
3. 해석가능성(Interpretability)
- 예측 성능만으로는 부족하며 “왜 그런 예측을 했는가”를 이해해야 한다.
- 전역적으로 어떤 특징이 중요한지, 지역적으로 특정 샘플의 예측 이유는 무엇인지를 본다.
- 주요 기법은 Permutation Importance(특징 셔플 후 성능 저하 측정)와 SHAP(특징 기여도, 트리 모델에 특히 효율적)이다.
4. 도구·데이터셋 및 로드맵
- 도구: NumPy, Pandas, scikit-learn, Optuna(AutoML), PyTorch 등
- 데이터셋: Kaggle, UCI, OpenML, AI Hub
- 향후 강의: 고전 ML → 딥 아키텍처 → 표현 학습 → LLM과 정형 데이터 → 새 패러다임 TabPFN