정리

대표값

대표값Pandas장점단점적합한 상황
평균mean()모든 자료를 반영하고 계산에 유리극단값에 민감대칭적이고 이상값이 적은 자료
중앙값median()극단값에 강함모든 값의 크기를 직접 반영하지 않음치우친 분포, 소득·주택가격 자료
최빈값mode()범주형 자료에도 적용 가능없거나 여러 개일 수 있음가장 흔한 범주·값을 찾을 때

산포도

산포도Pandas극단값 영향
범위max() - min()매우 큼
IQRquantile(0.75) - quantile(0.25)비교적 작음
분산var()매우 큼
표준편차std()
변동계수std() / mean()단위가 다른 자료 비교에 유리

df.describe()

import pandas as pd
 
df.describe()
count
mean
std (표준편차)
min (최솟값)
25% (제1사분위수(Q1); 25백분위수)
50% (제2사분위수(Q2); 50백분위수; 중앙값)
75% (제3사분위수(Q3); 75백분위수)
max (최댓값)

IQR 방식의 이상치 제거

import pandas as pd
 
q1  = df['column'].quantile(0.25)  # Q1 계산
q3  = df['column'].quantile(0.75)  # Q3 계산
iqr = q3 - q1                      # 사분위수 범위(IQR) 계산
 
# 이상치 경계 계산
lower_bound = q1 - 1.5 * iqr  # 하한선 계산
upper_bound = q3 + 1.5 * iqr  # 상한선 계산
 
# 이상치를 제거한 데이터만 필터링
filtered_df = df[(df['column'] >= lower_bound) & (df['column'] <= upper_bound)]

1. 도표를 이용한 자료 정리

1.1. 통계자료의 구분

통계자료는 측정값의 성격과 요약 방법에 따라 다음과 같이 구분한다.

질적자료(범주형 자료)

  • 수치 자체보다 범주나 속성이 의미를 갖는 자료
  • 명목자료, 순서자료
  • 예: 성별, 혈액형, 선호 색상

양적자료(수치형 자료)

  • 수치의 크기와 차이가 의미를 갖는 자료
  • 이산자료, 연속자료
  • 예: 연봉, 연령, 사용 시간

자료를 작은 값에서 큰 값 또는 큰 값에서 작은 값 순으로 정렬하는 것을 자료 배열이라고 한다.

1.2. 도수분포표

도수분포표 (frequency distribution table)

  • 자료를 일정한 기준에 따라 범주 또는 계급으로 나누고,
  • 각 범주·계급에 속하는 자료의 수를 정리한 표이다.

기본 용어와 공식

  • 전체 자료 수:
  • 번째 범주 또는 계급의 도수:
  • 상대도수:
  • 누적도수:
  • 누적상대도수:

(1) 범주형 도수분포표

질적자료를 둘 이상의 범주로 나누어 정리한다.

작성 순서

  1. 자료가 집단으로 묶일 수 있도록 범주를 설정한다.
  2. 각 범주의 도수와 상대도수를 구한다.
  3. 도수의 합이 , 상대도수의 합이 1 또는 100%인지 확인한다.

(2) 계급형 도수분포표

양적자료의 관측값을 일정한 간격으로 묶어 계급을 만들고 각 계급의 도수를 기록한다.

작성 순서

  1. 최댓값과 최솟값으로 범위 을 구한다:
  2. 계급의 수 를 정한다:
  3. 계급의 간격 를 정한다:
  4. 각 계급의 양 끝값 평균으로 계급값 를 구한다:
  5. 도수, 상대도수, 누적도수, 누적상대도수를 계산한다.

계급은 서로 겹치지 않아야 하며 일반적으로 “이상, 미만”으로 표시한다. 계급 수, 간격, 첫 구간을 어떻게 정하느냐에 따라 같은 자료도 분포의 인상이 달라질 수 있다. 최댓값이 마지막 계급을 벗어나면 마지막 계급을 추가하는 방식으로 조정할 수 있다.

cf.

  • : floor
  • : ceiling

2. 그림을 이용한 자료 정리

2.1. 그래프 선택

그래프적합한 자료핵심 특징
막대그래프범주형 자료범주별 크기를 비교하며 막대 사이가 떨어져 있음
히스토그램계급화한 양적자료연속된 계급을 표현하며 막대가 붙어 있음
도수분포다각형계급화한 양적자료계급값과 도수를 선분으로 연결
원그래프구성비 자료전체에서 각 범주가 차지하는 비율 표현
줄기-잎 그림비교적 적은 양적자료분포 형태와 원자료 값을 동시에 보존
꺾은선그래프시계열 자료시간에 따른 변화와 추세 표현

2.2. 막대그래프 (bar chart)

  • 질적자료의 범주별 도수를 막대 높이 또는 길이로 나타낸다.
  • 수직 막대그래프: 가로축에 범주, 세로축에 도수
  • 수평 막대그래프: 세로축에 범주, 가로축에 도수

2.3. 히스토그램 (histogram)

  • 계급형 도수분포표의 계급구간을 밑변, 도수를 높이로 나타낸다.
  • 양적자료의 분포 형태를 파악하는 데 사용한다.
  • 막대그래프와 달리 계급들이 연속되어 있으므로 막대 사이를 띄우지 않는다.

도수분포다각형

  • 히스토그램 각 직사각형의 윗변 중앙, 즉 를 선분으로 연결한다.
  • 양 끝에는 도수가 0인 가상의 계급을 추가해 선을 가로축과 연결한다.
  • 집단의 크기가 다를 때는 도수 대신 상대도수분포다각형을 사용하면 분포를 비교하기 쉽다.

2.4. 원그래프 (pie chart)

전체를 원으로 나타내고 각 범주의 상대도수에 따라 부채꼴로 나눈다.

2.5. 줄기-잎 그림

자료 값을 **줄기(stem)**와 **잎(leaf)**으로 분리하여 표시한다.

작성 방법

  1. 줄기와 잎을 구분한다.
  2. 줄기는 작은 값부터 세로로 배열한다.
  3. 각 자료의 잎을 해당 줄기 옆에 적는다.
  4. 잎을 작은 값부터 정렬한다.
  5. 줄기와 잎이 의미하는 자릿값을 표시한다.

장점

  • 분포 모양을 볼 수 있다.
  • 히스토그램과 달리 개별 관측값을 복원할 수 있다.
  • 중앙값, 최빈값 등의 위치를 쉽게 확인할 수 있다.

2.6. 꺾은선그래프

  • 일정한 시간 간격으로 관측한 값을 점으로 찍고 선분으로 연결한다.
  • 시간의 흐름에 따른 증가·감소, 추세, 변동을 파악하는 데 적합하다.
  • 집단이 둘 이상일 때는 여러 선을 함께 그려 변화 추이를 비교할 수 있다.

2.7. 퍼센트와 퍼센트포인트

  • 퍼센트(%): 한 수치를 100으로 보았을 때 다른 수치가 차지하는 상대적 크기
  • 퍼센트포인트(%p): 두 퍼센트의 산술적 차이

예를 들어 비율이 2%에서 4%로 변하면 2%p 증가한 것이며, 원래 값에 비해서는 100% 증가한 것이다.

3. 대표값

대표값은 자료의 중심적인 위치를 하나의 값으로 요약한 것이다.

3.1. 산술평균

모평균 (population mean)

모집단 의 평균:

표본평균 (sample mean)

표본 의 평균:

범주형 도수분포표에서의 가중산술평균

범주값 의 도수가 라면:

계급형 도수분포표에서의 가중산술평균

각 계급의 계급값을 , 도수를 라 하면:

계급값으로 원자료를 대표하므로 실제 원자료로 구한 평균과는 약간 차이가 날 수 있다.

산술평균의 성질

  1. 평균에 대한 편차의 합은 0이다.
  1. 편차제곱합은 평균을 기준으로 할 때 최소가 된다.
  1. 모든 관측값에 같은 상수를 더하거나 모든 값에 같은 상수를 곱하면 평균도 같은 방식으로 변한다.
  2. 계산이 쉽고 모든 관측값을 사용하지만, 극단값의 영향을 많이 받는다.

3.2. 중앙값 (median)

자료를 작은 값부터 정렬했을 때 중앙에 위치하는 값이다.

  • 이 홀수:
  • 이 짝수:

중앙값은 편차 절댓값의 합을 최소로 하며 극단값의 영향을 평균보다 적게 받는다.

3.3. 최빈값 (mode)

최빈값은 자료에서 가장 많이 나타나는 값이다.

  • 최빈값이 두 개 이상일 수 있다.
  • 모든 값의 도수가 같으면 최빈값이 없을 수 있다.
  • 히스토그램에서는 가장 높은 봉우리가 있는 계급 부근에 해당한다.

3.4. 평균·중앙값·최빈값과 분포 모양

분포 모양대략적인 관계
대칭인 단봉분포
오른쪽 꼬리가 긴 분포
왼쪽 꼬리가 긴 분포

피어슨의 경험식:

3.5. 백분위수(percentile)와 사분위수(quartiles)

백분위수

  • 자료를 오름차순으로 정렬했을 때 전체를 로 나누는 값

계산 알고리즘

  1. 자료를 오름차순으로 정렬한다.
  2. 를 계산한다.
  3. 가 정수이면:
  4. 가 정수가 아니면 로 두고:

주요 사분위수

  • 제1사분위수 : 25백분위수
  • 제2사분위수 : 50백분위수 = 중앙값
  • 제3사분위수 : 75백분위수

백분위수 계산법은 소프트웨어마다 보간 규칙이 다를 수 있으므로 문제에서 지정한 방법을 확인해야 한다.

3.6. 절사평균 (trimmed mean)

산술평균과 중앙값의 장점을 함께 고려한 대표값으로, 양쪽 극단값 일부를 제거하고 나머지 자료의 평균을 구한다.

절사비율이 일 때:

  1. 자료를 정렬한다.
  2. 을 계산한다.
  3. 작은 쪽 개와 큰 쪽 개를 제거한다.
  4. 남은 개 값의 평균을 구한다.

4. 산포도 (dispersion)

산포도는 자료가 중심을 기준으로 얼마나 흩어져 있는지를 나타낸다.

4.1. 범위

계산은 간단하지만 최솟값과 최댓값만 사용하므로 극단값의 영향을 크게 받는다.

4.2. 사분위수 범위 (interquartile range)

가운데 50% 자료의 퍼짐을 나타내므로 범위보다 극단값의 영향을 덜 받는다.

4.3. 분산

모분산

간편식:

표본분산

간편식:

표본분산의 분모가 인 것은 표본평균을 사용하면서 잃는 자유도 1을 보정하기 위한 것이다.

도수분포표의 표본분산

계급형 도수분포표에서는 대신 계급값을 사용한다.

4.4. 표준편차

분산의 양의 제곱근이다.

분산은 원래 단위의 제곱을 사용하지만 표준편차는 원자료와 같은 단위를 사용한다.

구분평균편차분산표준편차
모집단
표본집단
확률변수

4.5. 변동계수

단위가 다르거나 평균 차이가 큰 자료들의 상대적 산포를 비교할 때 사용한다.

  • 가 클수록 평균에 비해 상대적으로 더 많이 흩어져 있다.
  • 변동계수의 제곱은 **상대분산(relative variance)**이라고 한다.
구분변동계수상대분산
모집단
표본집단

4.6. 5점 요약 표시

자료를 다음 다섯 값으로 요약한다.

\

이 다섯 값은 상자그림의 기초가 된다.

4.7. 왜도와 첨도

왜도/비대칭도 (skewness)

왜도는 분포가 대칭에서 얼마나 벗어났는지를 나타낸다.

  • : 대칭분포
  • 가 클수록 비대칭 정도가 큼

첨도 (kurtosis)

첨도는 분포의 뾰족한 정도를 나타낸다.

  • : 표준정규분포와 같은 뾰족함
  • : 표준정규분포보다 정점이 높고 뾰족함
  • : 표준정규분포보다 정점이 낮고 완만함

5. 상자그림 (box plot)

상자그림은 중앙 위치, 산포, 대칭성, 이상값을 한눈에 보여 주는 그래프이다.

5.1. 작성 순서

  1. , , 를 구한다.
  2. 를 양 끝으로 하는 상자를 그린다.
  3. 상자 안에서 중앙값 의 위치에 선을 그린다.
  4. 을 계산한다.
  5. 안울타리(inner fence)를 구한다.
  1. 안울타리 안에서 가장 작은 값과 가장 큰 값까지 수염(whisker)을 그린다.
  2. 수염 밖의 자료는 이상값으로 따로 표시한다.

바깥울타리(outer fence):

  • 안울타리와 바깥울타리 사이: 보통 이상값
  • 바깥울타리 밖: 극단 이상값

5.2. 해석

  • 중앙값이 상자 중앙에 있고 양쪽 수염 길이가 비슷하면 대체로 대칭적이다.
  • 한쪽 수염이 더 길면 그 방향으로 꼬리가 길 가능성이 있다.
  • 집단별 상자그림을 나란히 그리면 중앙값, 퍼짐, 비대칭성, 이상값을 쉽게 비교할 수 있다.