Statistics

평균과 분산

datathings 2025. 4. 10. 21:28

기술 통계학은 앞선 글에서 설명드린 것처럼 조사하거나 측정된 데이터의 특징을 수치, 표, 그래프로 파악하는 분야를 말합니다. 저희가 중고등학교 시절에 배웠던 평균이나 분산, 표준편차가 이에 해당합니다. 사람들에게 친숙하고 너무 쉬운 내용이지만 의미를 다시 한번 짚고 넘어가 봅시다. 그리고 학교 때 다 배우지 못한 개념들도 있을 수 있으니 천천히 읽어 보시면 도움이 될지도 모릅니다.

 

I. 평균

평균은 데이터의 중심적인 값을 의미합니다. 중심이 어떤 의미일까요? 기하학에서 원이란 평면 위의 한점에 이르는 거리가 일정한 평면 위의 점들의 집합을 의미합니다. 그리고 이 평면 위의 한점을 원의 중심이라 부릅니다. 이렇듯 원의 중심은 평면에서 원을 이루는 수 많은 점들의 한 가운데 위치합니다. 평균의 정의에서 말하는 중심적인 값 역시 이와 다르지 않습니다. 마치 원에서 중심이 원주 전체와 균형 잡히는 위치에 있는 것처럼 평균은 수직선 위에서 모든 값을 양쪽으로 균형 잡히게 해주는 "중심점" 역할을 합니다.

 

1. 산술 평균 (Arithmetic mean)

저희가 일반적으로 말하는 평균은 산술 평균 입니다. 데이터의 총합을 데이터의 개수로 나눈 값입니다.  

 

\[\overline{x}=\left(x_{1}+x_{2}+x_{3}+...x_{n-1}+x_{n}\right)\div n\]

 

학생들의 키의 평균을 구한다거나, 카드 사용액의 평균을 구한다거나 할 때 사용할 수 있습니다

 

2. 기하 평균 (Geometric mean)

기하 평균은상승 평균이라 부르며 성장율과 같은 비율 값의평균을 구할 때 산술 평균 보다 더 정확한 결과를 제공합니다. 참고로 G는 Geometric으로 기하 평균을 의미합니다. 

 

\[\overline{x_{G}}=\sqrt[n]{x_{1}\cdot x_{2}\cdot x_{3}...x_{n-1}\cdot x_{n}}\]

 

예를 들어 어떤 자산이 1년차에 50% 증가하고, 2년차에 50% 감소했다고 가정합시다. 산술 평균의 경우에는 0.5 + (-0.5) = 0 을 통해 손해가 없는 것 처럼 보이지만 실제를 금액이 줄어있습니다. 가령 자산이 1000원이었다면 1년 차에 1500원이 되었고, 2년 차에 750원이 되었을테니까요.

 

만약 성장율의 평균을 기하 평균을 이용해 계산한다면  1년차의 수익율은 1.5 / 2년차는 0.5 이고, 따라서 매년 평균 13% 정도의 손실이 있었다고 계산이 됩니다. 

 

\[\sqrt{1.5\times 0.5}=0.866\]

 

실제 2년차의 자산 가격이 750원이니, 1000 X 0.866 X 0.866 = 0.75로 거의 일치합니다. 

 

3. 조화 평균 (Harmonic mean)

조화 평균은 여러 수의 역수의 평균을 구한 뒤, 그 역수를 다시 취한 값입니다. 말이 어려우니 식을 바로 살펴봅시다.

 

\[\overline{x_{H}}=\frac{n}{\frac{1}{x_{1}}+\frac{1}{x_{2}}+\frac{1}{x_{3}}+...+\frac{1}{x_{n-1}}+\frac{1}{x_{n}}}\]

 

조화 평균은 속도와 같은 단위당 비율을 다룰 때 사용합니다. 가령 평균 시속이나, 평균 주행 시간 등의 속도 문제를 계산할 때나, 단위당 가격, 단위 시간당 처리량 등 비용 대비 효율, 효율성 평가 할 때 적절한 결과를 제시합니다. 

 

어떤 사람이 동일한 거리를 60kph로 갔다가 40kph로 돌아왔다고 가정해보죠. 산술 평균의 경우 이 사람의 이동속도는 50kph 입니다. 하지만 속도 = 거리 / 시간 공식을 이용해 자세히 구해보면, 실제 조화 평균과 동일한 식으로 세워지게 되고, (거리는 1km라고 합시다) 조화 평균은 48kph 입니다.

 

\[\frac{2}{\frac{1}{60} + \frac{1}{40}} = 48\]

II. 분산

평균은 데이터의 중심점을 의미합니다. 그럼 반대로 이 중심점을 기준으로 얼마나 데이터가 흝어져 있는지를 나타내는 값이 분산입니다. 평균과 마찬가지로 기하학적인 관점에서 보면 같은 원의 중심을 가지더라도 원의 반지름이 다른 원은 무수히 많이 존재합니다. 원의 반지름이 클 수록 원을 이루는점들의 기하학적으로 멀리 떨어져 있고, 분산이 크다고 볼 수 있을 것 같습니다.

 

1. 분위수 (Quartile)

n개의 데이터를 작은 순서대로 늘어 놓고, 이것을 k 등분 했을 때의 그 경계 값을 분위수라고 합니다. 제일 대표적인 값이 사분위 입니다. (k=4) 제일 작은 수치 부터 1분위, 2분위, 3분위, 분위수라고 표현하며 여기서 2분위수는 데이터의 중간에 위치해 중앙값이라고도 부릅니다. (평균은 아닙니다)   

 

 

2. 편차 (Deviation) 와 분산 (Variance)

편차는 데이터의 값과 평균의 차를 의미합니다. 그리고 이렇게 개별 데이터에 대해 계산되는 편차를 하나의 지표로 나타낸 것이 분산입니다. 그리고 분산의 양의 제곱근을 표준 편차(s) 라고 합니다. 

 

  • 편차 \[d_{i}=x_{i}-\overline{x}\]
  • 분산 \[s^2 = \frac{1}{n} \sum_{i=1}^{N} (x_i - \overline{x}\ )^2\]

3. 변동계수 (Coefficient of Variation, CV)

마지막으로 설명할 지표는 변동계수 입니다. 변동계수는두 개의 데이터가 흝어진 정도를 비교하는 경우에 사용됩니다. 앞에서 데이터의 흝어짐은 편차나 분산으로 표현할 수 있다고 이야기 했는데요, 변동계수는 계수라는 말에서 알 수 있듯이 절대적인 분산이 아닌,  상대적인 변동성을 보고 싶을 때 사용합니다. 가령 다른 단위를 가진 그룹 간에 흩어진 정도를 비교 한다거나 하는 경우 말입니다. 

 

\[cv=s\div\overline{x}\]

 

변동계수는 표준 편차를 평균으로 나누어 계산합니다. 변동 계수는 어떻게 활용할 수 있는지 살펴 봅시다. A,B 두개의 제품의 무게를 비교하는데 두 제품 모두 표준 편차는 5g입니다. 그럼 동일한 안정성을 가지고 있을까요? 평균 무게마저 같다면 그렇게 판단할 수 있지만, 평균이 다른 경우 변동 계수가 달라집니다.

 

  • A 제품: 평균 무게 100g, 표준편차 5g → CV = 5 / 100 = 0.05 (5%)
  • B 제품: 평균 무게 20g, 표준편차 5g → CV = 5 / 20 = 0.25 (25%)

따라서 같은 표준 편차라고 하더라도 CV를 이용하면 B가 더 불안정한 제품임을 알 수 있습니다. 반대로 데이터에 따라 표준 편차는 다르지만 CV가 같은 경우도 있습니다. 이 경우는 데이터의 흩어진 정도의 차이가 없다고 분석할 수 있습니다.