오늘 포스팅에서는 통계의 기본 개념에 대해 간략하게 공부해보려고 합니다.
데이터 분석을 공부하다 보면 평균, 분산, 표준편차, 표본, 모집단과 같은 용어를 자주 접하게 되는데요. 처음에는 비슷해 보이지만 각각 의미가 다르기 때문에 기본 개념부터 정확하게 이해하는 것이 중요합니다.
통계란?
통계란 조사나 실험을 통해 수집한 자료 또는 그 자료를 요약하여 나타낸 수치를 말합니다.
통계학은 이렇게 수집한 자료를 정리하고 분석하여 의미 있는 결과를 찾아내는 방법을 연구하는 학문입니다.
쉽게 말하면 많은 데이터 속에서 특징과 규칙을 발견하고, 이를 바탕으로 합리적인 판단을 내리는 과정이라고 볼 수 있습니다.
편차, 분산, 표준편차
통계에서 데이터가 평균을 중심으로 얼마나 퍼져 있는지 확인하기 위해 편차, 분산, 표준편차를 사용합니다.
편차
편차는 각 데이터값과 평균의 차이를 의미합니다.
예를 들어 데이터의 평균이 10이고 특정 데이터값이 13이라면 편차는 3이 됩니다.
반대로 데이터값이 8이라면 편차는 -2가 됩니다.
편차를 모두 더하면 양수와 음수가 서로 상쇄될 수 있기 때문에 데이터가 얼마나 퍼져 있는지 정확하게 확인하기 어렵습니다.
분산
분산은 각 데이터의 편차를 제곱한 뒤 평균을 계산한 값입니다.
편차를 제곱하면 음수가 사라지기 때문에 데이터가 평균에서 얼마나 떨어져 있는지 확인할 수 있습니다.
분산이 작으면 데이터가 평균 주변에 모여 있다는 의미이고, 분산이 크면 데이터가 평균에서 넓게 퍼져 있다는 의미입니다.
표준편차
표준편차는 분산에 제곱근을 적용한 값입니다.
분산은 편차를 제곱하여 계산하기 때문에 원래 데이터와 단위가 달라집니다. 표준편차는 분산에 제곱근을 씌워 원래 데이터와 같은 단위로 표현할 수 있도록 만든 값입니다.
표준편차가 작으면 데이터가 평균 주변에 집중되어 있고, 표준편차가 크면 데이터가 평균에서 넓게 분포되어 있다고 해석할 수 있습니다.
모집단과 표본
모집단은 조사하고자 하는 전체 대상을 의미합니다.
예를 들어 전국 대학생의 평균 수면시간을 조사한다면 전국 대학생 전체가 모집단이 됩니다.
하지만 전국 대학생을 모두 조사하는 것은 시간과 비용이 많이 들기 때문에 모집단의 일부를 선택하여 조사하게 됩니다.
이때 모집단에서 실제 조사를 위해 선택한 일부 대상을 표본이라고 합니다.
표본을 이용하여 모집단의 특성을 추정하려면 표본이 모집단을 잘 대표할 수 있어야 합니다. 이를 표본의 대표성이라고 합니다.
표본이 특정 집단에만 치우쳐 있다면 조사 결과도 실제 모집단과 다르게 나타날 수 있습니다.
오차범위와 신뢰수준
표본조사를 통해 얻은 결과는 모집단 전체를 조사한 결과와 차이가 발생할 수 있습니다.
이러한 차이를 고려하기 위해 오차범위와 신뢰수준을 사용합니다.
오차범위
오차범위는 표본조사를 통해 계산한 추정값이 실제 모집단의 값과 어느 정도 차이가 날 수 있는지를 나타내는 범위입니다.
예를 들어 어떤 후보의 지지율이 50%이고 오차범위가 ±3%라면 실제 지지율은 약 47%에서 53% 사이에 있을 수 있다고 해석합니다.
신뢰수준
신뢰수준은 같은 방식으로 표본조사와 신뢰구간 계산을 반복했을 때, 계산된 구간이 실제 모집단의 값을 포함하는 비율을 의미합니다.
예를 들어 신뢰수준이 95%라면 같은 방법으로 조사를 여러 번 반복하여 신뢰구간을 만들었을 때 약 95%의 구간이 실제 모집단의 값을 포함한다는 의미입니다.
표본추출 방법
표본을 어떤 방식으로 선택하느냐에 따라 조사 결과의 신뢰성이 달라질 수 있습니다.
대표적인 표본추출 방법에는 단순 랜덤 추출법, 계통 추출법, 집락 추출법, 층화 추출법이 있습니다.
단순 랜덤 추출법
단순 랜덤 추출법은 모집단의 모든 대상이 표본으로 선택될 가능성을 동일하게 가지도록 무작위로 추출하는 방법입니다.
제비뽑기나 난수표를 이용하는 방식이 대표적인 예입니다.
방법이 단순하고 이해하기 쉽지만 모집단의 전체 목록이 필요하다는 특징이 있습니다.
계통 추출법
계통 추출법은 모집단의 데이터에 순서를 부여한 뒤 일정한 간격으로 표본을 추출하는 방법입니다.
예를 들어 1,000명 중 100명을 조사한다면 추출 간격은 10이 됩니다.
처음 시작할 번호를 무작위로 선택한 뒤 해당 번호부터 10명 간격으로 표본을 선택합니다.
계통 추출법은 간단하고 빠르게 표본을 추출할 수 있지만 데이터 배열에 일정한 규칙이나 주기가 있다면 결과가 편향될 수 있습니다.
집락 추출법
집락 추출법은 모집단을 여러 개의 집락으로 나눈 뒤 일부 집락을 무작위로 선택하여 조사하는 방법입니다.
집락 추출법은 클러스터 추출법 또는 군집 추출법이라고도 합니다.
예를 들어 전국 학생을 조사할 때 전국의 학생을 한 명씩 추출하는 대신 몇 개 학교를 무작위로 선택한 뒤 해당 학교 학생들을 조사할 수 있습니다.
집락추출에서 각 집락은 모집단의 축소판처럼 다양한 특성을 포함하는 것이 이상적이며 집락끼리는 서로 비슷한 구성을 가지는 것이 좋습니다.
층화 추출법
층화 추출법은 모집단을 성별, 연령, 지역과 같은 기준에 따라 여러 개의 층으로 나눈 뒤 각 층에서 표본을 추출하는 방법입니다.
같은 층에 포함된 대상은 비교적 비슷한 특징을 가지며 서로 다른 층은 다른 특징을 가집니다.
예를 들어 직원을 직급별로 나눈 뒤 각 직급에서 일정한 인원을 추출하는 방식이 층화 추출법에 해당합니다.
층화 추출법에는 비례 층화 추출법과 불비례 층화 추출법이 있습니다.
비례 층화 추출법은 모집단에서 각 층이 차지하는 비율과 동일하게 표본을 추출하는 방법입니다.
불비례 층화 추출법은 모집단의 층별 비율과 다르게 표본을 추출하는 방법입니다.
특정 집단의 표본이 너무 적을 때 해당 집단을 더 많이 조사하기 위해 불비례 층화 추출법을 사용할 수 있습니다.
복원추출과 비복원추출
표본을 추출할 때 한 번 선택한 대상을 다시 모집단에 포함하는지에 따라 복원추출과 비복원추출로 나눌 수 있습니다.
복원추출
복원추출은 한 번 선택한 대상을 다시 모집단에 포함하는 방법입니다.
따라서 동일한 대상이 여러 번 선택될 수 있습니다.
비복원추출
비복원추출은 한 번 선택한 대상을 모집단에서 제외하는 방법입니다.
따라서 동일한 대상이 다시 선택되지 않습니다.
복원추출과 비복원추출은 단순 랜덤 추출법이나 층화 추출법과는 별개의 개념입니다.
실제 사람이나 제품을 대상으로 하는 표본조사에서는 같은 대상을 중복해서 조사하지 않는 비복원추출이 주로 사용됩니다.
측정과 척도
측정은 대상이 가진 속성이나 특성을 일정한 기준에 따라 수치나 기호로 나타내는 과정입니다.
척도는 이러한 속성을 측정하고 분류하기 위해 사용하는 기준이나 체계를 의미합니다.
척도는 크게 질적 척도와 양적 척도로 구분할 수 있습니다.
질적 척도
질적 척도는 숫자의 크기보다는 대상의 종류나 순서를 구분하는 데 사용하는 척도입니다.
명목척도
명목척도는 대상을 서로 다른 범주로 구분하는 척도입니다.
혈액형, 거주지역, 상품 종류 등이 명목척도에 해당합니다.
각 범주 사이에는 순서나 크기의 의미가 없습니다.
예를 들어 혈액형 A형이 B형보다 크거나 작다고 해석할 수는 없습니다.
순서척도
순서척도는 대상을 범주로 구분하면서 범주 사이의 순서까지 나타낼 수 있는 척도입니다.
만족도 등급, 학년, 신용등급 등이 순서척도에 해당합니다.
다만 각 단계 사이의 간격이 동일하다고 볼 수는 없습니다.
예를 들어 매우 만족과 만족 사이의 차이가 만족과 보통 사이의 차이와 같다고 단정할 수 없습니다.
양적 척도
양적 척도는 숫자의 크기와 간격이 의미를 가지는 척도입니다.
구간척도
구간척도는 값의 순서뿐만 아니라 각 값 사이의 간격도 의미가 있는 척도입니다.
섭씨온도, 화씨온도, 연도 등이 구간척도에 해당합니다.
구간척도에는 절대적인 0이 존재하지 않습니다.
예를 들어 섭씨 20도가 섭씨 10도보다 두 배 따뜻하다고 말할 수는 없습니다.
비율척도
비율척도는 값 사이의 간격이 의미가 있고 절대적인 0이 존재하는 척도입니다.
절대적인 0은 해당 속성이 완전히 존재하지 않는 상태를 의미합니다.
키, 몸무게, 나이, 거리, 소득, 가격 등이 비율척도에 해당합니다.
비율척도는 덧셈과 뺄셈뿐만 아니라 곱셈과 나눗셈을 이용한 비율 비교도 가능합니다.
예를 들어 몸무게가 80kg인 사람은 40kg인 사람보다 몸무게가 두 배라고 표현할 수 있습니다.
기술통계와 추론통계
통계는 분석 목적에 따라 기술통계와 추론통계로 구분할 수 있습니다.
기술통계
기술통계는 수집한 데이터의 특징을 요약하고 설명하는 통계 방법입니다.
평균, 중앙값, 최댓값, 최솟값, 분산, 표준편차 등을 계산하거나 표와 그래프를 활용하여 데이터를 정리합니다.
기술통계는 현재 가지고 있는 데이터가 어떤 특징을 가지는지 파악하는 데 목적이 있습니다.
추론통계
추론통계는 표본에서 얻은 정보를 이용하여 모집단의 특성을 추정하거나 가설을 검정하는 통계 방법입니다.
모집단 전체를 조사하기 어려울 때 일부 표본을 조사하고 그 결과를 바탕으로 모집단의 평균이나 비율을 추정할 수 있습니다.
표본에는 오차가 발생할 수 있기 때문에 추론통계에서는 확률, 신뢰수준, 오차범위 등을 함께 고려합니다.
통계는 단순히 평균을 계산하는 것에서 끝나는 것이 아니라 데이터를 올바르게 수집하고 해석하는 전체 과정을 포함합니다.
예상문제 1
다음 중 분산과 표준편차에 대한 설명으로 옳지 않은 것은?
① 분산은 편차를 제곱한 값들의 평균이다.
② 표준편차는 분산에 제곱근을 적용한 값이다.
③ 표준편차가 클수록 데이터가 평균 주변에 모여 있다.
④ 표준편차는 원래 데이터와 같은 단위로 표현된다.
정답: ③
해설:
표준편차가 클수록 데이터가 평균에서 넓게 퍼져 있다는 의미입니다. 반대로 표준편차가 작으면 데이터가 평균 주변에 모여 있습니다.
예상문제 2
다음 사례에 해당하는 표본추출 방법은 무엇인가?
한 회사가 직원 만족도를 조사하기 위해 직원을 사원, 대리, 과장, 부장으로 구분한 뒤 각 직급에서 일정한 인원을 추출하였다.
① 단순 랜덤 추출법
② 계통 추출법
③ 집락 추출법
④ 층화 추출법
정답: ④
해설:
층화 추출법은 모집단을 비슷한 특성을 가진 여러 층으로 나눈 뒤 각 층에서 표본을 추출하는 방법입니다. 직원을 직급별로 구분한 후 각 직급에서 표본을 선택했으므로 층화 추출법에 해당합니다.
예상문제 3
다음 중 척도의 종류와 사례가 올바르게 연결된 것은?
① 명목척도-고객 만족도 순위
② 순서척도-거주지역
③ 구간척도-섭씨온도
④ 비율척도-시험 성적 등급
정답: ③
해설:
섭씨온도는 값 사이의 간격은 의미가 있지만 절대적인 0이 존재하지 않으므로 구간척도에 해당합니다. 거주지역은 명목척도, 고객 만족도 순위와 시험 성적 등급은 순서척도에 해당합니다.
