오늘은 확률에 대해 좀 더 깊게 들여다보기 앞서 기댓값과 분산, 표준편차에 대해 정리하고 가려고 합니다.
확률분포나 가설검정을 이해하려면 먼저 기댓값과 분산의 개념을 알아야 하는데요. 용어가 많아 보이지만 개념과 예시를 함께 보면 쉽게 구분할 수 있습니다.
기댓값, 분산, 표준편차
- 기댓값: 확률변수가 가질 수 있는 값에 각각의 확률을 곱한 뒤 모두 더한 값입니다. 같은 실험을 여러 번 반복했을 때 평균적으로 기대할 수 있는 값이라고 보면 됩니다.
- 예시: 앞면이면 1점, 뒷면이면 0점을 받는 동전 던지기의 기댓값은 0.5입니다.
- 분산: 확률변수의 값들이 기댓값을 기준으로 얼마나 퍼져 있는지를 나타내는 값입니다.
- 예시: 분산이 작으면 값들이 기댓값 주변에 모여 있고, 분산이 크면 넓게 퍼져 있습니다.
- 표준편차: 분산에 제곱근을 적용한 값입니다. 원래 데이터와 같은 단위로 나타낼 수 있습니다.
- 예시: 몸무게 데이터의 표준편차는 kg 단위로 해석할 수 있습니다.
확률
- 확률: 어떤 사건이 발생할 가능성을 0과 1 사이의 값으로 나타낸 것입니다.
- 확률이 0이면 해당 사건이 발생할 수 없고, 확률이 1이면 반드시 발생합니다. 발생 가능한 모든 결과의 확률을 더하면 1이 됩니다.
- 예시: 동전을 한 번 던질 때 앞면과 뒷면이 나올 확률은 각각 0.5이며, 두 확률의 합은 1입니다.
- 표본공간: 주어진 실험이나 관찰에서 발생할 수 있는 모든 결과의 집합입니다.
- 예시: 주사위를 한 번 던질 때 표본공간은 {1, 2, 3, 4, 5, 6}입니다.
- 사건: 표본공간에 포함된 결과 중에서 관심을 가지는 결과의 집합입니다.
- 예시: 주사위를 던져 짝수가 나오는 사건은 {2, 4, 6}입니다.
- 조건부확률: 특정 사건이 발생했다는 조건에서 다른 사건이 발생할 확률입니다.
- 표현: P(A|B)는 사건 B가 발생했을 때 사건 A가 발생할 확률을 의미합니다.
- 예시: 뽑은 카드가 빨간색이라는 조건에서 해당 카드가 하트일 확률입니다.
독립사건과 배반사건
- 독립사건: 한 사건의 발생이 다른 사건의 발생확률에 영향을 주지 않는 사건입니다.
- 예시: 동전을 두 번 던질 때 첫 번째 결과는 두 번째 결과에 영향을 주지 않습니다.
- 배반사건: 두 사건이 동시에 발생할 수 없으며 공통된 결과가 없는 사건입니다.
- 예시: 주사위를 한 번 던질 때 홀수가 나오는 사건과 짝수가 나오는 사건은 배반사건입니다.
독립사건과 배반사건은 다른 개념입니다. 배반사건은 한 사건이 발생하면 다른 사건이 발생할 수 없으므로 일반적으로 독립사건이 아닙니다.
확률변수와 확률분포
확률변수
- 확률변수: 무작위 실험으로 발생하는 결과를 숫자로 표현한 변수입니다.
- 예시: 동전을 세 번 던졌을 때 앞면이 나온 횟수를 확률변수 X로 나타낼 수 있습니다.
확률분포
- 확률분포: 확률변수가 가질 수 있는 값과 각 값에 대응하는 확률을 정리한 것입니다.
- 예시: 동전을 두 번 던졌을 때 앞면이 나오는 횟수는 0번, 1번, 2번이 될 수 있으며 각 횟수에 해당하는 확률이 존재합니다.
이산확률분포
이산확률변수: 가질 수 있는 값을 하나씩 셀 수 있는 확률변수입니다.
예시: 고객 수, 불량품 개수, 앞면이 나온 횟수 등이 있습니다.
1. 베르누이분포
베르누이분포: 한 번의 시행에서 성공과 실패처럼 두 가지 결과만 나타나는 분포입니다.
예시: 제품 한 개를 검사했을 때 정상 또는 불량으로 나오는 경우입니다.
2. 이항분포
이항분포: 서로 독립적인 베르누이 시행을 n번 반복했을 때 성공이 k번 발생할 확률을 나타내는 분포입니다.
예시: 동전을 7번 던져 앞면이 2번 나올 확률입니다.
3. 기하분포
기하분포: 첫 번째 성공이 나올 때까지 시행한 횟수의 확률을 나타내는 분포입니다.
예시: 주사위를 던졌을 때 두 번째 시행에서 처음으로 6이 나올 확률입니다.
4. 다항분포
다항분포: 한 번의 시행에서 세 가지 이상의 결과가 나올 수 있는 실험을 여러 번 반복할 때 사용하는 분포입니다.
예시: 주사위를 10번 던졌을 때 1부터 6까지의 숫자가 각각 몇 번 나오는지에 대한 확률입니다.
5. 포아송분포
포아송분포: 일정한 시간이나 공간 안에서 특정 사건이 몇 번 발생하는지를 나타내는 분포입니다.
예시: 3시간 동안 스팸전화가 3번 걸려올 확률입니다.
이산확률분포 예상문제
예상문제 1
다음 중 한 번의 시행에서 성공과 실패처럼 두 가지 결과만 나타나는 분포는 무엇인가요?
① 이항분포
② 베르누이분포
③ 기하분포
④ 포아송분포
정답: ② 베르누이분포
해설: 베르누이분포는 한 번의 시행에서 성공과 실패처럼 두 가지 결과만 가지는 분포입니다.
예상문제 2
동전을 7번 던졌을 때 앞면이 정확히 2번 나올 확률을 구할 때 사용하는 분포는 무엇인가요?
① 이항분포
② 기하분포
③ 다항분포
④ 정규분포
정답: ① 이항분포
해설: 이항분포는 독립적인 베르누이 시행을 여러 번 반복했을 때 성공 횟수에 대한 확률을 나타냅니다.
예상문제 3
주사위를 계속 던졌을 때 세 번째 시행에서 처음으로 6이 나올 확률은 어떤 분포를 이용하나요?
① 포아송분포
② 베르누이분포
③ 기하분포
④ 다항분포
정답: ③ 기하분포
해설: 기하분포는 첫 번째 성공이 발생할 때까지 필요한 시행 횟수를 나타냅니다.
연속확률분포
연속확률변수: 일정한 구간 안에서 셀 수 없이 많은 값을 가질 수 있는 확률변수입니다.
예시: 키, 몸무게, 온도, 시간 등이 있습니다.
1. 균일분포
균일분포: 일정한 구간 안의 모든 값이 동일한 가능성을 가지는 분포입니다.
예시: 0부터 10 사이에서 숫자 하나를 무작위로 선택하는 경우입니다.
연속확률분포에서는 특정한 하나의 값이 나올 확률보다 일정한 구간에 포함될 확률을 계산합니다.
2. 정규분포
정규분포: 평균을 중심으로 좌우가 대칭인 종 모양의 분포입니다.
평균 근처에 값이 가장 많이 모여 있고, 평균에서 멀어질수록 값의 빈도가 낮아집니다.
예시: 사람들의 키나 시험점수는 조건에 따라 정규분포와 비슷한 형태를 보일 수 있습니다.
3. t분포
t분포: 정규분포와 비슷한 종 모양이지만 정규분포보다 꼬리가 두꺼운 분포입니다.
표본의 크기가 작고 모집단의 표준편차를 모를 때 모집단 평균을 추정하는 데 주로 사용합니다.
자유도가 커질수록 t분포는 정규분포에 가까워집니다.
예시: 15명의 표본을 이용하여 전체 직원의 평균 업무시간을 추정하는 경우입니다.
4. 카이제곱분포
카이제곱분포: 서로 독립인 표준정규 확률변수들을 제곱하여 더한 값이 따르는 분포입니다.
0보다 작은 값을 가질 수 없으며 자유도가 커질수록 좌우 대칭에 가까워집니다.
주로 범주형 변수의 독립성 검정이나 모집단 분산 검정에 사용합니다.
예시: 성별과 상품 선호도가 서로 관련되어 있는지 검정하는 경우입니다.
5. F분포
F분포: 서로 독립인 두 카이제곱 확률변수를 각각의 자유도로 나눈 값들의 비율이 따르는 분포입니다.
0보다 작은 값을 가질 수 없으며 등분산 검정과 분산분석에 활용합니다.
예시: 두 생산라인의 제품 분산이 같은지 비교하는 경우입니다.
첨도와 왜도
첨도
첨도: 데이터가 중심에 얼마나 집중되어 있는지와 꼬리 부분이 얼마나 두꺼운지를 나타내는 값입니다.
예시: 극단적인 값이 많고 꼬리가 두꺼운 분포는 첨도가 크게 나타날 수 있습니다.
왜도
왜도: 데이터 분포가 좌우 어느 방향으로 치우쳐 있는지를 나타내는 값입니다.
왜도가 0에 가까우면 좌우 대칭이고, 양수이면 오른쪽 꼬리가 길며, 음수이면 왼쪽 꼬리가 깁니다.
예시: 일부 고소득자가 포함된 소득분포는 오른쪽 꼬리가 긴 양의 왜도를 보일 수 있습니다.
공분산과 상관계수
공분산
공분산: 두 변수가 함께 움직이는 방향을 나타내는 값입니다.
공분산이 양수이면 두 변수가 같은 방향으로 움직이고, 음수이면 반대 방향으로 움직입니다.
예시: 광고비가 증가할수록 매출도 증가한다면 공분산은 양수로 나타날 수 있습니다.
상관계수
상관계수: 두 변수 사이의 선형적인 관계의 방향과 강도를 -1부터 1 사이의 값으로 나타낸 것입니다.
상관계수가 1에 가까우면 강한 양의 상관관계, -1에 가까우면 강한 음의 상관관계, 0에 가까우면 선형관계가 약하다는 의미입니다.
예시: 공부시간이 늘어날수록 시험점수가 높아진다면 양의 상관관계가 나타날 수 있습니다.
상관관계가 있다고 해서 반드시 한 변수가 다른 변수의 원인이라는 의미는 아닙니다.
추정과 가설검정
추정
추정: 표본에서 얻은 정보를 이용하여 모집단의 특성을 알아내는 방법입니다.
모수: 모집단의 평균, 분산, 비율처럼 모집단의 특성을 나타내는 값입니다.
통계량: 표본평균, 표본분산처럼 표본에서 계산한 값입니다.
모수의 추정: 표본에서 계산한 통계량을 이용하여 모집단의 모수를 추정하는 과정입니다.
점추정
점추정: 하나의 값을 이용하여 모집단의 모수를 추정하는 방법입니다.
예시: 표본평균이 170cm일 때 모집단의 평균 키를 170cm로 추정하는 경우입니다.
구간추정
구간추정: 모수가 포함될 것으로 예상되는 범위를 이용하여 추정하는 방법입니다.
예시: 모집단의 평균 키가 95% 신뢰수준에서 168cm부터 172cm 사이에 있다고 추정하는 경우입니다.
가설검정
가설검정: 모집단에 대해 설정한 가설이 표본자료를 기준으로 타당한지 판단하는 과정입니다.
가설검정 절차: 귀무가설과 대립가설 설정 → 유의수준 결정 → 검정방법 결정 → 검정통계량과 p-value 계산 → 귀무가설 기각 여부 판단
귀무가설
귀무가설: 차이, 효과 또는 관계가 없다고 설정하는 기본 가설입니다.
예시: 새로운 학습법과 기존 학습법의 평균점수 차이가 없다.
대립가설
대립가설: 차이, 효과 또는 관계가 있다고 설정하는 가설입니다.
예시: 새로운 학습법과 기존 학습법의 평균점수 차이가 있다.
제1종오류와 제2종오류
제1종 오류: 실제로 귀무가설이 참인데 귀무가설을 기각하는 오류입니다.
예시: 실제로 효과가 없는 치료제를 효과가 있다고 판단하는 경우입니다.
제2종 오류: 실제로 귀무가설이 거짓인데 귀무가설을 기각하지 못하는 오류입니다.
예시: 실제로 효과가 있는 치료제를 효과가 없다고 판단하는 경우입니다.
검정통계량
검정통계량: 표본 결과가 귀무가설에서 얼마나 벗어나 있는지를 판단하기 위해 계산하는 값입니다.
예시: t검정에서 계산하는 t값이 검정통계량에 해당합니다.
기각역
기각역: 귀무가설을 기각하게 되는 검정통계량의 범위입니다.
예시: 계산한 검정통계량이 기각역에 포함되면 귀무가설을 기각합니다.
유의수준
유의수준: 귀무가설이 참인데도 잘못 기각할 수 있도록 허용한 최대 확률입니다. 보통 0.05를 사용합니다.
유의확률
유의확률: 귀무가설이 참이라고 가정했을 때 현재의 표본 결과 또는 이보다 더 극단적인 결과가 나타날 확률입니다.
p-value < 유의수준 0.05: 통계적으로 유의하다고 판단하여 귀무가설을 기각합니다.
p-value ≥ 유의수준 0.05: 통계적으로 유의하다고 보기 어려우므로 귀무가설을 기각하지 못합니다.
p-value는 귀무가설이 참일 확률이나 귀무가설을 지지하는 확률이 아닙니다.
또한 귀무가설을 기각하지 못했다고 해서 귀무가설이 참이라고 확정하거나 귀무가설을 수용하는 것은 아닙니다.
비모수검정
모수검정
모수검정: 모집단이 특정한 분포를 따른다고 가정하고 평균, 분산 등의 모수를 이용하는 검정방법입니다.
예시: t검정, 분산분석, 피어슨 상관분석 등이 있습니다.
비모수검정
비모수검정: 모집단이 특정한 분포를 따른다는 가정을 강하게 적용하지 않는 검정방법입니다.
예시: 데이터가 정규성을 만족하지 않거나 순서척도 자료를 분석하는 경우입니다.
모수검정과 비모수검정의 차이
모수검정은 평균과 분산 등의 모수를 중심으로 분석하고, 비모수검정은 순위나 중앙값을 활용하는 경우가 많습니다.
비모수검정의 종류
맨휘트니 U검정: 서로 독립인 두 집단을 비교할 때 사용합니다.
윌콕슨 부호순위검정: 서로 관련된 두 집단이나 대응표본을 비교할 때 사용합니다.
크루스칼-왈리스 검정: 서로 독립인 세 집단 이상을 비교할 때 사용합니다.
프리드먼 검정: 서로 관련된 세 집단 이상을 비교할 때 사용합니다.
스피어만 순위상관분석: 순위자료나 비정규 자료의 상관관계를 확인할 때 사용합니다.
추정과 가설검정 예상문제
예상문제 1
다음 중 p-value에 대한 설명으로 옳은 것은 무엇인가요?
① 귀무가설이 참일 확률이다.
② 귀무가설을 지지하는 확률이다.
③ 귀무가설이 참일 때 현재 결과 이상으로 극단적인 결과가 나타날 확률이다.
④ 제2종 오류가 발생할 확률이다.
정답: ③
해설: p-value는 귀무가설이 참이라고 가정했을 때 현재 결과 또는 더 극단적인 결과가 나타날 확률입니다.
예상문제 2
유의수준이 0.05이고 p-value가 0.03일 때 올바른 판단은 무엇인가요?
① 귀무가설을 기각한다.
② 귀무가설을 수용한다.
③ 대립가설을 기각한다.
④ 통계적으로 유의하지 않다.
정답: ① 귀무가설을 기각한다.
해설: p-value가 유의수준보다 작으면 통계적으로 유의하다고 판단하여 귀무가설을 기각합니다.
예상문제 3
다음 중 비모수검정을 사용하는 상황으로 가장 적절한 것은 무엇인가요?
① 데이터가 정규성을 만족하는 경우
② 표본이 충분히 크고 평균을 비교하는 경우
③ 데이터가 정규성을 만족하지 않고 순서척도로 측정된 경우
④ 모집단의 분산을 알고 있는 경우
정답: ③
해설: 비모수검정은 정규성 가정을 만족하지 않거나 순서척도 자료를 분석할 때 사용할 수 있습니다.
