- 중심 경향 측정값은 데이터의 대표값을 나타냄으로써 데이터를 요약합니다.
- 세 가지 주요 측정값은 산술 평균, 중앙값 및 최빈값입니다.
- 적절한 측정 방법을 선택하는 것은 데이터의 특성에 따라 달라집니다.
- 데이터 기반 의사결정은 다양한 분야에서 필수적입니다.
우리는 일상생활에서 종종 데이터에 기반한 결정을 내립니다. 예를 들어 매달 지출하는 금액, 자녀의 평균 성적, 회사의 평균 급여 등이 있습니다. 하지만 이러한 정보를 올바르게 해석하려면 체계적인 정리와 통계적 도구가 필요합니다. 바로 이 부분에서 중심 경향 측정값이 중요한 역할을 합니다. 중심 경향 측정값은 데이터 세트에서 가장 대표적인 값을 식별하는 데 도움이 되는 일련의 매개변수 입니다.
이 글에서는 통계적 개념에 대해 알아야 할 모든 것을 자세히 살펴보겠습니다. 개념이 무엇인지, 어떻게 계산하는지, 장단점은 무엇인지, 어떤 경우에 어떤 개념을 사용하는 것이 가장 좋은지, 그리고 실제 사례까지 다룹니다. 모든 정보는 교육 및 전문 자료를 바탕으로 명확하고 흥미롭게 구성되어 있어 누구나 쉽게 이해할 수 있습니다.
중심 경향 측정값이란 무엇인가요?
중심 경향 측정값 (중심 위치 측정값 이라고도 함 )은 데이터가 어디에 집중되는 경향이 있는지를 보여줌으로써 데이터 세트를 요약하는 수치 값입니다. 다시 말해, 일련의 관측값에서 "대표적인" 또는 중심값이 무엇인지 알려줍니다.
이러한 측정값은 변수의 동작 방식 , 값의 대칭성, 결과에 영향을 미치는 극단적인 값의 존재 여부, 또는 가장 흔한 요소가 무엇인지 등을 파악할 수 있게 해주기 때문에 통계 데이터를 분석하는 데 매우 유용합니다.
중심 경향을 측정하는 주요 지표는 세 가지입니다.
- 산술 평균
- 중앙값
- 유행
각 조치에는 고유한 특징, 이상적인 사용 시나리오 및 한계가 있습니다. 이에 대해서는 나중에 자세히 살펴보겠습니다.
산술 평균
산술 평균은 아마도 가장 잘 알려져 있고 가장 널리 사용되는 중심 경향 측정값일 것입니다. 이는 데이터 세트의 모든 값을 더한 다음 전체 데이터 포인트 수로 나누어 계산합니다.
예를 들어, 다섯 학생의 시험 점수가 각각 6.0, 5.4, 3.1, 7.0, 6.1이라면 평균 점수는 다음과 같습니다.
- 더하기: 6.0 + 5.4 + 3.1 + 7.0 + 6.1 = 27.6
- 데이터 포인트 수: 5
- 평균 = 27.6 / 5 = 5.52
이 값 5.52 는 데이터 세트의 손익분기점을 나타냅니다. 이는 평균 또는 산술 평균값 으로도 알려져 있습니다.
단순 평균 외에도 다음과 같은 변형이 있습니다.
- 가중 평균각 값에 서로 다른 가중치 또는 중요도가 부여될 때.
- 표본 평균표본을 기준으로 평균을 계산할 때, 전체 모집단을 기준으로 계산하지 않을 때를 말합니다.
평균은 구간별로 그룹화된 데이터에도 적용할 수 있습니다. 이러한 경우에는 계급값과 절대 빈도를 사용하여 계산합니다.
산술평균의 속성
- 모든 데이터를 사용하세요그래서 매우 유익합니다.
- 뿐 각 데이터 세트에 대해.
- 균일한 분포에 이상적입니다..
- 수학적으로 유용함이를 통해 대수 계산을 수행할 수 있습니다.
평균의 한계
- 극단적인 값에 민감함이상치는 결과에 상당한 왜곡을 초래할 수 있습니다.
- 그다지 유용하지 않아요 이질적인 분포 또는 극단적인 값으로.
- 연속형 데이터나 그룹형 데이터의 경우 다음과 같을 수 있습니다. 근접한 그리고 간격의 너비에 따라 달라집니다.
중앙값
중앙값 은 데이터를 작은 값부터 큰 값 순으로 정렬했을 때 가운데에 위치하는 값입니다 . 중앙값은 데이터 세트를 두 개의 동일한 부분으로 나눕니다. 즉, 절반은 값이 작은 그룹이고 나머지 절반은 값이 큰 그룹입니다.
데이터 포인트 개수가 홀수인 경우의 예:
데이터: 1, 1, 2, 2, 2, 3, 3
중앙값은 네 번째 값인 2 입니다.
데이터 포인트 개수가 짝수인 경우의 예:
데이터: 1, 1, 2, 2, 2, 3, 3, 4
중앙값은 두 중심값인 2와 2.5의 평균값인 2가 됩니다.
데이터를 여러 범주로 그룹화할 때, 누적 빈도를 이용하여 중앙값 구간을 찾고 , 이를 보간하여 보다 정확한 값을 얻습니다.
중앙값의 장점
- 극단적인 값의 영향을 받지 않습니다.이는 더욱 견고한 측정 기준이 됩니다.
- 이는 이질적인 인구를 더 잘 나타냅니다.예를 들어, 불평등이 심한 기업의 급여 문제 등이 있습니다.
- 그룹화된 데이터에 대해서도 계산할 수 있습니다.개방 간격에서도 마찬가지입니다.
중앙값의 단점
- 대수 계산에는 덜 유용합니다..
- 순서에 따라 다릅니다모든 데이터를 정리해야 합니다.
- 그룹 내에서 그 가치는 다음에 따라 달라집니다. 간격의 크기와 개수.
유행
최빈값 은 데이터 세트에서 가장 빈번하게 나타나는 값, 즉 가장 많이 반복되는 값 입니다. 최빈값을 구하는 특별한 공식은 없으며, 단순히 가장 자주 나타나는 값을 찾으면 됩니다.
예 :
데이터: 5, 7, 4, 6, 9, 5, 6, 1, 5, 3, 7
최빈값은 5 입니다 . 왜냐하면 5가 세 번 나타나기 때문입니다.
분포는 다음과 같은 특징을 가질 수 있습니다:
- 하나의 패션: 단봉형
- 두 가지 트렌드: 이중모드
- 두 가지 이상의 트렌드: 멀티모달
- 유행을 따르는모든 값의 빈도가 같을 때
그룹화된 데이터의 경우, 최빈 구간을 식별하고 최빈 구간, 이전 및 이후 계급의 빈도와 구간의 너비를 고려하는 보간 공식을 적용하여 계산을 수행합니다 .
패션의 이점
- 계산이 쉬움특히 개별 데이터의 경우.
- 질적 변수와 함께 사용할 수 있습니다..
- 이상적 전형적인 특징을 설명하십시오 (예를 들어, 가장 많이 팔리는 자동차 색상).
패션의 단점
- 그것은 항상 존재하는 것은 아닙니다..
- 불완전한 정보를 사용합니다.: 가장 많이 반복되는 값만 살펴보고 나머지는 무시합니다.
- 균일 분포에서는 그다지 유용하지 않습니다..
- 데이터를 어떻게 그룹화하느냐에 따라 크게 달라집니다. 간격이 있다면요.
각 방법은 언제 사용해야 할까요?
적절한 측정 방법을 선택하는 것은 데이터의 특성에 따라 달라집니다.
- 미디어 극단적인 값이 없는 정량적이고 대칭적인 데이터에 이상적입니다.
- 중앙값이상치나 왜곡된 분포가 있을 때 유용합니다.
- 유행질적 변수 또는 더 일반적인 값을 식별하는 데 선호됩니다.
때로는 데이터 분포를 더 잘 이해하기 위해 여러 측정값을 함께 사용하는 것이 도움이 될 수 있습니다 . 예를 들어, 급여를 비교할 때 평균값이 높게 나오는 이유는 몇몇 고액 연봉자 때문일 수 있지만, 중앙값은 "일반적인" 직원의 급여 수준을 보다 현실적으로 보여줄 수 있습니다.
그들은 왜 중요합니까?
중심 경향 측정값은 다양한 상황에서 실질적으로 활용됩니다.
- 교육학생 그룹의 평균 성적을 계산합니다.
- 경제인구의 평균 소득을 분석합니다.
- 의학환자들의 평균 혈압을 연구합니다.
- 사회학설문조사에서 가장 흔한 답변을 조사합니다.
또한 이를 통해 서로 다른 데이터 세트를 비교하고, 시간 경과에 따른 변화를 평가하거나, 품질 표준을 설정할 수 있습니다.
또한, 평균 데이터뿐만 아니라 나머지 값들이 어떻게 분포되어 있는지도 전체적인 상황을 파악하기 위해 분산, 표준 편차 또는 변동 계수와 같은 분산 측정값 과 함께 사용되는 경우가 많습니다 .
이러한 개념들이 기본적인 것처럼 보일지라도, 계산 방법과 각각을 언제 사용해야 하는지 이해하는 것은 데이터 기반 의사결정을 내리는 데 있어 매우 중요한 차이를 만들어낼 수 있습니다.
중심 경향 측정값은 하나, 둘 또는 여러 개의 대표값을 사용하여 통계 정보를 효과적으로 요약하는 방법을 제공합니다 . 데이터 유형과 분석 목적에 따라 평균, 중앙값 또는 최빈값 중 적절한 측정값을 선택하는 것은 현실을 정확하게 해석하는 데 매우 중요합니다. 집단 행동을 연구하든, 결과를 비교하든, 혹은 단순히 우리 주변 세상을 더 잘 이해하든, 이러한 통계 도구는 모든 엄밀한 데이터 분석에 필수적입니다.