AUTHOR’S ORIGINAL · 원문 작성 · ARCHIVE 224385644652
데이터의 함정: 왜 '누가 투표하는가'를 알아도 '누가 승리할지' 알 수 없을까?
필자 Econ Blog_K의 공개 원문을 허락받아 자동 수집했습니다. 문장과 이미지 순서를 보존하고 지면 폭만 조정했습니다.

1. 데이터의 시대, 우리가 놓치고 있는 것
데이터와 통계가 정치를 지배하는 시대입니다. 선거철만 되면 미디어는 정교한 설문조사를 바탕으로 "어떤 성향의 유권자가 어느 정당을 지지하는가"에 대한 분석을 쏟아냅니다. 하지만 여기서 우리는 근본적인 질문을 던져야 합니다. "우리는 과연 이 숫자들을 제대로 해석하고 있는가?"
우리가 흔히 접하는 뉴스 헤드라인—예를 들어 "반이민 정서가 극우 정당의 돌풍을 일으켰다"는 식의 분석—은 통계학적으로 볼 때 종종 '반쪽짜리 진실'에 불과합니다. 특정 정당 지지자들의 개인적 성향(개별 수준 데이터, Individual-level data)을 파악하는 것과, 그 정당이 국가적 선거에서 승리하는 메커니즘을 이해하는 것은 차원이 다른 문제입니다. 지지자의 '특성'에만 매몰되어 '지형'을 읽지 못할 때, 데이터는 우리에게 가장 정교한 함정을 파놓습니다.
2. 정반대의 오류: ‘원자론적 오류(Atomistic Fallacy)’의 등장
정치학에서는 오랫동안 집단 데이터를 통해 개인의 행동을 잘못 추론하는 ‘생태학적 오류(Ecological Fallacy)’를 경계해 왔습니다. 하지만 데이터 분석 기술이 비약적으로 발전하고 개별 유권자의 미세한 성향까지 파악할 수 있게 된 오늘날, 우리는 그 반대의 함정인 ‘원자론적 오류(Atomistic Fallacy)’에 더 자주 빠지곤 합니다.
이는 개인 수준에서 발견된 상관관계를 국가 전체의 거시적 현상을 설명하는 근거로 무분별하게 확장할 때 발생합니다.
"원자론적 오류는 개별 데이터에서 발견된 상관관계를 암묵적으로 또는 명시적으로 집합적인 정치 현상을 설명하는 도구로 취급할 때 발생한다. 이는 선거 결과를 해석하고 정책적 대응을 설계하는 과정에서 심각한 왜곡을 초래할 수 있다."
구분
생태학적 오류 (Ecological Fallacy)
원자론적 오류 (Atomistic Fallacy)
추론 방향
집단(Macro) → 개인(Micro)
개인(Micro) → 집단(Macro)
핵심 오류
"실업률 높은 지역이니 실업자가 투표했을 것"
"지지자가 반이민 성향이니 반이민이 승리 요인일 것"
즉, 숲의 모양을 보고 나무의 성격을 단정 짓는 것이 생태학적 오류라면, 나무 몇 그루의 특성만 보고 숲 전체의 성격을 규정하려는 것이 바로 원자론적 오류입니다.

Illustration of the ecological and atomistic fallacies
Illustration of the ecological and atomistic fallacies
3. 개인의 ‘확률’보다 집단의 ‘크기’가 승패를 결정한다
개별 유권자의 지지 확률이 높다고 해서 그 집단이 반드시 정당의 승리를 견인하는 것은 아닙니다. 팀 블랜다스(Tim Vlandas)와 다프네 할리키오풀루(Daphne Halikiopoulou) 연구팀의 흥미로운 가상 시나리오를 통해 이를 살펴보겠습니다. 110명의 유권자가 있는 사회가 있습니다.
특성 A 집단 (10명): 정당 X를 지지할 확률이 50%입니다. (강력한 지지층)
특성 B 집단 (100명): 정당 X를 지지할 확률이 10%에 불과합니다. (느슨한 지지층)
개인 수준의 상관관계만 보면 특성 A는 정당 X를 지지하게 만드는 가장 강력한 변수입니다. 그러나 실제 득표수는 A집단에서 5표, B집단에서 10표가 나옵니다. 정당 X의 성공에 더 크게 기여한 것은 확률은 낮지만 규모가 압도적인 B집단입니다.
여기서 우리는 ‘유권자-정당 역설(Voter-Party Paradox)’을 발견합니다. 정당의 지지 기반은 핵심 지지층(Core voters)의 '열성'이 아니라, 낮은 확률로 지지하더라도 그 수가 훨씬 많은 '외연 집단'에 의해 결정될 수 있습니다. 선거의 승패는 개별 지지 확률(Magnitude)이 아니라, 그 특성이 유권자 지형에서 차지하는 분포(Distribution)에 달려 있습니다.

Relationship between the distributions of a characteristic and the overall party vote share.
Relationship between the distributions of a characteristic and the overall party vote share.
4. 반이민 정서가 극우 정당의 성공을 전적으로 설명하지 못하는 이유
유럽 극우 정당의 성장은 흔히 '반이민 정서의 확산'으로 설명됩니다. 하지만 이를 원자론적 오류의 관점에서 비판적으로 볼 필요가 있습니다. 개별 수준에서 '반이민 태도'는 극우 지지를 예측하는 가장 강력한 변수일지라도, 국가 전체 수준에서는 해당 태도의 ‘분포(Prevalence)’와 ‘민감도(Salience)’가 훨씬 더 중요합니다.
실제 데이터는 반이민 정서를 가진 인구 자체가 폭발적으로 늘어났다기보다, 해당 이슈의 주목도(Salience)가 높아져 소수의 반이민 정서가 강하게 결집했거나, 경제적 불만을 가진 더 넓은 유권자 층과 전략적으로 연대했기 때문임을 시사합니다.
"어떤 특성이 개인에게 미치는 영향이 강력하더라도, 그 특성이 유권자들 사이에 널리 퍼져 있지 않다면 집합적 관련성(Relevance)은 제한적일 수 있다."
즉, 반이민 정서의 개인적 영향력은 클지 몰라도, 실제 선거 결과를 결정짓는 집합적 관련성(Relevance)은 다른 경제적, 사회적 요인들의 분포에 의해 좌우될 수 있다는 것입니다.
5. 통계적 수치의 함정: 영향력(Magnitude)과 중요도(Importance)의 혼동
연구자와 미디어가 빠지기 쉬운 세 가지 치명적인 함정을 정리해 보겠습니다.
계수와 중요도의 혼동: 특정 성향(예: 문화적 우려)의 개별적 영향력(계수)이 크더라도, 그 유권자가 소수라면 국가적 선거 결과에는 미미한 영향만 미칩니다.
변수 간 비교의 오류: "문화적 우려를 가진 유권자가 경제적 우려를 가진 유권자보다 정당을 지지할 확률이 25% 높다"는 결과가 나와도, 후자의 집단 규모가 10배 크다면 선거 승리의 진짜 동력은 경제적 요인에 있습니다.
변화의 동인에 대한 오해: 이것이 가장 역설적인 지점입니다. 어떤 특성이 지지 여부를 더 잘 예측하게 되었다고 해서(상관계수 증가), 그것이 전체 득표율 상승의 원인인 것은 아닙니다. 오히려 정당이 대중적 지지를 얻어 외연을 넓히면, 개별 변수의 예측력은 예전보다 낮아질 수도 있습니다. 반대로 지지층이 좁게 결집할수록 특정 변수의 예측력은 높아집니다. 따라서 "예측력이 높아졌다"는 지표가 "승리의 원인"이 아닐 수도 있음을 직시해야 합니다.
6. 더 나은 선거 해석을 위한 제언
데이터는 거짓말을 하지 않지만, 그 데이터를 읽는 우리의 시각은 얼마든지 편향될 수 있습니다. 진정한 정치적 통찰은 단순히 "누가 지지하는가"를 넘어 "그 지지층이 전체 유권자 지형에서 어떤 위치와 규모를 차지하는가"를 살필 때 나옵니다.
전문가들은 이제 미시적(Micro) 분석과 거시적(Macro) 분석을 결합한 ‘사회적 구조화(Social structuration)’ 측정이나 ‘투표 블록 분해(Voting bloc decomposition)’와 같은 정교한 기법을 활용하여 이러한 함정을 극복하려 노력하고 있습니다.
숫자에만 매몰되어 그 뒤에 놓인 전체적인 맥락과 분포의 힘을 잊는다면, 정책 설계자들은 엉뚱한 타겟을 향해 자원을 낭비하게 될 것입니다. 우리가 보는 데이터가 숲의 일부인지, 아니면 숲 전체의 풍경인지 구분하는 날카로운 통찰이 그 어느 때보다 필요한 시점입니다.
Source: Vlandas T, Halikiopoulou D. The (forgotten) atomistic fallacy in political science and its implications for how we interpret elections. European Journal of Political Research. Published online 2026:1-12. doi:10.1017/S1475676526101315