Paperis.

© 2026 네오쿤스. All rights reserved.

이용약관개인정보처리방침환불 정책콘텐츠·제거 요청

상호: 네오쿤스 · 대표자: 김근태 · 사업자등록번호: 751-04-03501 · 통신판매업 신고번호: 통신판매업 신고 후 표기 예정

주소: 서울특별시 서초구 서초대로 266, B103-S36호(서초동) · Tel: 010-7254-2475 · 이메일: support@paperis.app

Paperis.

Paperis 아티클

누구를 재고 있었나 — 심리학이 "사람"이라고 말할 때의 그 사람

심리학이 「사람은 ~한다」고 쓸 때 앉아 있던 사람 — WEIRD 지적 이후 15년, 표본은 얼마나 넓어졌고 번역된 척도는 같은 것을 재는가

🔥논쟁✦AI 생성심리·사회과학 · 2026년 10월 10일

내 분야 논문을 오디오로

관심 분야·저널을 고르면 Paperis가 핵심 논문을 요약하고 음성으로 변환해 드려요. 출퇴근길에 들어보세요.

Paperis 무료로 시작하기 →

누구를 재고 있었나 — 심리학이 "사람"이라고 말할 때의 그 사람

교과서 문장의 숨은 주어

심리학 논문의 결론은 대개 이렇게 쓰입니다. "사람은 손실을 이득보다 크게 느낀다." "사람은 타인의 행동을 상황보다 성격으로 설명한다." 주어가 "사람"입니다. 그런데 그 문장 뒤에 실제로 앉아 있던 사람은 거의 전부 대학생이었습니다. 실험에 실제로 참여해 측정된 사람들을 표본이라 하고, 표본에서 얻은 결과가 표본 밖의 더 넓은 사람들에게도 해당한다고 말하는 일을 일반화라고 합니다. "사람은 ~한다"는 문장은 대학생이라는 표본에서 인류 전체로 일반화한 문장입니다.

2010년 한 리뷰가 이 관행에 이름을 붙였습니다. 서구의(Western), 교육받은(Educated), 산업화된(Industrialized), 부유한(Rich), 민주주의(Democratic) 사회의 머리글자를 딴 WEIRD입니다. 지적은 두 겹이었습니다. 첫째, 행동과학의 실험 결과는 인구 집단에 따라 상당히 다릅니다. 둘째, 그 집단별 분포에서 WEIRD 표본은 자주 바깥값, 곧 나머지와 동떨어진 값이었습니다. 검토된 영역은 주변부가 아니었습니다 — 시지각, 공정성, 협력, 공간 추론, 범주화와 귀납 추론, 도덕 추론, 추론 양식, 자기개념, IQ의 유전율. 결론은 절제된 문장이었습니다. 한 하위집단에서 뽑은 데이터만으로 어떤 행동 현상이 보편이라고 주장할 선험적 근거, 곧 미리 내세울 만한 뚜렷한 근거는 없다는 것입니다 (PMID 20550733, DOI: 10.1017/s0140525x0999152x). 같은 호의 논평은 뇌 영상 연구도 같은 편향을 공유한다고 덧붙였습니다 (PMID 20546651).

미리 못 박아 둘 것이 있습니다. 이 지적의 요지는 어느 사회가 낫거나 못하다는 것이 아닙니다. 표준이 잘못 잡혔다는 것입니다. 얇은 한 조각만 재 놓고 전체의 이름으로 서술했다는, 표집(누구를 연구에 데려오느냐)과 측정(그 사람들에게서 무엇을 어떻게 재느냐)의 문제입니다.

지적의 근거들

가장 자주 인용된 증거는 경제 게임이었습니다. 돈을 나누는 방식으로 사람이 자기 이익만 따르는지 보는 최후통첩·공공재·독재자 게임을 소규모 사회 15곳에서 돌린 연구가 있습니다. 대학생만 대상으로 한 기존 실험으로는 가릴 수 없던 질문에 답하려는 연구였습니다 (PMID 16372952). 자기 이익에 기반한 표준 모형은 연구한 모든 사회에서 실패했고, 사회 간 행동 변이는 기존 연구보다 훨씬 컸습니다. 시장 통합의 정도와 일상에서 협력이 주는 이득이 클수록 실험에서 친사회성도 높았습니다.

기초 지각도 예외가 아닌 듯 보였습니다. 화면의 한 곳이 바뀐 것을 알아채는 변화맹 과제에서 미국 참가자는 초점 물체의 변화에, 동아시아 참가자는 상대적으로 맥락의 변화에 민감했습니다 (PMID 21702819). 서구 음악에 거의 노출되지 않은 아마존의 치마네족은 어울리게 들리는 협화 화음과 부딪히게 들리는 불협화 화음을 똑같이 유쾌하다고 평가했습니다. 같은 나라 도시 거주자는 협화음을 선호했고 미국 응답자는 더 강하게 선호했습니다 (PMID 27409816).

자기와 도덕 쪽도 흔들렸습니다. 자신을 긍정적으로 보려는 욕구가 모든 사람에게 있는지 다시 따져 보니, 이 욕구는 북미 문화에 뿌리를 둘 수 있었습니다 (PMID 10560328). 사회적 압력으로 한 행동이라 그 사람의 태도를 거의 알려 주지 않을 때도, 행동과 같은 태도를 지녔을 것이라 짐작하는 대응편향은 일본인과 달리 미국인에게서만 유지됐습니다 (PMID 12416925). 농촌 마야 참가자는 더 큰 이익을 위한 수단으로서의 가해를 부수효과로서의 가해보다 더 금지된 것으로 보면서도, 행동으로 해를 끼치는 것과 행동하지 않아 해가 생기는 것(작위와 부작위)은 도덕적으로 구분하지 않았습니다 (PMID 20092817).

반격 — 한 대표 사례에 대한 재검토

그런데 이야기를 여기서 끝내면 정직하지 않습니다. 지각 영역에서 문화 영향의 가장 유명한 사례로 꼽히던 뮐러-라이어 착시에 대해, 최근 한 종합 리뷰가 정면으로 반론을 폈습니다. 이 착시는 길이가 같은 두 선분 끝에 화살표를 안팎으로 붙이면 길이가 달라 보이는 그림입니다. 백 년 넘게 이어진 연구 계보는 어떤 사회에서 자랐는지, 직각으로 짜인 목공 환경에 얼마나 노출됐는지에 따라 이 착시가 아예 보이지 않을 수도 있다고 주장했습니다. 여기서 "기초적으로 보이는 시각 처리조차 문화적으로 진화한 부산물"이라는 명제가 나왔습니다.

이 리뷰는 2025년에 이 가설이 거의 확실히 틀렸다고 논증했습니다. 착시는 다른 생태에 사는 비인간 동물에게서도 나타나고, 자연 장면의 통계만으로도 재현됩니다. 목공 환경 특유의 직선이 없어도, 심지어 선이 하나도 없어도 생깁니다. 시각이 아닌 감각에서도, 선천적 시각장애인에게서도 나타납니다. 나아가 저자들은 원 사례 연구의 역사적 데이터와 민족지 기술(현지 관찰 기록)을 다시 열어, 문화 차이가 있다는 증거와 그 차이가 핵심 문화 변수와 맺는 상관이 실제로는 매우 일관되지 않았다고 보고했습니다. 그 증거는 의심스러운 연구 관행에 시달렸고, 후대 논의에서 잘못 전해졌다고 합니다 (PMID 40388159). 다만 이 반박은 한 편의 리뷰가 낸 논증이고, 겨냥한 것도 시지각의 착시 사례이며, 경제 게임 같은 다른 영역의 증거는 아닙니다.

보편성 쪽 증거도 그동안 쌓였습니다. 소규모 사회 10곳의 567명에게서 잰 자부심은 언어와 생계 방식이 크게 다른데도 지역 청중의 가치 평가를 따라갔습니다. 두 값이 함께 오르내리는 정도를 재는 상관계수 r이 같은 지역 안에서는 평균 r=+0.66, 지역을 건너서도 +0.29였습니다 (PMID 30068602). 대화의 순서교대는 10개 언어에서 말이 겹치는 것을 피하고 침묵을 최소화하는 같은 패턴을 보였고, 언어별 차이는 평균에서 250밀리초 범위였습니다 (PMID 19553212). 수치심이 평판 손상에 대한 방어라는 예측은 6개국에서 지지됐습니다 (PMID 41871240). 잘못한 사람에게 벌을 주려는 응보 감정이 피해자 보상과 재발 억제를 함께 따른다는 예측은 인도네시아 멘타와이 원예농 74명과 미국인 600명에서 같이 확인됐습니다 (PMID 42113676).

특히 눈여겨볼 것은 한 연구 안에서도 어떤 층은 사회마다 같고 어떤 층은 다르다는 점입니다. 주변 선택지에 따라 보상의 가치를 다르게 매기는 성질은 11개국 전부에서 비슷했지만, 별도 과제로 잰 위험회피는 국가별로 유의하게 달랐습니다 (PMID 36909645). 서울과 로스앤젤레스 표본은 잘못의 원인을 상황 탓으로 보느냐 성향 탓으로 보느냐에서 크게 갈렸는데도, 시공간적으로 멀거나 권위의 승인이 있는 위반을 덜 나쁘게 판단하는 패턴은 양쪽에서 같았습니다 (PMID 35987768).

반대로 정서 지각, 곧 표정에서 감정을 알아보는 일은 여전히 갈립니다. 하드자 수렵채집민 연구는 보편적 정서 지각의 증거를 거의 찾지 못했습니다 (PMID 32123191). 보편성 증거가 실험 방법에 의존한다는 주장이 있고 (PMID 28950961), 보편성을 지지한 쪽 실험의 조작 점검 절차가 오히려 참가자에게 서구식 정서 범주를 가르쳤을 수 있다는 반박이 오갔습니다 (PMID 25608863).

그래서 요점은 "예측할 수 없다"이다

이 대차대조표에서 끌어낼 결론은 "서구가 이상하다"도 "결국 다 같다"도 아닙니다. WEIRD 표본이 자주 바깥값이었다는 관찰이 철회된 것은 아니지만, 어떤 현상은 문화를 건너가고 어떤 현상은 건너가지 않는데, 어느 쪽인지는 재 보기 전에 알 수 없다는 것입니다. 발달심리에서 나온 최근의 한 줄 요약이 이 태도를 담습니다. 여러 연구실이 함께하는 재현 시도들을 보면 문화 차이는 분명 중요한 경우도 있지만 종종 가정된 것보다 작고 덜 체계적이며, 그러므로 문화적 일반화 가능성은 전제할 것이 아니라 경험적으로 검증할 문제라는 것입니다 (PMID 42396701). 문제는 특정 표본이 열등하다는 것이 아니라, 어떤 표본 하나로도 그 답을 미리 알 수 없다는 데 있습니다.

15년 뒤, 실제로 무엇이 바뀌었나

지적에 대한 관심은 크게 늘었습니다. 분야별로 다시 센 결과는 이렇습니다. 인지심리 대표 저널의 2016~2020년 논문 가운데 문화를 — 아주 넓게 정의해도 — 고려한 것은 약 7%였고, 그중 83%는 언어와 이중언어 연구였습니다 (PMID 36510095). 성 연구 5개 저널 2,223편에서 WEIRD 표본 비중은 68~88%였습니다 (PMID 33939579). 영아 발달 4개 저널의 2011~2022년 논문 1,682편, 참가자 약 100만 명을 코딩한 분석에서는 사회인구 정보가 지속적으로 보고되지 않았고, 보고된 경우에는 북미·서유럽 백인 영아 쪽으로 흔들림 없이 치우쳐 있었습니다 (PMID 37211974). 연인·부부 같은 관계를 다루는 관계과학 8개 저널 1,762연구는 20년 간격의 두 시점을 비교하면 사회경제적 지위 같은 일부 항목은 나아지지 않았고, 나아진 항목(성적지향)도 보고가 제한적이었습니다 (PMID 36757951). 정신생리학 저널 2010~2020년 논문의 인종·민족 보고율은 17%였습니다 (PMID 37332087).

가장 뼈아픈 숫자는 알코올 연구 저널의 2010~2022년 분석에서 나옵니다. 인구통계 항목의 보고율은 전반적으로 올랐고, 인종·성적지향·성별정체성·사회경제적 지위 등에서는 유의하게 올랐습니다. 그런데 같은 기간 미국 밖에서 수행된 연구의 비중은 유의하게 줄었습니다 (PMID 38653579). 보고가 개선되는 것과 표본이 넓어지는 것은 다른 일입니다. 표본 지역에 따라 결과가 달라 보이기도 합니다. 한 검토에서 청소년의 소셜미디어 사용과 우울을 다룬 2018~2020년 논문 34편 중 70% 이상이 북반구(Global North) 표본이었고, 남반구(Global South) 표본은 30% 미만이었습니다. 둘의 연관은 Global North에서는 양의 방향으로 유의했고 남반구(Global South)에서는 영에 가깝고 유의하지 않았습니다 (PMID 37694229).

더 최근 시점에서 전체를 다시 센 시도도 있습니다. 같은 분야 연구자의 검토(동료심사)를 거치기 전 원고인 프리프린트로, Psychological Science 2023년 6~12월호 45편·133연구를 센 결과입니다. 표본은 여전히 85%가 WEIRD였고, 문화적으로 관련된 특성은 초록의 54%에서만 보고됐습니다. 표본을 넘어선 과일반화, 곧 잰 사람들보다 넓은 집단에 대해 결론을 서술하는 일은 초록의 97%에서 일어났습니다(동료심사 전 프리프린트) (DOI: 10.31234/osf.io/mkpce_v1). 같은 프리프린트는 WEIRD 국가가 세계 인구의 약 12%라고 적습니다.

두 개의 100칸 격자. 왼쪽은 사람 아이콘 100개 중 12개가 파랑(세계 인구에서 WEIRD 국가의 몫 약 12%), 오른쪽은 네모 100칸 중 85칸이 파랑(Psychological Science 2023년 6~12월호 45편·133연구 표본의 85%가 WEIRD). 동료심사 전 프리프린트의 수치이고 두 값의 분모가 달라 서로 순위를 매기지 않는다는 주석이 붙어 있다.

왜 안 바뀌는가. 한 논평은 냉정하게 답합니다. 50년 넘게 주장해 왔는데도 움직이지 않는 이유는 지식이나 논변이나 영리한 약어의 부족이 아니라, 보편적이고 탈맥락적이며 일반화 가능한 학문이라는 분야의 자기 이미지와 우선순위에 있다는 것입니다 (DOI: 10.1017/s0140525x25104172).

다양성만 늘리면 되는가 ① — 누구를 더하느냐

2010년에도 낙관은 있었습니다. 온라인 성격검사 응답자 564,502명을 분석한 논평은 19%가 선진 경제권 밖, 20%가 비서구 사회라며 인터넷의 가능성을 제시했습니다 (DOI: 10.1017/s0140525x10000300). 그런데 이후 연구는, 연구자들이 대학생이나 온라인 노동자 같은 표본에서 고학력자를 많이 모으며 고학력은 중립적인 축이 아니라고 지적합니다. 95개국 268,992명이 응답한 세계가치조사(2005~2022) 자료로 학력이 높은 집단과 낮은 집단의 문화적 거리를 잰 프리프린트는, 고학력 집단이 신념·가치·행동에서 WEIRD 국가와 유의하게 더 비슷하다고 보고했습니다. 이 패턴은 중국·러시아·인도처럼 크고 영향력 있는 다른 나라들과의 유사성으로는 나타나지 않았고 소득이나 주관적 지위도 같은 패턴을 만들지 않았습니다. 저자들은 각국의 대학생과 온라인 노동자로 만든 "국제" 표본이 WEIRD 국가에 전형적인 가치를 과대대표할 수 있다고 봅니다(동료심사 전 프리프린트) (DOI: 10.31234/osf.io/8wr5d_v2). 2010년의 한 논평은 아예 표본 다양화만으로는 일반화 가능한 원리에 도달하지 못하며, 데이터를 수집하는 맥락, 곧 실험이 이루어지는 상황의 범위를 함께 넓혀야 한다고 적었습니다 (DOI: 10.1017/s0140525x10000063).

지름길로 제안되는 것도 있습니다. 대규모 언어모델이 사람처럼 설문에 답하게 만든 합성 응답자입니다. 미국·사우디아라비아·아랍에미리트를 비교한 연구에서 GPT-4의 합성 응답은 평균적으로 인간과 그럴듯하게 비슷했지만 사우디아라비아와 아랍에미리트에서는 상관이 더 약한 경향이 있었습니다 (DOI: 10.1177/23794607241311793). 더 근본적인 비판도 있습니다. 학습 코퍼스가 서구·영어·3인칭 서술에 치우쳐 있어 합성 응답은 사람들이 자기 경험을 표현하는 방식이 아니라 타인이 그들을 서술한 방식을 재생산할 수 있다는 것입니다. 합성 응답으로 대체하면 번역·현지 전문성·공동체 협력 같은 인프라에 투자할 유인이 약해질 수 있다고도 합니다(동료심사 전 프리프린트) (DOI: 10.31234/osf.io/8x37h_v1).

다양성만 늘리면 되는가 ② — 도구와 이론이 이미 맞춰져 있다

표본을 넓히면 곧바로 다음 벽이 나옵니다. 도구 자체가 특정 참가자 집단에 맞춰 다듬어져 있다는 것입니다. 방글라데시 농촌에서 사회적 할인 과제(상대와의 사회적 거리에 따라 내가 나눠 줄 몫이 어떻게 줄어드는지 재는 과제)를 수행하려던 연구팀의 기록이 이를 구체적으로 보여 줍니다. 여러 차례 예비조사와 수정을 거치며 드러난 암묵적 전제는 숫자와 문자에 대한 익숙함, 추상적 수직선과 2차원 도형을 읽는 능력, 그리고 일련의 선택을 서로 고립된 사건으로 다루는 태도였습니다. 팀은 현장 관찰을 거쳐 방글라데시와 미국 대학생 양쪽에서 작동하는 프로토콜을 새로 만들었습니다 (PMID 30397138).

이론도 마찬가지입니다. 발달심리의 두 대표 이론에도 같은 편향이 있다는 점검이 나왔습니다. 사람이 타인과 의도를 함께 나누는 능력을 다룬 공유지향성 이론은 기초 데이터베이스가 편향되어 있어, 인간 일반의 사회인지를 설명한다는 주장이 약해집니다. 아이와 양육자의 정서적 유대를 다룬 애착이론은 상호의존이나 애착 네트워크처럼 여러 사회에서 관찰되는 공동체 지향적 구성개념을 핵심 가정에서 배제합니다 (PMID 40407757). WEIRD라는 범주 자체가 뭉뚱그림이라는 비판도 있습니다 — 각 항목이 제대로 조작화되지 않아 WEIRD 맥락 안에 사는 다양한 정체성의 사람들을 지워 버린다는 것입니다 (DOI: 10.1146/annurev-anthro-102218-011133).

균형을 위해 반대 방향의 주장도 소개합니다. 한 논문은 표본 다양성 권고가 애초에 사람 사이의 일반화를 목표하지 않는 연구에까지 적용되곤 한다고 지적합니다. 또한 WEIRD 표본과 편의표본은 같은 것이 아니고, 연구자가 손쉽게 모을 수 있는 사람들로 꾸린 편의표본은 오히려 심리학을 세계화하는 데 중요한 수단이라고 말합니다 (PMID 39509224).

더 어려운 문제 — 번역이 같은 것을 재는가

척도는 정서나 우울처럼 눈에 보이지 않는 마음의 특성을 여러 문항의 점수로 바꿔 놓은 질문지입니다. 같은 척도를 번역해 여러 나라에서 돌리면 점수를 나란히 놓고 비교하고 싶어집니다. 그런데 13개국 12,635명에게 정적·부적 경험을 묻는 척도를 돌린 연구에서, "슬픈", "두려운", "화난" 세 문항은 나라 사이에서 같은 잣대로 작동하지 않았습니다. 세 문항을 제외하면 집단 간 점수의 기준선이 같은 상태, 곧 부분 스칼라 불변까지는 지지됐습니다. 이 세 문항으로 나라를 비교할 때는 조심이 필요하다는 뜻입니다. 초록은 이 차이의 원인이 번역인지 문화적 의미의 차이인지 밝히지 않습니다 (PMID 34105378).

개념도. 위에 「슬픈」「두려운」「화난」 세 문항 카드가 있고, 각 카드 아래에 눈금 간격이 다른 두 개의 자(한 나라의 잣대, 다른 나라의 잣대)가 놓여 있다. 제목은 같은 문항, 다른 잣대. 오른쪽에는 세 문항을 제외하면 부분 스칼라 불변까지 지지됐다는 칸, 아래에는 원인이 번역인지 문화적 의미 차이인지 초록이 밝히지 않는다는 점선 칸이 있다. 13개국 12,635명 연구.

"이 나라가 더 높다"고 말하려면 척도가 두 집단에서 같은 것을 같은 방식으로 재고 있어야 합니다. 이 조건을 측정 불변성(measurement invariance, 측정 동등성이라고도 합니다)이라 부릅니다.

검증 절차는 정리돼 있습니다. 질적 연구로 그 개념이 그 문화에서 의미가 있는지 확인하고, 번역·적응한 뒤 예비조사와 인지면접(참가자가 문항을 어떻게 이해하는지 직접 묻는 면접)을 거칩니다. 그다음 확인적 요인분석과 라쉬 모형 같은 통계 방법으로 불변성 가설을 명시적으로 검증합니다. 그런데 이 검토는 불편한 문장을 남깁니다. 불변성이 성립해도 규범·기대·고통 표현의 문화적 차이에서 오는 역치 효과, 곧 같은 정도의 고통에도 "그렇다"고 답하는 기준선이 문화마다 달라지는 효과는 남을 수 있습니다. 2008년의 이 서술적 검토는 정신건강 분야 문헌에서 문화공정한 비교를 실제로 입증한 사례가 드물다고 평가했습니다 (PMID 18924560).

실제 결과는 그 경고에 부합합니다. 5대륙 27개국에서 도덕 판단의 다섯 가지 토대를 재는 도덕기반질문지 단축형을 검증한 연구는, 5요인 모형, 곧 다섯 토대가 다섯 덩어리로 나뉜다는 구조가 넓은 범위의 인구집단에서 문제없이 들어맞게 문항을 짜는 일 자체가 어렵다고 보고했습니다 (PMID 30596252).

가장 선명한 사례는 정신증 경험 척도입니다. 환각 같은 증상, 의욕 없음, 우울 증상을 자기보고로 재는 이 척도로 13개국 7,141명을 분석한 연구는, 저·중소득국에서 정신증 경험이 더 흔하다는 기존 결과가 측정 편향 때문인지 따져 보았습니다. 부분 스칼라 불변이 성립해, 문항 뒤의 공통 특성을 통계 모형으로 추정한 잠재점수는 비교할 수 있었습니다. 그러나 문항의 오차 크기까지 집단 간에 같은 상태인 잔차 불변성은 성립하지 않아, 문항 점수를 단순히 더한 합산점수 비교는 편향된다고 보고했습니다. 보정 전후를 비교하니 한 요인은 과대추정, 다른 요인은 과소추정이었습니다. 고소득국과 견준 저·중소득국의 차이(효과 크기 d, 곧 두 집단 평균의 차이를 흩어진 정도로 나눈 값)가 무의욕은 d=0.03에서 d=−0.42로, 마술적 사고는 d=−0.03에서 d=0.33으로 바뀌었습니다 (PMID 33023691). 합산점수로 나라를 비교한 기존 연구들도 편향됐을 가능성이 높다는 뜻입니다. 다만 같은 연구는 보정 후에도 대부분의 요인에서 저·중소득국이 유의하게 더 높았고(무의욕만 유의하게 더 낮았습니다), 정신증 경험이 저·중소득국에서 더 흔하다는 기본 결과는 확인됐다고 밝힙니다 — 편향은 개별 요인의 크기와 방향을 흔들었지, 큰 그림을 다 뒤집은 것은 아닙니다.

모든 검증이 실패로 끝나는 것은 아닙니다. 저·중소득 8개국 4,732명에서 우울 척도 15문항을 문항반응이론, 곧 문항마다 그 숨은 특성을 얼마나 잘 가려내는지 따지는 분석으로 살핀 연구는 15개 중 13개 문항이 여러 환경에서 잘 작동한다고 보고했습니다. 판별력이 낮았던 것은 자살 사고와 "성적 관심이나 즐거움의 상실" 두 문항이었습니다. 같은 우울 수준인데도 나라에 따라 문항 점수가 달라지는 차별기능은 대부분의 문항에서 어느 정도 있었지만, 총점 수준에 영향을 준 곳은 한 나라(인도네시아)뿐이었습니다 (PMID 27083900). 측정 도구가 사람이 아니라 알고리즘일 때도 같은 문제가 생깁니다. 자동 표정 인식 시스템 두 종은 서양 데이터셋에서 높은 정확도를 보이고도 동양 데이터셋에서는 특히 부정 정서에서 성능이 떨어져 측정 불변성을 위반했습니다. 행복 측정은 정확하고 불변이었습니다 (PMID 38130968).

번역 실무의 표준은 이미 있는데도 문제가 남아 있습니다. 한 논문은 원인에 하나를 더 보태자고 제안합니다. 이 문제는 오래 번역 절차에 대한 지식 부족 탓으로 여겨졌지만, 그 진단에 기반한 해법들이 널리 채택되고도 문제는 해결되지 않았습니다. 저자들은 번역되는 척도 자체에 대한 정보가 부족한 것이 추가 원인일 수 있다고 봅니다. 그렇다면 번역자가 스스로 풀 수 있는 문제가 아니므로, 원 척도 제작자가 척도별 번역 가이드를 만드는 방안을 검토해 보자는 제안입니다 (PMID 36355577).

척도가 아예 묻지 않는 것

번역이 완벽해도 남는 층이 있습니다. 애초에 그 척도가 묻지 않는 것들입니다.

케냐의 저소득층 청소년에게 정해진 보기 없이 "가장 큰 문제"를 직접 묻자 61%가 사회적 문제를, 38%가 학업 문제를, 35%가 경제적 문제를 들었습니다. 그런데 표준화된 정신건강 척도가 재는 정서·행동 문제를 자신의 최상위 문제로 든 참가자는 17%였습니다. 표준 척도가 놓칠 수 있는 문제가 있다는 뜻입니다 (PMID 33528725). 케냐 서부 루오족을 대상으로 현지에서 공동 개발한 우울 질문지는 116명 대상 탐색적 요인분석에서 인지·정서·신체의 3요인 구조, 곧 문항들이 세 묶음으로 갈리는 구조가 시사된 반면 표준 도구는 1요인이었습니다. 현지 도구는 표준 도구가 놓친 특징들을 잡아냈습니다 (PMID 33818199).

"생각이 너무 많다"는 여러 사회에서 고통을 표현하는 관용어입니다. 체계적 고찰은 1979~2014년의 138편을 종합해, 이 표현이 우울·불안·PTSD 같은 구성개념(직접 보이지 않아 척도로 재는 개념)과 가변적으로 겹치지만 진단이 포착하지 못하는 측면을 담고 있고, 문화 사이뿐 아니라 문화 안에서도 변이가 크다고 보고했습니다 (PMID 26584235). 문화적 고통 개념과 정신과 진단을 비교한 45편·18,782명의 메타분석(여러 연구 결과를 합쳐 다시 계산하는 분석)은 더 불편한 결과를 냅니다. 중등도 이상 품질 기준을 만족한 연구가 27%뿐이었는데, 품질이 높은 연구일수록 두 개념의 연관이 약했습니다. 저자들은 문화적 고통 개념이 역학 연구에 본질적으로 맞지 않는 것은 아니며 연구 품질이 걸림돌이라고 결론짓습니다 (PMID 24366490).

제안과 시도들

비관만 남기는 것은 정확하지 않습니다. 다만 아래는 대부분 설계와 제안이어서 효과는 이 자료로 확인되지 않았습니다. 심리과학 가속기(PSA) 같은 상시·분산 다연구실 네트워크는 하나의 연구를 여러 나라에서 함께 수행하도록 설계됐고 (PMID 31886452), 404명의 연구자가 45개 언어로 175개국 117,293명의 연애·짝 선호 자료를 모은 조사 같은 규모도 나왔습니다 (PMID 40593913). 무작정 넓히는 대신 이론이 표집을 이끌게 하자는 제안도 있습니다 — 환경의 가혹함이 시간선호를, 시장 통합이 성격 구조를 어떻게 빚는지 같은 사회생태 가설이 어떤 집단을 재야 하는지를 지정해 준다는 것입니다 (PMID 30397108). 결과가 다른 상황에도 통하는 정도인 외적 타당도를 인구·상황·결과·시간대 네 영역으로 쪼개 점검하자는 틀도 같은 방향이고 (PMID 31743074), 다지역 연구의 난제를 정리한 논문은 공동체의 의사를 최우선에 두는 접근을 권하며 이런 고려가 과학적 엄밀성의 일부라고 적습니다 (PMID 32962541). 그리고 재현성, 곧 다시 해 보면 같은 결과가 나오는 성질과 일반화가능성은 따로 풀 문제가 아니라 함께 풀어야 할 얽힌 문제라는 정리가 있습니다 (PMID 36104999). 「심리학의 재현 위기 — 우리가 믿었던 발견들은 왜 흔들렸나」가 다룬 재현 위기와 이 편의 표집 문제가 만나는 지점이 여기입니다.

표. 제안과 시도 여섯 가지가 한 줄씩 있다: 설계(심리과학 가속기), 수집 규모(404명 연구자·45개 언어·175개국 117,293명 조사), 제안(이론이 표집을 이끌게), 틀(외적 타당도 네 영역), 권고(공동체 의사 우선), 정리(재현성과 일반화가능성은 얽힌 문제). 각 줄 오른쪽의 효과 칸은 모두 점선 빈칸이며 이 자료로 확인되지 않음이라고 적혀 있다.

정직한 미해결

정리하면, 이 논쟁에서 확정된 것은 생각보다 적습니다.

무엇이 보편인지는 여전히 사례별로만 답할 수 있습니다. 자부심의 구조와 대화의 순서교대는 건너갔고, 협화음 선호와 변화 탐지의 초점은 건너가지 않았으며, 정서 지각은 아직 다투는 중입니다. 이 목록을 미리 맞힌 이론은 이 편의 자료에 없고, 이론이 표집을 이끌게 하자는 제안 (PMID 30397108)은 아직 제안 단계입니다. 다만 보편과 변이가 한 연구 안에서 층으로 갈리기도 합니다. 아동의 또래 협력 선호는 세 집단에서 크게 달랐지만 협력 중의 긍정 정서와 사회인지 능력의 관계는 집단을 건너 일정했습니다 (PMID 33211711). 고급 마음이론, 곧 사회적 추론과 규범 인식 등으로 재는 타인의 마음을 읽는 능력의 3요인 구조는 일본·독일 아동에서 공통이었으나 발달 경로는 달랐습니다 (PMID 41983731). "무엇이" 아니라 "어느 층이" 보편이냐가 진짜 질문일 수 있습니다.

불변성 검증이 실패했을 때 무엇을 할지는 선택지가 갈립니다. 부분 불변에 기대 집단 평균을 숨은 특성 수준에서만 비교할지, 문제 항목을 빼고 척도를 바꿀지, 아예 비교를 포기할지 — 어느 쪽이 표준인지는 이 편의 자료로는 알 수 없습니다.

다양화가 대표성으로 이어진다는 보장이 없습니다. 무엇이 "충분한" 일반화 가능성인지 가리기 어렵다는 점은 이 논문도 짚습니다 (PMID 39509224). 유전과 문화의 경계도 고정돼 있지 않습니다 — 누적 문화가 유전자와 기능적으로 겹칠 때 유전 효과는 가려지거나 드러나거나 뒤집힐 수 있고 그 양상은 특정 시점 특정 사회에 고유한데, WEIRD 표집 문제가 바로 이 조건 의존성을 안 보이게 만든다는 분석도 있습니다 (PMID 34016199).

애초의 지적을 낸 저자들도 28편의 논평에 답하며, 넓은 기반의 행동과학은 실험과 민족지를 포함한 다양한 방법을 다양한 인구집단에 적용해야 한다고 적었습니다 (DOI: 10.1017/s0140525x10000725). 15년이 지난 지금 남은 질문은 처음과 크게 다르지 않습니다. "사람은 ~한다"라고 쓸 때 우리는 누구를 재고 있었는가. 그리고 더 많은 사람을 잰다고 할 때, 우리는 정말 같은 것을 재고 있는가.


근거 논문

  • "The weirdest people in the world?" (2010) — PMID 20550733 / DOI: 10.1017/s0140525x0999152x — WEIRD 개념의 원 논문. 인구 집단 간 변이가 크고 WEIRD 표본이 자주 바깥값. 시지각·공정성·협력·공간추론·범주화·도덕추론·추론양식·자기개념·IQ 유전율 검토.
  • "Beyond WEIRD: Towards a broad-based behavioral science" (2010) — DOI: 10.1017/s0140525x10000725 — 28편 논평에 대한 저자들의 응답. 실험과 민족지의 통합 강조.
  • "The weirdest brains in the world" (2010) — PMID 20546651 — 뇌 과학도 같은 표집 편향을 공유한다는 논평.
  • "'Economic man' in cross-cultural perspective: behavioral experiments in 15 small-scale societies" (2005) — PMID 16372952 — 자기이익 모형이 15개 사회 전부에서 실패, 시장 통합·협력 이득이 클수록 친사회성 높음.
  • "Culture and change blindness" (2006) — PMID 21702819 — 미국인은 초점 물체, 동아시아인은 맥락 변화에 상대적으로 민감.
  • "Indifference to dissonance in native Amazonians reveals cultural variation in music perception" (2016) — PMID 27409816 — 치마네족은 협화·불협화를 동등하게 평가. 볼리비아 도시·미국 순으로 협화 선호 증가.
  • "Mayan morality: an exploration of permissible harms" (2010) — PMID 20092817 — 수단/부수효과 구분은 공유, 작위/부작위 구분은 농촌 마야 참가자에게서 관찰되지 않음.
  • "Is there a universal need for positive self-regard?" (1999) — PMID 10560328 — 긍정적 자기존중 욕구가 북미 문화에 뿌리를 둘 수 있다는 재검토.
  • "Cultural variation in correspondence bias" (2002) — PMID 12416925 — 행동의 태도 진단성이 낮을 때 미국인만 대응편향 유지.
  • "Is visual perception WEIRD? The Müller-Lyer illusion and the cultural byproduct hypothesis" (2025) — PMID 40388159 — 문화적 부산물 가설에 대한 종합 반박. 비인간 동물·자연장면 통계·선 없는 자극·타 감각·선천맹 증거 + 원자료 재검토.
  • "Invariances in the architecture of pride across small-scale societies" (2018) — PMID 30068602 — 소규모 사회 10곳 567명. 자부심이 지역 청중 가치평가를 r=+0.66(지역 내), +0.29(지역 간)로 추적.
  • "Universals and cultural variation in turn-taking in conversation" (2009) — PMID 19553212 — 10개 언어에서 겹침 회피·침묵 최소화 공통, 차이는 250ms 범위의 양적 차이.
  • "Outcome context-dependence is not WEIRD" (2023) — PMID 36909645 — 11개국 전부에서 맥락의존 보상 부호화 동일. 반면 위험회피는 국가별로 유의하게 다름.
  • "Cross-cultural evidence that shame is a defense against reputational damage" (2026) — PMID 41871240 — 6개국 및 미국 두 지역에서 두 예측 모두 지지.
  • "Moral parochialism and causal appraisal of transgressive harm in Seoul and Los Angeles" (2022) — PMID 35987768 — 상황/성향 귀인은 크게 갈렸으나 도덕 편협성 패턴은 양쪽에서 동일.
  • "Retributive Sentiments Track Both Deterrent and Compensatory Concerns in a Small-Scale Society and a WEIRD Sample" (2026) — PMID 42113676 — 멘타와이 74명·미국 600명, 네 실험.
  • "Emotion Perception in Hadza Hunter-Gatherers" (2020) — PMID 32123191 — 보편적 정서 지각 증거를 거의 찾지 못함.
  • "Revisiting diversity: cultural variation reveals the constructed nature of emotion perception" (2017) — PMID 28950961 — 보편성 증거의 방법 의존성.
  • "Cultural variation in emotion perception is real" (2015) — PMID 25608863 — 조작 점검이 서구 정서 범주를 가르쳤을 가능성 제기.
  • "Cross-cultural generalizability is an empirical question" (2026) — PMID 42396701 — 문화 차이는 가정된 것보다 작고 덜 체계적일 때가 많으므로 전제가 아니라 검증 대상.
  • "Consideration of culture in cognition" (2023) — PMID 36510095 — 인지심리 저널 2016~2020년 논문 중 약 7%만 문화 고려, 그중 83%가 언어·이중언어.
  • "How WEIRD and Androcentric Is Sex Research?" (2022) — PMID 33939579 — 5개 저널 2,223편(2015~2019), WEIRD 68~88%.
  • "Diversity and representation in infant research" (2023) — PMID 37211974 — 4개 저널 1,682편·약 100만 명(2011~2022). 지속적 미보고 + 북미·서유럽 백인 영아 편중.
  • "'Mostly White, heterosexual couples'" (2023) — PMID 36757951 — 8개 저널 1,762연구, 1996~2000 대 2016~2020 비교. 일부 항목은 개선 없음.
  • "Participant diversity in Psychophysiology" (2023) — PMID 37332087 — 2010~2020년 인종·민족 보고 17%, 60% 이상이 보고 후 미분석.
  • "Participant diversity in ACER: 2010-2022" (2024) — PMID 38653579 — 보고율은 전반적으로 상승했으나 미국 밖 연구 비중은 유의하게 감소.
  • "Lack of Sample Diversity in Research on Adolescent Depression and Social Media Use" (2023) — PMID 37694229 — 34편 중 70% 이상 Global North. 연관이 Global North에서 유의, Global South에서 무.
  • "Beyond WEIRD: The Persistence of Limited Samples and Overgeneralisation in Psychological Science" (2026) — DOI: 10.31234/osf.io/mkpce_v1 — WEIRD 국가 세계 인구 약 12%. Psychological Science 2023년 45편·133연구에서 표본 85% WEIRD, 과일반화 초록 97%(동료심사 전 프리프린트).
  • "Psychology wants to stay WEIRD, not go WILD" (2026) — DOI: 10.1017/s0140525x25104172 — 50년의 정체는 지식 부족이 아니라 분야의 우선순위·가치 문제라는 논평.
  • "Wired but not WEIRD: The promise of the Internet in reaching more diverse samples" (2010) — DOI: 10.1017/s0140525x10000300 — 온라인 564,502명 중 19%가 선진 경제권 밖, 20% 비서구.
  • "More educated people are more WEIRD" (2025) — DOI: 10.31234/osf.io/8wr5d_v2 — 95개국 268,992명. 고학력이 WEIRD 국가와의 문화적 유사성을 예측, 소득·주관적 지위는 아님(동료심사 전 프리프린트).
  • "The WEIRD are even weirder than you think: Diversifying contexts is as important as diversifying samples" (2010) — DOI: 10.1017/s0140525x10000063 — 표본만이 아니라 맥락도 다양화해야 한다는 논평.
  • "Beyond WEIRD: Can synthetic survey participants substitute for humans in global policy research?" (2024) — DOI: 10.1177/23794607241311793 — GPT-4 합성 응답이 평균적으로는 유사했으나 비WEIRD 국가에서 상관 약화.
  • "Synthetic survey participants cannot substitute for sample diversity in policy" (2026) — DOI: 10.31234/osf.io/8x37h_v1 — 인구통계 라벨링≠대표성. 학습 코퍼스 편향과 인프라 투자 유인 약화 비판(동료심사 전 프리프린트).
  • "Learning from failures of protocol in cross-cultural research" (2018) — PMID 30397138 — 방글라데시 농촌 사회적 할인 과제. 숫자·문자·수직선·2D 도형 친숙함과 고립된 선택이라는 암묵적 전제.
  • "Let's go WILD: increasing inclusivity in theories of developmental psychology" (2025) — PMID 40407757 — 공유지향성 이론의 데이터 편향, 애착이론의 공동체 지향 구성개념 배제.
  • "Soylent Is People, and WEIRD Is White" (2019) — DOI: 10.1146/annurev-anthro-102218-011133 — WEIRD 항목의 조작화 부재가 WEIRD 맥락 내 다양성을 지움. 백인성이라는 미명시 축.
  • "There is nothing WEIRD about basic research: The critical role of convenience samples" (2025) — PMID 39509224 — 다양성 권고의 오적용 문제. WEIRD 표본과 편의표본은 다르며 편의표본은 세계화에 중요.
  • "Measurement validity in cross-cultural comparative research" (2008) — PMID 18924560 — 측정 불변성 검증 절차 정리. 완전한 준거 타당화는 신기루일 수 있고, 불변성 후에도 역치 효과가 남음.
  • "Testing Measurement Invariance of the Moral Foundations Questionnaire Across 27 Countries" (2020) — PMID 30596252 — 5요인 모형을 다양한 인구집단에서 문제없이 수렴시키기 어려움.
  • "Measurement Invariance of the Scale of Positive and Negative Experience Across 13 Countries" (2022) — PMID 34105378 — 12,635명. 슬픔·두려움·분노 항목이 문화적으로 비불변.
  • "Comparing psychotic experiences in low-and-middle-income-countries and high-income-countries with a focus on measurement invariance" (2022) — PMID 33023691 — 7,141명. 합산점수 비교는 편향. 보정 시 무의욕 d=0.03→−0.42, 마술적 사고 d=−0.03→0.33.
  • "Depression symptoms across cultures: an IRT analysis" (2016) — PMID 27083900 — 8개국 4,732명. 15개 중 13개 문항은 잘 작동, 자살사고·성적 관심 항목은 판별력 낮음.
  • "The cross-race effect in automatic facial expression recognition violates measurement invariance" (2023) — PMID 38130968 — 자동 표정 인식 두 종이 동양 데이터셋에서 부정 정서 인식 저하. 행복 측정치는 불변.
  • "Improving Scale Equivalence by Increasing Access to Scale-Specific Information" (2023) — PMID 36355577 — 진단을 바꾸자는 제안. 척도별 번역 가이드를 원 제작자가 만들어야 한다는 주장.
  • "In Their Own Words: Using Open-Ended Assessment to Identify Culturally Relevant Concerns among Kenyan Adolescents" (2022) — PMID 33528725 — 개방형에서 사회 61%·학업 38%·경제 35%, 표준 척도 항목을 최상위 문제로 든 비율 17%.
  • "Complementing standard western measures of depression with locally co-developed instruments" (2021) — PMID 33818199 — 루오족 LDQ-17은 3요인, PHQ-9는 1요인. 현지 도구가 표준 도구가 놓친 특징 포착.
  • "'Thinking too much': A systematic review of a common idiom of distress" (2015) — PMID 26584235 — 138편(1979~2014). 정신과 구성개념과 가변적으로 겹치되 문화 내 변이도 큼.
  • "Cultural concepts of distress and psychiatric disorders" (2014) — PMID 24366490 — 45편·18,782명. 중등도 이상 품질 27%, 대표표본 29%. 품질이 높을수록 연관이 약함.
  • "The Psychological Science Accelerator" (2018) — PMID 31886452 — 상시·분산·포괄적 다연구실 네트워크.
  • "Cross-cultural data on romantic love and mate preferences from 117,293 participants across 175 countries" (2025) — PMID 40593913 — 404명 연구자, 45개 언어.
  • "Broadening horizons: Sample diversity and socioecological theory" (2018) — PMID 30397108 — 이론이 표집을 이끌게 하자는 제안. 환경 가혹성·시장 통합이 심리 특질 발현을 설명.
  • "Weighing People Rather Than Food: A Framework for Examining External Validity" (2020) — PMID 31743074 — 인구·상황·결과·시간대 네 영역의 외적 타당도 점검 틀.
  • "Navigating cross-cultural research: methodological and ethical considerations" (2020) — PMID 32962541 — 공동체 중심 접근이 과학적 엄밀성의 일부라는 주장.
  • "Integrating open science and multiculturalism to restore trust in psychology" (2022) — PMID 36104999 — 재현성과 일반화가능성은 얽힌 문제라는 정리.
  • "Cultural variation in young children's social motivation for peer collaboration" (2020) — PMID 33211711 — 세 집단 240명. 협력 선호는 크게 갈렸으나 협력 중 긍정 정서와 사회인지의 관계는 일정.
  • "Reading between the lines: Universal structure and cultural variation in advanced theory of mind" (2026) — PMID 41983731 — 일본·독일 아동. 3요인 구조는 공통, 발달 경로는 상이.
  • "Cultural evolution of genetic heritability" (2021) — PMID 34016199 — 유전율 추정치가 문화 동역학에 따라 달라지며, WEIRD 표집이 그 조건 의존성을 은폐.

🏛️ 이 글의 뿌리가 된 논문

이 글이 근거로 삼은 논문 중 ‘거인의 어깨’에 오른 초석 연구예요. 개념을 익혔다면 원전으로 가보세요.

  • The weirdest people in the world?2010

    서구 중심의 표본이 보편적 인간을 대변하지 못함을 비교 데이터로 입증했습니다.

    이 분야의 거인의 어깨 →
📚 심리·사회과학 — 사람을 재는 법
4 / 7
  1. 1.심리학의 재현 위기 — 우리가 믿었던 발견들은 왜 흔들렸나
  2. 2.연구자 자유도와 p-해킹 — 조작 없이도 원하는 결과가 나오는 법
  3. 3.사라지는 효과 — 교과서에 실렸던 발견들은 왜 다시 재면 작아지는가
  4. 4.누구를 재고 있었나 — 심리학이 "사람"이라고 말할 때의 그 사람
  5. 5.스탠퍼드 감옥실험은 무엇을 보여 줬나 — '상황이 악마를 만든다'는 서사에 제기된 비판들
  6. 6.무작위 대조시험은 정말 '황금표준'인가
  7. 7.실험 없이 인과를 묻는 법 — 자연실험과 네 가지 설계
← 이전 글사라지는 효과 — 교과서에 실렸던 발견들은 왜 다시 재면 작아지는가다음 글 →스탠퍼드 감옥실험은 무엇을 보여 줬나 — '상황이 악마를 만든다'는 서사에 제기된 비판들

이 글은 AI가 연구 논문을 바탕으로 작성한 교육·정보 제공용 콘텐츠이며, 전문가의 조언을 대체하지 않습니다. 오류를 발견하셨나요? 알려주세요

© 2026 네오쿤스(Paperis) · 링크 공유는 환영합니다. 전문 전재·재배포는 사전 허가가 필요합니다.