Загружаем каталог…
Загружаем каталог…
본편에서는 AI 응답자가 300문항 평균 12.4%p 틀렸다는 이야기를 했습니다. → 본편 읽기 여기서는 본편에 안 넣은 네 가지를 봅니다. 모델을 바꾸면 결론이 어떻게 뒤집히는지. 다양성이 사라지는 게 숫자로 어떻게 보이는지. 왜 보정을 걸 수 없는지. 그리고 이 연구를 어디까지 믿어도 되는지. 1. 모델을 바꾸면 미국인이 달라진다 Pew는 Claude Opus 4.6과 GPT-5.1 두 모델로 같은 설문을 돌렸습니다. 평균 오차는 Opus 11.4%p, GPT-5.1 13.3%p였습니다. 여기까지만 보면 "둘 다 비슷하게 못한다"로 읽힙니다. 그런데 문항을 하나씩 뜯어보면 둘은 반대 방향으로 틀렸습니다. 질문 사람 Opus GPT 나라가 가는 방향에 불만 69% 70% 100% 낙태가 합법이어야 한다 60% 62% 48% 트럼프 지지자 중 "매우 강하게 지지" 65% 46% 88% GPT 세계의 미국인은 100%가 나라에 불만입니다. Opus 세계의 미국인은 트럼프를 지지하긴 하는데 그렇게 열렬하지는 않습니다. Pew가 쓴 표현을 빌리면 이렇습니다. GPT는 미국인을 실제보다 극단적으로 그렸고, Opus는 실제보다 중도적으로 그렸습니다. 둘 다 사람이 아닙니다. 이게 왜 치명적인지는 이렇게 생각해 보면 됩니다. AI로 여론조사를 돌리는 사람은 모델을 하나 고릅니다. 그 선택이 결론의 방향을 정합니다. 그런데 모델을 고를 때 참고할 정답지가 없어요. 정답지가 있으면 애초에 AI를 안 썼겠죠. 2. 다양성이 사라지는 걸 숫자로 보기 본편에서 "질문의 47%에 아무도 안 고른 보기가 있었다"를 봤습니다. 기준을 조금 느슨하게 잡아도 비슷합니다. 응답률이 1%도 안 되는 보기가 있는 질문은 AI 설문에서 66%였습니다. 실제 설문에서는 1%였습니다. 정치 얘기가 아닌 질문에서 더 선명하게 보입니다. 잠을 몇 시간 자느냐는 질문이 그렇습니다. 하루 수면 시간 사람 AI 5~6시간 39% 69% 7~9시간 54% 31% 4시간 이하 또는 10시간 이상 9% 0% 사람 100명 중 9명은 4시간 이하로 자거나 10시간 이상 잡니다. AI 응답자 중에는 그런 사람이 한 명도 없었습니다. 방문한 나라 수를 물었을 때도 같았습니다. 10개국 이상 가봤다는 사람이 실제로는 13%인데, AI 응답자는 1%였습니다. 여기서 중요한 건 이게 버그가 아니라는 점입니다. 언어 모델은 다음에 올 가능성이 가장 높은 말을 고르는 장치입니다. "40대 중산층 남성이라면 몇 시간 자겠는가"에 가장 그럴 법한 답은 6시간입니다. 4시간은 그럴 법하지 않습니다. 그런데 실제 세상에는 4시간 자는 사람이 있습니다. 여론은 대체로 "그럴 법하지 않은 답을 고른 소수"로 채워져 있습니다. AI는 바로 그 부분을 꾸준히 지웁니다. 3. 고정관념은 이렇게 증폭된다 본편의 월드컵 예시 말고도 쌍이 더 있습니다. 집단과 질문 실제 AI 히스패닉 — 스페인어 수업이 매우 중요하다 32% 72% 민주당 성향 — 억만장자의 재산이 나라에 해롭다 45% 86% 공화당 성향 — 이스라엘에 호감이 있다 58% 90% 이상 중국의 국제적 영향력이 강해졌다 62% 100% 패턴이 보입니다. AI는 집단 이름을 받으면 그 집단의 교과서적 입장을 거의 만장일치로 답합니다. 실제 구성원들은 그 입장에 절반 조금 넘게만 동의합니다. 본편에서 봤듯이 AI는 히스패닉이 아닌 사람들의 월드컵 관심도는 거의 맞혔습니다. 꼬리표가 안 붙은 집단은 잘 맞히고, 꼬리표가 붙은 집단은 크게 틀립니다. 4. 틀리는 방향이 일정하지도 않다 "AI가 늘 과장한다"고 정리하면 편한데, 그것도 아닙니다. 최근 사건을 묻는 문항들을 보면 부호가 섞여 있습니다. 질문 사람 AI 방향 데이터센터가 환경에 나쁘다 53% 98% 과장 전기요금이 매우 걱정된다 52% 23% 축소 단속 요원이 얼굴을 가려도 된다 38% 17% 축소 이란 공습에 찬성한다 36% 48% 과장 보정을 걸 수 없다는 뜻입니다. "AI 결과에서 20%p 빼면 된다" 같은 교정 규칙을 만들 수가 없어요. 문항마다 부호가 바뀝니다. 5. 이 연구의 한계 셋 호의적으로 읽으면 반론도 가능합니다. 하나, prompt가 전부일 수 있습니다. Pew는 인구통계와 2025년 정치 성향 응답을 줬습니다. 과거 설문 응답을 더 주거나, 답하기 전에 길게 생각하게 했다면 달랐을 수 있습니다. 다만 Pew는 여러 모델을 시험하고 그중 가장 잘한 걸 골랐습니다. 대충 한 비교는 아닙니다. 둘, 정답지도 흔들립니다. 비교 기준은 같은 사람들의 실제 응답입니다. 그런데 사람도 설문에서 적당히 답하고, 질문을 잘못 읽고, 기분에 따라 다르게 답합니다. 그 흔들림까지 전부 AI 오차로 계산됐습니다. 셋, 잰 건 한 가지 쓰임새입니다. 이 실험이 안 된다고 말한 건 "전국 여론의 비율을 AI로 추정하기"입니다. 설문 문항의 표현이 헷갈리는지 미리 보기. 응답 비율 말고 응답 이유를 탐색하기. 이런 용도까지 같이 틀렸다고 말하기엔 근거가 부족합니다. 6. 정리 결과를 한 줄로 줄이면 이렇습니다. AI는 평균을 잘 맞히고 분포를 못 맞힙니다. 그리고 여론조사가 알고 싶은 건 대개 분포입니다. 지식 문제 정답률이 사람 50%, AI 80%였다는 숫자가 이걸 압축해서 담고 있습니다. AI 응답자는 모범적인 시민이었습니다. 문제는 모범적인 시민이 미국 인구의 대표가 아니라는 것이었습니다. 출처 Pew Research Center, "Silicon Samples and Synthetic Surveys: Can AI Stand In for Human Respondents?", 2026년 9월 30일 https://pewresearch.org/data-labs/2026/09/30/can-ai-stand-in-for-human-survey-takers-not-really
То, что RADAR обнаружил и классифицировал для этой возможности. Это опубликованный источником текст, а не подтверждение, что предложение ещё действует.
AI 설문 편 심화 — 모델을 바꾸면 미국인이 달라진다. 본편에서는 AI 응답자가 300문항 평균 12.4%p 틀렸다는 이야기를 했습니다. 여기서는 본편에 안 넣은 네 가지를 봅니다. 모델을 바꾸면 결론이 어떻게 뒤집히는지. 다양성이 사라지는 게 숫자로 어떻게 보이는지. 왜 보정을 걸 수 없는지. 그리고 이 연구를 어디까지 믿어도 되는지. 1. 모델을 바꾸면 미국인이 달라진다 Pew는 Claude Opus 4.6과 GPT-5.1 두 모델로 같은 설문을 돌렸습니다. 평균 오차는 Opus 11.4%p, GPT-5.1 13.3%p였습니다. 여기까지만 보면 "둘 다 비슷하게 못한다"로 읽힙니다. 그런데 문항을 하나씩 뜯어보면 둘은 반대 방향으로 틀렸습니다. 질문 사람 Opus GPT 나라가 가는 방향에 불만…
Открыть источникAI 설문 편 심화 — 모델을 바꾸면 미국인이 달라진다. 본편에서는 AI 응답자가 300문항 평균 12.4%p 틀렸다는 이야기를 했습니다. → 본편 읽기 여기서는 본편에 안 넣은 네 가지를 봅니다. 모델을 바꾸면 결론이 어떻게 뒤집히는지. 다양성이 사라지는 게 숫자로 어떻게 보이는지. 왜 보정을 걸 수 없는지. 그리고 이 연구를 어디까지 믿어도 되는지. 1. 모델을 바꾸면 미국인이 달라진다 Pew는 Claude Opus 4.6과 GPT-5.1 두 모델로 같은 설문을 돌렸습니다. 평균 오차는 Opus 11.4%p, GPT-5.1 13.3%p였습니다. 여기까지만 보면 "둘 다 비슷하게 못한다"로 읽힙니다. 그런데 문항을 하나씩 뜯어보면 둘은 반대 방향으로 틀렸습니다. 질문 사람 Opus GPT 나라가 가는…
Открыть источник