Загружаем каталог…
Загружаем каталог…
히스패닉 미국인이 월드컵을 얼마나 챙겨 볼 것 같냐고 AI에게 물었습니다. AI는 97%라고 답했습니다. 같은 질문에 실제 히스패닉 응답자들이 답한 건 42%였습니다. 그런데 히스패닉이 아닌 사람들한테는 같은 질문에 AI가 22%라고 했습니다. 실제는 25%였습니다. 3%p 차이. 거의 맞혔습니다. 한쪽은 맞히고 한쪽은 두 배 넘게 틀렸다는 게 이 이야기의 전부입니다. AI가 못해서 틀린 게 아니었어요. "히스패닉이면 축구를 좋아하겠지"를 너무 잘해서 틀렸습니다. 같은 질문인데 한쪽만 틀렸습니다. 굵은 선이 AI 응답입니다. 뭘 한 실험인가 미국의 여론조사 기관 Pew Research Center가 9월 30일에 이 결과를 냈습니다. Pew는 American Trends Panel이라는 걸 운영합니다. 미국 성인 전체에서 무작위로 뽑은 사람들을 패널로 모셔 둡니다. 그리고 같은 사람들에게 주기적으로 같은 설문을 돌립니다. 누가 답했는지를 Pew는 이미 알고 있다는 뜻이에요. 이번에 한 일은 이렇습니다. 그 패널에 실제로 있는 사람 한 명 한 명의 정보를 AI에게 줬습니다. 나이, 성별, 인종, 학력 같은 인구통계. 그리고 2025년에 미리 받아둔 정치 성향 설문 응답. 그러고 "당신이 이 사람입니다"라고 시킨 다음, 똑같은 설문을 풀게 했습니다. 이렇게 만든 가짜 응답자를 digital twin(디지털 쌍둥이)이라고 부릅니다. 이 방식이 요즘 조용히 퍼지고 있어요. 설문은 돈과 시간이 많이 드니까, AI로 대신 돌려서 싸고 빠르게 여론을 보자는 겁니다. 이 실험이 좋은 건 채점이 된다는 겁니다. 같은 사람이 실제로 답한 결과가 이미 손에 있으니까요. 2026년에 돌린 설문 세 개, 300문항 가까이를 그렇게 맞춰봤습니다. 주로 쓴 모델은 Claude Opus 4.6입니다. 여러 모델을 돌려보고 성적이 가장 좋았던 걸 골랐습니다. 같은 사람에게 두 번 답을 받았기 때문에 채점이 됩니다. 좋은 소식: 큰 그림은 꽤 맞는다 미국인 전체를 한 덩어리로 보고 묻는 질문에서는 성적이 나쁘지 않았습니다. "나라가 가는 방향에 불만인가" — 실제 69%, AI 70%. "낙태가 합법이어야 하나" — 실제 60%, AI 62%. 여론조사에서 2%p 차이는 보통 오차 범위 안입니다. 사람 1,000명한테 물어도 뽑기 운에 따라 그 정도는 흔들린다는 뜻이에요. 이 정도만 보면 쓸 만해 보입니다. 함정 1: 쪼개는 순간 무너진다 300문항 전체의 평균 오차는 12.4%p였습니다. 질문 네 개 중 하나 넘게(28%) 오차가 15%p를 넘었습니다. 12.4%p가 어느 정도인지 감이 안 올 수 있는데, 지지율 42%와 55%의 차이입니다. 선거 결과가 뒤집히는 폭이에요. 더 불편한 건 집단별 성적입니다. 오차가 12%p 아래로 내려간 집단이 하나도 없었습니다. 공화당·공화당 성향 응답자에서 16.1%p, 흑인 응답자에서 15.1%p가 가장 컸습니다. 전체 평균이 맞았던 건 반대 방향 오차끼리 서로 지웠기 때문입니다. 큰 숫자 하나만 보면 괜찮아 보이고, 쪼개면 다 틀려 있습니다. 함정 2: AI는 망설이지 않는다 여기가 제일 흥미로운 부분입니다. 사람 응답자는 전체 응답의 16%에서 "모르겠다"를 골랐습니다. AI는 4%였습니다. 사람의 4분의 1입니다. 지식을 묻는 문제 13개에서는 더 벌어집니다. 사람의 평균 정답률은 50% 정도였고, 75%를 넘긴 문제가 하나도 없었습니다. AI는 평균 80%였고, 여섯 문제는 98% 이상을 맞혔습니다. 수정헌법 1조가 언론 자유를 보장하냐는 문제에서 사람은 52%, AI는 98%였습니다. AI는 시민으로서 너무 모범적이었습니다. 여론조사가 알고 싶은 건 "사람들이 정답을 아는가"가 아닙니다. "사람들이 실제로 어떻게 알고 있는가"입니다. 여기서는 잘 맞히는 게 틀린 겁니다. 함정 3: 선택지가 비어버린다 실제 설문에서는 보기가 다섯 개 있으면 다섯 개 모두에 누군가는 표를 던집니다. AI 설문에서는 달랐습니다. 질문의 47%에서, 단 한 명도 고르지 않은 보기가 최소 하나씩 나왔습니다. 실제 설문에서 그런 질문은 0개였습니다. 미중 무역 질문이 좋은 예입니다. AI 응답자 98%가 "중국이 더 이득"을 골랐습니다. 실제 사람들은 42%만 그랬습니다. 나머지는 미국이 이득(10%), 둘 다 비슷(24%), 모르겠다(19%)로 갈라졌습니다. AI는 가장 많은 사람이 고를 법한 답을 아주 잘 찾아냅니다. 그리고 그 주변에 흩어져 있던 사람들을 지워버립니다. AI는 가장 그럴 법한 보기 하나에 몰립니다. 함정 4: 작년 일까지만 안다 이번에 쓴 모델이 학습한 데이터는 2025년 5월까지입니다. 그 뒤에 벌어진 일을 묻는 질문에서 바로 티가 났습니다. "데이터센터에 대해 전혀 들어본 적 없다"에 AI는 3%, 사람은 26%였습니다. AI 세계에서는 모두가 데이터센터를 압니다. "전기요금이 매우 걱정된다"는 AI 23%, 사람 52%였습니다. 2026년 미국에서 전기요금이 피부에 닿는 문제가 됐다는 걸, 모델은 몰랐습니다. 그런데 이 결과를 어디까지 믿어야 할까 반대쪽도 봐야 합니다. 첫째, prompt를 어떻게 쓰느냐에 따라 결과가 바뀝니다. 이 실험은 인구통계와 정치 성향만 줬습니다. 더 많은 정보를 줬다면 성적이 달라졌을 수 있어요. 둘째, 비교 기준인 사람 응답도 완벽하지 않습니다. 사람도 설문에서 적당히 답하고, 질문을 잘못 읽습니다. 그 오차까지 전부 AI 몫으로 계산된 구도예요. 셋째, 쓰임새를 구분해야 합니다. 이 실험이 안 된다고 말한 건 "미국인 몇 %가 X를 지지하나"를 AI로 알아내는 일입니다. 설문 문항이 헷갈리게 쓰였는지 미리 돌려보는 용도까지 싸잡아 틀렸다고 말하긴 어렵습니다. 그래도 Pew의 결론 자체는 분명합니다. 사회적으로 중요한 주제의 여론조사를 AI로 대체할 수는 없다는 쪽입니다. 🔍 더 깊이 본편에 안 넣은 세 가지를 심화편에서 봅니다. 1 모델을 Opus에서 GPT-5.1로 바꾸면 미국인이 달라집니다. "나라가 가는 방향에 불만인가"에 사람은 69%, Opus는 70%, GPT는 100%였습니다. 2 다양성이 사라지는 게 정치 얘기가 아닌 질문에서 더 선명합니다. 하루 4시간 이하로 자거나 10시간 이상 자는 사람이 실제로는 9%인데, AI 응답자 중에는 0명이었습니다. 3 AI가 늘 과장하는 것도 아닙니다. 문항마다 부호가 바뀌어서 보정을 걸 수가 없습니다. → 심화편 읽기 가져갈 것 하나 AI로 사람을 대신 세우는 일은 설문에서만 벌어지지 않습니다. 가상 고객 인터뷰, 페르소나 테스트, 합성 데이터. 다 같은 구조입니다. 이 실험이 알려주는 건 그 결과물이 틀리는 방향입니다. AI는 무작위로 틀리지 않습니다. 가장 전형적인 쪽으로, 가장 확신에 찬 모습으로, 소수 의견을 지우면서 틀립니다. 그리고 그렇게 나온 결과는 그럴듯하게 읽힙니다. 틀린 걸 알아채기 어려운 이유가 거기 있습니다. 출처 Pew Research Center, "Silicon Samples and Synthetic Surveys: Can AI Stand In for Human Respondents?", 2026년 9월 30일 https://pewresearch.org/data-labs/2026/09/30/can-ai-stand-in-for-human-survey-takers-not-really
То, что RADAR обнаружил и классифицировал для этой возможности. Это опубликованный источником текст, а не подтверждение, что предложение ещё действует.
AI는 전체 여론을 1%p 차이로 맞혔다. 집단별로 쪼개자 55%p 틀렸다. 히스패닉 미국인이 월드컵을 얼마나 챙겨 볼 것 같냐고 AI에게 물었습니다. AI는 97%라고 답했습니다. 같은 질문에 실제 히스패닉 응답자들이 답한 건 42%였습니다. 그런데 히스패닉이 아닌 사람들한테는 같은 질문에 AI가 22%라고 했습니다. 실제는 25%였습니다. 3%p 차이. 거의 맞혔습니다. 한쪽은 맞히고 한쪽은 두 배 넘게 틀렸다는 게 이 이야기의 전부입니다. AI가 못해서 틀린 게 아니었어요. "히스패닉이면 축구를 좋아하겠지"를 너무 잘해서 틀렸습니다. 같은 질문인데 한쪽만 틀렸습니다. 굵은 선이 AI 응답입니다. 뭘 한 실험인가 미국의 여론조사 기관 Pew Research Center가 9월 30일에 이 결과를…
Открыть источник