본편에서는 AI 응답자가 300문항 평균 12.4%p 틀렸다는 이야기를 했습니다. → 본편 읽기 여기서는 본편에 안 넣은 네 가지를 봅니다. 모델을 바꾸면 결론이 어떻게 뒤집히는지. 다양성이 사라지는 게 숫자로 어떻게 보이는지. 왜 보정을 걸 수 없는지. 그리고 이 연구를 어디까지 믿어도 되는지. 1. 모델을 바꾸면 미국인이 달라진다 Pew는 Claude Opus 4.6과 GPT-5.1 두 모델로 같은 설문을 돌렸습니다. 평균 오차는 Opus 11.4%p, GPT-5.1 13.3%p였습니다. 여기까지만 보면 "둘 다 비슷하게 못한다"로 읽힙니다. 그런데 문항을 하나씩 뜯어보면 둘은 반대 방향으로 틀렸습니다. 질문 사람 Opus GPT 나라가 가는 방향에 불만 69% 70% 100% 낙태가 합법이어야 한다 60% 62% 48% 트럼프 지지자 중 "매우 강하게 지지" 65% 46% 88% GPT 세계의 미국인은 100%가 나라에 불만입니다. Opus 세계의 미국인은 트럼프를 지지하긴 하는데 그렇게 열렬하지는 않습니다. Pew가 쓴 표현을 빌리면 이렇습니다. GPT는 미국인을 실제보다 극단적으로 그렸고, Opus는 실제보다 중도적으로 그렸습니다. 둘 다 사람이 아닙니다. 이게 왜 치명적인지는 이렇게 생각해 보면 됩니다. AI로 여론조사를 돌리는 사람은 모델을 하나 고릅니다. 그 선택이 결론의 방향을 정합니다. 그런데 모델을 고를 때 참고할 정답지가 없어요. 정답지가 있으면 애초에 AI를 안 썼겠죠. 2. 다양성이 사라지는 걸 숫자로 보기 본편에서 "질문의 47%에 아무도 안 고른 보기가 있었다"를 봤습니다. 기준을 조금 느슨하게 잡아도 비슷합니다. 응답률이 1%도 안 되는 보기가 있는 질문은 AI 설문에서 66%였습니다. 실제 설문에서는 1%였습니다. 정치 얘기가 아닌 질문에서 더 선명하게 보입니다. 잠을 몇 시간 자느냐는 질문이 그렇습니다. 하루 수면 시간 사람 AI 5~6시간 39% 69% 7~9시간 54% 31% 4시간 이하 또는 10시간 이상 9% 0% 사람 100명 중 9명은 4시간 이하로 자거나 10시간 이상 잡니다. AI 응답자 중에는 그런 사람이 한 명도 없었습니다. 방문한 나라 수를 물었을 때도 같았습니다. 10개국 이상 가봤다는 사람이 실제로는 13%인데, AI 응답자는 1%였습니다. 여기서 중요한 건 이게 버그가 아니라는 점입니다. 언어 모델은 다음에 올 가능성이 가장 높은 말을 고르는 장치입니다. "40대 중산층 남성이라면 몇 시간 자겠는가"에 가장 그럴 법한 답은 6시간입니다. 4시간은 그럴 법하지 않습니다. 그런데 실제 세상에는 4시간 자는 사람이 있습니다. 여론은 대체로 "그럴 법하지 않은 답을 고른 소수"로 채워져 있습니다. AI는 바로 그 부분을 꾸준히 지웁니다. 3. 고정관념은 이렇게 증폭된다 본편의 월드컵 예시 말고도 쌍이 더 있습니다. 집단과 질문 실제 AI 히스패닉 — 스페인어 수업이 매우 중요하다 32% 72% 민주당 성향 — 억만장자의 재산이 나라에 해롭다 45% 86% 공화당 성향 — 이스라엘에 호감이 있다 58% 90% 이상 중국의 국제적 영향력이 강해졌다 62% 100% 패턴이 보입니다. AI는 집단 이름을 받으면 그 집단의 교과서적 입장을 거의 만장일치로 답합니다. 실제 구성원들은 그 입장에 절반 조금 넘게만 동의합니다. 본편에서 봤듯이 AI는 히스패닉이 아닌 사람들의 월드컵 관심도는 거의 맞혔습니다. 꼬리표가 안 붙은 집단은 잘 맞히고, 꼬리표가 붙은 집단은 크게 틀립니다. 4. 틀리는 방향이 일정하지도 않다 "AI가 늘 과장한다"고 정리하면 편한데, 그것도 아닙니다. 최근 사건을 묻는 문항들을 보면 부호가 섞여 있습니다. 질문 사람 AI 방향 데이터센터가 환경에 나쁘다 53% 98% 과장 전기요금이 매우 걱정된다 52% 23% 축소 단속 요원이 얼굴을 가려도 된다 38% 17% 축소 이란 공습에 찬성한다 36% 48% 과장 보정을 걸 수 없다는 뜻입니다. "AI 결과에서 20%p 빼면 된다" 같은 교정 규칙을 만들 수가 없어요. 문항마다 부호가 바뀝니다. 5. 이 연구의 한계 셋 호의적으로 읽으면 반론도 가능합니다. 하나, prompt가 전부일 수 있습니다. Pew는 인구통계와 2025년 정치 성향 응답을 줬습니다. 과거 설문 응답을 더 주거나, 답하기 전에 길게 생각하게 했다면 달랐을 수 있습니다. 다만 Pew는 여러 모델을 시험하고 그중 가장 잘한 걸 골랐습니다. 대충 한 비교는 아닙니다. 둘, 정답지도 흔들립니다. 비교 기준은 같은 사람들의 실제 응답입니다. 그런데 사람도 설문에서 적당히 답하고, 질문을 잘못 읽고, 기분에 따라 다르게 답합니다. 그 흔들림까지 전부 AI 오차로 계산됐습니다. 셋, 잰 건 한 가지 쓰임새입니다. 이 실험이 안 된다고 말한 건 "전국 여론의 비율을 AI로 추정하기"입니다. 설문 문항의 표현이 헷갈리는지 미리 보기. 응답 비율 말고 응답 이유를 탐색하기. 이런 용도까지 같이 틀렸다고 말하기엔 근거가 부족합니다. 6. 정리 결과를 한 줄로 줄이면 이렇습니다. AI는 평균을 잘 맞히고 분포를 못 맞힙니다. 그리고 여론조사가 알고 싶은 건 대개 분포입니다. 지식 문제 정답률이 사람 50%, AI 80%였다는 숫자가 이걸 압축해서 담고 있습니다. AI 응답자는 모범적인 시민이었습니다. 문제는 모범적인 시민이 미국 인구의 대표가 아니라는 것이었습니다. 출처 Pew Research Center, "Silicon Samples and Synthetic Surveys: Can AI Stand In for Human Respondents?", 2026년 9월 30일 https://pewresearch.org/data-labs/2026/09/30/can-ai-stand-in-for-human-survey-takers-not-really
히스패닉 미국인이 월드컵을 얼마나 챙겨 볼 것 같냐고 AI에게 물었습니다. AI는 97%라고 답했습니다. 같은 질문에 실제 히스패닉 응답자들이 답한 건 42%였습니다. 그런데 히스패닉이 아닌 사람들한테는 같은 질문에 AI가 22%라고 했습니다. 실제는 25%였습니다. 3%p 차이. 거의 맞혔습니다. 한쪽은 맞히고 한쪽은 두 배 넘게 틀렸다는 게 이 이야기의 전부입니다. AI가 못해서 틀린 게 아니었어요. "히스패닉이면 축구를 좋아하겠지"를 너무 잘해서 틀렸습니다. 같은 질문인데 한쪽만 틀렸습니다. 굵은 선이 AI 응답입니다. 뭘 한 실험인가 미국의 여론조사 기관 Pew Research Center가 9월 30일에 이 결과를 냈습니다. Pew는 American Trends Panel이라는 걸 운영합니다. 미국 성인 전체에서 무작위로 뽑은 사람들을 패널로 모셔 둡니다. 그리고 같은 사람들에게 주기적으로 같은 설문을 돌립니다. 누가 답했는지를 Pew는 이미 알고 있다는 뜻이에요. 이번에 한 일은 이렇습니다. 그 패널에 실제로 있는 사람 한 명 한 명의 정보를 AI에게 줬습니다. 나이, 성별, 인종, 학력 같은 인구통계. 그리고 2025년에 미리 받아둔 정치 성향 설문 응답. 그러고 "당신이 이 사람입니다"라고 시킨 다음, 똑같은 설문을 풀게 했습니다. 이렇게 만든 가짜 응답자를 digital twin(디지털 쌍둥이)이라고 부릅니다. 이 방식이 요즘 조용히 퍼지고 있어요. 설문은 돈과 시간이 많이 드니까, AI로 대신 돌려서 싸고 빠르게 여론을 보자는 겁니다. 이 실험이 좋은 건 채점이 된다는 겁니다. 같은 사람이 실제로 답한 결과가 이미 손에 있으니까요. 2026년에 돌린 설문 세 개, 300문항 가까이를 그렇게 맞춰봤습니다. 주로 쓴 모델은 Claude Opus 4.6입니다. 여러 모델을 돌려보고 성적이 가장 좋았던 걸 골랐습니다. 같은 사람에게 두 번 답을 받았기 때문에 채점이 됩니다. 좋은 소식: 큰 그림은 꽤 맞는다 미국인 전체를 한 덩어리로 보고 묻는 질문에서는 성적이 나쁘지 않았습니다. "나라가 가는 방향에 불만인가" — 실제 69%, AI 70%. "낙태가 합법이어야 하나" — 실제 60%, AI 62%. 여론조사에서 2%p 차이는 보통 오차 범위 안입니다. 사람 1,000명한테 물어도 뽑기 운에 따라 그 정도는 흔들린다는 뜻이에요. 이 정도만 보면 쓸 만해 보입니다. 함정 1: 쪼개는 순간 무너진다 300문항 전체의 평균 오차는 12.4%p였습니다. 질문 네 개 중 하나 넘게(28%) 오차가 15%p를 넘었습니다. 12.4%p가 어느 정도인지 감이 안 올 수 있는데, 지지율 42%와 55%의 차이입니다. 선거 결과가 뒤집히는 폭이에요. 더 불편한 건 집단별 성적입니다. 오차가 12%p 아래로 내려간 집단이 하나도 없었습니다. 공화당·공화당 성향 응답자에서 16.1%p, 흑인 응답자에서 15.1%p가 가장 컸습니다. 전체 평균이 맞았던 건 반대 방향 오차끼리 서로 지웠기 때문입니다. 큰 숫자 하나만 보면 괜찮아 보이고, 쪼개면 다 틀려 있습니다. 함정 2: AI는 망설이지 않는다 여기가 제일 흥미로운 부분입니다. 사람 응답자는 전체 응답의 16%에서 "모르겠다"를 골랐습니다. AI는 4%였습니다. 사람의 4분의 1입니다. 지식을 묻는 문제 13개에서는 더 벌어집니다. 사람의 평균 정답률은 50% 정도였고, 75%를 넘긴 문제가 하나도 없었습니다. AI는 평균 80%였고, 여섯 문제는 98% 이상을 맞혔습니다. 수정헌법 1조가 언론 자유를 보장하냐는 문제에서 사람은 52%, AI는 98%였습니다. AI는 시민으로서 너무 모범적이었습니다. 여론조사가 알고 싶은 건 "사람들이 정답을 아는가"가 아닙니다. "사람들이 실제로 어떻게 알고 있는가"입니다. 여기서는 잘 맞히는 게 틀린 겁니다. 함정 3: 선택지가 비어버린다 실제 설문에서는 보기가 다섯 개 있으면 다섯 개 모두에 누군가는 표를 던집니다. AI 설문에서는 달랐습니다. 질문의 47%에서, 단 한 명도 고르지 않은 보기가 최소 하나씩 나왔습니다. 실제 설문에서 그런 질문은 0개였습니다. 미중 무역 질문이 좋은 예입니다. AI 응답자 98%가 "중국이 더 이득"을 골랐습니다. 실제 사람들은 42%만 그랬습니다. 나머지는 미국이 이득(10%), 둘 다 비슷(24%), 모르겠다(19%)로 갈라졌습니다. AI는 가장 많은 사람이 고를 법한 답을 아주 잘 찾아냅니다. 그리고 그 주변에 흩어져 있던 사람들을 지워버립니다. AI는 가장 그럴 법한 보기 하나에 몰립니다. 함정 4: 작년 일까지만 안다 이번에 쓴 모델이 학습한 데이터는 2025년 5월까지입니다. 그 뒤에 벌어진 일을 묻는 질문에서 바로 티가 났습니다. "데이터센터에 대해 전혀 들어본 적 없다"에 AI는 3%, 사람은 26%였습니다. AI 세계에서는 모두가 데이터센터를 압니다. "전기요금이 매우 걱정된다"는 AI 23%, 사람 52%였습니다. 2026년 미국에서 전기요금이 피부에 닿는 문제가 됐다는 걸, 모델은 몰랐습니다. 그런데 이 결과를 어디까지 믿어야 할까 반대쪽도 봐야 합니다. 첫째, prompt를 어떻게 쓰느냐에 따라 결과가 바뀝니다. 이 실험은 인구통계와 정치 성향만 줬습니다. 더 많은 정보를 줬다면 성적이 달라졌을 수 있어요. 둘째, 비교 기준인 사람 응답도 완벽하지 않습니다. 사람도 설문에서 적당히 답하고, 질문을 잘못 읽습니다. 그 오차까지 전부 AI 몫으로 계산된 구도예요. 셋째, 쓰임새를 구분해야 합니다. 이 실험이 안 된다고 말한 건 "미국인 몇 %가 X를 지지하나"를 AI로 알아내는 일입니다. 설문 문항이 헷갈리게 쓰였는지 미리 돌려보는 용도까지 싸잡아 틀렸다고 말하긴 어렵습니다. 그래도 Pew의 결론 자체는 분명합니다. 사회적으로 중요한 주제의 여론조사를 AI로 대체할 수는 없다는 쪽입니다. 🔍 더 깊이 본편에 안 넣은 세 가지를 심화편에서 봅니다. 1 모델을 Opus에서 GPT-5.1로 바꾸면 미국인이 달라집니다. "나라가 가는 방향에 불만인가"에 사람은 69%, Opus는 70%, GPT는 100%였습니다. 2 다양성이 사라지는 게 정치 얘기가 아닌 질문에서 더 선명합니다. 하루 4시간 이하로 자거나 10시간 이상 자는 사람이 실제로는 9%인데, AI 응답자 중에는 0명이었습니다. 3 AI가 늘 과장하는 것도 아닙니다. 문항마다 부호가 바뀌어서 보정을 걸 수가 없습니다. → 심화편 읽기 가져갈 것 하나 AI로 사람을 대신 세우는 일은 설문에서만 벌어지지 않습니다. 가상 고객 인터뷰, 페르소나 테스트, 합성 데이터. 다 같은 구조입니다. 이 실험이 알려주는 건 그 결과물이 틀리는 방향입니다. AI는 무작위로 틀리지 않습니다. 가장 전형적인 쪽으로, 가장 확신에 찬 모습으로, 소수 의견을 지우면서 틀립니다. 그리고 그렇게 나온 결과는 그럴듯하게 읽힙니다. 틀린 걸 알아채기 어려운 이유가 거기 있습니다. 출처 Pew Research Center, "Silicon Samples and Synthetic Surveys: Can AI Stand In for Human Respondents?", 2026년 9월 30일 https://pewresearch.org/data-labs/2026/09/30/can-ai-stand-in-for-human-survey-takers-not-really
문제 요약 n x n 시계 격자에서 한 시계를 조작하면 자기 자신과 상하좌우 인접 시계가 시계 방향으로 90도 회전한다. 모든 시곗바늘을 12시 방향인 0 으로 만들기 위한 최소 조작 횟수를 구한다. 시계 방향은 0, 1, 2, 3 으로 표현하며 모든 변화는 mod 4 연산으로 처리할 수 있다. 핵심 관찰 1. 같은 시계는 최대 3번만 조작하면 된다 한 시계를 4번 조작하면 영향을 받는 모든 시계가 한 바퀴 돌아 원래 상태로 돌아온다. 따라서 최적해에서 각 시계의 조작 횟수는 0 , 1 , 2 , 3 번 중 하나만 고려하면 충분하다. 2. 첫 행을 제외한 행의 조작은 강제로 결정된다 r 행의 시계를 조작할 수 있는 시점에는 r - 1 행을 더 이상 바꿀 수 있는 방법이 거의 없다. r - 1 행의 c 열 시계에 영향을 주는 아래 행의 조작은 오직 (r, c) 의 조작뿐이다. 그러므로 (r - 1, c) 를 0 으로 만들기 위해 (r, c) 를 몇 번 조작해야 하는지는 다음처럼 유일하게 결정된다. count = (-board[r - 1][c]) % 4 첫 행의 조작 횟수만 정하면, 둘째 행부터 마지막 행까지의 조작 횟수는 모두 자동으로 정해진다. 풀이 과정 첫 행의 각 칸을 0~3 번 조작하는 모든 경우를 탐색한다. 첫 행 조작을 격자에 적용한다. r = 1 부터 마지막 행까지 순회한다. 바로 위 행의 각 시계를 0으로 만들기 위해 현재 행의 같은 열 시계를 필요한 횟수만큼 조작한다. 마지막 행이 모두 0인 경우, 조작 횟수 최솟값을 갱신한다. 첫 행의 경우의 수는 최대 4^8 = 65,536 개이므로 충분히 탐색할 수 있다. Python 코드 from itertools import product def solution(clockHands): n = len(clockHands) answer = float("inf") dr = [0, -1, 1, 0, 0] dc = [0, 0, 0, -1, 1] def rotate(board, row, col, count): """(row, col)을 count번 조작한 결과를 보드에 반영한다.""" for direction in range(5): nr = row + dr[direction] nc = col + dc[direction] if 0 <= nr < n and 0 <= nc < n: board[nr][nc] = (board[nr][nc] + count) % 4 # 첫 행의 모든 조작 조합을 시도한다. for first_row in product(range(4), repeat=n): board = [row[:] for row in clockHands] operation_count = sum(first_row) # 첫 행 조작을 적용한다. for col, count in enumerate(first_row): if count: rotate(board, 0, col, count) # 현재 행을 조작해 바로 위 행을 0으로 확정한다. for row in range(1, n): for col in range(n): count = (-board[row - 1][col]) % 4 if count: rotate(board, row, col, count) operation_count += count # 마지막 행도 모두 0이면 유효한 해다. if all(clock == 0 for clock in board[-1]): answer = min(answer, operation_count) return answer 정당성 설명 첫 행의 각 칸은 0~3번만 조작하면 되므로, 알고리즘은 가능한 첫 행 조작 조합을 모두 탐색한다. 임의의 첫 행 조작 조합을 고정하자. r - 1 행 c 열에 영향을 주는 아직 선택되지 않은 조작은 (r, c) 뿐이다. 따라서 이 시계를 0 으로 만들려면 (r, c) 를 (-board[r - 1][c]) mod 4 번 조작해야 하며, 다른 횟수로는 r - 1 행을 0으로 확정할 수 없다. 그러므로 고정된 첫 행 조합에 대해 알고리즘이 계산한 이후 행의 조작은 유일하며, 그 조합에서 가능한 해가 존재한다면 반드시 찾아낸다. 모든 첫 행 조합을 탐색하므로 모든 가능한 해를 검토하고, 그중 최소 조작 횟수를 반환한다. 복잡도 분석 첫 행의 조작 조합은 4^n 개다. 각 조합마다 n^2 개의 칸을 처리하고, 한 번의 조작 반영은 최대 5개 칸에만 영향을 준다. 시간 복잡도: O(4^n * n^2) 공간 복잡도: O(n^2) n <= 8 이므로 최대 65,536 개의 첫 행 조합만 확인하면 된다. 주의할 점 조작 횟수는 board[row - 1][col] 이 아니라 그 음수의 mod 4 값이다. 현재 값이 3 이면 한 번 조작해 0 으로 만들어야 한다. 현재 행을 처리할 때는 반드시 바로 위 행 을 0으로 확정해야 한다. 마지막 행은 아래에서 보정할 행이 없으므로, 모든 값이 0인지 직접 검사해야 한다. 보드마다 독립적으로 시뮬레이션해야 하므로, 첫 행 조합을 바꿀 때 원본 배열을 깊은 복사해야 한다. 마무리 행 단위로 보면 첫 행만 선택이고 나머지는 강제 전이라는 구조가 보인다. 첫 행의 작은 경우의 수를 완전탐색하고, 이후 행을 위에서 아래로 확정해 나가면 최소 조작 횟수를 구할 수 있다.
随着人工智能工具深度嵌入互联网日常应用,OpenAI正依托其庞大的用户基数开辟全新业务版图。该公司日前正式推出“使用ChatGPT登录”(Sign in with ChatGPT)身份验证服务,允许第三方开发者和企业将ChatGPT账号作为其应用的统一认证入口。这一举措标志着OpenAI正式涉足数字身份验证领域,直接与长期主导这一市场的Google、苹果及微软等科技巨头展开正面竞争。 阅读全文