[프라임경제] 근거가 열 개 붙으면, 확인하기도 전에 믿음이 간다.
가정해보자. 이사 갈 동네를 인공지능(AI)에게 물었더니 △통근 시간 △학군 △개발 계획 △시세 흐름이 수치와 사례를 달고 줄줄이 이어진다. 이렇게 확인할 수 있는 주장을 촘촘히 채운 말을 이 글에서는 '빽빽한 말'이라 부르겠다. 그 가운데 몇 개나 확인하겠는가. 한두 개 훑다가 이만하면 됐다고 닫는 사람이 많을 것이다. 빽빽한 말 앞에서 생기는 이 믿음은 단순한 기분일까, 아니면 실험으로 잴 수 있는 힘일까.
스위스 로잔연방공과대학교(École Polytechnique Fédérale de Lausanne, EPFL) 연구팀 등이 2025년 5월 발표한 논문이 첫 실마리를 준다. 연구팀은 미국 성인 900명에게 온라인 토론을 시켰다. 주제는 '학생은 교복을 입어야 하는가' 같은 시사 쟁점이었고, 찬성과 반대 역할은 참가자의 본래 생각과 상관없이 무작위로 맡겼다. 토론 상대는 사람이거나 챗지피티(GPT-4 모델, 이하 챗지피티)였는데, 참가자에게는 어느 쪽인지 알리지 않았다.
여기에 조건이 하나 더 붙었다. 어떤 상대에게는 참가자의 △성별 △나이 △학력 △정치 성향을 미리 알려줬다. 연구팀은 토론 전후로 그 주장에 얼마나 동의하는지를 1점에서 5점 사이로 물어 토론이 생각을 얼마나 움직였는지 쟀다.
결과는 한 조건에서만 뚜렷했다. 참가자의 정보를 쥔 챗지피티와 토론했을 때 참가자가 상대 주장 쪽으로 마음을 옮기는 정도가 사람과 토론했을 때보다 컸다. 우연이라 보기 어려운 차이였다. 반면 정보가 없는 챗지피티는 사람과 큰 차이가 없었고, 같은 정보를 쥔 사람 상대도 마찬가지였다. 연구팀은 챗지피티가 개인 정보를 사람보다 훨씬 잘 활용했다고 해석했다.
다만 정보를 준 챗지피티와 주지 않은 챗지피티 사이의 차이는 우연이 아니라고 말할 수준에 이르지 못했기에 개인 정보만의 효과라고 단정하지는 않았다.
그렇다면 AI는 나를 알아야만 내 생각을 움직일 수 있을까. 나를 전혀 모르는 AI도, 말하는 방식만으로 내 생각을 바꿀 수 있지 않을까.
영국 AI보안연구소(AI Security Institute) 연구팀 등이 2025년 12월 발표한 논문이 이 물음을 다뤘다. 연구팀은 영국 성인을 대상으로 세 차례 실험을 진행했다. 연구별 표본을 합하면 7만6977명이고, 중복 참여를 제외한 실제 참가자는 4만2357명이었다. 정치적 설득 대화 조건에서는 참가자들이 AI와 최소 두 차례, 최대 열 차례 대화를 주고받았다. 이때 설득 방식을 여덟 가지 가운데 하나로 바꿔 지시했다. 이야기를 들려주라는 지시도 있었고, 사실과 증거를 많이 들라는 지시도 있었다. 연구팀은 대화 전후로 동의 정도를 0점에서 100점 사이로 물어 대화하지 않은 사람들보다 점수가 얼마나 더 올랐는지를 설득 효과로 보았다.
가장 크게 효과가 난 것은 빽빽한 말이었다. 사실과 증거를 많이 들라는 지시가 여덟 가지 방식 가운데 설득 효과가 가장 컸고, 사실 주장이 많은 대화일수록 설득 효과도 큰 경향이 있었다. 참가자에게 맞춰 말하는 방식도 효과는 있었지만, 그 크기는 훨씬 작았다. 나를 아는 AI보다 빽빽하게 말하는 AI가 더 크게 움직였다는 뜻이다.
대신 정확도는 떨어졌다. 챗지피티의 후속 모델(GPT-4o 모델)에게 다른 지시를 주었을 때는 정확한 주장이 78%였는데, 사실과 증거를 많이 들라고 하자 62%로 내려갔다. 말을 빽빽하게 채울수록 틀린 말도 함께 섞여 든 것이다. 연구팀은 이 틀린 말이 설득을 키운 원인이라기보다 말을 많이 채우다 딸려 들어온 것에 가깝다고 해석했다. 거짓 정보를 쓰라고 지시해도 설득 효과가 눈에 띄게 오르지 않았기 때문이다.
이 연재는 AI가 건넨 말을 그 자리에서 받아들이는 사람을 '텍스터', 그 말이 무엇에 기대고 있는지 따져 본 뒤 자기 판단을 세우는 사람을 '컨텍스터'라 불러왔다. 두 연구에 이 구분을 옮겨 보면, 사람의 마음을 가장 크게 움직인 것은 나를 아는 듯한 말과 빽빽한 말이었다. 필자는 텍스터가 그 앞에서 가장 쉽게 설득된다고 해석한다. 근거가 열 개라는 사실 자체가 믿을 이유가 되기 때문이다. 컨텍스터는 그 근거를 '검산'한다. 검산은 계산이 맞는지 처음부터 다시 따져 보는 일이다. 열 개를 전부 다시 계산할 필요는 없다. 가장 그럴듯하게 들린 근거 하나를 골라, 정말 있는 이야기인지 확인하면 된다.
이를테면 건강기능식품을 고르며 AI에게 물었더니, 연구 결과 열 개를 줄줄이 들며 한 제품을 권한다고 하자. 텍스터는 열 개라는 숫자에 마음이 놓여 결제한다. 컨텍스터는 마음이 가장 놓인 근거 하나를 골라 실제 연구인지, 사람을 대상으로 했는지부터 확인한다. 하나가 흔들리면 열 개의 무게가 달라지기 때문이다.
빽빽한 말은 힘이 세다. 근거가 촘촘히 이어지면 누구나 마음이 놓인다. 그것은 잘못이 아니라 사람의 습성이다.
그러나 말의 양이 곧 말의 무게는 아니다. AI는 지치지 않고 빽빽한 말을 만들어낸다. 그 말을 믿을지 정하는 일은 말이 아니라 우리의 몫이다. 검산은 거창하지 않다. 가장 그럴듯한 근거 하나만 골라 정말 그런지 확인하면 된다. 그 한 번의 확인이 텍스터와 컨텍스터를 가른다.
AI가 근거를 열 개 댈 때 우리는 그중 하나라도 검산해 보았는가.
최홍규 EBS 연구위원 / 미디어학 박사
--comment--
첫 번째 댓글을 작성해 보세요.
댓글 바로가기