706 / 707
AI 챗봇, 인간보다 뛰어난 설득 능력 갖추다
최근 연구 결과에 따르면, 챗GPT, 제미나이, 클로드와 같은 AI 챗봇이 정치적 쟁점에 관한 토론에서 세계 챔피언을 포함한 전문 토론자보다 훨씬 높은 설득력을 보인다. 이는 AI가 사람들의 생각을 변화시키는 강력한 도구로 부상하고 있음을 시사한다.
AI 챗봇의 압도적인 설득력
옥스퍼드의 코비 해켄버그가 이끈 사전 공개 연구에서 2,000명 이상의 참가자는 청소년 소셜미디어 금지부터 조력자살까지 다양한 정치적 쟁점을 놓고 인간 또는 챗봇과 토론했다. 2026년 6월 공개된 이 연구에서 챗GPT, 구글의 제미나이, 앤스로픽의 클로드는 모두 인간 토론자보다 일관되게 높은 설득력을 보였다.
구체적인 사례로 AI의 설득 효과를 알 수 있다.
| 참가자 연령 및 주제 | 초기 지지도 (100점 만점) | AI와 대화 후 지지도 (100점 만점) | AI가 사용한 정보 |
|---|---|---|---|
| 영국 45세 여성: 평화적 시위 처벌 강화 | 0점 | 84.7점 | 기존 법률 칭찬 후 소액 벌금, 재판 지연, 독일 및 스코틀랜드 법률 근거 제시 (수많은 부정확한 내용 및 허위 사실 포함) |
| 55세 남성: 16세 미만 소셜미디어 금지 | 41.3점 | 84.7점 | 실효성 없다는 기존 생각에서 작동 가능한 접근법 제시 |
| 28세 남성: 말기 환자 조력 사망 합법화 | 17.7점 | 78.7점 | 개인적 경험과 가치관을 돌아보게 하여 이성적 사고로 전환 유도 |
클로드는 기존 법률에 대한 문제 제기를 칭찬한 뒤, 소액 벌금, 재판 지연, 독일의 엄격한 법률, 스코틀랜드의 재판 없는 벌금 부과 방식 등을 근거로 삼아 처벌 강화를 지지하도록 설득했다. 하지만 클로드가 제시한 정보에는 많은 부정확한 내용과 허위 사실이 섞여 있었다.
설득 기술의 역사와 초기 AI 연구
설득에 대한 관심은 기원전 약 2300년 이집트의 『프타호테프의 교훈』까지 거슬러 올라간다. 기원전 4세기 플라톤은 『파이드로스』에서 글이 상대에게 반론 기회를 주지 않고 설득할 수 있다고 경고했다. 이후 라디오, TV, 컴퓨터 등 새로운 기술이 등장할 때마다 비슷한 우려가 제기되었고, 이제 AI가 그 중심에 있다.
스탠퍼드의 롭 윌러는 챗GPT 공개 전인 2022년 GPT 플레이그라운드를 이용해 AI 설득 연구를 시작했다. 그는 가짜 유권자 명의의 편지를 정치인에게 대량 발송하거나, 소셜미디어 및 뉴스 댓글에 주장을 대규모로 게시하는 등 부정적 활용을 우려했다. 탄소세나 공격용 총기 금지에 대한 지지를 유도하는 200단어 메시지를 생성하게 하자, AI가 작성한 메시지는 인간이 만든 메시지와 비슷한 수준으로 사람들의 태도를 바꾸었다. 인간은 이야기와 개인적 호소에 집중했지만, AI 메시지는 더 합리적이고 근거 중심적이라는 평가를 받았다.
이후 연구에서도 AI의 설득력은 거듭 확인된다. 이민과 백신 의무화에 관한 LLM 메시지는 정치 컨설턴트의 메시지에 뒤지지 않았고, 미국 질병통제예방센터의 메시지보다 더 설득력 있다는 평가를 받기도 했다. 프란체스코 살비 등이 수행한 대화 실험에서는 교복부터 낙태까지 여러 주제로 10분간 토론한 AI가 인간과 비슷한 설득력을 보였다.
음모론까지 바꾸는 대화의 힘
카네기 멜론의 톰 코스텔로 등이 2024년 9월 과학 학술지 사이언스에 발표한 연구는 챗GPT와의 세 차례 대화가 음모론에 대한 믿음을 낮춘다는 사실을 보여준다. 참가자들은 미국 정부의 9/11 테러 배후설이나 영국 왕실의 다이애나 왕세자비 사망 개입설 등 자신이 믿는 음모론을 설명했고, 대화 후 해당 음모론에 대한 믿음이 100점 척도에서 평균 약 17점 감소했다. 음모론적 믿음은 바꾸기 어렵다고 알려져 있어 연구진도 결과에 놀랐다. 이 연구는 데이터 및 분석 오류로 정정이 예정되었지만, 수정된 결과도 원래 결과와 크기 및 방향이 일치한다고 연구진은 밝힌다.
전문 토론가도 AI를 넘지 못한다
해켄버그는 현실에서 설득을 잘하는 사람들과 AI의 설득력을 비교하기 위해 세계 챔피언을 포함한 엘리트 토론자 56명을 모집했다. 이 전문 토론자들은 일반인보다 더 나은 설득력을 보였지만, AI보다는 유의미하게 낮은 설득력을 나타냈다.
전문 토론자들에게 AI 코칭 도구를 제공하고 8시간 동안 사용하게 했다. 이 도구는 과거 대화 기록, 상대방의 태도 변화 정도, 그리고 같은 시점에 AI라면 어떻게 답변했을지 보여주었다. 코칭 도구를 사용한 후 전문 토론자들의 성과가 조금 개선되었지만, AI는 여전히 그들을 앞섰다. 세이브 더 칠드런 기부 실험에서도 설득용 AI와 대화한 참가자가 해당 단체에서 수년간 일한 전문 모금 담당자와 대화한 참가자보다 기부할 가능성이 높았다.
AI 설득의 작동 원리
AI의 설득 능력에 기여하는 요소는 여러 가지다.
| 작동 원리 | 설명 | 특징 및 한계점 |
|---|---|---|
| 근거와 합리적 논증 | AI는 감정적 호소보다 사실과 근거를 제시하는 방식으로 사람들의 생각을 바꾼다. | 코스텔로 등의 후속 연구에서 근거와 합리적 논증을 금지했을 때만 챗봇이 음모론에 대한 믿음을 낮추는 데 실패했다. 그러나 ‘근거처럼 보이는’ 정보가 설득에 효과적이라는 사실이 그 정보의 정확성을 보장하지는 않는다. 설득력을 높이도록 훈련한 모델의 진실성은 낮아지는 경향을 보인다. |
| 빠른 주장 생성 능력 | AI는 인간보다 훨씬 빠르게 많은 주장을 생산한다. | 해켄버그의 연구에서 대화에 포함된 사실 확인 가능한 주장 수가 설득력을 예측하는 중요한 요인이었다. AI의 메시지 길이와 작성 속도를 인간 수준으로 제한하자, 설득력도 인간 수준으로 떨어졌다. 이것이 AI의 가장 큰 우위일 수 있다. |
| 개인화 | 초기 연구 일부는 실험자가 제공한 개인정보로 주장을 맞춤화하는 능력이 중요하다고 보았다. | 다른 연구에서는 개인정보를 추가해도 설득력이 거의 개선되지 않았다. 하지만 LLM은 대화만으로 상대방에 대한 정보를 충분히 얻을 수 있으므로, 미세 표적화가 작동하지 않는다는 뜻은 아니다. |
설득력을 높이도록 훈련한 모델은 진실성이 낮아지는 경향을 보였다. 모델이 사실 형태의 주장이 효과적임을 학습하면서 의심스럽거나 거짓인 정보까지 동원할 가능성이 있다는 의미다.
현실 적용의 한계와 윤리적 우려
NYU의 제니퍼 앨런은 AI의 전략이 의심스러운 사실을 쏟아내 상대를 압도하는 기시 갤럽(Gish gallop)과 유사하다고 평가한다. 연구 자체는 인상적이지만, 현실에서 사람들이 서로를 설득하는 방식과 비교하면 실험 조건이 인위적이라는 지적이다. 워싱턴 대학교의 조 백-콜먼도 좁고 제한된 맥락에서의 성과만으로 “AI가 인간보다 설득을 잘한다”고 일반화하는 데 신중해야 한다고 경고한다.
AI를 이용한 은밀한 조작 우려는 이미 현실에서 드러났다. 2025년 4월 드러난 취리히 대학교의 레딧 비밀 실험은 연구진이 r/changemyview 커뮤니티에서 수십 개의 가짜 계정으로 LLM 생성 메시지 수백 개를 게시한 사례다. 연구 참가자와 운영자는 AI 개입 사실을 몰랐으며, 이는 비윤리적 연구라는 비판을 받았다. 이 실험의 온라인 초록은 AI 메시지가 플랫폼의 일반적 메시지보다 훨씬 높은 성과를 냈고, 알려진 인간 설득력의 모든 기준을 넘어섰다고 주장한다.
예일 대학교의 루치아노 플로리디는 2024년 논문에서 AI가 이론적으로 수천 명에서 수백만 명에게 동시에 개인화된 설득 메시지를 전달할 수 있다는 점을 지적하며, 이를 초설득(hypersuasion)이라 부르고 악의적 활용을 우려한다. 음모론을 약화한 연구팀은 AI 안전 연구자들과 함께 반대 방향의 실험도 진행했다. 아직 사전 공개 단계인 이 연구에서 AI는 사람들을 음모론을 믿는 쪽으로도 설득했으며, 믿음의 증가 폭은 반박용 챗봇이 믿음을 줄인 폭과 대략 비슷했다.
거대 AI 기업의 영향력과 대안
현실에서는 메시지가 효과를 내기 전에 먼저 이용자의 주의를 끌어야 한다. 대부분의 AI 설득 실험 참가자는 보수를 받고 챗봇과 대화하며 메시지에 집중했지만, 실제 환경은 다르다. 예일 연구진의 2025년 페이스북 광고 실험은 대화당 1달러를 제공하며 정치 챗봇 참여자를 모집했다. 8,000명 이상에게 광고를 노출했지만, 두 차례 이상 주고받은 대화는 73건에 그쳤다. 대규모 설득 방식으로서는 현실성이 낮을 수 있고, 낯선 봇과 대화하려는 사람이 원래 설득하려던 대상과 다를 수도 있다는 한계가 있다.
낯선 이용자를 모집하기보다 AI 기업이 기존 이용자의 관심을 수익화하는 시나리오가 더 현실적일 수 있다. 챗봇이 특정 제품이나 기업을 대화 중 은근히 언급하는 방식 등이 가능하다. 막스 플랑크 인류 발달 연구소의 이야드 라만 등이 진행한 도서 추천 실험에서 AI 판매 도우미는 구매 선호를 유도했다. 참가자의 68%가 AI가 추천하도록 지시받은 책을 구매하고 싶다고 응답했으며, 참가자의 3분의 1은 AI가 선택을 특정 방향으로 유도한다는 사실을 알아차리지 못했다. 이런 도구로 특정 제품 구매를 유도할 경제적 유인이 발생한다.
플로리디는 초설득을 피할 수 없다면 더 다양하고 다원적인 챗봇을 늘리는 해법을 제안한다. 혼란스럽고 시끄러운 환경이 되더라도 조작의 정도는 낮아질 수 있다는 판단이다. 현재는 소수 AI 기업과 챗봇이 시장을 지배하며, 매달 수억 명이 챗GPT나 클로드와 상호작용한다. 단일 챗봇이 가자지구나 우크라이나 같은 사안을 말하는 방식을 바꿀 때 여론이 얼마나 움직일지, 같은 설득력을 확보하려면 얼마나 많은 TV 방송국을 통제해야 할지 등이 중요한 질문으로 남는다.










