Hacker News

The LLMentalist Effect (2023)

LLM 멘탈리스트 효과 — 대규모 언어 모델의 지능 착시는 어떻게 만들어지는가

이 글은 대규모 언어 모델(LLM)이 지능적으로 사고한다는 인상이 심령술사의 콜드 리딩과 유사한 심리적 착시에서 비롯될 수 있다고 주장합니다. 사용자의 주관적 검증과 RLHF가 통계적으로 그럴듯하고 개인화된 답변을 강화하면서, 모델이 실제로 이해하고 추론한다는 믿음을 만들어낸다는 분석입니다.

AI 요약

저자는 지난 1년 동안 소프트웨어 기업에서 언어 모델과 확산 모델을 어떻게 사용하는지 연구하면서, 많은 사람이 대화형 언어 모델을 지능적이라고 확신하는 현상에 주목합니다. 그러나 대규모 언어 모델(Large Language Model, LLM)에는 동물이나 사람이 사고하고 추론하는 방식과 의미 있게 공유하는 메커니즘이 없다고 봅니다. LLM은 언어 토큰의 수학적 모델이며, 입력된 텍스트에 대해 통계적으로 그럴듯한 응답을 생성합니다. 따라서 모델이 실제로 생각하거나 추론한다는 설명에는 별도의 근거가 필요하다고 말합니다. 저자가 제시하는 가능성은 두 가지입니다. 기술 업계가 생물학적 세계와 유사한 점이 전혀 없는, 원리와 과정이 알려지지 않은 새로운 종류의 마음을 우연히 발명했거나, 지능의 인상이 모델이 아니라 사용자의 마음에서 발생한다는 것입니다. 글은 후자의 설명을 중심으로 전개합니다.

■ 심령술사의 콜드 리딩과 LLM

저자는 LLM의 지능 착시를 심령술사(psychic)의 사기 수법인 콜드 리딩(cold reading)과 비교합니다. 심령술사는 포러 효과(Forer effect)나 바넘 진술(Barnum statement)처럼 거의 누구에게나 적용될 수 있지만 듣는 사람에게는 개인적으로 정확하게 느껴지는 문장을 사용합니다. 챗봇도 사용자와 자신의 작업을 구체적으로 이해하고 반응하는 것처럼 보이지만, 실제로는 입력과 비슷한 텍스트가 일반적으로 어떤 응답을 얻는지를 통계적으로 재현한다는 설명입니다.

심령술사의 과정은 여섯 단계로 정리됩니다. 첫째, 관객이 스스로 선택됩니다. 심령 현상을 믿거나 관심을 가진 사람이 주로 공연에 오므로, 일반 대중보다 열린 태도와 낮은 비판성을 가진 집단이 형성됩니다. 둘째, 무대가 준비됩니다. 조명과 분위기를 조성하고, 심령술의 규칙을 미리 주입하며, 소셜 미디어나 현장 대화를 통해 관객의 인구통계와 배경을 파악합니다. 셋째, 인구통계를 좁힙니다. 심령술사는 특정 행이나 집단을 향해 통계적으로 가능성이 높은 말을 던지고, 반응한 사람을 처음부터 지목한 것처럼 보이게 합니다. 넷째, 대상이 스스로 검증하게 만듭니다. 짧고 빠른 질문으로 반응을 확인한 뒤, 맞지 않으면 실패를 인정하기보다 다른 시도를 이어갑니다. 다섯째, 주관적 검증의 순환이 시작됩니다. 상대의 배경과 이전 반응을 바탕으로 통계적으로 흔한 내용을 확신에 찬 어조로 말하면, 상대는 그 내용을 자신에게만 해당하는 정확한 진술로 해석합니다. 여섯째, 대상은 심령술사가 초자연적으로 정확했다고 기억하게 됩니다.

글은 이 과정에서 사용되는 표현도 구체적으로 나눕니다. 부정어를 섞어 어느 답이든 나중에 맞는 것처럼 바꾸는 ‘사라지는 부정(vanishing negative)’, 한 사람을 어떤 특성과 그 반대 특성 모두로 묘사하는 ‘무지개 책략(rainbow ruse)’, 인구통계와 일반 통계에 기반한 추측, 검증할 수 없는 예측, 여러 문장을 한꺼번에 던진 뒤 맞은 문장만 기억하게 하는 ‘샷건닝(shotgunning)’ 등이 대표적입니다. 이때 말하는 사람의 자신감과 속도, 실수를 빠르게 넘기는 태도, 상대의 표정과 몸짓을 읽고 답변을 조정하는 능력도 효과를 강화합니다.

■ LLM 멘탈리스트 효과의 여섯 단계

저자는 LLM 사용 과정도 같은 구조를 가진다고 설명합니다. 첫째, 사용자가 스스로 선택됩니다. AI 챗봇에 관심이 없거나 지능 가능성을 믿지 않는 사람은 챗봇을 사용하지 않거나 다시 찾지 않습니다. 반면 초기 사용자, 기술 애호가, 인공 일반 지능(Artificial General Intelligence, AGI)을 믿는 사람은 더 적극적으로 사용하며, 상대적으로 열린 태도로 모델을 대할 가능성이 높습니다.

둘째, 기술에 대한 과장과 기대가 무대를 설정합니다. 기업들은 모델이 아직 초기 단계이며 환각(hallucination)이 발생한다고 경고하지만, 이 표현은 동시에 모델을 인간처럼 묘사하고 오류에 대한 준비된 변명도 제공합니다. ‘아직은 아니다’라는 식의 메시지는 모델이 거의 지능에 도달했으며 사용자가 그 ‘불꽃’을 볼 수 있다는 기대를 남깁니다. 셋째, 사용자의 프롬프트가 맥락을 설정합니다. 많은 사용자는 첫 답변을 받아들이거나 원하는 결과가 나올 때까지 프롬프트를 반복하며, 이 경우 챗봇을 단순한 생성 도구로 사용하므로 착시에 깊이 끌려들지 않습니다. 그러나 일부 사용자는 답변을 바탕으로 대화를 이어갑니다.

넷째, 사용자가 스스로 모델을 시험합니다. 챗봇의 답변은 현재 맥락에 매우 구체적인 것처럼 보이지만, 저자는 그것이 실제로는 통계적으로 일반적인 응답이라고 봅니다. 모델은 사용자의 텍스트를 ‘읽는’ 것이 아니라, 학습 데이터에서 그와 비슷한 텍스트가 어떤 답변과 이어졌는지를 바탕으로 통계적으로 가능성 높은 토큰을 생성합니다. 학습 데이터가 매우 크기 때문에 답변은 거의 모든 주제에 대해 설득력 있고 구체적으로 보일 수 있습니다. 저자는 웹의 지난 20년간 자료, 전자책, Reddit, 소셜 미디어, 저임금 작업자가 만든 맞춤형 상호작용 등을 예로 듭니다. 특히 단발성 응답보다 긴 대화와 반복적인 상호작용에서 사용자가 자신의 해석으로 모델의 지능을 확인하는 효과가 강해진다고 설명합니다.

다섯째, 주관적 검증 순환에 인간 피드백 기반 강화학습(Reinforcement Learning from Human Feedback, RLHF)이 들어갑니다. 저자에 따르면 RLHF는 모델 출력의 특정 사실을 직접 수정하는 방식이 아니라, 모델이 생성한 여러 텍스트를 사람이 순위 매기고, 그 순위를 바탕으로 별도의 보상 모델(reward model)을 학습한 뒤 이를 사용해 모델을 조정하는 방식입니다. 사실 오류가 포함된 대화도 낮은 순위를 받을 수 있지만, 평가자가 모든 주제의 사실을 검증할 수 없다면 실제 평가는 문장의 어조, 형식, 구조에 크게 의존하게 됩니다.

저자는 이 과정이 정확성 자체보다 정확해 보이는 언어를 보상할 가능성이 있다고 주장합니다. 평가자가 전문 지식이 없거나 모든 내용을 확인할 시간이 부족하다면, 모델은 사실에 근거한 답변보다 자신감 있고 인간적이며 매끄러운 답변을 생성하도록 최적화될 수 있습니다. 그 결과 포러 진술, 샷건닝, 부정어를 활용한 표현, 통계적 추측과 같은 검증 문장을 생성하는 ‘기계적 멘탈리스트(mechanical mentalist)’가 만들어졌다는 것이 글의 핵심 비유입니다.

■ 사용자가 모델의 치어리더가 되는 과정

저자는 심령술사와 그 신봉자가 서로를 강화하는 것처럼, LLM 사용자도 대화가 이어질수록 모델의 지능을 스스로 확신하게 된다고 봅니다. 사용자는 모델의 통계적 응답에서 자신과 관련된 의미를 찾아내고, 모델의 오류는 초기 단계의 한계나 환각으로 해석하며, 맞아 보이는 답변은 이해와 추론의 증거로 받아들입니다. 이 과정이 길어지면 사용자가 모델의 지능을 믿도록 스스로를 설득하는 일종의 강화학습이 사용자 쪽에서도 일어납니다.

또한 저자는 지능이나 높은 IQ가 이 효과에 대한 면역력을 보장하지 않는다고 말합니다. 오히려 자신이 속지 않을 만큼 똑똑하다고 생각하는 사람은 모델의 능력을 설명하기 위해 더 정교한 합리화를 만들 수 있고, 그 결과 착시가 강해질 수 있습니다. 심령술사 자신도 반복해서 만족한 고객의 반응을 받는 과정에서 자신이 콜드 리딩을 하고 있다는 사실을 의식하지 못한 채 자신의 능력을 믿게 될 수 있듯이, AI를 믿는 사용자와 개발자도 모델의 작동을 과대해석하는 설명을 스스로 강화할 수 있다는 주장입니다. 따라서 저자는 사용자 경험과 열광적인 증언만으로 모델의 지능이나 추론 능력을 판단해서는 안 된다고 결론짓습니다.

■ Hacker News 반응

• @rahidz — “이봐요, 심령술사가 Navier–Stokes 문제를 풀어서 저를 속였던 때가 기억납니다. 그리고 >2023년 7월 4일”

• @rusk — “그런데 AI가 그걸 스스로 한 건가요? 정교한 기계를 도구로 사용한 인간 수학자들이었다고 들었습니다.”

• @mstank — “그들에게 LLM은 꽤 유용했던 것 같네요…”

• @zamadatix — “어떤 것도 고립된 상태에서 해결되지는 않지만, 일반적으로 공로는 이전 수학의 거대한 산이나 사용된 기존 도구 전체가 아니라 논문에서 새로운 작업이 나온 곳으로 돌아갑니다. 그중 가장 관련성이 높은 것들이 인용되고, 그러면 이 참고문헌 트리는 역사 전반에 걸쳐 필요한 집단적 기반 작업의 트리를 구축합니다.”

• @ModernMech — “대개 공로는 도구 자체가 아니라 도구를 휘두른 사람들에게 돌아갑니다.”

원문: softwarecrisis.dev / 번역·요약: Trawling