Confident Isn't Accurate: How AI Hallucinations Actually Work
자신감 있는 답변이 정확한 답변은 아닙니다 — AI 환각이 생기는 방식
AI 환각은 모델이 사실을 확인하고 거짓말을 택한 결과가 아니라, 다음에 올 가능성이 높은 토큰을 생성하는 과정에서 생기는 오류입니다. 글은 환각이 잦은 상황과 RAG의 한계를 설명하고, 제품에 출처·수정 기능을 제공하는 등 대응 방법을 제안합니다.
- 주제
AI 요약
AI가 자신감 있게 답한다고 해서 사실까지 정확한 것은 아닙니다. 이 글은 ‘환각’이라는 표현이 AI를 사람처럼 의인화한다고 지적하며, 모델의 답변 생성 방식에서 오류가 생기는 이유를 설명합니다. 모델은 사실 데이터베이스에서 정답을 찾아오는 대신, 대량의 학습 자료에서 익힌 패턴을 바탕으로 다음 토큰의 확률을 계산합니다. 학습 자료가 대체로 현실을 반영하므로 통계적으로 그럴듯한 답과 사실이 겹치는 경우가 많지만, 둘 사이의 간극에서 환각이 발생합니다.
‘모르겠습니다’보다 그럴듯한 답이 앞서는 이유
예를 들어 특정 회사의 CEO를 묻더라도 모델은 정답을 검색하지 않습니다. 문장 뒤에 올 후보들의 가능성을 따질 뿐입니다. 학습 자료에는 백과사전식으로 자신 있게 설명하는 글이 많고, 모른다고 밝히는 글은 드뭅니다. 그래서 불확실성을 표현하는 답은 후보 순위에서 밀릴 수 있습니다.
대화형 모델은 답변을 거절하는 추가 훈련을 받기도 합니다. 하지만 많은 벤치마크에서는 ‘모르겠습니다’도 오답과 같은 점수를 받습니다. 답을 추측하는 모델이 모른다고 답하는 모델보다 평가에서 유리해질 수 있습니다. 따라서 모델이 거짓말을 하기로 결정했다기보다, 문맥을 이어갈 가능성이 높은 문장을 자신감 있는 어조로 내놓는다고 설명합니다.
환각이 더 자주 나타나는 경우
학습 자료에서 드물게 다뤄진 사실이나 출처마다 답이 엇갈리는 주제는 정답의 통계적 근거가 약합니다. 수치·날짜·인용처럼 세부 정보가 필요한 질문도 위험합니다. 모델은 실제 논문을 찾아 인용하는 대신, 논문 제목과 저자, 학술지 이름이 어떻게 생겼는지 학습한 패턴으로 그럴듯한 인용을 만들 수 있습니다.
학습 시점 이후의 정보도 문제입니다. 모델이 최신 사실을 알지 못해도 오래된 답을 자신 있게 말할 수 있으며, 어떤 정보가 오래됐는지 항상 판별하지는 못합니다. 전제가 틀린 질문에는 그 전제를 받아들인 뒤 설명을 이어갈 수 있습니다. 글은 또 존재하지 않는 코드 패키지 이름을 제안하는 사례를 언급합니다. 공격자가 그런 이름의 패키지를 실제로 등록해 사용자가 설치하기를 기다리는 공격을 ‘slopsquatting’이라고 부릅니다.
RAG도 환각을 완전히 없애지는 못합니다
Retrieval-augmented generation(RAG)은 모델이 학습 데이터만으로 답을 만들게 두는 대신, 검색한 자료를 바탕으로 답하도록 구성합니다. 생성 과정은 여전히 토큰 예측이지만, 근거가 될 실제 문서를 문맥에 넣습니다. 다만 검색이 엉뚱한 문서를 가져오거나 모델이 문서 내용을 잘못 읽고 과장할 수 있습니다. 글은 ‘환각이 없다’고 홍보한 RAG 기반 법률 조사 도구에서도 답변의 약 6분의 1에서 3분의 1가량 환각이 발견됐다고 소개합니다.
사용자가 확인하고 제품이 수정 경로를 제공해야 합니다
답변에 출처와 인용을 요청하면 정확성이 보장되지는 않지만, 결과를 검증할 단서는 생깁니다. ‘모르면 모른다고 답하라’고 지시하면 불확실성을 말하는 쪽으로 유도할 수 있지만, 모델이 자신의 무지를 실제로 아는 것은 아닙니다. 같은 질문을 여러 번 던져 답이 달라지는지 보는 방법도 있습니다. 연구자들은 이 발상을 ‘semantic entropy’라는 탐지 방법으로 발전시켰습니다.
AI 기능을 출시하는 제품 엔지니어에게도 정확성은 ML 팀만의 과제가 아닙니다. 특히 구체적인 수치나 인용을 검증된 사실처럼 제시하지 말고, 이용 가능한 출처를 화면에 보이고 클릭할 수 있게 해야 합니다. 생성 기능뿐 아니라 사용자가 틀린 답을 표시하고 수정 의견을 남길 경로도 마련해야 합니다. 에이전트나 코파일럿이 추가한 패키지는 설치 전에 실제로 존재하는지 확인하라고 글은 권합니다. 글은 EU AI Act에 따라 AI 생성 콘텐츠를 표시해야 한다고도 언급합니다.
dev.to 반응
- @hannune — 엔티티 해소 작업에서 가장 많은 시간을 썼습니다. 표기는 비슷하지만 법적으로 다른 회사 이름을 모델이 자신 있게 하나로 합치곤 했는데, 점수에는 그 사례가 특별히 불확실하다는 표시가 없었습니다. 결국 직접 검토한 사례를 기준으로 별도의 불확실성 추정기를 만들었습니다. 더 어려운 문제는 처음부터 어떤 사례에서 모델이 틀렸는지 알아내는 일이었습니다. 모델에게 물어볼 수도 없으니까요.
원문: dev.to / 번역·요약: Trawling