- 할루시네이션이란 AI가 사실이 아닌 내용을 사실인 것처럼 자신 있게 내놓는 현상입니다
- 이것은 고장이 아니라 지금 AI가 답을 만드는 방식에서 따라 나오는 부작용입니다
- 그래서 없앨 수 있는 버그가 아니라 줄이고 걸러 내며 같이 사는 성질로 다뤄야 합니다
AI가 알려 준 내용을 믿고 옮겨 적었다가 뒤늦게 그런 자료가 없다는 것을 알게 된 경험이 한 번쯤 있으실 겁니다. 논문 제목과 저자까지 또박또박 적어 주기에 찾아보았더니 세상에 없는 논문이었고, 법 조항 번호를 그럴듯하게 말해 주기에 확인해 보았더니 그런 조항이 없었습니다. 이런 현상을 할루시네이션이라고 부릅니다. 할루시네이션이란 AI가 사실이 아닌 내용을 사실인 것처럼, 그것도 아주 자신 있는 말투로 내놓는 현상입니다.
영어 단어 hallucination은 원래 환각을 뜻합니다. 없는 것을 본 것처럼 말한다는 뜻에서 그대로 옮겨 온 말이고, 한국어로는 환각 현상이라고 부르기도 합니다. 이름만 들으면 AI가 가끔 고장 나는 순간처럼 들리는데, 실제로는 그렇지 않습니다. 맞는 답을 만들 때와 틀린 답을 만들 때 AI 안에서 벌어지는 일은 똑같습니다.
그래서 이 글은 AI를 믿지 마십시오로 끝나는 글이 아닙니다. 왜 이런 일이 생기는지를 먼저 짚고, 특히 잘 나타나는 자리 다섯 곳과 오늘 바로 줄일 수 있는 방법 네 가지를 순서대로 정리하겠습니다. 이 성질을 이해하고 나면 AI를 덜 쓰게 되는 것이 아니라 훨씬 마음 놓고 쓰게 됩니다.
할루시네이션이란 정확히 무엇을 가리키나요?
가장 알아보기 쉬운 형태는 존재하지 않는 것을 존재한다고 말하는 경우입니다. 없는 책, 없는 논문, 없는 통계, 없는 인용문을 만들어 내는 식입니다. 여기에 더해 실제로 있는 것을 잘못 연결하는 경우도 같은 이름으로 부릅니다. 진짜 저자에 가짜 책 제목을 붙이거나, 실제 사건의 연도를 바꿔 말하는 경우가 그렇습니다.
까다로운 점은 답 전체가 틀리는 일이 드물다는 것입니다. 열 줄 가운데 아홉 줄은 맞고 한 줄만 틀린 형태가 훨씬 흔합니다. 틀린 한 줄도 앞뒤 문장과 자연스럽게 이어져 있어서, 읽는 사람 입장에서는 그 줄만 튀어 보이지 않습니다. 전부 엉터리인 답보다 대부분 맞는 답이 더 위험한 이유가 여기에 있습니다.
겉모습도 사람을 안심시키는 쪽으로 만들어집니다. 출처를 요구하면 출처처럼 생긴 문자열을 만들어 주고, 숫자를 요구하면 숫자처럼 생긴 값을 만들어 줍니다. 형식이 갖춰져 있으니 확인해 보지 않으면 진짜와 구분되지 않습니다. 형식이 그럴듯하다는 것과 내용이 사실이라는 것은 아무 관계가 없습니다.
거짓말과는 무엇이 다른가요?
가장 큰 차이는 속이려는 의도가 없다는 점입니다. 사람이 거짓말을 할 때는 사실이 무엇인지 알고 있으면서 다른 말을 고릅니다. 숨기고 싶은 것이 있거나 얻고 싶은 것이 있기 때문입니다. AI에게는 그런 동기가 없습니다. 감추려는 사실도 없고 이득도 없습니다.
더 중요한 차이가 있습니다. AI는 자기가 틀렸다는 것을 모릅니다. 맞는 답을 내놓을 때와 틀린 답을 내놓을 때 스스로 느끼는 차이가 없습니다. 사람이라면 이건 확실하고 저건 가물가물하다는 감각이 있어서 말끝이 흐려지는데, AI에게는 그 감각이 없습니다. 그래서 틀린 답일수록 오히려 더 매끄럽게 나오기도 합니다.
AI의 자신 있는 말투를 믿을 근거로 삼으면 안 되는 이유도 같습니다. 그 말투는 내용을 검토한 결과가 아니라 학습한 글들이 대체로 단정적인 문체였기 때문에 따라 나온 습관에 가깝습니다. 틀렸다고 지적하면 순순히 사과하는 것도 마찬가지입니다. 사과한 다음에 또 다른 틀린 답을 자신 있게 내놓는 경우도 드물지 않습니다.
AI는 왜 없는 이야기를 만들어 낼까요?
여기가 이 글의 핵심입니다. AI는 사실을 찾아오는 도구가 아니라, 그럴듯한 다음 말을 이어 붙이는 도구입니다. 검색 엔진은 어딘가에 저장된 문서를 찾아 그 주소를 보여 줍니다. 반면 AI는 문서를 꺼내 오지 않습니다. 앞에 놓인 말을 보고 다음에 올 법한 말을 한 조각씩 골라 문장을 새로 만듭니다.
이 방식은 놀랄 만큼 잘 작동합니다. 수많은 글을 학습했기 때문에 자주 나오는 사실은 자연스럽게 따라 나옵니다. 문제는 근거가 부족한 자리에서도 같은 방식이 멈추지 않는다는 것입니다. 빈칸을 만나면 비워 두는 것이 아니라, 그 자리에 들어갈 만한 말을 골라 채웁니다. 말을 고르는 단위가 무엇인지는 토큰이란?에서 따로 정리해 두었습니다.
모르겠습니다가 정답인 상황에서도 그 말이 잘 나오지 않는 이유가 여기 있습니다. 학습한 글 중에 질문을 받고 모른다고만 적혀 있는 글은 많지 않습니다. 대부분의 글은 질문 뒤에 그럴듯한 설명이 이어집니다. 그러니 AI에게는 모른다는 답보다 그럴듯한 문장이 훨씬 자연스러운 출력이 됩니다.
여기에 하나가 더 겹칩니다. AI의 지식은 학습을 마친 시점에서 멈춰 있습니다. 그 뒤에 일어난 일은 알지 못하는데, 모른다고 말하는 대신 이전에 배운 흐름으로 짐작해 채워 넣습니다. 작년까지의 정보로 올해 상황을 그럴듯하게 지어내는 답이 나오는 구조입니다. 대화가 아주 길어졌을 때 앞부분 조건을 놓치고 엉뚱한 답이 나오는 것도 비슷한 뿌리인데, 이 부분은 컨텍스트 윈도우란?에서 따로 다루었습니다.
할루시네이션은 고장이 아니라 지금 AI가 작동하는 방식의 부작용입니다.사실을 찾아오는 것이 아니라 그럴듯한 다음 말을 이어 붙이는 방식이기 때문입니다.
특히 잘 나타나는 자리는 어디인가요?
아무 데서나 고르게 생기지 않습니다. 유난히 자주 나타나는 자리가 정해져 있습니다. 다음 다섯 가지가 나오면 그 자리에서 한 번 멈추는 습관만 들여도 사고의 대부분은 막을 수 있습니다.
- 사람 이름과 경력 — 이름과 직함과 소속은 조합이 흔해서, 실제로 없는 조합도 자연스럽게 이어집니다
- 숫자와 통계 — 자릿수만 그럴듯하면 문장이 매끄러워서, 틀린 값도 걸리는 느낌 없이 지나갑니다
- 법 조항과 규정 — 조문 번호는 형식이 정해져 있어 흉내 내기 쉽고, 개정도 잦아 옛 내용이 섞입니다
- 논문과 책과 주소 — 제목과 저자와 URL 모두 형태가 일정해서, 없는 자료도 형식만은 완벽하게 나옵니다
- 최근에 일어난 일 — 학습이 끝난 뒤의 일이라 알 수 없는데, 모른다고 하는 대신 짐작으로 채웁니다
공통점이 보이실 겁니다. 형식이 뚜렷하게 정해져 있는 것일수록 흉내 내기가 쉽습니다. 반대로 개념 설명이나 글 다듬기처럼 정해진 정답이 없는 일에서는 이 문제가 훨씬 덜합니다. 그래서 같은 AI라도 이 개념을 쉽게 설명해 달라는 부탁에는 강하고, 근거 조항을 알려 달라는 부탁에는 약합니다.
줄이려면 오늘 무엇을 하면 될까요?
완전히 없애는 방법은 아직 없습니다. 다만 눈에 띄게 줄이는 방법은 분명히 있습니다. 특별한 도구가 필요한 것도 아니고, 네 가지 모두 오늘 바로 할 수 있는 일입니다.
첫째, 출처를 함께 요구하십시오. 근거가 된 자료와 주소를 함께 적어 주십시오 한 줄을 붙이는 것만으로도 답이 조심스러워집니다. 다만 여기서 멈추면 안 됩니다. 출처 자체를 지어낼 수도 있기 때문에 링크는 직접 눌러 확인해야 합니다. 주소를 눌러 보는 데 드는 몇 초가 가장 값싼 검증입니다.
둘째, 자료를 직접 붙여 주십시오. 기억에서 꺼내게 하는 대신 읽을 것을 손에 쥐여 주는 방식입니다. 회사 규정이라면 규정집을, 계약이라면 계약서를 붙여 넣고 붙여 준 자료 안에서만 답하고 없으면 없다고 말해 주십시오라고 범위를 정해 주면 됩니다. 이렇게 자료를 먼저 찾아다 놓고 답하게 하는 방식을 RAG라고 부르는데, 요즘 서비스들이 파일 첨부 기능으로 제공하는 것이 대체로 이 구조입니다.
셋째, 모르면 모른다고 답하라고 미리 일러 두십시오. 확실하지 않은 부분은 추측하지 말고 모른다고 표시해 주십시오처럼 질문 앞에 한 줄을 넣는 것입니다. 이 한 줄이 모든 경우를 막아 주지는 않지만, 빈칸을 억지로 채우는 답이 줄어드는 것은 분명합니다. 답 안에 확실한 부분과 불확실한 부분을 나눠 표시해 달라고 부탁하는 것도 좋습니다.
넷째, 확인이 필요한 항목만 따로 검증하십시오. 답 전체를 처음부터 다시 조사하면 AI를 쓸 이유가 없어집니다. 앞에서 본 다섯 자리, 즉 이름과 숫자와 조항과 출처와 최근 소식만 골라 원래 자료에서 확인하면 됩니다. 나머지 설명과 구성은 대체로 그대로 써도 무리가 없습니다.
검색형 AI는 왜 나왔을까요?
지금까지의 이야기를 뒤집어 보면 답이 나옵니다. 기억에서 꺼내니까 지어내는 것이라면, 답하기 전에 찾아보게 하면 되지 않겠느냐는 발상입니다. 질문을 받으면 먼저 웹에서 문서를 검색해 가져오고, 그 문서 안에서 답을 쓰고, 어느 문장이 어디에서 왔는지 링크로 표시해 주는 방식입니다. 퍼플렉시티처럼 검색과 붙어 있는 AI가 이런 구조를 앞세워 나온 서비스입니다.
이 방식은 확실히 유리합니다. 최근 소식에 강하고, 출처가 함께 나오니 확인이 빠릅니다. 다만 이것으로 문제가 사라지지는 않습니다. 가져온 문서 자체가 틀렸을 수도 있고, 여러 문서를 요약해 합치는 과정에서 원문에 없던 말이 섞이기도 합니다. 출처가 붙어 있다고 해서 그 문장이 그 출처에 실제로 있는지까지 보장되지는 않습니다.
그래서 검색형 AI의 진짜 장점은 틀리지 않는다가 아니라 틀렸는지 확인하기가 쉬워진다 쪽입니다. 이것만 해도 큰 차이입니다. 확인할 방법이 없는 답과 몇 번의 클릭으로 확인되는 답은 쓸모가 전혀 다릅니다.
그래도 AI를 쓸 이유가 있을까요?
있습니다. 오히려 이 성질을 알고 나면 쓰는 자리가 더 분명해집니다. 판단의 기준은 간단합니다. 틀렸을 때 확인하는 비용이 얼마나 드는 일인가입니다. 초안 쓰기, 긴 글 요약, 번역, 표현 다듬기, 생각 정리처럼 내가 읽으면 바로 알아보는 일에서는 위험이 거의 없습니다. 틀리면 그 자리에서 고치면 그만입니다.
반대로 내가 모르는 사실을 대신 알아봐 달라고 하는 일에서는 위험이 커집니다. 내가 모르니 틀렸는지도 알 수 없기 때문입니다. 이럴 때는 앞에서 본 네 가지 방법으로 조건을 바꿔 준 다음에 쓰는 것이 맞습니다. 자료를 붙여 주거나, 출처를 받아 확인하거나, 검색형 AI를 쓰는 식입니다.
결국 할루시네이션은 AI를 쓸지 말지를 정하는 문제가 아니라, 어떻게 쓸지를 정하는 문제입니다. 자동차에 브레이크가 필요하다고 해서 자동차가 쓸모없는 물건이 되지는 않습니다. 브레이크가 어디 있는지 알고 타는 사람과 모르고 타는 사람이 다를 뿐입니다. 틀릴 수 있다는 전제를 깔고 쓰면 AI가 주는 이득은 여전히 크게 남습니다.
AI를 의심하며 쓰는 것과 아예 안 쓰는 것은 전혀 다른 이야기입니다.확인할 자리를 아는 사람에게는 여전히 가장 빠른 도구입니다.
- 할루시네이션은 사실이 아닌 내용을 사실처럼 자신 있게 말하는 현상입니다
- 거짓말과 달리 의도가 없고, AI는 틀린 줄을 모릅니다
- 원인은 사실을 찾는 대신 그럴듯한 다음 말을 잇는 방식에 있습니다
- 이름과 숫자와 조항과 출처와 최근 소식, 이 다섯 곳만 확인해도 대부분 걸러집니다
- 줄이는 가장 확실한 방법은 읽을 자료를 직접 붙여 주는 것입니다
같이 보면 좋은 글
- RAG란? — 자료를 붙여 주면 답이 달라지는 이유
- 퍼플렉시티란? — 검색과 붙어 있는 AI가 다른 점
- 컨텍스트 윈도우란? — 긴 대화가 앞부분을 잊는 이유
- AI 사전 전체 목록
다음 편에서는 파인튜닝으로 이어가겠습니다. 자료를 옆에 붙여 주는 방식이 RAG라면, 모델 자체를 우리 쪽 자료로 다시 가르치는 방식은 무엇이 다른지, 개인이나 작은 회사 입장에서 둘 중 어느 쪽을 먼저 생각해야 하는지 정리해 두면 AI를 내 일에 맞추는 방법이 훨씬 또렷해집니다.