개념
환각은 대규모 언어모델(LLM)이 실제 사실과 어긋나거나 존재하지 않는 정보를 마치 사실인 것처럼 생성하는 현상을 말한다. 없는 논문·저자·수치·URL을 지어내거나, 질문과 다른 근거를 그럴듯하게 제시하는 경우가 대표적이다.
이는 언어모델이 "진실 여부"를 판별하는 대신, 학습한 패턴을 바탕으로 다음에 올 법한 토큰을 확률적으로 예측하도록 설계되었기 때문에 발생한다. 그 결과 문장은 문법적으로 매끄럽고 확신에 찬 어조를 띠지만, 내용의 정확성은 별도로 보장되지 않는다. 학습 데이터에 없거나 희소한 주제, 최신 정보, 정밀한 사실 확인이 필요한 질문에서 특히 자주 나타난다.
쓰임새
환각은 LLM을 실제 서비스에 적용할 때 신뢰성을 저해하는 핵심 문제로 다뤄진다. 완화를 위해 널리 쓰이는 방법은 다음과 같다.
- RAG(검색 증강 생성): 외부 문서를 검색해 근거로 함께 제공하면, 모델이 자체 기억에만 의존하지 않아 사실성이 높아진다.
- 출처 인용·근거 표시: 답변에 참조 문서를 함께 제시해 사용자가 검증할 수 있게 한다.
- 검증 단계: 생성 결과를 규칙·별도 모델·사람이 교차 확인하거나, 불확실할 때 "모른다"고 답하도록 유도한다.
다만 이런 기법으로 환각을 줄일 수는 있어도 완전히 제거하기는 어렵다. 따라서 의료·법률·금융처럼 정확성이 중요한 영역에서는 모델 출력을 사람이 최종 검토하는 절차를 두는 것이 안전하다.