AI 검색의 인용은 얼마나 믿을 수 있나 — 검증가능성 연구와 환각

XeoLab 편집팀 · 최종 수정 2026-10-07 · 읽는 시간 약 5분

핵심 요약

2023년 스탠퍼드 연구진이 Bing Chat·Perplexity 등 생성형 검색엔진 4종을 사람이 평가했더니, 생성된 문장 중 인용으로 완전히 뒷받침되는 비율은 51.5%, 인용의 정밀도는 74.5%였습니다. AI는 그럴듯하지만 사실이 아닌 내용(환각)을 만들 수 있으므로, 브랜드는 AI가 읽고 그대로 옮길 수 있는 정확한 1차 자료(가격·주소·서비스 범위)를 사이트에 두어야 합니다.

인용이 달려 있다고 사실인 것은 아니다

Liu·Zhang·Liang(스탠퍼드, EMNLP 2023 Findings)은 생성형 검색엔진의 답변을 문장 단위로 사람이 검수했습니다. 문장이 인용한 출처에 의해 완전히 뒷받침되는 비율은 평균 51.5%에 그쳤고, 인용 정밀도(달린 인용이 실제로 그 문장을 뒷받침하는 비율)는 74.5%였습니다. 연구진은 '유창하고 신뢰감 있는 문체'와 '미지원 주장·부정확한 인용'이 공존한다고 결론지었습니다.

2023년 초 평가라 지금의 엔진은 다를 수 있지만, 브랜드 입장에서 교훈은 같습니다. 우리 페이지가 인용됐다는 사실만으로 안심할 수 없고, AI가 우리에 대해 '무엇을' 말하는지 원문을 확인해야 합니다.

환각이란 무엇인가

ACM TOIS에 실린 대규모 언어 모델 환각 서베이(Huang 외)는 환각을 '그럴듯하지만 사실이 아닌 내용'으로 정의하고, 현실 사실과 모순되거나 검증 불가한 사실을 지어내는 '사실성 환각'과 지시·맥락·논리에서 벗어나는 '충실성 환각'으로 나눕니다. 브랜드의 가격·위치·서비스를 틀리게 말하는 것은 전형적인 사실성 환각입니다.

AI 검색은 답하기 전에 문서를 검색해 읽는 RAG(검색 증강 생성) 구조라서, 읽을 만한 정확한 문서가 있으면 환각이 줄어듭니다. RAG 원전 논문(NeurIPS 2020)도 외부 문서를 결합한 생성이 더 구체적이고 사실적이라고 보고했습니다.

브랜드가 할 수 있는 일

  • AI가 그대로 옮길 수 있는 사실 문장을 사이트에 둡니다. 가격·범위·조건·주소·운영시간을 문장으로 쓰고, 같은 사실을 구조화 데이터로 한 번 더 적습니다.
  • 회사 정보 표기를 모든 채널에서 통일합니다. 표기가 갈리면 AI가 서로 다른 실체로 보거나 섞어 말합니다.
  • AI 답변 원문을 정기적으로 수집해 틀린 서술(환각)을 찾아내고, 그 근거가 될 1차 자료를 보강합니다. 측정이 곧 교정의 출발점입니다.

자주 묻는 질문

AI가 우리 가격을 틀리게 말합니다. 어떻게 고치나요?

AI를 직접 고칠 수는 없습니다. AI가 읽는 페이지에 정확한 가격을 문장과 구조화 데이터로 명시하고, 외부에 퍼진 옛 정보(블로그·디렉터리)를 갱신 요청하세요. 이후 반복 측정으로 서술이 바뀌는지 확인합니다.

출처

A = 플랫폼 공식·방법 공개 연구 · B = 방법을 밝힌 벤더/실무 연구 · C = 방법·출처 없는 주장. 이 글은 A·B 출처의 사실만 수치로 씁니다.

관련 용어

함께 읽기