GEO 논문이 말하는 것 — KDD 2024 연구에서 통한 방법과 안 통한 방법

XeoLab 편집팀 · 최종 수정 2026-10-07 · 읽는 시간 약 6분

핵심 요약

KDD 2024에 발표된 GEO 논문은 1만 개 질의 벤치마크(GEO-bench)에서 9가지 콘텐츠 전략을 실험했습니다. 인용문 추가·통계 추가·출처 인용 추가가 가시성을 가장 많이 높였고(초록 기준 최대 40%), 전통 SEO의 키워드 반복은 기준선보다 오히려 낮아졌습니다. 단, 2023년 GPT-3.5 기반 시뮬레이션이라 실제 상용 AI 검색의 수치와 같지는 않습니다.

어떤 연구인가

Aggarwal 외 6인(프린스턴·조지아텍·앨런 AI 연구소·IIT 델리)이 2023년 11월 arXiv에 올리고 2024년 KDD에서 발표한 논문입니다. '생성형 엔진 최적화(GEO)'라는 용어를 학술적으로 정의하고, 효과를 잴 수 있는 벤치마크를 처음 만들었습니다.

GEO-bench는 다양한 도메인의 사용자 질의 1만 건(학습 8,000·검증 1,000·테스트 1,000)으로 구성됩니다. 실험용 생성 엔진은 구글 상위 5개 결과를 소스로 GPT-3.5가 답을 만드는 구조였습니다.

실험한 9가지 전략

연구진은 같은 페이지를 아래 9가지 방식으로 고쳐 넣고, 생성된 답변 안에서 그 페이지가 차지하는 비중(위치 보정 단어 수)과 주관적 인상 점수를 비교했습니다.

  • 출처 인용 추가(Cite Sources) · 인용문 추가(Quotation Addition) · 통계 추가(Statistics Addition)
  • 쉬운 문장(Easy-to-Understand) · 유창성 개선(Fluency) · 고유 단어(Unique Words) · 전문 용어(Technical Terms) · 권위적 어조(Authoritative)
  • 키워드 반복(Keyword Stuffing) — 전통 SEO 기법

결과: 근거를 붙인 글이 이겼다

위치 보정 단어 수 기준(기준선 19.5)에서 상위 세 전략은 다음과 같았습니다.

  • 인용문 추가 27.8 — 기준선 대비 약 43% 상승
  • 통계 추가 25.9 — 약 33% 상승
  • 출처 인용 추가 24.9 — 약 28% 상승
  • 키워드 반복 17.8 — 기준선(19.5)보다 하락

이 결과를 어떻게 읽어야 하나

초록의 '최대 40%'는 최고치이지 평균이 아니고, 실험 엔진은 실제 ChatGPT나 구글 AI 모드가 아닌 2023년 GPT-3.5 시뮬레이션이며 질의는 영어입니다. 그래서 '실제 ChatGPT에서 40% 오른다'로 옮기면 틀립니다.

그럼에도 방향은 분명합니다. 생성 엔진은 근거(출처·통계·인용문)가 붙은 문장을 선택하고, 검색엔진에서 통하던 키워드 반복은 통하지 않습니다. 논문은 전략 효과가 도메인마다 달라 도메인별 최적화가 필요하다고도 덧붙입니다. XeoLab이 '수식어 대신 사실 문장, 출처 있는 숫자'를 콘텐츠 원칙으로 두는 근거입니다.

자주 묻는 질문

이 논문대로 하면 ChatGPT에 바로 나오나요?

아닙니다. 논문은 통제된 실험이고 실제 엔진은 색인·제3자 근거·모델 기억이 함께 작용합니다. 다만 '근거 있는 글이 선택된다'는 방향은 실제 운영에서도 유효하며, 효과는 반복 측정으로 확인해야 합니다.

출처

A = 플랫폼 공식·방법 공개 연구 · B = 방법을 밝힌 벤더/실무 연구 · C = 방법·출처 없는 주장. 이 글은 A·B 출처의 사실만 수치로 씁니다.

관련 용어

함께 읽기