ChatGPT에 한 번 물어본 결과는 왜 믿으면 안 되나
XeoLab 편집팀 · 최종 수정 2026-10-07 · 읽는 시간 약 4분
핵심 요약
같은 질문을 같은 AI에 던져도 답은 매번 조금씩 다릅니다. AI가 검색을 할지 말지, 어떤 출처를 고를지에 무작위성이 있기 때문입니다. 그래서 한 번 물어본 결과로 '나온다/안 나온다'를 판단하면 안 되고, 하루 여러 번·여러 날 측정해 주 단위 추세로 읽어야 합니다. 무료 간이 진단은 '참고용 한 장면'입니다.
AI 답변은 왜 흔들리나
OpenAI는 공식 문서에서 자사 모델 API가 '기본적으로 비결정적(non-deterministic by default)'이라 같은 요청에도 출력이 달라질 수 있고, 재현용 seed를 써도 결정성은 보장되지 않는다고 밝힙니다. 같은 프롬프트를 반복 요청한 학술 연구에서는 벤치마크에 따라 문제의 47.6~75.8%에서 동일한 출력이 한 번도 나오지 않았고, temperature를 0으로 둬도 결정성이 보장되지 않았습니다. 이것은 특정 도구의 한계가 아니라 LLM의 성질입니다.
한 번 측정이 만드는 착각
오늘 아침 ChatGPT가 우리를 1위로 추천했다고 해서 내일도 그렇다는 보장이 없습니다. 반대로 한 번 안 나왔다고 노출이 0인 것도 아닙니다. 영업 자료의 '이렇게 나옵니다' 캡처 한 장은 그 시각·그 계정의 한 관측일 뿐입니다.
반복 측정의 최소 조건
- 같은 질문 묶음을 고정하고(바꾸면 비교 불가)
- 하루에 시간대를 나눠 여러 번 측정해 일 단위로 묶고
- 최소 1~2주 추세로 판단하며
- 수집 조건(AI·계정·지역·시간)을 기록해 둡니다.
간이 진단은 이렇게 읽자
무료 간이 진단은 '지금 이 순간 AI가 우리를 아는가'를 보는 입구입니다. 결과가 좋아도 나빠도 그 자체를 성과나 실패로 읽지 말고, 정식 측정으로 추세를 확인하는 계기로 쓰는 것이 맞습니다.
출처
A = 플랫폼 공식·방법 공개 연구 · B = 방법을 밝힌 벤더/실무 연구 · C = 방법·출처 없는 주장. 이 글은 A·B 출처의 사실만 수치로 씁니다.
- A · 공식/방법 공개OpenAI Cookbook — Reproducible outputs with the seed parameter— 'non-deterministic by default' 공식 문구
- A · 공식/방법 공개Ouyang 외, 「An Empirical Study of the Non-determinism of ChatGPT in Code Generation」, ACM TOSEM (arXiv 2308.02828)— 코드 생성 도메인 — 'LLM 출력은 같은 입력에도 달라진다'의 일반 근거로만