가짜 통계 5만 개로 챗GPT 인용 유도하기 — 실험 결과와 GEO 전략
metehan.ai조회수 01일 전
핵심
필자는 7개월 전 완전히 거짓인 통계 5만 개를 담은 웹사이트를 런칭했다. 구글은 이를 색인 해제(디인덱싱)했지만, ChatGPT는 지금도 계속 인용하고 있다. 330개 이상의 참조 도메인이 링크하고 있으며, 학술논문과 은행 투자 보고서에까지 등재되었다.
실험의 배경
아이디어의 출발점
- 필자의 장기 연구인 대형언어모델(LLM), 연관성 엔지니어링(relevance engineering), 근거 기반 답변(grounding)에서 출발
- 팀들이 LLM으로 신속하고 최근의 콘텐츠를 작성할 때, 모델들은 자신의 지식 격차를 메우기 위해 신뢰할 수 있어 보이는 데이터를 찾아야 한다는 패턴 발견
- 통계는 정확히 LLM이 찾는 것
- GEO(AI 검색 엔진 최적화) 조언은 보통 한 순간에만 집중: 브랜드를 AI 답변에 포함시키는 것. 이 실험은 그 이후를 본다 — 사람들이 그 결과물을 프레젠테이션, 쇼핑 목록, 웹사이트에 옮겨 담을 때 일어나는 일
사전 연구
- Seer Interactive가 2025년 8월 발표한 연구가 영감 제공
- 2026년 3월에 테스트를 위한 사이트 구축 시작
실험 설정: 하루에 만든 5만 개의 거짓 통계
웹사이트 구성
- 도메인: stateglobe.com (새로 구매)
- GPT-4.1로 하루 만에 통계 페이지 5만 개 생성
- SEO, 콘텐츠 마케팅, 소셜 미디어, 전자상거래, 웹 기술에 관한 통계 수록
- 200개 국가 대상
- 모든 숫자는 완전히 조작 — 단 하나도 검증하지 않음
- 기본 AI 웹 디자인 템플릿 사용
- 비용: 약 $30
- 나중에 15,000개의 리스티클(listicle, 리스트+에세이) 추가: 약 $20 추가
- 총 비용 약 $50
반응
- Growth Memo에 소개되며 큰 주목 받음
- 출중한 결과를 보여주면서도 AI 검색 결과에 대한 사람들의 우려를 드러냈기 때문에 반응이 열정적
실제 일어난 일
구글은 즉시 사이트를 매장했다
- 초기: 트래픽, 색인, 참여도 양호
- 인덱서 도구로 1주일 내에 대부분 색인, 구글 검색 결과 노출
- 런칭 직후 두 개의 구글 업데이트가 나옴 → 구글 가시성 급락
- 지난 7개월간 구글에서 거의 보이지 않음
- 색인된 페이지: 5~20 임프레션(노출수) 사이를 오감
- 서브도메인 시도로 임프레션 증가 시도 → 효과 미미
- 사이트 외 조치 없음. 일부 페이지는 로드되지 않을 수도 있음
그러나 ChatGPT는 절대 멈추지 않았다
구글 매몰 이후 7개월간 ChatGPT의 활동
- Cloudflare 크롤 데이터 확인:
- 지난 30일간 600,000회 이상의 봇 요청
- 약 72,000회는 ChatGPT-User 에이전트 (ChatGPT가 실시간으로 페이지를 열 때 사용하는 사용자 에이전트)
- 이는 학습용 크롤이 아니라 실제 질문에 답하기 위해 거짓 통계 페이지를 가져오는 것
- 구글이 잊은 지 7개월 후, 사이트에는 330개 이상의 참조 도메인 링크
- Ahrefs와 Semrush 데이터
- Shopify, DHL, Bluehost 같은 유명 브랜드 포함
ChatGPT는 지금도 계속 인용하고 있다
- 런칭 이후 7개월이 지난 지금도 인용과 트래픽 계속 발생
- Tomek의 ChatGPT 인덱스 연구에 따르면 ChatGPT는 구글 상위 10개를 단순 복사하지 않음
- 프롬프트를 자체 부쿼리(팬아웃 쿼리)로 재작성
- 검색 소스와 자체 캐시에서 후보 검색
- 재순위 지정
- 소수의 페이지를 열어 답변의 근거 제공(grounding)
- GA4: 2026년 3월 이후 ChatGPT에서만 10,000회 이상 세션
- Cloudflare: 사이트가 검색에서 높은 평점
- Peec 합류(2026년 6월) 직후 설정한 시각화 대시보드에서 추적 중인 몇 개 프롬프트: 현재도 성능 우수
- 2026년 10월 7일: stateglobe.com이 이 프롬프트들에서 두 번째 순위 (데이터 강국 Statista에만 뒤짐)
주요 교훈
1. 검색 순위 ≠ LLM 검색성(retrieval)
-
가장 중요한 교훈: 구글 순위와 LLM의 검색가능성은 완전히 다른 문제
-
LLM 검색 메커니즘
- 구글의 상위 10개를 복사하지 않음
- 프롬프트를 팬아웃 쿼리(fanout queries)로 세분화
- 캐시와 검색 소스에서 후보 추출
- 순위 재지정 후 소수 페이지 열기
- 한 페이지가 구글에서 완전히 보이지 않아도 LLM의 모든 단계에서 잘 작동 가능
-
StateGlobe 사례
- 구글에서는 매장 → AI 검색 봇은 계속 돌아옴
- GEO 관점: 구글 순위는 신호일 뿐 전부가 아님
- 구글만 추적하면 구글이 "아니오"라고 해도 작동하는 채널을 놓친다
2. 거짓 데이터가 실제 인용이 되었다
StateGlobe는 100% 거짓 데이터로 구성 (저비용 모델, 프롬프트는 국가·주제 목록 + 두 문장)
- 인용 사례
- 학술논문 인용
- 카타르 최대 금융그룹의 투자 연구 사용
- 인도 경제 언론 인용
- 캐나다 인플루언서 커뮤니티 연구 보고서 소스
참고: 이는 StateGlobe로 역링크된 인용만. 링크 없이 데이터를 재사용한 경우는 훨씬 많을 것으로 추정
3. 불편한 함의: 인용 세탁(Citation Laundering)
-
메커니즘
- 1일차: StateGlobe의 거짓 숫자 = 권위성 0, 신규 도메인의 무작위 통계
- 학술논문 인용 → 은행 인용 → 다음 사람 또는 모델이 이 숫자를 발견할 때는 심각한 기관이 인용한 출처가 있는 통계로 보임
- 거짓 데이터가 진짜가 되진 않지만 모든 인용이 신뢰성 있어 보이게 함
-
잠재적 악화 시나리오
- 많은 검색과 인용 후 페이지가 웹 크롤에 포함
- 웹 크롤이 학습 데이터가 됨 (발생하지 않기를 바람)
- GPT-4.1 추측에서 시작한 숫자 → 다음 모델이 "알게 되는" 지식으로 변환될 위험
-
더 큰 위험과 해결책
- 이 실험이 제시하는 더 큰 위험: 출처 검증이 작가와 연구자 업무의 필수 부분이 되어야 함
실제 데이터로 진행한 추가 실험
Peec 합류 후 GEO 연구팀과 함께 같은 테스트를 실시 (이번에는 진정한 데이터 사용)
- 조작 없음, 모든 통계 검증 및 출처 표기
- URL: peec.ai/ai-search-geo-statistics
- 결과: AI 콘텐츠 작성 도구 사용 의심되는 사이트들이 즉시 링크 시작
- 통계 콘텐츠 발행으로 링크 얻기는 가설이 사실임을 두 번째로 증명
왜 LLM은 통계 페이지를 인용하는가?
메커니즘
- 점점 더 많은 콘텐츠가 LLM으로 작성됨
- LLM이 작성할 때는 적절한 주제 연구
- 격차가 생기면 숫자를 찾아 채움
이유들
리서치 = 통계를 묻는 팬아웃 쿼리
- 리서치가 필요한 프롬프트 → 모델이 부쿼리로 세분화
- "통계", "데이터", "보고서", 현재 연도 같은 수정자(modifier) 추가
- 예: "원격근무에 관한 블로그 포스트 작성" → "원격근무 통계 2026" 검색
- 모델이 인간이 입력하는 것이 아닌 모델이 검색하는 방식에 최적화된 페이지가 LLM 결과에 더 자주 나타남
숫자는 지식 격차를 채우는 근거처럼 보인다
- 모델이 글쓰기 초안 작성 시 "원격근무가 증가하고 있다"는 페이지 인용 → 권위성 낮음, 모호함
- "직원의 X%가 주 1회 이상 원격근무" → 구체적, 인용 가능, 정보 추가
- 모델이 답변에 근거를 부여할 때 구체적 숫자가 가장 유용한 것
- 이 실험이 증명하듯이 그런 숫자가 항상 근거인 것은 아님
모델은 숫자를 검증하지 않는다
- 검색 근거 답변의 처리 예산이 타이트함 (지연시간, 비용)
- 시스템: 페이지 몇 개 가져오기 → 관련 구절 추출 → 작성 시작
- 사실 확인 불가
- 단일 통계 검증 = 독립 출처 찾기, 비교, 충돌 해결
- 수십억 프롬프트 × 수백만 사용자 = 검증 비용 (시간·돈) 합산 → 속도/비용 관점에서 불가능
- 해결책: 관련성을 평가하되 진실성은 평가하지 않는 리랭커(reranker) 사용
- 구절이 쿼리와 매치되고 권위 있어 보이면 사용
통계는 신선함 신호를 내장하고 있다
- ChatGPT의 최근성 편향(recency bias)
- 통계 페이지: 제목, 제목, URL에 연도 포함
- 세 가지 내장된 신호 → 모델이 페이지 내용이 최신임을 인식
통계 페이지를 올바르게 만드는 법
두 테스트가 증명하는 것: 통계 페이지는 LLM 인용을 받을 매우 강력한 방법. 거짓 데이터 생성은 절대 권장하지 않음
실행 방법 (Peec에서 성공한 방법)
-
한 문장에 한 주장
- 각 통계는 문맥 없이도 독립적으로 이해 가능
- 검색은 페이지 단위가 아니라 구절 단위로 작동
- 숫자가 위 단락 없이는 의미 없으면 추출 불가능
-
모든 숫자 옆에 출처와 연도 표기
- "According to [Source] (2026), X%..."
- 모델, 인간 에디터, 신뢰성에 모두 도움
- 정보 위생(information hygiene)의 작은 부분이지만 정보 환경 전체에 이로움
-
제목을 팬아웃 쿼리와 맞추기
- "[주제] statistics", "[주제] market size", "[주제] adoption by country"
- 사람들이 입력하는 키워드가 아니라 모델이 실행하는 검색 방식 고려
-
업데이트 날짜 표시 (그리고 실제로 업데이트)
- 신선함은 모델이 고려하는 실제 신호
- 오래된 통계 페이지는 최신 페이지에 진다
-
통계를 쉽게 가져올 수 있게
- 서버 렌더링 HTML 사용 (JavaScript, 탭, 이미지 뒤에 숨기지 말 것)
- robots.txt, CDN, WAF 규칙 확인
- 사이트가 무의식중에 AI 검색 봇을 차단할 수 있음
-
단순하게 유지
- Peec AI GEO 통계 페이지: 기본적으로 리스트
- 그 이상일 필요 없음
- 디자인 리소스는 실제로 디자인 이득을 볼 수 있는 다른 사이트/자산에 할당
-
가능하면 원본 데이터 추가
- 집계 통계: 소수 인용 가능
- 독창적 주장: 1차 출처가 될 수 있음
페이지가 선택되고 있는지 추적하는 방법
Google Search Console은 AI 봇 활동 표시 불가
대신 추적할 항목:
-
서버 로그 또는 Cloudflare의 AI 봇 활동
- ChatGPT-User, OAI-SearchBot, PerplexityBot 같은 검색 봇 확인 (학습용 크롤러 아님)
- Peec에는 이 기능 있음
-
GA4의 AI 추천 세션
- chatgpt.com, perplexity.ai 등 출처
-
프롬프트 세트 전체에서 인용 및 가시성 추적
- Peec은 자체 도구 사용
-
Ahrefs 또는 Semrush의 신규 참조 도메인
-
링크되지 않은 언급
- 따옴표로 정확한 숫자 검색
- 링크 없이 데이터를 사용하는 사람들 발견
윤리 관련
원칙
- 절대 거짓 콘텐츠 발행 금지
- 이 실험은 5만 개의 미검증 통계에 의존했지만, 결과를 공개하기 위한 것
- 웹사이트는 현재도 운영 중이며 면책 조항 포함
- LLM이 선택하길 바라는 콘텐츠 발행 시 항상 정확하고 접근 가능한 정보 발행
전망의 불확실성
- 이 전술이 계속 작동할 보장 없음
- 테스트했고 결과를 공개했으니, LLM이 이 격차를 메울 수 있음
- 현재는 작동, 미래는 불명
- 절대 악용되어선 안 됨
전략 위치
- 이는 전술이며, 조직의 GEO 전략 전체 근거가 되어서는 안 됨
- StateGlobe의 결과는 극단적
- 이 기법이 혜택을 볼 가능성이 높은 브랜드: 사람들이 이미 신뢰하는 조직
Peec의 향후 GEO 연구
- 이 정도의 실험 약 40개 진행 중
- 일부는 진행 중, 일부는 결과 나옴
- 장기 브랜드 전략 구축 = 테스트, 측정, 학습 공유
- 추가 결과 예정