본문 바로가기
← 목록으로

ChatGPT의 검색 엔진 활용 방식: 검색 결과부터 인용까지의 전 과정

think.resoneo.com조회수 017시간 전

핵심

ChatGPT는 웹 검색 답변을 생성할 때 검색 엔진에서 제목, 주소, 약 200자의 스니펫(snippet) 세 부분만 추출하여 사용한다. 실제 페이지를 여는 경우는 80회 중 1회 미만이며, 그나마 사유 모드(thinking mode)에서만 발생한다. 나머지 경우 다른 시점에 다른 누군가를 위해 생성된 세 줄 분량의 텍스트가 페이지를 대신한다.

연구 방법론

분석 대상: 2026년 7월 캡처된 1,249개의 실제 ChatGPT 답변

측정 도구:


ChatGPT가 검색 결과에서 가져가는 것

규모별 현황

엔진 선택: 모드와 질문 유형에 따라 결정

즉시 모드(무료 계정): 라브라도(labrador, OpenAI 자체 인덱스) 중심

사유 모드(유료 계정): Google 스크랩(bright) 중심으로 전환

즉시 모드에서 질문의 유형이 엔진 선택을 결정하지만, 사유 모드에서는 네 가지 질문 유형 모두에서 Google로 수렴한다.


OpenAI의 세 가지 검색 엔진

1. Labrador(라브라도): OpenAI의 자체 인덱스

정의: 검색 엔진을 스크랩하지 않고 자체 구축한 인덱스로, 뉴스 피드, 과학 저장소, 파트너 플랫폼으로 보충된다.

특징:

Labrador은 Bing의 재브랜딩이 아님:

Labrador은 라이선싱 카탈로그도 아님:

2. Bright: Google의 스크랩

특징:

결론: Google 첫 페이지와의 높은 일치율과 Bing과의 낮은 일치율은 bright가 Google을 스크랩하고 있음을 강하게 시사한다.

사유 모드에서의 우위: 사유 모드에서는 시간의 4분의 3을 bright(즉, Google)에서 실행한다.

3. Labrador (뉴스): 재작성 요약


검색 결과에 대한 Google의 영향력

Google 토큰의 암호화: Google이 상품 캐러셀에서 제거되었지만, Google 상품 ID는 사용자가 카드를 클릭할 때 발동하는 요청에서 암호화된 블록 옆에 여전히 남아 있다.

여전히 기능적 의존성: OpenAI의 내부 카탈로그(머천트 피드로 구성)가 카매로 상품을 공급하지만, 이 카탈로그는 모든 것을 처리할 수 없다.

OpenAI는 의존성을 보이는 스트림(stream)에서는 감췄지만, 클릭 시에만 발동하는 레이어에서는 유지하고 있다.

타이밍 일치(인과관계 아님): Google의 SerpApi에 대한 항소 기각 2일 후(7월 21일) 엔진 필드가 제거됨. 달력 일치로 표시되지만, 측정상 인과관계를 증명하지는 못한다.


검색 규모의 차이: 즉시 vs 사유

| 항목 | 즉시 모드 | 사유 모드 | |------|----------|----------| | 검색 팬아웃 | 1 | 6 | | 가져온 페이지 | 11 | 100 | | 고유 도메인 | 8 | 28 | | 실제 열어서 읽은 페이지 | 0 | 1/6 대화당 1개 | | 주요 엔진 | labrador | scraped Google (bright) |

사유 모드는 즉시 모드보다 9배 더 넓게 도달하며, 한 질문에서 수백 페이지에 달할 수 있다.


엔진 필드의 제거

변화 기록 (2026년 7월 26일 측정)

7월 21일 이전: 모든 결과가 엔진을 명시

7월 21일: 엔진 필드가 스트림에서 사라짐

7월 22일 이후: 어떤 답변도 결과의 출처를 명시하지 않음

증거: 1,249개 답변의 코퍼스 중, result_source 필드는 760개에 나타나고 489개에는 나타나지 않음. 마지막 라벨이 있는 스트림은 7월 21일, 첫 번째로 완전히 벗겨진 날은 7월 22일.


모델이 실제로 받는 것: 세 가지 형식

페이지가 어떤 엔진을 통해 오든, ChatGPT가 받는 것은 정확히 검색 엔진 결과처럼 보인다: 각 페이지마다 제목, 스니펫, URL. 그 이상도 이하도 없다.

Bright(Google 스크랩)

Labrador(자체 인덱스)

Labrador(뉴스)


Labrador 스니펫의 구조: 200자 규칙

Labrador의 인덱스에 저장된 스니펫은 200자를 조금 넘어서 자르며, 메타데이터(메타 설명)가 아니라 페이지의 렌더링된 본문 시작 부분에서 가져온다.

스니펫 구성 순서

  1. H1 앞의 콘텐츠 (평균 7자)
  2. H1 헤딩 자체 (중앙값 51자)
  3. 실제 콘텐츠 (약 146자)

H1 기준 8회 중 7회 스니펫에 포함된다. 자름은 거의 절대 H1 중간에 떨어지지 않는다: 400개 스니펫 중 4개만 잘림.

스니펫 시작 전의 콘텐츠 손실

사람들이 가정하는 것이 아닌 것들이 스니펫의 시작 부분을 먹는다. 패ンくず표시와 바이라인은 미미하고, 진정한 손실은:

  1. 섹션 키커, 카테고리: 29% 빈도, 18자 손실
  2. 첫 번째 이미지 대체 텍스트 (제목 바로 아래): 9% 빈도, 50자 손실 (최대)
  3. 게시 또는 업데이트 날짜: 11% 빈도, 25자 손실
  4. 사이트/브랜드명: 7% 빈도, 44자 손실
  5. 저자 바이라인: 3% 빈도, 45자 손실
  6. 패んくずくず표시: 7% 빈도, 23자 손실

중요한 발견: H1 마크업 없음

조사한 페이지 7개 중 1개는 H1 마크업이 전혀 없다. 이 경우 앵커링은 예측 불가능해진다: 스니펫이 템플릿이 선택한 어떤 소제목에서 시작되며, 더 이상 콘텐츠 관리자는 아무것도 제어할 수 없다.

스니펫 선택 방식

스니펫은 질문에 기반하지 않는다. 같은 보도자료의 7개 지역 변형을 같은 요청으로 검색하면 7개의 다른 앵커 지점을 생성한다. 또한 검색 시간에 구성되지 않는다: 서로 다른 여러 질문 하에서 본 페이지의 대다수는 정확히 동일한 스니펫을 반환한다. 크롤 시간에 동결되고 오래된다.

실전 조언

즉시 모드에서의 그라운딩 예산은 전체 제목 + H1부터 시작하는 약 150자의 실질적인 콘텐츠다.


인덱스와 읽기 캐시: 두 가지 다른 저장소

정의

| 항목 | 인덱스 | 읽기 캐시 | |------|--------|----------| | 보유 내용 | 짧은 스니펫, 크롤 시간에 동결 | 전체 페이지, 이미 Markdown 변환됨 | | 접근 방식 | 쿼리, 키워드 | 주소, 정확한 URL | | 목적 | 페이지 찾기 | 페이지 읽기 | | 작성자 | OAI-SearchBot | ChatGPT-User 및 OAI-SearchBot | | 업데이트 트리거 | SearchBot 방문 및 그것뿐 | 사용자 요청, 30분 후 | | 수명 | 만료 관찰 안 됨; 스니펫 13%는 크롤로부터 1개월 이상 뒤처짐 | 만료 관찰 안 됨; 수주에서 수개월 | | 측정 방법 | API Crawled 필드 (로그에 흔적 없음) | ChatGPT-User가 서버 로그에 나타남 |

중요한 구별: 두 저장소가 같은 페이지를 보유하지 않는다. 인덱스에 있는 모든 URL이 읽기 캐시에 나타나는 것은 아니다. 찾을 수 있는 것과 읽을 수 있는 것은 다른 것이다.

읽기 캐시의 나이 측정

신선도: 30분

이 창 아래에서는 페이지가 전혀 다시 열리지 않는다. 한 사용자가 오후 2시에 페이지를 요청하고 다른 사용자가 2:29 PM에 요청하면: 2 PM 사본이 두 번째 사용자가 받는 것이고, ChatGPT는 페이지가 변경되었는지 확인하기 위해 돌아가는 것조차 신경 쓰지 않는다.

보유: 수개월

새로운 요청이 없으면 사본이 폐기되지 않는다. 만료 관찰 안 됨.

메커니즘: 먼저 제공하고 나중에 확인하는 캐시다. 사본이 30분을 지나면, ChatGPT는 여전히 이전 버전을 표시한 후 백그라운드에서 새로고침을 진행한다. 새 버전은 다음 요청에서만 제공된다. 즉, 로그에 ChatGPT-User가 나타날 때, 그것은 현재 사용자를 위한 읽기가 아니라 다음 방문자가 이익을 받을 OpenAI의 캐시 새로고침이다.

캐시 증거 체인

테스트 사이트에서 무작위 지문이 제공된 페이지와 서버 로그에 동시에 기록되었다. 모델이 지문을 뱉어낼 때, 우리는 어떤 방문이 그것이 읽은 사본을 생성했는지 정확히 안다.

예시: 신선한 페이지, 아무도 읽지 않음, 연결이 없는 두 유료 계정

  1. 계정 A가 페이지 요청

    • 로그: 1개의 ChatGPT-User 히트
    • 지문 기록 = 2a2b
    • 사본이 방금 생성됨
  2. 22분 후 → 계정 B, 다른 세션, 다른 국가

    • 모델 답변: "... 2a2b ..."
    • 계정 A의 지문을 글자 그대로 반환
  3. 그 사이 서버가 본 것

    • 히트 없음
    • 계정 B는 우리 서버를 건드리지 않았음. 계정 A의 사본을 읽었음.

이중 증명: 지문이 동일하고 히트 카운터가 0이다.

캐시의 세부 발견

  1. 캐시는 사용자 간에 공유됨

    • 한 계정이 생성한 사본이 다른 계정(다른 국가, 다른 플랜)에 반환되며, 원본 서버에 도달하는 단일 히트도 없다
    • 캐시 키는 페이지 주소이지, 사용자가 아니다
    • 참고: 테스트 페이지는 Cache-Control: no-store 헤더를 보냈는데(명시적으로 캐싱 금지), 어쨌든 캐시되었다
  2. 세 개의 로봇, 하나의 인덱스, 하나의 캐시

    • ChatGPT-User: 읽기 캐시(전체 페이지) 구성
    • OAI-SearchBot: 인덱스(스니펫) 구성, 읽기 캐시도 공급 (다만 체계적이지는 않음)
    • 페이지를 방문했지만 온디맨드 읽기는 없었던 SearchBot의 페이지는 실제로 읽기 캐시에 있다
  3. ChatGPT-User는 절대 스니펫을 업데이트하지 않음

    • 역은 참이 아니다 (이것이 직관에 어긋나는 부분)
    • ChatGPT-User는 인덱스를 건드리지 않음
    • OpenAI의 인덱스와 서버 로그로 모두 날짜가 있는 페이지에서, 제공된 스니펫은 SearchBot 방문 범위 내 며칠을 추적한다
    • 그러나 ChatGPT-User는 두 로봇 중 더 최근인 경우가 대부분이다
    • 즉, 페이지를 읽으러 돌아오고, 전체 페이지 사본을 새로고침하지만, 그 어느 것도 검색이 표시하는 스니펫을 변경하지 않는다
  4. 학습 로봇(GPTBot)은 둘 다 들어가지 않음

    • 거의 모든 인덱스 항목이 GPTBot의 마지막 방문보다 더 최근이므로, 새로고침되지만 그것에 의해 새로고침되지는 않음
    • 읽기 캐시도 확인했고 같은 것을 검증함
    • 실질적 결과: 크롤되는 것과 사용 가능한 것은 두 가지 다른 것이다

주변 캐시

주 저장소 외에도, ChatGPT는 자신이 구성한 객체를 유지한다. 페이지처럼 읽혀지지는 않지만, 같은 방식으로 오래된다.

| 캐시된 것 | 관찰된 수명 | 결과 | |----------|-----------|------| | 뉴스 기사 요약 | 캡처 간 안정적 | 한 번 생성, 이후 반복적으로 제공 | | 상품 또는 엔티티 카드 (ChatGPT 사이드바) | 수주 또는 수개월 | 계정 간, 국가 간에도 동일 |

상품 카드의 시연이 두드러진다: 프랑스의 유료 계정과 미국의 무료 계정에서 클릭한 같은 상품은 정확히 같은 텍스트를 반환하며, 한 번 생성되었다.


캐시 협력 조사 (cross-measured, 2026년 7월)

Jérôme Salomon (Oncrawl의 기술 SEO 전문가)과의 협력으로 두 독립적 프로토콜이 각각 서로에게 답변한다: 서버 로그 및 API 한편, 워터마킹된 페이지와 계정 함대 다른 한편. Jérôme이 확립한 5가지 사실:

1. 매개변수가 웹 접근 없이 캐시를 검색함

external_web_access: false를 API에 전달하면 모델이 웹으로 나가지 않고 답변하도록 요청한다. 반환되는 모든 것은 반드시 저장소에서 온다. 이것이 발견 인덱스와 읽기 캐시가 존재한다는 구체적 증명이며, 전체 이전 섹션의 시작점이다.

2. 인덱스는 OAI-SearchBot으로 날짜 표시, 두 저장소는 같은 페이지를 보유하지 않음

Oncrawl 사이트의 한 섹션에서 OpenAI의 인덱스와 서버 로그로 모두 날짜가 있는 수십 개의 페이지. 제공된 스니펫은 SearchBot 방문 범위 내 며칠을 추적한다. 이 로봇이 두 저장소를 공급하는 이유는, 방문했지만 온디맨드 읽기가 없었던 페이지도 샘플 절반에서 읽기 캐시에 나타나기 때문이다. 그러나 그들이 같은 페이지를 보유하지는 않는다: 명확히 인덱스에 있는 페이지가 읽기 캐시에는 없었으며, 이는 검색이 인덱스에서 제공된다는 것을 확인한다. 따라서 인덱스는 비어있지 않고, 선택적이다: SearchBot 및 파트너 피드로 공급됨. 주의: 새로고침 온SearchBot방문은 규칙이지 법이 아니다. 스니펫의 소수가 몇 달 뒤처져 있고, 스니펫이 재크롤을 통해 계속 오래될 수 있다.

3. noindex 지시문이 무시됨

Jérôme이 실행한 분석이 이를 확인한다: 메타 로봇을 수행하는 페이지: noindex를 방문한 OpenAI의 로봇이 캐시에서 끝난다. 인덱싱 금지가 저장소에서 벗어나게 하지는 않는다.

4. 읽혀지는 것이 저장되는 것을 보장하지 않음

ChatGPT-User 방문이 캐시에 들어가는 것을 보장하지 않으며, 적어도 우리가 관찰할 수 있는 범위 내에서. 이 로봇이 실제로 방문한 페이지 중, 적어도 절반은 거기에 나타난다. 모두가 그렇다는 증명은 없고, 제한은 우리 기구에서 온다: 모델이 페이지를 열지 여부를 결정하므로, 시도하지 않자마자 테스트는 거짓 음수를 생성한다. 그 절반은 하한이고, 로봇 방문이 아마도 캐싱을 기계적으로 트리거할 것이다.

5. 보유 기간이 90일 이상으로 측정됨

마지막으로 기록된 OpenAI 로봇 방문이 91일 뒤로 간 페이지가 여전히 캐시에서 제공되었다. 다른 보유 측정과 달리, 시작점은 추정이 아니다: 서버 로그의 라인이다, 추론이 아니다. 이전 섹션의 30분 신선도 창과 혼동하지 말 것. 이것은 사본이 얼마나 오래 생존하는지, 다시 확인되기까지 얼마나 오래 걸리는지가 아니다.


Web Search API를 측정 기구로 (계약 외)

Jérôme의 직감이 맞았다: API는 응용 프로그램과 같은 기계를 내부 마커까지 노출한다. 엔진 자체는 API에서 선택할 수 없지만, 단서는 올바른 장소를 가리켰다: 파고들면 아무도 보지 않는 필드가 드러났다.

API 활용

POST /v1/responses에서 web_search 도구로, include: ["web_search_call.results"]를 요청한다. 모든 결과가 응용 프로그램 스트림이 절대 노출하지 않는 내부 메타데이터가 접두어로 붙는다.

세 가지 정보 조각 (분석한 7,782개 결과 전체):

이 중 어느 것도 문서화되지 않았고, OpenAI가 7월 21일 파이프라인 명명 필드가 제거된 방식처럼 제거하는 것을 막을 수 없다.

단어 예산의 지도: OpenAI의 출판사 계약 외부에서 측정됨

| 예산 | 적용 대상 | 읽음 | |-----|---------|------| | 25단어 | Guardian, ESPN, Washington Post, Bloomberg, Corriere, Spiegel… | 원인 미정 | | 100단어 | 11개 도메인 확인, 모두 알려진 라이선시: Le Monde, WSJ, Politico, Bild, Condé Nast, Hearst… | 계약 조항인 것 같음 | | 200단어 | 기본값, 나머지 모든 웹 | 정상 체제 |

값은 도메인 및 채널 쌍마다 상수이며, 올바른 키가 발견되면 잔차 분산이 없다. 도메인의 PDF는 도메인의 예산을 상속한다. 100 클래스는 자명하다. 25 클래스는 여전히 수수께끼다: 계약이 있는 출판사와 없는 출판사를 혼합하고, robots.txt 설명은 양방향의 반례로 반박된다.

지시문이 시스템 프롬프트에 명시됨

이 단어 한도는 API 발명이 아니다. 3월에 발표한 ChatGPT 시스템 프롬프트에 있었다: [wordlim N] 지시문(기본적으로 소스당 200단어)이 GPT-5.3 버전에 있다. API는 이제 서버 측, 소스별로 이를 확인한다. 어제 프롬프트가 명령한 것과 오늘 스트림이 측정하는 것 사이의 루프가 닫힌다.


인용 메커니즘: 어떤 페이지가 표시되고 왜

핵심 발견

총 61,332개의 URL이 측면 패널에 나타난다:

모델이 실제로 한 것:

대다수의 페이지는 모델이 열지 않고 인용된다. 열기는 예외다.

답변당 규모

중앙값 답변:

중앙값 열린 페이지: 0 (10개 답변 중 9개는 아무것도 열지 않음)

9개 페이지 중 10개는 패널 하단을 벗어나지 않는다. 선택되었고 모델에 전달되었으며, 답변에 잠재적으로 기여했지만, ChatGPT는 거의 중요성을 주지 않는다.

두 가지 인용 방식

ChatGPT: turn0search11 (0번 턴, 검색 계열, 11번째 결과) Gemini: PerQueryResult(index='6.2') (6번째 쿼리, 2번째 결과)

두 경쟁사, 두 아키텍처, 같은 엔지니어링 결정: 인용은 주소가 아니라 정렬된 캐시의 좌표다. 검색 시간에 저장소에 넣은 것이 쓸 시간에 인용될 수 있는 것을 결정한다. 나머지 (페이지 품질, 신선도)는 이전 단계를 생존할 때만 방정식에 들어온다.

열기 vs 단순 존재

| 상태 | 인용률 | |------|-------| | 모델이 열어서 읽음 | 74% | | 검색 URLs에만 존재 | 7% |

그러나 열기는 드물다. 80개 페이지 중 1개만 열린다. 그 열기는 유료 계정의 사유 모드에만 예약된다: 코퍼스의 759개 오픈 중 757개가 거기 있고, 2개만 무료 계층 대화가 단일 페이지를 연다.

모델이 여는 것

규제 자료, 공식 자료, 1차 자료가 매우 구체적이다. 트리 깊은 페이지, 거의 홈 페이지는 아니다.

영어 코퍼스에서 가장 열린 도메인: openai.com, anthropic.com, learn.microsoft.com, digital-strategy.ec.europa.eu, 뉴스룸 및 가격 책정 페이지.

메모리에서 인용된 URL

즉시 모드에서, 인용의 85%가 검색 네트 어디에도 나타나지 않는 URL을 가리킨다. 사유 모드에서는 31%다. 일부는 위젯(지도, 상품 카드, 엔티티 카드)에서 나온다. 나머지는 모델의 자체 메모리에서 작성된 브랜드 홈페이지처럼 보인다. 아직 둘을 구분할 수는 없다.

arXiv 사례 및 경고

arXiv가 코퍼스에서 2,600회 이상 나타난다. 인용 10회. 열린 적 없다.

스니펫 없이 도착하기 때문이라고 생각할 수 있지만, 반례가 결정적이다: arXiv가 스니펫으로 도착한 117회 중, 정확히 0회 인용되었다. 벗겨져서 무시되지 않고, 단순히 무시되었다.

Reddit도 같은 패턴: 대규모로 끌려가지만 거의 표시되지 않음. ChatGPT가 사전출판(preprint)과 Reddit 스레드를 읽어서 보기를 형성하고, 일반 웹 페이지만 독자에게 노출한다.

경고: arXiv나 Reddit을 ChatGPT의 가장 보이는 사이트로 나열하는 연구는 끌려간 페이지와 인용된 페이지를 구분하지 못하는 도구를 사용한다. 이 도메인들은 대규모로 끌려가고 실제로는 사용자에게 거의 표시되지 않는다.


다섯 가지 검색 표면

웹 검색: 제목과 200자

기초, 이전 섹션에서 다룸. 무료 모드에서는 자체 인덱스, 사유 모드에서는 Google 스크랩. 이것이 유일한 표면이며, 여기서 페이지 작업이 직접 계산된다.

뉴스: 기계가 재작성한 기사

한 라벨 아래 두 체제. 자체 인덱스를 통해 ChatGPT는 약 1,100자의 요약을 받는다 (다른 경로로 제공되는 스크랩 스니펫보다 6~8배 길다). 그 긴 요약은 라이선싱 특전이 아니다: 계약이 없는 수백 개 아울렛이 같은 대우를 받는다. 그리고 그것은 진정으로 재작성되었다, 추출이 아니라: 기사 제목으로 시작하는 것도 없고, 웹 어디에서도 축자로 찾을 수 없다.

로컬 및 지도: ID 포맷이 출처를 드러냄

여기서 사본은 사이트에서 오지 않고, 피드에서 온다: Yelp, TripAdvisor, Google Maps. 각 공급자는 ID 포맷으로 인식 가능하다.

가장 암시적인 사실: Yelp 표시가 있는 기록 중 거의 5분의 1이 비즈니스의 Google 비즈니스 프로필에서 복사한 링크를 수행하는데, Yelp 자체는 주소만 표시한다. OpenAI가 스티칭을 한다. 제공자 라벨이 각 필드의 출처를 알려주지는 않는다.

쇼핑: 웹 검색과 연결 없음

상품 캐러셀이 엔진과 단일 주소를 공유하지 않는다. ChatGPT 링크에서 잘 순위가 매겨진다고 해서 상품 카드에 들어가는 것은 아니다: 이들은 두 가지 다른 직업이다.

Amazon은 제품 오퍼에서 완전히 부재, 이름을 지정하는 질문까지. 상품 카드는 수주 동안 캐시된 객체, 모두에게 동일하다: 상품의 첫 조회에 있는 것이 나중에 잘 순위보다 더 가치가 있다.

이미지: 서버에 접근하지 않고 제공됨

이미지가 OpenAI에서 다시 호스팅된다. 인프라에 접근하지 않고 답변에 나타나므로, 로그에 흔적이 없다.

반직관적 세부: 사유 모드에서 썸네일은 Bing의 이미지 배달 네트워크를 통과한다. 이것이 우리의 전체 코퍼스에서 유일한 Microsoft 지문이다.

이 섹션의 핵심

이 5개 중 오직 1개만 전형적인 검색에 연결되어 있다. 다른 4개는 피드, 카탈로그, 헌신적 인덱스로 공급되며, 각 수직에 특정한 SEO 기법이 적용된다: 이미지 SEO, 로컬 SEO 및 Google 비즈니스 프로필, 쇼핑 피드. 웹 검색만 처리하는 ChatGPT 가시성 전략은 4개 문을 닫은 채로 둔다.


고려할 만한 질문

뉴스 전체 체인

OpenAI가 기사의 요약을 생성하고, 저장하고, 사용자에게 며칠 동안 제공하는데, 기사 자체는 약 8회 중 1회만 인용된다는 사실을 똑바로 볼 가치가 있다. 가치는 섭취 시 포착된다. 표시 시간에 반환되지 않는다. 사실을 제시하고 모두 자신의 결론을 내릴 수 있다.

새 페이지가 OpenAI 인덱스에 어떻게 들어가는가?

ChatGPT가 이미 알고 있는 페이지를 어떻게 가져오는지 안다. 페이지가 거기에 들어가게 하는 것이 무엇인지는 모른다. 16일 동안 모니터링된 도메인에서 페이지 하나도 들어가지 않았다. 4개 트리거가 병렬로 테스트 중: 고아 페이지, 한 번 읽은 페이지, 알려진 페이지에서 연결된 페이지, sitemap에 나열된 페이지. 답변이 이 중 어느 하나도 충분하지 않을 수도 있다.

그러나 하나의 결과가 이미 있지만, 인덱싱이 아니라 크롤링에 관한 것이다. GPTBot이 sitemap을 대략 하루에 한 번 다운로드하고 거기 나열된 URL을 따라가지 않았다: 8개 중 0개. 같은 아침에 링크를 통해 도달 가능한 모든 8개 페이지 (확인된 OpenAI 로봇에만 제공된 링크 포함)를 크롤링했다. Bingbot, ClaudeBot, GoogleOther는 정확히 그 반대를 했다: sitemap을 통해 나왔고 다른 건 없었다. OpenAI에서는 발견이 링크에서 실행된다. 크롤링은 여전히 인덱싱이 아니다.

긴 답변을 요청하면 더 검색하는가?

사유 모드에서, 인용 수가 명확히 답변 길이를 추적한다. 즉시 모드에서는 관계가 없다. 길이 지시가 더 큰 검색 예산을 야기하는지, 아니면 어려운 질문이 단순히 둘 다를 요청하는지는 모른다.

즉시 모드에서 스니펫이 없는 인용이 왜 그렇게 많은가?

즉시 모드에서 인용 중 1개가 스니펫이 없이 도착하는데, 사유 모드에서는 1% 미만이다. 두 가지 단서가 있다.

첫 번째, 우리 측정에서 지배적: URL이 검색에서 오지 않고, 모델의 파라메트릭 메모리(학습된 지식)에서 작성되며, 그 인용의 95%가 검색 네트 어디에도 나타나지 않는다.

두 번째, 미미한: 일부 채널이 스니펫을 전혀 수행하지 않는다 (forum, scientific, video), 하지만 그들은 5%의 경우만 설명한다. 그것은 5%의 URL이 진정으로 검색되고 빈 스니펫으로 제공되는 것을 남기며, 이를 둘 다 설명하지 않는다. 우리는 해결할 수 없다.

개방형 과제: 인용된 벗겨진 URL

여기서 우리가 깨뜨릴 수 없는 질문이며, 독립적인 측정을 원하는 대상이다.

일부 검색 결과가 제목, URL 및 그 이상 없이 도착한다. 잘린 스니펫도 아니다: 빈 것. YouTube, Reddit, arXiv를 제외하고 (거의 절대 수행하지 않음), 나머지는 일반 페이지다: ESPN, Yahoo Sports, Guardian, 비즈니스 디렉토리.

모델이 판단할 것이 없으므로 무시할 것을 기대할 것이다. 반대가 일어난다. 즉시 모드에서, 스니펫이 없는 결과가 14.9% 시간에 인용되는데, 스니펫이 있는 결과는 8.2%: 모델이 2배 적게 알면서 2배 자주 인용된다.

우리의 단서는 충분하지 않다. 로컬 질문에서 스니펫 부재는 대화당 총계이며 지도 표시와 일치하므로, 링크 목록이 단순한 풍경이고 지도가 답변을 수행하는 것처럼 보인다: 인용을 설명할 것이다, 누락된 스니펫을 아닐 것이다. 뉴스 질문에서 메커니즘이 다르고, 부재가 URL에 고착되며 한 대화에서 다음 대화로 같은 페이지를 따른다.

현상을 재현할 수 있거나 설명이 있으면, 우리에게 쓰라. 프로토콜은 짧다: 즉시 모드에서 서버 스트림을 캡처, 유형 검색의 결과 격리, YouTube, Reddit, arXiv를 제외한 다음, 스니펫 있음/없음을 비교한 인용률. 사유 모드는 같은 방식을 비교하지 않으므로, 너무 많은 URL을 끌어와서 인용률이 그 의미를 잃는다.


OpenAI가 Bright Data 이름을 자신의 코드에 쓴다

상품 캐러셀이 벤더 이름을 명확하게 명명하는 서버 측 실험 할당 블록을 실행한다. 7월 22일의 3개 대화에서:

"analytics_meta": {
  "ab_test.search_engine_all.layer_name": "sonic_search_engine_all",
  "ab_test.search_engine_all.group_name": "",
  "ab_test.search_engine_all.allocated_experiment":
      "shopping_brightdata_new_feed_serving_week_2026_06_22"
}

이 이름은 브라우저에 전송된 구성에 나타나지 않는다: 할당은 순전히 서버 측이며, 이 측정 블록을 통해서만 누출된다. result_source 필드(정확히 네 값 중 하나가 bright다)에 대항하여, 가장 간단한 읽음은 이 엔진이 Bright Data라는 것이다.


기타 관찰

라우팅 결정론이 없음

동일 프롬프트가 이틀 뒤에 같은 계정에서 엔진을 완전히 전환할 수 있다. 재생 프롬프트의 3분의 1이 완전히 뒤집힌다. 단일 캡처에서 어떤 결론도 성립하지 않는다.

신선도 단어는 영향을 주지 않음

"오늘", "지금", "이 주말"을 질문에 쓰는 것도 측정 가능한 것을 바꾸지 않는다. 라이브 검색을 트리거하는 것은 수직과 요청된 사실의 실제 휘발성이다.

CSS로 숨겨진 텍스트도 읽혀짐

온디맨드 읽기에서, 스타일 규칙으로 숨겨진 모든 것이 모델에 전달된다. 이를 관찰된 능력으로 문서화하지만, 사용할 전술로서는 아니다.

구조화된 데이터가 전송되지 않음

온디맨드 읽기에서, JSON-LD가 모델에 도달하기 전에 문서에서 제거된다. 주의: 이것은 인덱스가 그것으로 무엇을 하는지는 아무것도 말하지 않으며, 그것은 다른 단계다.

페이지가 모델에 Markdown으로 도착함

온디맨드 읽기에서, HTML이 모델에 도달하기 전에 Markdown으로 변환된다. 중요한 미묘함: 이 단계에서 변환이 아무것도 정리하지 않으며, 메뉴와 푸터가 모든 것과 함께 통과한다. 인덱싱 시간에, 스니펫을 구성하는 단계에서, 상용구가 제거된다. 인덱스와 읽기 캐시에서 유지되는 것도 HTML이 아니다: 페이지가 거기 Markdown으로 저장된다, 이미 변환됨.

4메가바이트를 초과하면 페이지가 읽혀지지 않음

부분 읽음, 자르지 않음: 페이지가 완전히 거부된다. 실제로 거의 어떤 페이지도 그 크기에 도달하지 않는다.

최고의 인용이 태그 없이 도착함

ChatGPT가 표시되는 링크의 95%에 utm_source=chatgpt.com을 추가하고, 즉시 모드에서는 100%에 추가한다. 한 가족이 체계적으로 이를 피한다: 모델이 열어서 읽은 페이지는 절대 그 매개변수를 수행하지 않는다. 즉, 가장 가치 있는 인용, 실제로 읽은 페이지에서 나온 인용이, 정확히 분석 도구가 ChatGPT에 귀속시키지 못할 것이다.

답변 캐시가 검색을 단락함

서버 구성이 24시간 유효한 인스턴트-답변 캐시를 설명하며, 0.5초 미만에서 쿼리되고, 의미적 유사성으로 트리거됨. 이미 질문이 충분히 가까우면, 검색이 일어나지 않는다.