ChatGPT 유출 데이터로 밝혀진 웹 페이지 청크 순위 체계
핵심
ChatGPT 유출 데이터는 다단계 하이브리드 검색 구조를 사용한다는 증거를 제시한다. 검색 결과 페이지는 개별 청크(chunks)로 분할되며, 각 청크는 신경망 관련성 점수(neural relevance weights)로 평가된다.
조사 배경
Peec AI 연구팀이 SSE(Server-Sent Events) 데이터에서 점수, 스키마 등 주요 정보를 발견했다.
조사 시작점은 쇼핑 비교 프롬프트였다. "300달러 이하의 최고 무선 노이즈 캔슬링 헤드폰은? Sony WH-1000XM5, Bose QuietComfort 헤드폰, Sennheiser Momentum 4를 비교해줘"라는 질문에 ChatGPT가 5개의 제품 카드(Sony WH-1000XM5, Bose QuietComfort Headphones, Sennheiser Momentum 4 Wireless, Sony ULT Wear, Soundcore Space One Pro)로 답변했다. 같은 대화 턴에서 4번의 웹 검색을 수행하고 96개 페이지를 불러왔다.
주요 발견
다단계 하이브리드 검색 구조 증명
기존 논쟁: ChatGPT가 전체 웹 페이지를 평가하는지, 아니면 개별 청크를 평가하는지에 대해 의견이 갈렸다.
결론: 두 주장 모두 불완전했다. ChatGPT는 **다단계 하이브리드 검색 계층(multi-stage hybrid retrieval hierarchy)**을 사용한다.
핵심 메커니즘
- 미리 인덱싱된 페이지: 검색 인덱스 캐시에서 미리 점수 매겨진 청크 조각을 불러온다. 신경망 관련성 점수를 1.0000으로 정규화하여 페칭 페이로드에 그대로 포함한다.
- 신규 또는 미인덱싱 페이지: 런타임에 수백 개의 작은 조각으로 분할한다.
수학적 증거: 최대값 정규화
SoundGuys 비교 URL(https://www.soundguys.com/sony-wh-1000xm5-vs-bose-noise-cancelling-headphones-700-71868/)의 검색 결과 기록에는 3개 청크와 3개 점수가 포함됐다.
- 신경망 랭커(sonic-re-fh-chunk-ev3-sx4)의 세 번째 청크 원점수: 0.9983865023
- 페이지 내용 구조의 같은 청크: 정확히 1.0000
- 다른 두 청크도 유사한 비율로 재조정됨
검증 범위
96개 페이지 중:
- 76개는 미리 인덱싱된 페이지(labrador)로, 원점수 대 페이지 비교 가능
- 모든 76개 페이지에서 청크 개수와 순서가 일치
- 웹, PDF, Reddit, YouTube, Wikipedia 결과(68개): 최상단 청크가 정확히 1.0
- 뉴스 결과(8개): 정확히 0.5
- 청크 간 비율: 소수점 4자리까지 일치(중앙값 편차 0.00001, 최악의 경우 0.0008)
정규화 계수는 비트 단위로 정확하지 않아 청크마다 소수점 6자리에서 변동하나, 정확한 산술 방식은 현재 분석 중이다.
인용 마크업 해석
SoundGuys 청크가 검색 결과에서는 1,289자였으나 페칭된 페이지에서는 1,279자인 이유:
- 검색 결과: 【28†Image: Bose Noise Canceling Headphones 700-6-2】 같은 인용 앵커 포함
- 모델에 전달되는 페이지 표현: 앵커 래퍼는 제거, 링크 텍스트만 유지
시스템 특성
ChatGPT 전체 검색 시스템은 다층 하이브리드 방식으로 작동한다.
- Statsig A/B 변형 및 모델 선택이 검색 설정을 변경
- "Instant", "Medium", "High" 설정에 따라 구성 변경
- 동적 시스템이므로 언제든 변경될 수 있음
FAQ
Q. 모든 데이터를 공개하지 않는 이유?
A. 단일 JSON 덤프가 200,000줄을 초과할 수 있다(프롬프트 하나, 즉시/중간/높음/쇼핑/비교 쿼리 등 여러 설정 사용). 수동 검토에 시간이 소요되고, 테스트 계정 보안을 위해 자동화하지 않음.
Q. 왜 Claude, Gemini, ChatGPT로 요약하지 않는가?
A. 컨텍스트 윈도우 제한으로 인해 필연적으로 부분이 생략되므로, 팀이 수동으로 읽고 분석하는 방식이 더 효과적.
Q. 이 발견을 바탕으로 실험을 시작했는가?
A. 초기 발견을 바탕으로 실험을 적극 진행 중이므로 Peec AI를 팔로우하기를 권장함.
Q. 이 유출에서 눈에 띄는 세 가지 키워드?
A. 의미론(semantics), 진정한 독창성(originality), 권위성(authority)
주요 주의사항: 모든 발견은 ChatGPT UI에서 나온 것이며, API에서 얻은 것이 아니다. 시스템 구성은 언제든 변경될 수 있다.