본문 바로가기
← 목록으로

ChatGPT 유출 데이터로 밝혀진 웹 페이지 청크 순위 체계

metehan.ai조회수 029일 전

핵심

ChatGPT 유출 데이터는 다단계 하이브리드 검색 구조를 사용한다는 증거를 제시한다. 검색 결과 페이지는 개별 청크(chunks)로 분할되며, 각 청크는 신경망 관련성 점수(neural relevance weights)로 평가된다.

조사 배경

Peec AI 연구팀이 SSE(Server-Sent Events) 데이터에서 점수, 스키마 등 주요 정보를 발견했다.

조사 시작점은 쇼핑 비교 프롬프트였다. "300달러 이하의 최고 무선 노이즈 캔슬링 헤드폰은? Sony WH-1000XM5, Bose QuietComfort 헤드폰, Sennheiser Momentum 4를 비교해줘"라는 질문에 ChatGPT가 5개의 제품 카드(Sony WH-1000XM5, Bose QuietComfort Headphones, Sennheiser Momentum 4 Wireless, Sony ULT Wear, Soundcore Space One Pro)로 답변했다. 같은 대화 턴에서 4번의 웹 검색을 수행하고 96개 페이지를 불러왔다.

주요 발견

다단계 하이브리드 검색 구조 증명

기존 논쟁: ChatGPT가 전체 웹 페이지를 평가하는지, 아니면 개별 청크를 평가하는지에 대해 의견이 갈렸다.

결론: 두 주장 모두 불완전했다. ChatGPT는 **다단계 하이브리드 검색 계층(multi-stage hybrid retrieval hierarchy)**을 사용한다.

핵심 메커니즘

수학적 증거: 최대값 정규화

SoundGuys 비교 URL(https://www.soundguys.com/sony-wh-1000xm5-vs-bose-noise-cancelling-headphones-700-71868/)의 검색 결과 기록에는 3개 청크와 3개 점수가 포함됐다.

검증 범위

96개 페이지 중:

정규화 계수는 비트 단위로 정확하지 않아 청크마다 소수점 6자리에서 변동하나, 정확한 산술 방식은 현재 분석 중이다.

인용 마크업 해석

SoundGuys 청크가 검색 결과에서는 1,289자였으나 페칭된 페이지에서는 1,279자인 이유:

시스템 특성

ChatGPT 전체 검색 시스템은 다층 하이브리드 방식으로 작동한다.

FAQ

Q. 모든 데이터를 공개하지 않는 이유?
A. 단일 JSON 덤프가 200,000줄을 초과할 수 있다(프롬프트 하나, 즉시/중간/높음/쇼핑/비교 쿼리 등 여러 설정 사용). 수동 검토에 시간이 소요되고, 테스트 계정 보안을 위해 자동화하지 않음.

Q. 왜 Claude, Gemini, ChatGPT로 요약하지 않는가?
A. 컨텍스트 윈도우 제한으로 인해 필연적으로 부분이 생략되므로, 팀이 수동으로 읽고 분석하는 방식이 더 효과적.

Q. 이 발견을 바탕으로 실험을 시작했는가?
A. 초기 발견을 바탕으로 실험을 적극 진행 중이므로 Peec AI를 팔로우하기를 권장함.

Q. 이 유출에서 눈에 띄는 세 가지 키워드?
A. 의미론(semantics), 진정한 독창성(originality), 권위성(authority)


주요 주의사항: 모든 발견은 ChatGPT UI에서 나온 것이며, API에서 얻은 것이 아니다. 시스템 구성은 언제든 변경될 수 있다.