본문 바로가기
← 목록으로

AI 검색에서 재순위 매기기: 패시지와 출처 선택 방식

metehan.ai조회수 063일 전

핵심

AI 검색은 한 번에 일어나는 단일 의사결정이 아니라, 발견 → 패시지 선택 → 출처 선택 → 답변 생성의 분리된 단계들로 구성된다. 재순위 매기기는 검색 시스템이 찾아낸 후보 문서와 패시지들을 신경망 모델이 다시 평가하여 관련성 점수를 매기는 단계다.


AI 검색의 기본 구조

검색 파이프라인 개요

  1. 쿼리 계획(Query Planning)

    • 사용자 질문을 재작성하고 여러 검색 쿼리로 분산("Best CRM for small business"가 3~4개 검색으로 나뉨)
  2. 검색 단계(Retrieval) - 넓은 그물

    • 키워드 검색(BM25): 정확한 단어 매칭, 빠르고 직자적
    • 벡터 검색(Embeddings): 텍스트를 의미를 담은 숫자 목록으로 변환(예: "자동차"와 "자동모빌"이 가까이 위치)
    • 두 결과 목록을 **Reciprocal Rank Fusion(RRF)**으로 병합(둘 다에서 높게 순위된 문서에 보상)
  3. 재순위 매기기 단계(Reranking) - 세밀한 체(sieve)

    • 수십~수백 개 후보를 신경망 모델이 쿼리와 각 패시지를 비교하며 다시 점수 매김
    • 최강 후보들이 다음 단계로 진행
  4. 생성 단계(Generation)

    • LLM이 남은 패시지들을 사용해 답변 작성 및 인용

재순위 매기기를 중요하게 봐야 하는 이유

왜 관련 페이지가 여전히 인용되지 않는가

전통 SEO 지표의 한계


BERT 가족 모델 기초

BERT란

BERT 학습 방식(왜 중요한가)

이항 인코더(Bi-encoder) vs 교차 인코더(Cross-encoder)

이항 인코더(임베딩 모델)

교차 인코더(재순위 매기기 모델 대부분)

이유: 파이프라인이 2단계로 운영


모델 가족과 특성

주요 모델 계보

BERT(구글, 2018)

DistilBERT, MiniLM, TinyBERT(2019-2020): 증류된 자식들

MiniLM(마이크로소프트, 2020)

TinyBERT(화웨이, 2019)

RoBERTa(페이스북, 2019)

XLM-RoBERTa(페이스북, 2019)

ELECTRA(구글, 2020)

DeBERTa(마이크로소프트, 2020-2021)

ModernBERT(2024년 12월)

Qwen3-Reranker(알리바바, 2025)


각 재순위 매기기가 콘텐츠에 대해 말할 수 있고 없는 것

4.1 교차 인코더: 판사들

예시: ms-marco-MiniLM, BGE-reranker, Jina-reranker, mxbai-rerank, GTE-multilingual-reranker

GEO/AEO가 알아야 할 두 가지 실용적 특이점

측정된 출력 비교: 12개 오픈 재순위 매기기가 같은 두 패시지를 읽은 결과

4.2 SPLADE: 투명한 키워드 기계

예시: naver/splade-cocondenser-ensembledistil(1억 1,000만)

예시 분석

실무 용도: SPLADE는 기본적으로 아주 똑똑한 키워드 시스템, 어휘 확장하지만 문장이 질문에 답하는지 깊게 모델링 하지 않음 → 설명 가능성과 "어떤 항이 빠졌는가" 도구로 사용, 품질의 최종 판정자가 아님

4.3 ColBERT: 단어 중매인

예시: jina-colbert-v2(1억 3,700만, 다국어)

메커니즘

예시 해석

읽기 팁: ColBERT 원점수는 쿼리 길이에 따라 증가(쿼리 토큰 합계)하므로, 다른 쿼리 간 원점수 비교 금지 → 대신 쿼리 토큰당 평균 유사도 비교

4.4 LLM 기반 재순위 매기기: 신세대

예시: Qwen3-Reranker(0.6B/4B/8B, 알리바바, 2025), mxbai-rerank-v2(Qwen2.5 기반)

능력

비용


ChatGPT가 아마 사용하는 것

공개된 정보(높은 확신)

OpenAI File Search(검색 기능, OpenAI API)

ChatGPT 웹 검색(OpenAI 도움말 페이지 문서화)

행동이 시사하는 것(중간 확신)

관찰된 인용이 일치하는 패턴

미지의 것


AEO/GEO와 SEO 팀을 위한 실용적 재순위 매기기 결정 가이드

진단 워크플로우(15분)

☐ 5~10개 목표 프롬프트 나열, 각 답변 카테고리 표시: 브랜드, 정의, 최고, 비교, 방법

☐ 각 프롬프트마다 페이지의 답변해야 할 섹션 저장. 경쟁자 URL이 인용/언급되면 열고 그 섹션 캡처. URL만 표시되면 가장 답변 같은 섹션 사용

☐ 실패 버킷 하나 지정: 검색되지 않음, 검색되었으나 약함, 또는 언급/잘못된 주장으로 인용됨

☐ 그래야만 편집 선택. 키워드 밀도나 모델 점수 추적으로 시작하지 말 것

사용 사례별 모델 선택

"왜 콘텐츠 점수가 낮은지 이해하려면"(설명 가능성)

"가장 정확한 순위 매김, 비용은 보조"

"CPU에서 속도, 대량 처리, 낮은 지연"

"콘텐츠가 영어 아님"

"문서가 길다"(가이드, 문서, 백서)

"2단계 검색 파이프라인 구축"

모델 선택 빠른 참조표

| GEO/AEO/SEO 질문 | 먼저 테스트할 모델 | 출력이 지원하는 것 | |---|---|---| | 낮은 점수 설명 | SPLADE | 정확한 항 수준 분해, 직접 편집 가능 | | 누락된 쿼리 단어 확인 | ColBERT(jina-colbert-v2) | 단어당 정렬 표 | | 최고 정확도, GPU 있음 | Qwen3-Reranker 4B/8B | 벤치마크 리더, 긴 문맥, 지침 | | 최고 관리형 품질, API 예산 | 현재 관리형 재순위 매기기 API | 자체 호스트 없이 생산 순위 매김 | | CPU, 대량 점수 매김 | ms-marco-MiniLM-L-6-v2 | 빠른 기준선, 하드웨어에서 처리량 측정 | | 거친 사전 필터 | ms-marco-TinyBERT-L-2 | 분류용 작은 모델, 최종 편집 결정 아님 | | 다국어 콘텐츠 | BGE-reranker-v2-m3 | 광범위 언어 적용, 각 지역 검증 필요 | | 긴 문서 | Ettin/ModernBERT 가족 | 잘림 전 더 많은 문맥, 여전히 패시지 창 테스트 필요 | | 콘텐츠 진단 | 여러 가족 | 합의가 신뢰도 높임, 불일치가 검토 사례 드러냄 |


AEO/GEO 및 SEO 콘텐츠 전략의 변화

발견 1: "주제에 대해"와 "이 쿼리에 답함"은 다른 테스트

발견 2: 목록이 인용에 자주 나타나는 이유는 보편적 "목록 편향"이 아님

발견 3: 대부분 테스트된 모델에서 단어 순서 섞기보다 누락된 개념이 더 중요

발견 4: 패시지 품질이 로컬 병목이 될 수 있음

발견 5: 교차 인코더 주의는 편집 지침 목록이 아님

발견 6: 모델 가족이 급격히 불일치하면서 상대 편집에서 일치 가능


AEO/GEO 및 SEO 팀을 위한 실용적 워크플로우

도구 선택에 관계없이 시작할 일곱 단계

  1. 쿼리 클러스터와 의도 정의: 브랜드, 정의, 비교, 선택, 방법 쿼리 분리
  2. 패시지 수준 후보 수집: 관련 섹션 저장, 현재 인용되거나 자주 능가하는 패시지
  3. 실패 단계 찾기: 발견/검색, 패시지 관련성, 최종 출처 사용 구별 후 편집 제안
  4. 여러 모델 가족 실행: 교차 인코더 1개 + SPLADE 또는 ColBERT, 복잡한 의도에는 LLM 재순위 매기기 추가
  5. 가장 강한 증거 읽기: 정확한 항 기여와 토큰 정렬, 제어된 다시 쓰기 선호, 주의를 가설로 취급
  6. 가장 작은 유용 다시 쓰기: 누락된 답변, 기준, 항목, 한정자, 증거 추가하되 관련 없는 산문 변경하지 말 것
  7. 두 번 검증: 같은 경쟁자 대상으로 다시 점수 매김, 실시간 검색, 언급, 인용 결과 모니터링

역할별 확인

콘텐츠 작성/편집할 때

콘텐츠 검토할 때

AEO/GEO 성능 보고할 때

도구/파이프라인 구축할 때


"재순위 매기기 친화적 청크"로 작성해야 하는가?

신화 부분

신화 1: 청크를 제어할 수 있다

신화 2: 청크 경계가 치명적

신화 3: 모든 문단이 자체 완결 답변 기계여야 한다

실제로 도움이 되는 것

로컬 자체 완결성

각 목표 쿼리당 한 문장 직접 답변

청크 의식 작성이 이득일 때

불필요하거나 적극적 낭비일 때


용어집