본문 바로가기
← 목록으로

브랜드 검색에서 ChatGPT의 질의 확산 현상 연구

mjcachon.com조회수 05일 전

핵심

사용자가 ChatGPT에 브랜드를 묻을 때마다 시스템은 그 브랜드만 검색하지 않는다. 사용자에게 보이지 않는 여러 관련 사항을 병렬로 검색한다. 본 연구는 3개 분야(의료, 스포츠용품 소매, 호텔)에서 189개의 브랜드 질문을 723회 실행해 1,797개의 검색을 분석했다.

연구 대상 및 방법론

분석 범위

주요 발견

반복 실행의 필요성

질의 확산은 확률적이다. 단일 실행 시 평균 3개 미만의 하위 검색이 생성되지만, 4회 반복하면 서로 다른 하위 검색이 평균 10.3개로 증가한다. 즉, 한 번의 실행만으로는 모델이 묻는 내용의 약 4분의 1만 볼 수 있으며, 어느 부분을 봤는지 알 수 없다. 따라서 구조적 패턴을 파악하기 위해 각 질문을 여러 번 반복 실행했다.

주요 수치

| 지표 | 전체 | 프로젝트 범위 | |------|------|------------| | 질문당 하위 검색 수 | 10.3 | 9.7 – 10.7 | | 실행당 하위 검색 수 | 2.6 (최대 13) | 2.5 – 2.7 | | 평균 하위 검색 길이 | 7단어 | 6.7 – 8.0 | | 브랜드명 포함 하위 검색 | 93.4% | 92.6% – 94.5% | | site: 연산자 포함 | 30.2% | 25.9% – 37.4% |

추가 관찰

브랜드 질의 확산의 3개 축

동일한 하위 검색이 site: 연산자, 따옴표 처리된 용어, 연도를 동시에 가질 수 있으므로, 단일 분류법이 아닌 같은 데이터에 대한 3가지 독립적인 관점이 있다.

축 1: 검색 대상 도메인

| 대상 | 건수 | 비율 | |------|------|------| | 일반 검색결과(site: 없음) | 1,254 | 69.8% | | site: [자사 도메인] | 299 | 16.6% | | site: [그룹 도메인] | 142 | 7.9% | | site: [제3자] | 100 | 5.6% | | site: [경쟁사] | 2 | 0.1% |

축 2: 검색 방식(사용된 연산자)

| 패턴 | 건수 | 비율 | |------|------|------| | site: 연산자 | 543 | 30.2% | | 완전 일치 따옴표 | 427 | 23.8% | | 명시적 연도 | 352 | 19.6% | | Boolean 연산자(OR, 괄호) | 24 | 1.3% | | filetype: 또는 PDF | 10 | 0.6% | | 리터럴 URL | 6 | 0.3% | | 제외(-) | 5 | 0.3% | | inurl: / intitle: | 0 | 0% |

이는 프로젝트를 색인 측면에서뿐 아니라 콘텐츠, 제목, 설명 등을 명시적으로 작성하는 방식도 통제해야 함을 시사한다.

축 3: 검색 내용(주제)

| 테마 | 비율 | |------|------| | 일반 브랜드 | 23.3% | | 제품 및 서비스 | 20.6% | | 평판 및 신뢰 | 10.1% | | 브랜드 아이덴티티 | 6.8% | | 공식성 및 채널 | 6.2% | | ESG 및 지속가능성 | 5.2% | | 사후 지원 | 4.8% | | 법무 및 준수 | 4.1% | | 산업재산권 | 4.0% | | 인증 및 상 | 3.8% | | 인물 및 리더십 | 3.6% | | 기업 보고 | 3.5% | | 보안 및 침해 | 2.3% | | 보도 및 미디어 | 1.8% |

핵심: 경쟁사를 명시하는 하위 검색은 0.8%에 불과하다. 브랜드 질의 확산은 중심지향적이다. 즉, 브랜드 자체, 그룹이나 자회사 디지털 자산, 이를 검증하는 출처 중심으로 회전한다. 따라서 모든 프로젝트의 가장 큰 요점은 브랜드, 서사(narrative), 디지털 발자국을 통제하는 것이 AI 가시성의 기초라는 것이다.

브랜드 질의 확산의 7가지 패턴

패턴 1: 자사 도메인 질의 확산

모든 site: 연산자의 55.1%가 브랜드의 메인 도메인을 가리킨다. 이는 세 프로젝트 모두에서 예외 없이 유지된다.

모델은 자사 도메인을 신뢰의 주요 출처로 사용하며, Google을 쿼리하는 방식 그대로 사용한다. 즉, "이 도메인의 모든 콘텐츠를 주라"는 식이다. 색인되지 않은 콘텐츠나 이런 패턴에 답할 수 없는 콘텐츠가 있으면 제3자에게 문을 열어준다.

또한 브랜드 질문의 64.4%가 최소 한 번 이상 자사 도메인에서 site: 검색을 유발한다. 나머지 35.6%는 모델이 이미 답을 알았거나 그 도메인을 유용한 출처로 간주하지 않았다는 가설이다.

패턴 2: 그룹 또는 모회사 질의 확산

site: 연산자의 26.2%는 같은 그룹이나 모회사 내 도메인을 가리킨다. 여기에는 기업 사이트, 보도실, 지속가능성 또는 지원 서브도메인, 국제 자산이 포함된다.

함의:

패턴 3: 제3자 질의 확산 및 외부 검증

site: 연산자의 18.4%는 제3자를 대상으로 한다. 수는 가장 적지만 가장 드러나는 패턴이다. 모델이 권위자로 취급하는 대상을 보여준다.

함의: 프로젝트 범위를 넓혀 현재 통제하지 않는 곳을 포함해 가시성을 높일 수 있는 곳을 찾아야 한다.

패턴 4: 리터럴 질의 확산(따옴표)

23.8%의 하위 검색이 따옴표를 포함한다(의료 및 호텔 프로젝트에서 더 빈번).

901개의 따옴표 처리된 문자열 분석:

| 문자열 유형 | 건수 | 비율 | |-----------|------|------| | 2-4단어: 브랜드, 직책, 섹션 | 499 | 55.4% | | 단일 용어(1단어) | 300 | 33.3% | | 코드/ID: 조세번호, 사건 파일, PDF | 78 | 8.7% | | 긴 구문(5단어 이상) | 24 | 2.7% |

모델은 이미 본 구문을 인용하여 확인한다. 이는 자사 콘텐츠에 대한 팩트 체크다. 자사 사이트에 게시된 주장, 직책, 수치는 검증할 팩트로 변환된다.

의미: 카피라이팅, 주장, CTA(행동 유도)에 창의적인 자유를 갖기 전에 고려해야 한다. 인간에게는 잘 읽히는 변형이 이런 새로운 발견 채널에서는 역효과가 될 수 있다.

패턴 5: 시간 기반 질의 확산

신선도(freshness)는 영어권 연구에서 널리 논의되었다. 본 연구에서는 19.6%의 하위 검색이 명시적 연도를 포함하며, 업계별로 편차가 크다.

과거에 순위에 '쓸모없다'고 여겨 noindex 처리되기도 한 콘텐츠(정보 페이지, 법적 공지, 미션, 비전, 가치)는 이제 더 이상 채움말이 아니다. 이런 URL은 브랜드 가시성을 구축하고, 언급 및 인용을 보호하고, 제3자를 배제할 수 있다.

패턴 6: (문서에서 누락)

문서에서 패턴 6은 명시되지 않았다.

패턴 7: 평판 위험 질의 확산

질의 확산의 10.1%는 평판과 신뢰에 관한 것이다. 여기에는 의견, 평가, 등급, 불만, 민원이 포함된다.

질의 확산이 의도치 않은 평판 감사로 변할 수 있으므로, 사건과 불만을 둘러싼 서사(narrative)를 통제하는 것이 중요하다.

모호한 디지털 아이덴티티

패턴 8은 아니지만, LLM이 브랜드에 영향을 미치는 방식을 잘 보여준다.

발견 1: 이미 리다이렉트된 도메인 검색

한 프로젝트에서 질의 확산이 현재 도메인으로 리다이렉트되는 구 도메인을 site: 검색으로 사용했다. 모델의 사전 학습이 이전 버전의 사이트로부터 형성되었을 가능성이 높다. 시간 기반 패턴과 달리, 모델은 도메인을 전혀 의문 없이 받아들인다.

함의: 프로젝트 인프라와 디지털 자산 맵을 정리하고, 리다이렉트 인벤토리를 갖춘 기본 SEO 위생을 유지하는 것이 직접적 영향을 미친다.

발견 2: 동일 브랜드의 여러 소셜 프로필 시도

소셜 미디어가 질의 확산 하위 검색의 5.5%를 차지하며, 특정 프로필로 항상 가지는 않는다. 한 프로젝트에서 모델은 세 개의 다른 Instagram 계정, 두 개의 LinkedIn, 두 개의 Facebook, 한 개의 YouTube를 시도하며 브랜드의 소셜 프로필을 찾으려고 했다. 시행착오를 통해 어느 것이 정확한지 추측하려고 한다.

이는 **패턴 6(공식성 테마)**과 직접 연결된다. 모델이 이런 검색을 한다면, 정보를 해결하지 못했다는 의미다.

해결책: 지루하지만 필수적이다. 명확한 커뮤니케이션, 자사 사이트에서의 링크, 프로필을 선언하는 스키마 마크업, 계정 전반의 일관된 네이밍. 기본처럼 들리고 그게 맞다. 기본을 미해결로 두는 것이 LLM 내 브랜드 통제를 천천히 빼앗는다.

다국어 통찰

긴밀히 관찰할 가치가 있다: 8.9%의 하위 검색이 영어 어휘를 사용한다. 국제적 발자국을 가진 프로젝트에서는 27.3%로 올라가고, 순수 지역 프로젝트에서는 1.0%로 떨어진다. 그 위에 실행의 9.9%는 언어를 섞는다.

브랜드가 국제적 존재를 가지면, 사용자가 스페인어로 질문해도 모델은 영어를 끌어온다. 글로벌 자산이 나타난다. 이는 언어 버전 간 메시징의 일관성이 매우 중요함을 의미한다. 번역 자체가 아니라 각 자산이 실제로 어떤 콘텐츠를 가진 것인지가 중요하다.

질의 확산이 진행되는 순서

이제 ChatGPT가 브랜드 질문을 받았을 때 검색하는 순서를 이해해보자. 결과 질의 확산은 일정한 순서를 따르고, 신호를 읽을 수 있다.

처음은 묻고, 끝은 검증

1,797개의 하위 검색을 각 실행 내 위치로 정렬하면 패턴이 드러난다:

첫 검색 vs 마지막 검색

각 실행의 첫 검색과 마지막만 비교하면:

단계별 순서

3개 분야에 걸친 질의 확산의 여정을 4가지 단계로 요약할 수 있다:

  1. 개방형 질문: 자연 언어, 연산자 없음, 따옴표 없음
  2. 좁히기: site: 연산자
  3. 검증: 따옴표 나타남, 뭔가가 리터럴로 언급되었는지 확인
  4. 고집: 더 짧고 구체적인 재구성

익명화된 실제 사례 (괄호로 패턴 표시):

브랜드가 참여하는 이벤트가 뭔지 묻는 질문 → 브랜드의 사이트를 보고, 필요한 것을 찾지 못한 후 → 따옴표 처리된 구문 검색, 제3자 사이트로 이동, 돌아와서 → 보도자료의 리터럴 문장으로 끝난다.

이 11단계는 유기적 가시성과 AI 가시성을 함께 작업할 기회를 시사한다. 검색 엔진과 모델이 실제로 어떻게 작동하는지 염두에 두면서.

질의 확산이 에스컬레이션하는 것이 표준은 아님

그렇다면 대부분의 실행이 에스컬레이션하지 않는다는 건?

질의 확산이 있는 687회 실행 중 246회는 단일 검색, 193회는 2번 검색만 한다. 63.9%는 2회 이하의 검색으로 해결된다. 질의 확산을 생성하지 않는 실행을 포함하면 더하다.

따라서 에스컬레이션은 기본 행동이 아니다. 그 전의 모든 것이 작동하지 않을 때 발생한다.

더하자면, 모델은 때로 같은 것을 여러 다른 방식으로 묻는다. 2회 이상 검색이 있는 실행의 23.1%에서 최소 한 쌍의 하위 검색이 동일하거나 몇 용어만 다르다(때로는 단지 브랜드명 자체, 그 가치, 미션 또는 슬로건).

또 다른 유용한 통찰: 모델이 비슷하거나 동일한 검색을 고집하고 있는데 당신이 그중 하나에 없다면, 아마도 어디에도 없을 것이다.

본 연구는 더 많은 브랜드로 반복하고 확대할 필요가 있지만, 이미 가설이 있다: 긴 질의 확산은 모델이 뒤져 다니고 있다는 의미일 수 있으며, 이는 제3자 사이트에 끝나는 문을 연다.

실행 가능한 요점

  1. 기업 속성당 색인 가능한 URL 1개씩. 다양한 특성이 여러 URL에 흩어져 있으면 모델이 찾기 어렵다.
  2. 핵심 데이터는 리터럴 HTML에, PDF나 이미지 안에만 있지 말 것. 모델이 인용 검색으로 가져갈 수 있어야 한다.
  3. 주장과 슬로건 일관성, 완전 일치 검색에서 견뎌낼 수 있도록.
  4. 기업 및 기타 콘텐츠에 현재 업데이트 날짜와 연도 표시.
  5. 평가, 불만, 사건에 대한 자사 페이지. 제3자 플랫폼에만 맡기지 말 것.
  6. 각 시장의 메인 도메인과 그룹 도메인 간 일관성.
  7. 링크된 공식 소셜 프로필 1개. 혼동을 피할 것.
  8. 공식 등록부의 정확한 존재 및 데이터.
  9. 과거 마이그레이션에서 라이브 리다이렉트. 구 도메인 유지 금지.

연구의 한계