콘텐츠 사이트에서 지식 그래프를 활용한 SEO 전략: 엔티티 태깅과 허브 페이지 구축
fajela.com조회수 04일 전
핵심
콘텐츠 사이트에서 지식 그래프(knowledge graph)와 SEO를 결합하려면 세 가지 요소가 필요하다: 다루는 인물, 기업, 개념에 대한 통제된 어휘(closed vocabulary), 모든 페이지에 붙은 엔티티 태그, 각 엔티티당 생성된 허브 페이지. 이 세 가지는 몇 날 만에 트래픽을 잃는 게시물들을 수년에 걸쳐 가치가 증대하는 자산으로 변환한다. 또한 기계(AI 시스템)가 검증할 수 있는 신뢰성을 구축한다.
뉴욕타임스의 엔티티 그래프 운영 방식
- 1851년부터 통제된 어휘 운영: 도서관 과학자들이 종이 색인으로 관리하던 시스템에서 출발했다.
- 현재 규모: 180만 개 이상의 기사 보유, 그중 150만 개 이상이 수작업으로 5가지 유형의 폐쇄 용어 목록으로 태그되어 있다.
- 5가지 유형: 인물, 기관, 지역, 주제, 창작물
- 태깅 파이프라인: 소프트웨어가 관련성 점수와 함께 태그를 제안 → 편집자가 확인 → 별도의 분류법 팀(Taxonomy Team)이 매일 새로운 용어 요청을 검토하고 동음이의 규칙을 작성(예: 작곡가 존 애덤스와 대통령 존 애덤스 구분)
- 허브 페이지의 효과: SEO 컨설턴트 크리스 롱의 분석에 따르면 약 10,000개의 토픽 페이지가 이러한 태그로부터 조립되어 있으며, 페이스북 토픽 페이지만 월 약 110만 건의 방문을 가져온다. 개별 기사는 며칠 후 트래픽을 잃지만 허브 페이지가 트래픽을 유지한다.
그래프 작업이 신뢰를 구축하는 이유
구글의 연구 근거
- Knowledge Vault: 신 루나 동(Xin Luna Dong)의 팀이 구축한 웹 규모의 사실 데이터베이스로, 페이지에서 추출한 사실들을 확률로 가중치 매긴다.
- Knowledge-Based Trust: 링크 대신 콘텐츠의 사실적 정확성으로 출처를 평가하는 방식. 실험 결과 높은 링크를 받은 가십 사이트는 사실 정확성에서 형편없었고, 정확한 소규모 사이트가 상위권에 올랐다.
AI 시대의 현실
- 언어 모델의 지식 한계: 메타에서 진행한 Head-to-Tail 벤치마크에 따르면 ChatGPT는 유명한(head) 엔티티에 대한 질문에 29.4% 정답률, 중간 인기도 엔티티는 21.9%, 소수 인기도(tail) 엔티티는 9.5% 정답률을 보였다.
- 틈새 사이트의 기회: 거의 모든 전문가, 도구, 기업이 소수 인기도 범주에 속하므로, AI 모델이 이들 사실을 학습 데이터에서 회상할 수 없다. 따라서 구조화된 엔티티 프로필이 있는 사이트가 검색 결과로 제시되어야 한다. Fajela 지식 그래프의 52명 전문가 대부분이 바로 이러한 소수 인기도 엔티티다.
- 검색 증강 생성(RAG)의 한계: 동의 팀이 구축한 CRAG 벤치마크에서 RAG 시스템은 44% 미만의 정확성을 보였고, 업계 최고 수준의 시스템도 환각 없이 약 63%에 그쳤다. 따라서 답변 엔진들은 검색 결과와 지식 그래프를 함께 활용하며, 사이트가 게시하는 구조화된 사실이 두 채널 모두에 공급된다.
콘텐츠 프로젝트의 시사점
기계가 검증할 수 있는 것은 추출할 수 있는 것뿐이므로, 명확한 이름, 안정적인 별명(alias), 마크업, 공유 식별자가 사이트를 검증 가능하게 만든다. 이후의 모든 단계는 사실 추출을 더 쉽게 하거나 오류를 더 어렵게 만든다.
6단계 구현 가이드
1단계: 지식 그래프의 기초가 될 어휘 구축
- 시작점: 최고 품질의 콘텐츠에서 출발해 자체 페이지를 가질 만한 모든 엔티티를 나열한다.
- 각 엔티티에 포함할 것: 유형, 정규화된 이름(canonical name), 2문장 설명, 별명
- 권장 유형 (콘텐츠 사이트는 5~6가지): 인물, 기관, 도구, 개념, 행사
- 소규모 시작: Fajela 지식 그래프는 현재 52명의 SEO 및 디지털마케팅 전문가, 38개의 회사 및 도구로 범위를 한정했다. 빠르게 테스트하려면 하나의 행사(예: SEO Vibes 2026 컨퍼런스)를 그래프화하는 것으로 충분하다.
- 인물 엔티티의 필드 계약: 이름, 현재 역할, 조직, 80~150단어 약력, 전문 분야, 주요 업적, sameAs 프로필 링크, Wikidata 및 구글 지식 그래프 ID(존재할 경우)
- 별명에 큰 노력 기울이기: 모든 스펠링, 별칭, 음차, 그리고 우크라이나어 같은 굴절 언어라면 격변까지 포함해야 한다. 그렇지 않으면 언급의 절반을 놓친다.
2단계: 모든 페이지에 태그를 붙이고 엔티티 목록 보호
- 폐쇄 어휘 강제: 저자는 정의된 어휘에서만 선택하고, 새 엔티티 추가는 편집상 결정을 의미하며 목록을 업데이트해야 한다.
- 기술 구현: 워드프레스에서는 커스텀 분류법, 정적 사이트에서는 프론트매터 필드. 두 경우 모두 게시 프로세스가 어휘 목록에 없는 태그를 거부해야 한다.
- 이것이 일반 CMS 태그와의 차이: 지식 그래프는 어휘가 폐쇄되고, 엔티티가 유형화되고 설명되며, 별명이 추적되고, 허브가 실제 페이지다.
- 주의점 — 지식 그래프 vs 그래프 데이터베이스: 지식 그래프는 엔티티, 설명, 그들 간의 연결 자체를 의미한다. Neo4j 같은 그래프 데이터베이스는 이를 저장하는 한 가지 선택지일 뿐이며, 백만 개 노드 쿼리에 최적화되어 있다. 콘텐츠 사이트는 보통 수백 개의 엔티티와 수천 개의 페이지를 가지며, 이 규모에서 같은 그래프가 워드프레스 분류법이나 구조화된 파일 폴더에 편하게 들어간다. 검색 엔진은 저장소를 보지 않고 게시된 페이지, 마크업, 그 사이의 링크를 본다.
- 실제 피해 사례: Fajela를 2026년 4월 감사했을 때 같은 SEO 전문가가 두 개의 다른 슬래그로 게시되고 있었으며, 엔티티 허브가 중단된 마이그레이션 URL 구조로 링크되고 있었다. 즉각적인 처벌은 없지만 손상은 숨어있으면서 중복이 순위, 내부 링크, 관련 콘텐츠 블록을 반으로 나눈다. 뉴욕타임스는 전문 분류법 부서로 이를 예방한다. 소규모 사이트는 검증 스크립트 하나와 하나의 명명 규칙으로 같은 보호를 얻을 수 있다(매번 게시할 때 실행).
3단계: 순위를 얻을 만한 엔티티 허브 페이지 발행
- 필수 섹션 (Fajela 엔티티 페이지의 구조):
- 인물과 현재 역할
- 무엇으로 알려져 있는가
- 주요 업적
- 강연 또는 영상
- sameAs에서 모은 검증된 프로필 링크 블록
- 고정 구조의 목적: 자동 생성 링크 목록이 현대의 품질 시스템에서 도어웨이 스팸으로 간주되지 않도록 한다.
- 두 가지 핵심 규칙:
- 허브를 점진적으로 발행한다: 한 번에 40개를 모두 올리거나 2주 후 30개를 다시 올리면 새 페이지들이 몇 개월간 "수집됨, 현재 색인되지 않음" 상태에 머물고, 이미 순위를 보유한 페이지가 같은 기간 하락한다. 대신 완전한 몇 개씩 발행하고 섹션을 실제 커버리지와 함께 성장시킨다.
- 의미와 통계가 나열을 이긴다: 링크되고 인용되는 허브 텍스트는 엣지의 의미(누가 어디서 말했는가, 누가 누구와 일했는가)와 그래프 전체의 통계를 설명한다.
- SEO 이점: 허브는 개별 기사가 오래 유지하지 못하는 엔티티 쿼리(이름, 브랜드, 개념)에 순위를 차지한다. 각각은 처음부터 작성할 필요가 없는 랜딩 페이지이며, 사실적으로 정확하고 신뢰할 수 있다.
4단계: 내부 링킹을 그래프에 연결
- 자동 생성: 내부 링크는 태그에서 직접 나온다.
- 링크 구조: 허브는 태그된 모든 기사로 링크 → 기사는 허브로 링크 백 → 관련 콘텐츠 블록이 엔티티를 공유하는 조각들을 연결 (허브 앤 스포크 구조, 메타데이터에서 생성)
- 동적 강화: 모든 새 게시물은 자동으로 접촉하는 허브를 강화하고, 오래된 게시물은 엔티티가 뉴스에 오를 때 새로운 링크를 받는다.
- 앵커 텍스트: 단순히 엔티티의 정규화된 이름이다.
5단계: 엔티티를 마크업하고 공개 지식 그래프에 참여
- 마크업의 역할: 내부 그래프를 구글 시스템과 LLM이 이해하도록 한다.
- 구조화된 데이터: 각 허브는 자신의 유형(Person, Organization, DefinedTerm)에 대한 구조화된 데이터를 담고, Wikipedia, Wikidata, 실제 프로필로 나가는 sameAs 링크를 포함한다.
- 기사의 참조: about과 mentions를 통해 엔티티를 참조한다.
- 마크업 선택: 페이지당 한 가지 문법. SEO Baza에서는 사이트 전체에 마이크로데이터를, Fajela는 블로그에서 JSON-LD를 사용한다. fajela.com에서는 커스텀 플러그인이 Wikidata에서 엔티티 데이터를 직접 가져와 설명과 식별자가 공개 그래프와 일치한다.
- 외부 식별자의 중요성: 뉴욕타임스는 2009년 주제 표제를 링크된 개방 데이터(Freebase, DBpedia, GeoNames에 매핑된 약 10,000개 태그)로 공개하기 시작했다. 오늘날 Wikidata가 그 역할을 하며, Fajela는 지식 그래프의 엔티티에 대한 구글 지식 그래프 ID(KGMID)를 추적한다. 공유 식별자가 있어야 기계가 "이 페이지, 그 패널, 그 Wikidata 항목이 같은 것"이라고 말할 수 있다.
6단계: 세상의 사실을 그래프 밖에 두기
- 그래프의 역할 제한: 뉴욕타임스 그래프는 한 가지 종류의 사실만 주장한다: 우리는 이 이야기를 게시했고 이것이 이 엔티티를 다룬다. 이 사실은 완벽한 출처를 가지며 절대 만료되지 않는다.
- 위험: 그래프가 세상의 사실을 주장하기 시작하면 모든 엣지는 출처, 날짜, 검토 사이클이 필요해진다. 세상은 변하지만 저장된 기록은 그렇지 않기 때문이다.
- 실패 사례: iGaming 데이터베이스 프로젝트에서 45개의 저장된 결제 수단 지원 주장 중 27개만 수작업 검증을 통과했고, 나머지 18개는 구식이었으며 그래프는 계속 이들을 사실로 제공했다. 이것은 정확히 지식 기반 신뢰가 처벌하는 행동이다: 더 이상 검증되지 않는 사실을 자신 있게 진술하는 것.
- 해결책: 사실을 담은 모든 레코드가 출처와 검증 날짜를 포함하고, 검증되지 않은 것은 게시된 페이지 밖에 둔다. 콘텐츠 사이트의 더 저렴한 규칙은 구조적: 가격, 기능, 재고는 저자와 날짜를 담는 산문에 두고, 그래프는 콘텐츠-엔티티 엣지(절대 만료되지 않음)를 위해 사용한다.
최소 실행 가능 버전
한 번 발행 시 태그가 허브 페이지, 관련 커버리지 블록, 내부 링크로 퍼져나간다.
스프레드시트 크기의 어휘, 하나의 분류법, 점진적으로 발행된 완전한 몇 개의 허브 페이지가 최소한의 시작점이다. 1주일의 작업이며, 발행되는 날부터 가치가 증대한다.