본문 바로가기
← 목록으로

AI 에이전트가 실제로 웹사이트를 사용할 수 있는가: 에이전트 웹 호환성 테스트의 교훈

wordlift.io조회수 06일 전

핵심

웹사이트가 크롤 가능하고 색인 가능하며 서버 렌더링되고 마크업이 잘되어 있어도 AI 에이전트가 사용하기에는 여전히 불가능할 수 있다. AI 준비 상태는 페이지의 속성이 아니라 호환성 관계이며, 에이전트의 실제 웹 능력은 게시자의 표면 제공, 런타임의 도구 및 정책 노출, 특정 세션의 검색 경로라는 세 요소에 모두 달려 있다.

벤치마크의 필요성

저자가 수 년간 이 주제를 조사한 결과, 현재 많은 감시 도구(Lighthouse의 신규 에이전틱 브라우징 점수 포함)가 있지만 AI 에이전트가 런타임에서 실제로 할 수 있는 것을 평가하는 것에 초점을 맞춘 비교 가능한 벤치마크가 없었다. 따라서 체크리스트가 아닌 벤치마크를 구축했다.

테스트 결과 (2026년 7월 27일 기준)

버전 관리되는 데이터셋은 17개 런타임 레코드와 159개의 관찰된 런타임-기능 쌍을 포함한다. 8가지 핵심 확인 모두에서 3회 시도를 완료한 구성만 표시:

주의: 이는 지능 점수나 브랜드 순위가 아니며, 특정 구성이 이 테스트 케이스에서 유럽에서 기록된 날짜에 증명할 수 있었던 것을 설명한다.

낮은 점수의 시스템도 유창하고 기술적으로 타당하며 부분적으로 정확한 설명을 생성했으나, 배포된 표면이 필요한 콘텐츠나 작업 경로를 노출하지 않았거나 증거가 원본 서버에 도달하지 않아 실패했다.

테스트 대상 8가지 핵심 기능

순서는 의도적: 읽기 → 렌더링 → 상태 유지 → 호출 → 작업 → 이해. 보이는 텍스트를 인용할 수 있는 시스템도 반드시 구조화된 데이터를 처리할 수는 없다. GET을 발급할 수 있는 시스템도 세션을 유지하거나 상태를 변경하지 못할 수 있다.

8가지 핵심 교훈

1. '브라우저 모드'는 텍스트 가져오기일 수 있다

일부 내보내기는 브라우저로 라벨되었으나 실제 동작은 GET 전용 텍스트 추출기에 가까웠다: 스크립트 요소 제거, 자바스크립트 실행 없음, 쿠키 지속성 없음, POST 불가, 긴 URL 거부, 브라우저 네이티브 도구 표면 없음. 제품 라벨은 사용자 경험을 설명하지만 모델이 실제 브라우저를 가지고 있음을 증명하지 않는다.

2. 유효한 JSON-LD도 모델에 보이지 않을 수 있다

S01 값들은 유효한 제품 JSON-LD 블록에 있었으나, 여러 추출 계층이 페이지가 활성 모델에 도달하기 전에 <script> 요소(application/ld+json 포함)를 모두 제거했다. 구조화된 데이터는 원본에 존재했지만 여전히 도달 불가능했다.

Schema.org(검색 엔진, 엔터프라이즈 검색 시스템, 지식 그래프 파이프라인, 능력 있는 에이전트가 모두 사용)는 여전히 필수적이나, 높은 가치의 엔티티의 경우 동일한 식별자, 속성, 관계, 출처가 일관된 HTML 표현도 함께 가져야 한다.

3. GET 접근은 웹 에이전트 능력이 아니다

ChatGPT Web과 테스트된 두 Claude 구성 모두 GET 가용성 엔드포인트에 3회 시도 모두 도달했다. 그러나 어느 것도 세션을 유지하거나 POST 동등물을 호출하거나 보류를 배치하지 않았다.

AI 에이전트가 가용성, 상태, 가격, 재고 또는 자격을 확인하기를 기대한다면:

문서 검색, 읽기 전용 엔드포인트 호출, 상태 유지, 상태 변경 작업 호출, 검증 가능한 원본 확인으로 작업 완료 사이에 실질적인 차이가 있다. 단일 "웹 접근" 배지는 이 5가지를 모두 붕괴시킨다.

4. 에이전트 중요 URL을 256자 이하로 유지하라

테스트된 한 가져오기 경로는 277자의 Merkur 대상 URL을 너무 길다고 거부했다. 244자 버전은 성공적으로 검색되었다.

실험은 기록된 최대값을 공개하지 않으며, 관찰된 임계값이 244~277 사이임을 보여줄 뿐이다. 256자 미만을 실질적 상호운용성 목표로 사용: 짧은 안정적 경로, slug과 쿼리 문자열에 걸친 큰 불투명 식별자 없음, 긴 엔티티 ID용 간결한 resolver URL, 간단한 실행 표시자 및 서명.

브라우저에서 작동하는 URL도 중간자에 의해 거부될 수 있으며, 모델이 보기 전에 차단된다.

5. 로그인해도 세션 가능하지 않을 수 있다

계정이 AI 제품에 로그인했어도 페이지 가져오기는 상태 비저장일 수 있다. HttpOnly 쿠키는 반환되지 않았고 세션 엔드포인트는 401을 반환했다. 웹사이트 세션 연속성과 AI 제품 인증은 별개의 기능이다.

6. 정답도 성공한 작업의 증거는 아니다

어시스턴트는 때때로 올바른 토큰이나 타당한 엔티티 사실을 반환했으나 원본은 수용된 증명, 표시된 검색, POST, 상태 변경을 기록하지 않았다. 양방향에서 이를 관찰: 어시스턴트는 네트워크 차단을 보고했으나 서버는 이미 PAGE_OPEN을 로깅했다.

이는 기만이 아니라 자신의 도구체인에 대한 가시성이 불완전하다는 것이다. 감시 목적으로는 원본 텔레메트리가 사후 서술보다 우선한다.

7. 무료 요금제 AI는 더 제한된 웹을 경험할 수 있다

이번 라운드는 무료 대 유료 매칭 쌍을 포함하지 않아 어떤 실패도 계정 등급에 귀속할 수 없다. (Perplexity Pro는 사용 불가능했으며 올바르게 기록되지 않음)

56개 ChatGPT 엔터프라이즈 SSE 추적의 별도 연구: 모델 경로를 행동 대리로 사용하면, 무료형 추적은 웹을 10.8% 검색한 반면 유료형은 47.4%, 매개변수 전용 답변은 각각 32.4% 대 5.3%였다.

교훈은 "무료 AI가 더 나쁘다"는 것이 아니라 등급이 증거 경로를 변경한다는 것. 더 저렴한 경험은 덜 검색하고, 덜 검증하며, 압축된 모델 메모리(parametric memory, 모델이 외운 지식)에 더 기댈 수 있다. 게시자는 두 가지 동시 작업을 가짐: 깨끗하고 일관된 공개 발자국을 통해 엔티티를 쉽게 기억하도록 만들고, 접근 가능한 HTML, 구조화된 데이터, 엔티티 페이지, 출처, 사이트맵, 지식 그래프를 통해 증거를 쉽게 검증하도록 만들기.

8. 능력과 책임은 함께 움직인다

Antigravity 클라이언트는 21/24를 얻었으나 이는 채팅 페이지와 근본적으로 다른 환경이다. Antigravity는 로컬 설치되고 에이전트에게 브라우저 및 터미널 접근을 포함한 작업 환경을 제공한다.

이는 단순히 "더 낫다"는 것이 아니라 거래: 더 큰 운영자 관리 신뢰 경계(trust boundary) 대신 더 많은 능력. 소비자 제품은 수백만 사용자를 미지의 사이트 전체에서 안전하게 보호하기 위해 모델과 개방형 웹 사이에 제한적 정책 경계를 유지한다. 로컬 및 엔터프라이즈 관리 에이전트는 경계를 바깥쪽으로 밀어내며, 운영자는 도달 가능한 파일 및 자격 증명, 실행 위치, 승인 게이트, 가역성, 유지된 로그에 대한 결정을 상속한다.

올바른 질문은 "어느 에이전트가 가장 많이 할 수 있는가?"가 아니라 **"어느 에이전트가 올바른 권한, 확인, 격리, 증거로 작업을 완료할 수 있는가?"**이다.

MCP와 배포 패턴

거의 모든 엔터프라이즈는 한 도메인 기능을 얻기 위해 Copilot이나 Claude를 교체하기를 원하지 않는다. 직원들이 이미 사용하는 어시스턴트가 관리되는 지식과 승인된 워크플로우에 도달하기를 원한다.

**웹 MCP(Model Context Protocol)**가 이 다리를 제공: 호환 호스트에 리소스, 도구, 프롬프트를 노출하는 MCP 서버. Microsoft는 Copilot Studio에서 패턴을 문서화하고, Anthropic은 MCP를 보조 시스템을 외부 시스템에 연결하는 표준으로 도입했다.

배포 패턴별 특성:

| 패턴 | 효과적 접근 | 주요 신뢰 소유자 | 주요 거래 | |------|-----------|----------------|--------| | 무료 소비자 어시스턴트 | 검색 또는 소독된 가져오기, 종종 심하게 제약 | AI 제공자 | 광범위한 접근성, 잠재적으로 더 약한 기반 | | 호스트 유료 어시스턴트 | 더 많은 검색 또는 추론, 여전히 정책 제약 | 제공자 및 고객 | 더 나은 기반 ≠ 에이전트 능력 | | 로컬 또는 관리 에이전트 | 브라우저, 파일, 터미널, 네트워크, 설치된 도구 | 사용자 또는 엔터프라이즈 | 높은 능력, 더 높은 거버넌스 부담 | | 기존 어시스턴트 + MCP | 명시적 도메인 리소스 및 승인된 도구 | 호스트, 엔터프라이즈, 도구 제공자 간 공유 | 어시스턴트 교체 없이 제어되는 특화 |

Agent WordLift의 실질적 가치는 기존 보조 시스템에 도메인 특화 실행 계층을 추가할 수 있다는 것:

MCP는 Copilot이나 Claude에 제한 없는 브라우저 접근을 마법처럼 부여하지 않으며, 호스트 제품의 정책을 무시하지도 않는다. 일반적 웹 검색의 가장 약한 부분 주변에 명시적인 관리된 경로를 만든다. 모델은 추론과 대화 표면으로 남고, Agent WordLift는 도메인 메모리, 도구, 실행 계약을 공급한다.

벤치마크 게임화 방지 설계

핵심 설계 결정: 산문이 아닌 증거 채점

런타임을 정확하게 정의: 모든 관찰은 제품, 모델 또는 보이는 모드, 상호작용 표면, 계획, 로그인 및 커넥터 상태, 지역, 날짜, 실행자, 시도 번호를 기록한다. "Claude", "Gemini", "ChatGPT"는 분석 단위가 아님: 동일 모델이 채팅 앱, 브라우저 에이전트, 코딩 환경, 도구 활성화 클라이언트에서 매우 다르게 동작한다.

시도마다 새 실행: 새로운 실행 ID, nonce, 쿠키, 정적 토큰, 동적 토큰, 검증 값. 이전 답변을 재생하여 아무것도 통과하지 않음. 런타임당 3회 시도, 최선의 일화가 아닌 통과 횟수로 보고.

원본이 권위: 서버는 페이지 열기, 세션 요청, GET/POST 호출, 보류 상태 변경, 정확한 값 증명, 브라우저 렌더링 이벤트, 진단 WebMCP 청구를 기록한다. 최종 JSON 내보내기가 정규 출처. 몇 가지 설득력 있는 거짓 양성을 포착했다.

거짓 양성이 통과보다 비용이 많음: 클라이언트 제공 WebMCP 라벨은 재생 가능했으므로 진단 전용이 됨. 동적 토큰 엔드포인트에 대한 직접 명중은 렌더링을 모방할 수 있으므로 W02는 이제 동일 출처 렌더링 이벤트를 요구. 긴 URL은 부분 문자열 우연으로 신원 확인을 만족할 수 있으므로 증명은 경계 인식됨. 에이전트는 awct_run을 사용하고 채점자는 별도 awct_gold 표시자를 사용.

실패를 증거 부재와 분리: 4가지 상태 유지: not_run(유효한 시도 없음), blocked(제약이 방지), failed(시도됨, 잘못된 결과), unverified(타당한 결과, 불충분한 증거). 한 번의 사전 실행 안전 거부는 0이 아닌 접근 장벽으로 기록됨.

웹팀이 지금 해야 할 일

초기 HTML을 의미 있게 만들기: 중요한 이름, 설명, 식별자, 가격, 가용성, 날짜, 관계는 서버 렌더링되거나 정적으로 생성된 HTML에 있어야 한다. Meta AI는 3회 시도 모두에서 정적 HTML을 읽었으나 다른 모든 확인을 실패했다. 정적 HTML은 여전히 가장 안전한 공유 인터페이스. 프로그레시브 개선(Progressive enhancement)은 에이전트 호환성 전략이다.

JSON-LD를 가시적 콘텐츠와 정렬: 안정적 @id 값, 명시적 타입, 유형화된 관계, 출처. 구조화된 데이터는 절대 페이지와 다른 엔티티나 상태를 설명해서는 안 됨.

전략적 엔티티를 위한 향상된 엔티티 표현 게시: 표준 식별자, 필수 속성, 다른 엔티티로의 관계, 소스 및 출처 링크, 기계 판독 대체, 에이전트가 합성하기 위한 충분한 가시적 컨텍스트.

읽기 확인을 상태 변경 작업과 분리: 256자 미만의 짧은 멱등성 GET 경로. POST는 진정한 상태 변경만 — 명확하고 제한되며 가역적, 확인에서 결정론적, HTML 폼 폴백 및 WebMCP를 프로그레시브 개선으로.

WebMCP는 성숙도 사다리 필요: "감지됨"은 거의 아무것도 알려주지 않음. None → declared → parseable → callable → agent-proven. 정적 감시는 처음 3가지를 신뢰할 수 있게 측정한다. 마지막 2가지만 호환성 수정에 도달 — 이번 라운드 M02/M03 관찰은 독립적 브라우저-호스트 증명을 얻지 못했다. 이는 WebMCP를 무효화하지 않으며, 도구 선언과 배포된 지원 증명이 별개 청구로 유지되어야 한다는 점을 보여준다.

최적화 전에 계측: 원본 텔레메트리 없이 에이전트가 페이지를 발견하지 못했는지, 콘텐츠 수신을 실패했는지, 오해했는지, 작동 권한이 없었는지 분명히 할 수 없다.

사용자가 실제로 사용하는 런타임 테스트: API 모델 평가에서 소비자 제품으로 외삽하지 말 것. 사업에 중요한 정확한 제품, 계획, 지역, 커넥터 상태를 감시하라.

WordLift AI Audit과의 연결

벤치마크는 AI Audit에 더 명확한 아키텍처를 제공한다 — 4개 계층, 4종류 증거:

| 계층 | 질문 | 증거 | 산출 | |------|------|------|------| | 정적 준비 | 게시자가 AI 판독 가능한 표면을 만들었는가? | HTML, 구조화 데이터, 렌더링 전략, 지시, 엔티티 신호, 도구 선언 | 준비 결과 및 우선순위 지정 수정 | | 런타임 호환성 | 명명된 배포 런타임이 그 표면을 사용할 수 있는가? | 새로운 3회 실행 기능 수정 | 런타임-기능 매트릭스 | | 원본 검증 | 게시자가 무엇이 발생했는지 증명할 수 있는가? | 요청, 렌더링 이벤트, 증명, 상태 변경, 대상 원본 로그 | 감시 가능 증거 추적 | | 관리 실행 | 엔터프라이즈의 자신 어시스턴트가 승인된 지식과 작업을 사용할 수 있는가? | MCP 리소스, 유형화된 도구, 인증, 권한, 실행 로그 | 제한된 Agent WordLift 기능 계층 |

공개 AI Audit는 진입점 — 페이지 준비의 빠르고 반복 가능한 분석. Agent Web Compatibility Test는 이 준비 신호가 행동으로 변환되는지 알려주는 연구 및 검증 계층이다.

함께 더 정직한 진행을 지원:

present → parseable → retrievable → understandable → actionable → agent-proven

조언 품질을 바꾼다. "구조화 데이터 추가" 대신 Audit는 어느 엔티티 사실이 누락되었는지, HTML에도 있는지, 어느 테스트된 런타임 경로가 이를 소비할 가능성이 있는지 명시할 수 있다. "WebMCP 감지됨" 대신 선언됨 대 호출 가능 대 에이전트 증명을 구분할 수 있다. "AI 에이전트가 이 페이지에 접근할 수 있다" 대신 증거 경계를 명명할 수 있다: 정적 가능성, 관찰된 검색, 검증된 이해, 또는 확인된 작업.

한계

더 넓은 교훈

수 년간 웹 가시성은 크롤링 및 순위를 의미했다. 에이전틱 웹은 더 긴 체인을 추가한다:

discover → retrieve → parse → identify → understand → act → verify

대부분 감시는 체인의 시작 근처에서 멈춘다. 대부분 제품 데모는 끝 근처 한 번의 성공적 실행을 보여준다. 둘 다 필요: 게시자의 관점과 런타임의 관점; 결정론적 작업, 반복된 시도, 작업이 발생했다고 주장하는 시스템의 증거.

웹은 페이지에 AI 관련 파일이 있기 때문에, 또는 어시스턴트가 한 번 요약하기 때문에 에이전트 준비가 되지 않는다.

지식이 명확하게 표현되고, 작업이 안전하게 노출되며, 여러 런타임이 이를 사용할 수 있고, 원본이 무엇이 발생했는지 증명할 수 있을 때 에이전트 준비가 된다.

이것이 우리가 AI Audit가 개발자가 도달하기를 원하는 표준이다.