이미지와 시각 검색 가이드: 텍스트 검색 쇠퇴 속 비주얼 커머스의 부상
시각 검색이 풀어주는 두 가지 난제
아마존이 한때 사진으로 검색하는 이유를 가장 명확하게 설명했다. 시각 검색은 두 가지 딜레마에 처한 쇼핑객을 위한 것이라고 했다.
-
발견의 문제: "무엇을 원하는지는 모르지만, 보면 알 거야"
- 잡지의 거실 사진을 보는 사람은 구매 목록을 갖고 있지 않다. 느낌을 갖고 있고, 그것을 촉발할 무언가를 기다리고 있다. 예를 들어 아이폰은 처음에는 비싼 전화를 사려던 사람들에게는 팔리지 않는 상품이었지만, 사람들이 본 후에 팔렸다.
-
어휘의 문제: "무엇을 원하는지는 알지만, 그것을 뭐라고 부르는지 모르겠어"
- 이 문제는 대부분의 이커머스 팀이 인정하는 것보다 더 일반적이다. 하드웨어 가게에 가서 나사를 사려고 한다고 해보자. 원통형 헤드, 플레어형, 평평한? 나무용, 콘크리트용, 고정물용? 대부분의 사람들은 손에 나사를 들고 가서 "이것들이 담긴 상자를 하나 주세요"라고 말한다.
카메라는 그 뻗어진 손이다. 쇼핑객이 상품을 찾기 전에 어휘를 알아야 한다는 단계를 건너뛸 수 있게 해준다. 이것이 시각 검색의 전체 핵심이며, 이것이 가구, 패션, 식물, 부품, 수집품 같이 물건의 이름을 짓기 어려운 카테고리에서 가장 빠르게 성장한 이유다.
이 두 딜레마는 십 년 전에도 사실이었다. 달라진 것은 기술이 따라잡았고 사용량이 늘어났다는 것이다.
현재 중요한 수치들
-
구글 렌즈 사용량: 구글은 2024년 10월에 렌즈가 월 거의 200억 건의 시각 검색에 사용되고 있으며, 그 중 20%가 쇼핑 관련이라고 보도했다. 이는 4,500만 개 이상의 상품 리스팅을 가진 쇼핑 그래프(Shopping Graph)와 매핑된다. 규모를 생각해보면, 이는 2023년 I/O에서 언급한 월 120억 건에서 증가한 것이다.
-
2025년 성장: 2025년 5월 구글 I/O에서 순다르 피차이는 렌즈가 전년 대비 65% 성장했으며 이미 그 해 1,000억 건 이상의 시각 검색이 있었다고 말했다.
-
카메라의 위치: 카메라는 지구에서 가장 많이 사용되는 홈페이지인 구글 검색창 안에 있다. 시각 검색은 사용자가 찾아야 하는 기능이 아니라 모든 쿼리 순간에 제시되는 것이다.
-
아마존의 성장: 아마존은 2024년 10월에 전 세계 시각 검색이 전년 대비 70% 증가했다고 보도했으며, 2025년 9월에 아마존 렌즈 라이브를 출시했다. 이는 실시간 카메라 스캔 기능으로, 슬와이프 가능한 상품 캐러셀을 갖추고 쇼핑 어시스턴트에 연결되어 있다.
텍스트 검색의 약세
이를 텍스트 검색에 일어나는 일과 비교해보면 경각심을 갖게 된다. SparkToro와 Datos의 분석에 따르면 2024년 미국 구글 검색의 58.5%가 클릭 없이 끝났으며, 2026년 업데이트는 그 수치를 68%에 올렸다. 현재 미국 검색 1,000건 중 약 276건만이 오픈 웹에 도달하는데, 2년 전에는 374건이었다.
이 두 추세를 함께 읽으면 전략적 상황이 불쾌하지만 분명하다.
- 텍스트 검색: 클릭을 더 적게, 더 적은 사이트로 전달하고 있다.
- 시각 검색: 빠르게 성장하고 있으며 상업적 의도가 이미 붙어 있다. 물체를 촬영하는 사람은 카테고리 이름을 입력하는 사람보다 훨씬 더 판매 깔때기 아래에 있다.
세대 간 발견 행동의 변화
또 다른 주목할 변화가 있다. 1,000명 이상의 미국 소비자를 대상으로 한 설문 조사에서, Z세대는 이제 구글(18.8%)보다 인스타그램(30.4%)과 틱톡(23.2%)에서 더 많이 상품을 발견한다. 구글은 여전히 모든 더 나이 많은 집단에서 편하게 주도한다. 하지만 가장 어린 구매자들은 이미 시각 우선, 피드 기반 방식으로 물건을 찾는 것을 당연하게 여기고 있다. 이것이 렌즈, 핀터레스트, AI 모드의 시각 그리드가 모두 제공하기 위해 만들어진 행동이다.
더 이상 "쉬운 기회"가 아닌 이유
수년간 이미지 SEO의 논리는 무시에 기반했다. 아무도 신경 쓰지 않으니 저렴한 이득이 있다는 주장이었다. 이 논리는 만료됐으며, 그 이유를 명확히 할 가치가 있다.
부분적으로는 이미 사실이 아니게 됐기 때문이다. 이커머스의 구조화된 데이터 채택은 이제 광범위하며, 이미지 검색 결과의 상품 배지는 특별하기보다는 일반적이다. 하지만 주로 스테이크의 형태가 바뀌었기 때문이다.
- 이미지가 보너스 채널이었을 때: 무시하는 것이 증분 트래픽만 비용으로 들었다.
- 지금: 이미지를 사용하는 시스템이 인간이 페이지를 보게 될지 여부를 결정하는 같은 시스템이다.
구체적인 예시:
- AI 모드 답변이 검색 결과 페이지 내에서 쇼핑 질문을 해결할 때, 상품 데이터와 이미지를 사용한다.
- 렌즈 캡처가 경쟁사 6개를 반환하고 당신을 반환하지 않으면 순위를 비용으로 들었을 뿐 아니라, 페이지가 로드되기 전에 쇼핑객의 고려 집합에서 당신을 제거했다.
- 상품 피드를 읽는 에이전트 체크아웃 흐름은 필요한 필드가 부족한 아름다운 사진을 "보지" 않을 것이다.
따라서 더 이상 논리는 상승 이득에 관한 것이 아니다. 자격에 관한 것이다. 이미지는 이제 기계가 당신의 상품이 무엇인지 확립하는 방법의 일부이며, 그 이후의 모든 것 — 검색, 매칭, 인용, 구매 — 은 그 식별이 올바른지에 달려 있다.
이것이 이 가이드의 전제이며, 다음에 따라오는 것의 순서를 설명한다. 표면이나 전술을 다루기 전에 다음 섹션은 이 시스템들이 실제로 어떻게 보는지를 다룬다. 이미지에서 무엇을 추출하는지, 그 주변 텍스트에서 무엇을 읽는지, 그리고 둘이 어디서 갈라지는지다. 이 가이드의 거의 모든 권장사항은 그 메커니즘에서 유래할 수 있다.