AI 검색 · 웹 기술
AI 크롤러, 막을 것인가 열 것인가
GPTBot·ClaudeBot·PerplexityBot… 사이트를 읽어 가는 AI 크롤러를 어떻게 할 것인가. 정답이 아니라 판단 기준을 - 실제로 결정해 본 운영자의 관점에서 정리했습니다.
테크유니온 4분 읽기
사이트 접속 로그를 보면 낯선 방문자들이 늘고 있습니다. GPTBot, ClaudeBot, PerplexityBot, CCBot - AI 회사들의 크롤러입니다. 이들을 막을 것인가, 열어 둘 것인가. 저희는 자사 홈페이지에서 이 결정을 실제로 내려야 했고, 그 과정에서 정리한 판단 기준을 공유합니다.
결정의 축은 하나 - 콘텐츠가 상품인가, 광고판인가
이 문제에 보편적 정답은 없습니다. 사이트의 성격에 따라 답이 갈릴 뿐입니다.
콘텐츠 자체가 상품인 사이트 - 언론사, 유료 강의, 리서치 판매, 스톡 이미지. 이런 곳에서 AI 학습 허용은 상품을 무상으로 넘기는 결정과 같습니다. 실제로 주요 언론사들이 AI 크롤러를 차단하거나 별도 라이선스 계약으로 가는 이유입니다.
노출이 목적인 사이트 - 회사 홈페이지, 서비스 소개, 채용 페이지. 여기서 콘텐츠는 상품이 아니라 광고판입니다. 광고판은 많이 읽힐수록 이득이고, AI 가 "이런 회사가 있다"고 답변에 언급해 주는 것이 바로 광고판의 성공입니다. 저희 홈페이지가 여기 해당했고, 그래서 전부 열었습니다.
대부분의 사이트는 이 둘 사이 어딘가에 있습니다. 그래서 크롤러를 뭉뚱그리지 말고 종류별로 나눠 결정하는 것이 실용적입니다.
크롤러는 세 종류다 - 각각 다른 결정
학습용 크롤러 (GPTBot, ClaudeBot, CCBot, Applebot-Extended, Google-Extended 등). 모델 학습에 콘텐츠를 수집합니다. 허용하면 미래 모델의 지식에 우리 콘텐츠가 스며들고, 차단하면 콘텐츠는 보호되지만 AI 의 세계에서 우리가 옅어집니다. "콘텐츠가 상품인가"라는 질문이 가장 직접적으로 적용되는 종류입니다.
검색·인용용 크롤러 (OAI-SearchBot, Claude-SearchBot, PerplexityBot 등). AI 검색 답변에 출처 링크와 함께 인용하기 위해 수집합니다. 노출과 유입으로 이어지는 경로라, 학습은 막더라도 이쪽은 여는 절충이 성립합니다. 실제로 언론사 중에도 학습용만 막고 검색용은 여는 곳들이 있습니다.
사용자 대리 방문 (ChatGPT-User, Claude-User 등). 사용자가 AI 에게 "이 페이지 요약해 줘"라고 시켰을 때의 방문입니다. 이것을 막는 것은 사실상 그 사용자를 막는 것에 가깝습니다.
이렇게 나누면 "다 막기 vs 다 열기"가 아니라, 우리 사이트에 맞는 조합을 설계할 수 있습니다.
실무에서 밟히는 함정 하나
결정을 내렸다면 robots.txt 로 선언하게 되는데, 여기 잘 알려지지 않은 함정이 있습니다. robots.txt 의 그룹 규칙은 상속되지 않습니다. 특정 크롤러를 이름으로 지목해 그룹을 만드는 순간, 그 크롤러는 모두에게 적용되던 기본 그룹(User-agent: *)의 규칙을 통째로 무시합니다.
무슨 뜻이냐면 - 기본 그룹에서 관리자 페이지를 차단해 두고, AI 크롤러 그룹에는 "Allow: /"만 적으면, 그 크롤러에게는 관리자 페이지 차단이 사라집니다. 저희도 자사 사이트 작업 중 이 동작을 확인하고, 봇 그룹마다 차단 규칙을 다시 적는 방식으로 처리했습니다. 전체 개편 과정은 경험기에 있습니다.
마지막으로 - '결정하지 않음'도 결정이다
robots.txt 를 손대지 않으면 대부분의 AI 크롤러에게 열려 있는 상태입니다. 그것이 우리 사이트에 맞는 상태라면 문제없지만, 검토 없이 그렇게 두는 것과 검토 후 그렇게 두는 것은 다릅니다. 일 년에 한 번이라도, 우리 콘텐츠의 성격과 크롤러 목록을 놓고 이 결정을 갱신하는 것을 권합니다. 크롤러 목록은 계속 늘어나고 있으니까요.
자주 묻는 질문
robots.txt 로 막으면 확실히 안 긁어 가나요?
robots.txt 는 법적 강제가 아니라 신사협정입니다. 주요 AI 회사들은 준수를 공언하고 있지만, 모든 수집 주체가 지키는 것은 아닙니다. 그래서 "확실한 보호"가 필요한 콘텐츠라면 로그인 뒤에 두는 것이 유일하게 확실한 방법입니다.
이미 학습된 내 콘텐츠는 차단하면 삭제되나요?
아닙니다. 차단은 앞으로의 수집에만 적용되고, 이미 학습된 모델에서 소급 제거되지 않습니다. 그래서 이 결정은 미래를 위한 결정이고, 미룰수록 선택지가 줄어드는 결정이기도 합니다.
차단하면 검색 순위에 영향이 있나요?
AI 크롤러 차단은 구글·네이버의 일반 검색 크롤러와 별개라 전통적 검색 순위에는 영향이 없습니다. 단, Google-Extended 처럼 한 회사가 검색용과 AI 용 토큰을 분리 운영하는 경우가 있으니, 차단 대상 토큰이 무엇에 쓰이는지 확인하고 결정해야 합니다.
우리 사이트에 어떤 AI 크롤러가 오는지 어떻게 확인하나요?
서버 접속 로그에서 User-Agent 문자열을 집계하면 됩니다. 호스팅 관리 화면의 통계나 로그 분석 도구에서 GPTBot 등 이름으로 검색해 보세요. 생각보다 많이, 자주 오고 있다는 것을 확인하는 것부터가 이 결정의 시작입니다.