고객이 찾아오게 만드는 것이 목적인 일반 기업 사이트라면, AI 크롤러는 허용하는 쪽이 이득입니다. 크롤러가 사이트를 읽어 가야 ChatGPT나 Perplexity 같은 AI 검색의 답변에 우리 회사가 등장할 수 있기 때문입니다. 차단이 필요한 쪽은 콘텐츠 자체가 상품인 언론사·출판사처럼 무단 학습을 우려하는 경우이고, 이때도 전면 차단보다는 학습용과 검색용을 구분해 선택하는 방법이 있습니다. 아래에서 질문 순서대로 풀어보겠습니다.

AI 크롤러가 정확히 무엇인가요?

크롤러는 웹페이지를 자동으로 방문해 내용을 읽어 가는 프로그램입니다. 구글 검색이 Googlebot으로 웹을 수집하듯, AI 회사들도 자체 크롤러를 운영합니다. 대표적으로 OpenAI의 GPTBot과 OAI-SearchBot, Anthropic의 ClaudeBot과 Claude-SearchBot, Perplexity의 PerplexityBot, 구글의 Google-Extended가 있습니다. 사이트의 robots.txt 파일(수집 프로그램에게 접근 규칙을 알려주는 파일)에 이 이름들을 적어 허용하거나 차단할 수 있습니다.

용도가 다 같은 크롤러인가요?

아닙니다. 크게 두 갈래입니다. GPTBot이나 Google-Extended는 주로 AI 모델의 학습 데이터 수집에 쓰이고, OAI-SearchBot이나 Claude-SearchBot 같은 검색용 크롤러는 사용자가 질문한 시점에 답변의 근거 자료를 찾기 위해 웹을 읽습니다. 학습용은 막고 검색용만 열어두는 선택도 가능하다는 뜻입니다. 고객 유입이 목적이라면 적어도 검색용 크롤러는 열어두는 것이 합리적입니다.

차단하면 무슨 일이 생기나요?

AI가 우리 사이트의 내용을 직접 확인할 수 없게 됩니다. 그 결과 AI 검색 답변에서 우리 회사가 빠지거나, 사이트 밖에 남아 있는 오래된 정보·타인이 쓴 글만으로 회사가 설명될 수 있습니다. 가격이나 서비스 내용이 바뀌었는데 AI는 옛 자료만 근거로 답하는 상황이 생기는 것입니다. 주의할 점은 의도치 않은 차단입니다. robots.txt는 열어뒀는데 클라우드플레어 같은 보안 서비스의 봇 차단 기능이 AI 크롤러를 막고 있는 경우가 흔하므로, 서버 접속 기록에 GPTBot 방문이 있는지 확인해 보는 것이 확실합니다.

허용하려면 어떻게 설정하나요?

robots.txt에서 해당 크롤러를 차단하는 줄을 지우거나, User-agent: GPTBot 아래 Allow: / 를 명시하면 됩니다. 수정은 홈페이지 제작사나 호스팅 업체에 요청하면 되고, 워드프레스라면 SEO 플러그인 설정에서 직접 바꿀 수도 있습니다. 반대로 학습만 막고 싶다면 GPTBot과 Google-Extended에만 Disallow를 걸고 검색용 크롤러는 열어둡니다. 설정 후에는 브라우저에서 우리도메인/robots.txt 를 열어 반영을 확인하고, 보안 서비스를 쓴다면 봇 차단 예외 목록에 같은 이름을 추가해야 실제로 허용됩니다.