AI 크롤러 robots.txt 설정: 허용과 차단 기준
GPTBot, ClaudeBot, PerplexityBot, OAI-SearchBot 등 주요 AI 크롤러의 정확한 이름과 robots.txt 작성법, 허용과 차단 판단 기준, 실제 서버 로그로 측정한 방문 빈도를 정리했습니다.
AI 검색에 노출되고 싶다면 가장 먼저 확인할 것은 콘텐츠가 아니라 robots.txt입니다. GPTBot이 Disallow로 막혀 있으면 아무리 좋은 글을 써도 ChatGPT 답변의 근거가 될 수 없습니다. 반대로 학습에 쓰이는 것을 원치 않는다면 어떤 이름을 어떻게 막아야 하는지 정확히 알아야 합니다.
문제는 AI 크롤러 이름이 하나가 아니고, 같은 회사도 용도에 따라 다른 이름을 쓴다는 점입니다. 학습용과 실시간 검색용이 분리된 경우도 있어서 하나를 막았다고 안심할 수 없습니다. 이 글은 주요 크롤러의 이름과 용도를 정리하고, 저희 서버 로그에 실제로 얼마나 자주 찾아오는지를 함께 보여 드립니다.
주요 AI 크롤러의 이름과 용도
OpenAI는 세 가지를 씁니다. GPTBot은 모델 학습용 수집, OAI-SearchBot은 ChatGPT 검색 결과에 사이트를 표시하기 위한 색인용, ChatGPT-User는 사용자가 대화 중 링크를 요청했을 때 그 자리에서 가져오는 용도입니다. 학습은 원치 않지만 검색 노출은 원한다면 GPTBot만 막고 OAI-SearchBot은 열어 두는 구성이 가능합니다.
Anthropic은 ClaudeBot이 수집을 담당하고, 사용자 요청 시점의 접근은 Claude-User로 구분합니다. Perplexity는 PerplexityBot이 색인용, Perplexity-User가 사용자 요청 처리용입니다. 구글은 조금 다른데, Googlebot은 일반 검색용이고 Google-Extended는 Gemini 학습과 근거 활용 여부를 따로 제어하는 토큰입니다. Google-Extended를 막아도 일반 검색 색인에는 영향이 없습니다.
이 밖에 Applebot-Extended, meta-externalagent, Amazonbot, Bytespider 등이 있습니다. 이름이 계속 늘어나기 때문에 목록을 통째로 외우기보다, 접근 로그에서 실제로 찾아오는 이름을 확인해 대응하는 방식이 현실적입니다.
실제로 얼마나 자주 오는지 로그로 확인했습니다
저희 사이트의 nginx 접근 로그를 보면 방문 빈도 차이가 뚜렷합니다. GPTBot이 가장 적극적이어서 블로그 글 열네 편을 하루에 두 번씩 가져간 날이 있었습니다. ClaudeBot은 누적 마흔네 개 페이지, meta-externalagent는 스물아홉 개, Applebot은 열아홉 개를 수집했습니다.
여기서 알 수 있는 것은 AI 크롤러가 이미 상당히 부지런하다는 점입니다. 사이트를 열어 두면 특별한 제출 절차 없이도 며칠 안에 찾아옵니다. 검색엔진 색인과 달리 승인 대기 같은 단계가 없기 때문에, 허용 설정만 제대로 되어 있으면 수집 자체는 빠르게 이루어집니다.
동시에 주의할 점도 보입니다. 같은 문서를 하루 두 번씩 가져가는 봇이 있으므로 트래픽 비용을 고려해야 합니다. 이미지가 많거나 서버 자원이 빠듯한 사이트라면 Crawl-delay나 특정 경로 차단으로 부담을 조절할 필요가 있습니다.
허용과 차단은 목적에 따라 갈립니다
AI 검색 노출이 목표라면 결론은 단순합니다. 위에 적은 크롤러를 모두 열어 두는 것이 맞습니다. 인용되려면 먼저 읽혀야 하고, 읽히려면 접근이 열려 있어야 합니다. 특히 색인용 봇인 OAI-SearchBot과 PerplexityBot을 막는 것은 검색 결과에서 스스로 빠지겠다는 선언과 같습니다.
반대로 언론사, 유료 콘텐츠 사업자, 창작물 권리를 지켜야 하는 곳은 판단이 다를 수 있습니다. 이 경우에도 전부 막기보다 학습용과 검색용을 구분하는 접근이 낫습니다. GPTBot과 Google-Extended는 막고 OAI-SearchBot은 열어 두면 학습 사용은 거부하면서 검색 노출은 유지할 수 있습니다.
가장 흔한 실수는 의도치 않은 전면 차단입니다. 개발 단계에서 넣은 Disallow: /가 그대로 배포되거나, 보안 설정에서 알 수 없는 User-Agent를 일괄 차단하면서 AI 크롤러가 함께 막히는 경우입니다. robots.txt는 통과하는데 서버나 CDN의 방화벽 규칙에서 차단되는 사례도 있어서, 파일만 보고 안심하면 안 됩니다.
robots.txt만으로는 부족한 부분
robots.txt는 강제력이 없는 약속입니다. 규칙을 지키지 않는 수집기도 존재하므로 반드시 막아야 하는 콘텐츠라면 인증 뒤에 두거나 서버 단에서 차단해야 합니다. robots.txt에 경로를 적는 행위 자체가 그 경로의 존재를 알리는 셈이라는 점도 기억할 필요가 있습니다.
반대 방향의 한계도 있습니다. 접근을 허용했다고 해서 인용이 보장되지는 않습니다. 크롤러가 페이지를 가져가도 본문이 자바스크립트로만 그려지거나 핵심 설명이 이미지 안에 들어 있으면 쓸 수 있는 재료가 없습니다. 허용은 필요조건이지 충분조건이 아닙니다.
그래서 robots.txt 설정을 마쳤다면 다음 단계는 콘텐츠가 서버 응답 HTML 안에 텍스트로 들어 있는지, 질문에 대한 답이 문단 앞쪽에 있는지, 구조화 데이터로 사실 정보를 제공하는지를 확인하는 일입니다.
설정 점검 순서
현재 robots.txt를 브라우저에서 직접 열어 전문을 확인합니다. 여러 User-agent 블록이 있을 때 마지막 규칙이 앞을 덮어쓰는 경우가 있으므로 전체를 읽어야 합니다. Disallow: / 가 남아 있는지 먼저 봅니다.
접근 로그에서 지난 30일간 방문한 봇의 User-Agent를 집계합니다. 목록에 없는 새 이름이 보이면 검색해서 용도를 확인하고 허용 여부를 정합니다. 실제 방문 기록이 가장 정확한 대응 근거입니다.
차단이 아니라 허용을 의도했는데 막혀 있었다면 수정 후 응답을 다시 확인합니다. CDN 캐시 때문에 이전 파일이 유지될 수 있으므로 캐시를 비우고 확인해야 합니다.
robots.txt 하단에 Sitemap 경로를 선언했는지 확인합니다. 이 한 줄이 있어야 크롤러가 전체 URL 목록을 찾아갑니다. 사이트맵 주소는 절대 경로로 적어야 합니다.
설정이 끝나면 며칠 뒤 접근 로그를 다시 보고 의도한 봇이 실제로 들어오는지 검증합니다. 설정과 결과가 다른 경우가 생각보다 많습니다.
자주 묻는 질문
GPTBot을 막으면 ChatGPT 답변에 우리 사이트가 안 나오나요?
학습 데이터에서는 빠지지만 검색 노출과는 별개입니다. ChatGPT의 웹 검색 결과에 표시되는 것은 OAI-SearchBot이 담당하므로, GPTBot을 막고 OAI-SearchBot을 열어 두면 학습 사용은 거부하면서 검색 노출은 유지할 수 있습니다.
Google-Extended를 막으면 구글 검색 순위가 떨어지나요?
떨어지지 않습니다. Google-Extended는 Gemini 학습과 AI 응답 근거 활용 여부만 제어하는 토큰이고 일반 검색 색인은 Googlebot이 담당합니다. 둘은 독립적으로 동작하므로 검색 순위에 영향을 주지 않습니다.
robots.txt 대신 메타 태그로 AI 크롤러를 제어할 수 있나요?
일부는 가능합니다. noai나 noimageai 같은 값을 인식하는 서비스가 있지만 표준이 아니라서 적용 범위가 좁습니다. 현재로서는 robots.txt의 User-agent 단위 제어가 가장 널리 지켜지는 방식이고, 페이지 단위로 세밀하게 나눠야 할 때 메타 태그를 보조로 쓰는 구성이 안전합니다.
실행 체크리스트
- GPTBot, OAI-SearchBot, ClaudeBot, PerplexityBot, Google-Extended의 허용 여부를 각각 확인합니다.
- 개발 단계에서 넣은 Disallow: / 가 배포본에 남아 있지 않은지 봅니다.
- 방화벽이나 CDN에서 알 수 없는 User-Agent를 일괄 차단하고 있지 않은지 점검합니다.
- robots.txt 하단에 Sitemap 절대 경로를 선언합니다.
- 설정 후 며칠 뒤 접근 로그로 의도한 봇의 방문을 검증합니다.
정리
AI 검색 최적화에서 robots.txt는 콘텐츠보다 앞에 있는 관문입니다. 여기가 막혀 있으면 뒤의 모든 작업이 무효가 되고, 열려 있으면 별도 제출 없이도 며칠 안에 주요 크롤러가 찾아옵니다. 실제로 저희 로그에서 GPTBot과 ClaudeBot은 매우 부지런히 움직이고 있었습니다.
설정 파일을 고쳤다면 반드시 접근 로그로 결과를 확인하세요. 의도와 실제가 어긋나는 경우가 흔하고, 그 차이는 로그를 봐야만 드러납니다.