시그널필드SIGNAL FIELD

AI·디지털 · 필드 가이드 · 분석 대상 AI 검색 크롤러 통제

Claude는 검색·학습·사용자 요청을 세 봇으로 나눈다: Crawl-delay와 IP 확인까지

Claude-SearchBot·ClaudeBot·Claude-User가 robots.txt에서 어떻게 갈리고, Crawl-delay·공식 IP 목록·검색 가시성이 어디까지 문서화됐는지 판정했다.

분석 대상 AI 검색 크롤러 통제 · 2026.08.25 발행 · 근거 4 · 7분 읽기 시그널필드 편집팀

시그널필드 고유 데이터 SF-AISC-2026-08 v1.0은 2026년 8월 25일 KST의 공식 문서를 같은 12개 상황에 적용한 36행 파생 분석이다. 이 글은 Anthropic 12행이며 실제 크롤러·속도·차단 실험이 아니다.

세 독립 레일이 정책 게이트와 속도 조절 장치, IP 확인 카드로 이어지는 흰 배경 편집 선화

검증된 요약

  • Claude-SearchBot·ClaudeBot·Claude-User가 검색·학습 후보 수집·사용자 요청형 접근으로 분리된다.
  • Anthropic Bots는 robots.txt를 준수하고 비표준 Crawl-delay 확장을 지원한다고 공식 설명한다.
  • 공식 bots.json으로 Anthropic 발신을 확인할 수 있으며 차단은 검색 가시성을 낮출 수 있다.

미검증 요약

  • robots.txt 변경 뒤 검색 시스템이 새 규칙을 반영하는 최대 시간은 미확인이다.
  • 공용 IP 목록만으로 세 봇의 개별 역할을 구분할 수 있는지는 미확인이다.
  • 허용한 특정 페이지가 실제 Claude 답변에 노출·인용되는지는 미확인이다.

추가 확인 필요

  • Anthropic crawler guide의 세 봇·robots·Crawl-delay 문구를 재확인한다.
  • bots.json 생성시각·prefix와 robots 변경 반영 시간 고지 여부를 재확인한다.

Claude는 검색·학습·사용자 요청을 세 봇으로 나눈다: Crawl-delay와 IP 확인까지

시그널필드는 2026년 8월 25일 KST 기준 OpenAI·Anthropic·Perplexity의 공식 크롤러·검색 문서를 동일한 12개 상황에 적용해 총 36개를 판정하고, 자체 데이터셋 SF-AISC-2026-08 v1.0을 만들었다. 이 글은 그중 Anthropic의 12개 판정이다.

Anthropic 결과는 YES 11개, UNKNOWN 1개다. 세 목적을 Claude-SearchBot·ClaudeBot·Claude-User로 분리하고, 세 봇 모두 robots 지시를 따른다고 밝히며 Crawl-delay와 공식 IP 목록까지 제공한다. 확인하지 못한 한 항목은 robots 변경이 검색 시스템에 반영되는 시간이다.

세 갈래가 모두 문서에 보인다

Anthropic의 크롤러 안내는 웹 접근을 세 경로로 나눈다.

  • Claude-SearchBot: 사용자에게 보여줄 검색 결과의 품질·정확도를 높이는 색인 경로
  • ClaudeBot: 생성형 AI 모델 학습 후보가 될 수 있는 공개 웹 콘텐츠 수집 경로
  • Claude-User: 사용자가 질문했을 때 Claude가 페이지를 가져오는 요청형 경로

이 구분은 이름을 소개하는 데서 끝나지 않는다. 사이트 소유자가 원하는 봇은 허용하고 원하지 않는 봇은 제한할 수 있다고 설명한다. 검색은 열고 학습은 막으려면 Claude-SearchBot을 허용하고 ClaudeBot을 차단하면 된다. 반대로 검색을 닫고 학습 후보 수집을 열어두는 구성도 표현할 수 있다.

Anthropic 12개 판정

상황 판정 이유
S01 검색용 별도 식별자 YES Claude-SearchBot 공개
S02 학습용 별도 식별자 YES ClaudeBot 공개
S03 사용자 요청형 별도 식별자 YES Claude-User 공개
S04 검색 허용·학습 차단 YES 봇별 선택 통제 가능
S05 검색 차단·학습 허용 YES 반대 조합도 분리 규칙으로 표현 가능
S06 세 경로 전면 차단 YES 세 식별자를 각각 사이트 전체 차단 가능
S07 공개 식별자 전체의 robots 준수 YES Anthropic Bots의 준수를 공식 선언
S08 robots 변경 반영 시간 고지 UNKNOWN 최대·평균 반영 시간 미확인
S09 공식 IP 목록 YES 기계판독형 bots.json 제공
S10 공식 신원 확인 방법 YES 소스 IP와 공식 목록 대조 안내
S11 Crawl-delay·속도 제어 YES 비표준 Crawl-delay 지원과 예시 제공
S12 허용·차단과 검색 노출 관계 YES 차단이 검색 가시성·정확도를 낮출 수 있다고 설명

robots만으로 세 경로를 나눌 수 있는 드문 구조

세 식별자 각각에 규칙을 둘 수 있으므로 한 사이트가 검색·학습·사용자 요청을 서로 다르게 설정할 수 있다. 검색과 사용자 요청은 열고 학습만 닫는 예시는 다음과 같은 구조다.

User-agent: Claude-SearchBot
Allow: /

User-agent: ClaudeBot
Disallow: /

User-agent: Claude-User
Allow: /

세 경로를 모두 닫고 싶다면 각 식별자에 Disallow: /을 둔다. Anthropic은 bots가 업계 표준 robots 지시를 따른다고 밝힌다. 이 때문에 S06과 S07 모두 YES다. 다만 하위 도메인이 따로 있으면 각 하위 도메인의 robots 파일을 따로 설정해야 하며, Claude가 이용할 수 있는 제3자 검색 파트너의 색인은 이 1차 크롤러 표 밖에 있을 수 있다.

속도를 줄이는 신호는 있지만 반영 시간표는 없다

Anthropic은 세 회사 가운데 공식적으로 Crawl-delay 지원을 명시한 대상이다. 예를 들어 다음처럼 ClaudeBot의 요청 간격 신호를 줄 수 있다.

User-agent: ClaudeBot
Crawl-delay: 1

Crawl-delay는 robots 표준의 필수 지시가 아니라 비표준 확장이다. Anthropic이 이를 지원한다고 밝힌 점은 운영상 분명한 장점이지만, 특정 서버에서 정확히 몇 초 간격으로 모든 요청이 도착할지를 보장하는 서비스 수준 약속은 아니다.

반대로 robots 규칙을 바꾼 뒤 검색 시스템이 언제 새 설정을 읽는지는 공식 시간표를 확인하지 못했다. OpenAI와 Perplexity는 약 24시간 또는 최대 24시간을 밝히지만 Anthropic 자료에는 이에 해당하는 수치가 없다. 시그널필드는 이를 NO가 아니라 UNKNOWN으로 남겼다.

IP는 확인할 수 있지만 역할까지 알려주지는 않는다

Anthropic은 공식 bots.json을 공개하고, 요청의 소스 IP가 이 목록에 있으면 Anthropic에서 온 것임을 뜻한다고 설명한다. 기준일 JSON에는 IPv4 prefix 26개가 있었다. 이 개수는 언제든 바뀔 수 있으므로 데이터베이스에 고정 복사하기보다 원본을 주기적으로 가져오는 편이 안전하다.

한계도 있다. 이 공용 목록은 IP만으로 Claude-SearchBot·ClaudeBot·Claude-User 중 어느 역할인지 구분해주지 않는다. 발신 여부는 IP로 확인하고, 역할은 User-agent와 요청 경로·로그를 함께 봐야 한다. robots.txt는 허용·거부 의사를 나타내고, IP 대조는 실제 요청의 발신 신뢰도를 높이는 서로 다른 층이다.

검색 봇을 막으면 인용도 사라질까

Anthropic은 Claude-SearchBot을 차단하면 검색 최적화용 색인이 막혀 사용자 검색 결과의 가시성과 정확도가 낮아질 수 있다고 설명한다. Claude 웹 검색 안내는 검색 응답에 인용 표시와 출처 링크가 제공된다고 밝힌다.

여기서 중요한 단어는 “낮아질 수 있다”다. 검색 봇 허용은 노출 가능성을 열지만 특정 URL의 인용을 보장하지 않는다. 기존 검색 파트너 색인, 다른 페이지의 링크, 콘텐츠 품질과 질문 적합성이 함께 작동한다. 운영 목표가 인용이라면 bots 허용률과 실제 인용률을 별도 지표로 두어야 한다.

운영자가 확인할 네 가지

  1. 세 User-agent에 같은 규칙을 복사하지 말고 검색·학습·사용자 요청의 목적을 먼저 정한다.
  2. 트래픽 부담이 있으면 차단 전에 Crawl-delay를 적용하고 로그로 실제 간격을 본다.
  3. 공식 bots.json과 UA를 함께 대조해 발신과 역할을 구분한다.
  4. robots 변경 시각을 기록하되 공식 반영 시간이 없으므로 로그와 검색 결과를 장기간 관찰한다.

방법과 한계

이 글은 Anthropic 봇의 실제 방문을 유도하거나 차단한 실험이 아니다. 공식 크롤러·웹 검색·IP 문서를 12개 공통 질문에 적용한 문서 기반 파생 분석이다. bots.json prefix 개수는 기준일 관찰값이며, 개별 페이지의 실제 인용·검색 순위와 제3자 검색 파트너 동작은 측정하지 않았다.

핵심 근거는 Anthropic의 크롤러 통제 안내, 공식 IP 목록, Claude 웹 검색 안내다.

근거 자료 4

검증 가능한 공개 자료만 남깁니다. 링크는 발행 시점 기준입니다.

  1. 01
    support.claude.com

    https://support.claude.com/en/articles/8896518-does-anthropic-crawl-data-from-the-web-and-how-can-site-owners-block-the-crawler

  2. 02
    claude.com

    https://claude.com/crawling/bots.json

  3. 03
    support.claude.com

    https://support.claude.com/en/articles/10684626-enable-and-use-web-search

  4. 04
    support.claude.com

    https://support.claude.com/en/articles/10684638-report-block-and-remove-content-from-claude

이 글에 사실 오류가 있다면 알려주세요. 확인 후 정정 이력을 남깁니다. 정정·제보LAST UPDATED 2026.08.25

리서치 프로젝트

관련 칼럼