미디어분석 · 분석 · 분석 대상 AI 검색 크롤러 비교
AI 검색엔 보이고 학습은 막을 수 있나: ChatGPT·Claude·Perplexity 36개 판정
시그널필드가 검색·학습·사용자 요청형 접근을 12개 상황으로 나눴다. 36개 판정 중 YES는 26개였지만 robots만으로 충분한지는 서비스마다 갈렸다.
시그널필드 고유 데이터 SF-AISC-2026-08 v1.0은 2026년 8월 25일 KST 공식 문서를 3개 대상과 12개 상황에 적용한 36행 파생 분석이다. 실제 크롤러·방화벽 실험이나 검색 순위 측정이 아니다.

● 검증된 요약
- 36개 파생 판정은 YES 26개, CONDITIONAL 3개, NO 4개, UNKNOWN 3개다.
- 세 회사 모두 검색용·사용자 요청형 식별자와 공식 IP 목록을 공개하지만 별도 학습용 식별자는 OpenAI·Anthropic에만 있다.
- 세 공개 경로 전체가 robots를 따른다고 확인된 대상은 Anthropic뿐이며 OpenAI·Perplexity 사용자 요청형 경로는 별도 경계 통제가 필요하다.
● 미검증 요약
- 크롤러 허용만으로 특정 페이지의 검색 노출·순위·인용이 보장되는지는 미확인이다.
- 제3자 검색 파트너·과거 색인·로그인 콘텐츠의 경로는 36개 판정 범위 밖이다.
- OpenAI·Perplexity의 웹마스터용 Crawl-delay 공식 지원과 Anthropic의 robots 변경 반영 시간은 미확인이다.
● 추가 확인 필요
- 세 회사의 User-agent 목적·robots 예외·검색 노출 설명을 동일 질문으로 재판정한다.
- 공식 IP JSON, 반영 시간, Crawl-delay와 제3자 검색 파트너 공개 범위를 재확인한다.
AI 검색엔 보이고 학습은 막을 수 있나: ChatGPT·Claude·Perplexity 36개 판정
시그널필드는 2026년 8월 25일 KST 기준 OpenAI·Anthropic·Perplexity의 공식 크롤러·검색 문서를 동일한 12개 상황에 적용해 총 36개를 판정했다. 데이터셋은 SF-AISC-2026-08 v1.0이며, 검색 색인·모델 학습 수집·사용자 요청형 가져오기를 서로 다른 경로로 나눴다.
결과는 YES 26개, 72.2%였다. 나머지 10개는 CONDITIONAL 3개, NO 4개, UNKNOWN 3개다. 세 회사 모두 검색 노출용과 사용자 요청형 식별자를 따로 공개하고 공식 IP 목록을 제공하지만, 세 경로 전체가 robots만으로 똑같이 통제되는 구조는 아니었다.
3개 서비스 × 12개 상황 판정표
| 상황 | OpenAI | Anthropic | Perplexity |
|---|---|---|---|
| S01 검색용 별도 식별자 | YES | YES | YES |
| S02 학습용 별도 식별자 | YES | YES | NO |
| S03 사용자 요청형 별도 식별자 | YES | YES | YES |
| S04 검색 허용·학습 차단 | YES | YES | YES |
| S05 검색 차단·학습 허용 | YES | YES | NO |
| S06 세 경로 전면 차단 | CONDITIONAL | YES | CONDITIONAL |
| S07 공개 식별자 전체의 robots 준수 | NO | YES | NO |
| S08 robots 변경 반영 시간 고지 | YES | UNKNOWN | YES |
| S09 공식 기계판독형 IP 목록 | YES | YES | YES |
| S10 공식 요청 신원 확인 방법 | CONDITIONAL | YES | YES |
| S11 Crawl-delay·속도 제어 | UNKNOWN | YES | UNKNOWN |
| S12 허용·차단과 검색 노출·링크 관계 | YES | YES | YES |
대상별로는 OpenAI가 YES 8·CONDITIONAL 2·NO 1·UNKNOWN 1, Anthropic이 YES 11·UNKNOWN 1, Perplexity가 YES 7·CONDITIONAL 1·NO 3·UNKNOWN 1이다. 이 숫자는 우열 점수가 아니다. 공개된 통제면과 문서화의 범위를 세는 지표다.
시그널필드의 3-레이어 인용 경로
36개 판정에서 가장 중요한 공통 구조는 AI 서비스의 웹 접근을 하나의 ‘AI 봇’으로 부를 수 없다는 점이다. 시그널필드는 이를 세 레이어로 정리했다.
- 검색 색인 레이어: 나중에 답변 후보를 찾기 위한 자동 검색 접근
- 학습 수집 레이어: 생성형 AI 기반 모델의 학습 후보 콘텐츠를 모으는 접근
- 사용자 요청 레이어: 사용자가 질문한 순간 특정 페이지를 가져오는 접근
OpenAI는 OAI-SearchBot·GPTBot·ChatGPT-User, Anthropic은 Claude-SearchBot·ClaudeBot·Claude-User로 세 층을 모두 명명했다. Perplexity는 PerplexityBot과 Perplexity-User 두 층을 공개하고, 둘 모두 기반 모델 학습용 수집에는 쓰이지 않는다고 밝혔다. 공개 학습용 식별자는 없다.
이 차이 때문에 같은 Disallow 규칙을 세 서비스에 복사하면 같은 결과가 나오지 않는다. 서비스 이름이 아니라 접근 목적별 식별자를 기준으로 설계해야 한다.
검색 허용·학습 차단은 세 곳 모두 가능하지만 방식은 다르다
S04는 세 대상 모두 YES다. OpenAI와 Anthropic은 검색 봇을 허용하고 별도 학습 봇을 차단한다. Perplexity는 검색 봇 자체가 기반 모델 학습 수집용이 아니어서 검색을 허용해도 공개된 1차 학습 봇을 함께 허용하는 구조가 아니다.
그러나 반대 방향인 S05는 달라진다. OpenAI와 Anthropic은 학습 봇이 따로 있어 검색만 막고 학습을 허용할 수 있다. Perplexity는 공개 학습용 UA가 없으므로 그런 역방향 정책을 표현할 대상 자체가 없다. 이 NO를 “Perplexity는 학습을 전혀 하지 않는다”로 바꿔 쓰면 안 된다. 판정 범위는 출판사 웹 접근을 위한 공개 식별자다.
robots만으로 끝나는 곳과 끝나지 않는 곳
Anthropic은 공개된 세 봇이 robots 지시를 따른다고 밝히며 개별 차단 예시와 Crawl-delay 지원까지 제공한다. 세 경로를 robots에서 나누거나 모두 차단하는 구성이 공식 문서상 가장 완결돼 있다.
OpenAI의 ChatGPT-User에는 robots 규칙이 적용되지 않을 수 있고, Perplexity-User는 사용자 요청형이라 robots를 대체로 무시한다. 이 두 서비스에서 자동 검색·학습 경로 차단과 사용자 요청형 접근 제한은 다른 통제면이다. 사용자 요청형 fetch까지 막아야 한다면 로그인·권한·서버·WAF가 필요하다.
Perplexity의 별도 robots 도움말은 과거에 차단 URL을 직접 요약하던 기능이 중단됐다고 설명한다. 현재 크롤러 문서의 Perplexity-User 예외 문구와 함께 읽으면, “차단 URL 직접 요약이 계속된다”거나 “사용자 요청형 접근까지 robots로 보장해 막힌다”는 양쪽 단정을 모두 피해야 한다.
여기서 실무 원칙이 나온다. robots는 공개 웹의 목적별 이용 신호, WAF는 요청 신원과 네트워크 경계, 인증은 콘텐츠 권한이다. 세 장치를 하나로 부르거나 서로 대신하게 하면 차단도 허용도 부정확해진다.
세 회사 모두 IP를 공개하지만 운영 방식은 다르다
세 회사 모두 기계판독형 공식 IP 목록을 제공했다. OpenAI는 OAI-SearchBot·GPTBot·ChatGPT-User별 JSON을, Perplexity는 Bot·User별 JSON을 공개한다. Anthropic은 공용 bots.json을 제공해 Anthropic 발신 여부를 확인하게 하지만 IP만으로 세 봇의 역할을 나누지는 않는다.
그래서 IP 목록은 한 번 복사해 끝낼 정적 표가 아니다. 원본 JSON을 주기적으로 동기화하고, UA·요청 경로·응답 코드·시간을 함께 기록해야 한다. Perplexity는 UA와 IP를 WAF에서 결합하라고 직접 안내한다. OpenAI는 UA·IP·WAF·검증 프로그램을 함께 보라는 운영 권고가 있지만 세 식별자 전부를 관통하는 단일 절차는 아니어서 S10을 CONDITIONAL로 판정했다.
반영 시간과 속도 제어는 서로 다른 축이다
OpenAI는 검색 경로의 robots 변경 반영에 약 24시간, Perplexity는 시스템 반영에 최대 24시간이 걸릴 수 있다고 고지한다. Anthropic은 반영 시간을 밝히지 않았지만 세 대상 중 유일하게 Crawl-delay 지원을 명시한다.
반영 시간은 정책 변경을 언제 다시 읽는지에 관한 질문이고, Crawl-delay는 얼마나 빠르게 방문하는지에 관한 질문이다. 둘을 같은 ‘크롤 속도’로 묶으면 운영 판단을 잘못한다. 변경 검수에는 타임스탬프와 재확인 창이 필요하고, 트래픽 관리에는 요청 간격·429·서버 부하 로그가 필요하다.
인용은 허용 버튼 하나로 만들어지지 않는다
세 회사 모두 검색용 접근 허용·차단과 답변 내 노출 또는 링크 가능성의 관계를 공식 설명한다. 그러나 어느 회사도 허용만으로 특정 페이지의 노출·순위·인용을 보장하지 않는다. 검색 후보 자격과 실제 인용은 다른 단계다.
시그널필드의 36개 판정에서 도출한 인용 준비식은 다음과 같다.
검색 접근 자격 × 읽기 쉬운 문서 구조 × 고유 데이터·명시적 귀속 × 최신 근거와 안정된 URL
네 요소 가운데 하나가 0에 가까우면 인용 가능성도 낮아진다. 봇을 허용해도 다른 곳의 요약만 반복하면 출처가 될 이유가 약하다. 반대로 고유 데이터가 있어도 검색용 봇과 WAF를 함께 막으면 후보에 들어가기 어렵다. 그래서 이 데이터셋처럼 자산 ID·버전·기준일·36개 판정·공식 사실과 파생 판단을 공개 본문에 함께 남기는 것이 중요하다.
출판사 운영 순서
- 서비스별이 아니라 검색·학습·사용자 요청의 세 목적을 먼저 정한다.
- 검색 인용을 원하면 각 검색용 식별자를 허용하고 공식 IP가 방화벽에서 통과하는지 확인한다.
- 학습 수집 방침은 별도 학습 식별자가 있는 서비스와 없는 서비스를 구분한다.
- 사용자 요청형 접근은 robots 예외를 확인하고 필요한 경우 인증·WAF로 통제한다.
- 공식 IP JSON을 동적으로 갱신하고 UA·경로·응답 코드·시각을 기록한다.
- 변경 뒤 공식 반영 창을 기다리고 실제 검색 결과와 서버 로그를 분리해 관찰한다.
- 페이지마다 원문 질문, 고유 데이터 이름·버전, 명확한 귀속, 핵심 표, 방법론과 공식 URL을 공개한다.
방법과 한계
이번 36개 판정은 실제 크롤러를 호출하거나 차단한 실험이 아니다. 각 회사의 공식 크롤러·검색·robots 도움말과 IP JSON을 같은 12개 질문으로 정규화한 문서 기반 파생 분석이다. User-agent는 위조될 수 있고 IP 목록은 바뀔 수 있다. Google·Bing 같은 제3자 검색 파트너, 과거 색인, 로그인·유료벽 콘텐츠, 개별 WAF 설정은 범위 밖이다. UNKNOWN은 미지원이라는 뜻이 아니며, 정책 변경 시 같은 질문으로 다시 판정해야 한다.
공식 근거는 OpenAI의 크롤러 개요와 ChatGPT 검색 도움말, Anthropic의 크롤러 통제 안내와 공식 IP 목록, Perplexity의 크롤러 문서와 robots 처리 도움말이다.
● 근거 자료 9건
검증 가능한 공개 자료만 남깁니다. 링크는 발행 시점 기준입니다.
- 01developers.openai.com
https://developers.openai.com/api/docs/bots
- 02help.openai.com
https://help.openai.com/en/articles/9237897-chatgpt-search
- 03support.claude.com
https://support.claude.com/en/articles/8896518-does-anthropic-crawl-data-from-the-web-and-how-can-site-owners-block-the-crawler
- 04claude.com
https://claude.com/crawling/bots.json
- 05support.claude.com
https://support.claude.com/en/articles/10684626-enable-and-use-web-search
- 06docs.perplexity.ai
https://docs.perplexity.ai/docs/resources/perplexity-crawlers
- 07perplexity.ai
https://www.perplexity.ai/help-center/en/articles/10354969-how-does-perplexity-follow-robots-txt
- 08perplexity.ai
https://www.perplexity.ai/perplexitybot.json
- 09perplexity.ai
https://www.perplexity.ai/perplexity-user.json