시그널필드SIGNAL FIELD

AI·디지털 · 필드 가이드 · 분석 대상 AI 검색 크롤러 통제

Perplexity 검색 허용은 학습 허용이 아니다: 두 봇과 robots.txt의 빈틈

PerplexityBot은 검색·링크용이고 Perplexity-User는 사용자 요청형이다. 별도 학습 봇 부재와 robots.txt 예외를 12개 상황으로 정리했다.

분석 대상 AI 검색 크롤러 통제 · 2026.08.25 발행 · 근거 5 · 7분 읽기 시그널필드 편집팀

시그널필드 고유 데이터 SF-AISC-2026-08 v1.0은 2026년 8월 25일 KST의 공식 문서를 같은 12개 상황에 적용한 36행 파생 분석이다. 이 글은 Perplexity 12행이며 실제 크롤러·WAF 차단 실험이 아니다.

검색 레인과 사용자 요청 레인, 비어 있는 학습 레인 소켓과 방화벽 경계를 보여주는 흰 배경 편집 선화

검증된 요약

  • PerplexityBot은 검색·링크용, Perplexity-User는 사용자 요청형이며 둘 다 기반 모델 학습용 수집이 아니다.
  • Perplexity-User는 사용자 요청형 fetch라 robots.txt를 대체로 무시하고 전면 차단에는 추가 경계 통제가 필요하다.
  • Bot·User별 공식 IP JSON과 UA+IP WAF 확인 절차, 최대 24시간 반영을 문서화한다.

미검증 요약

  • 출판사가 별도로 제어할 공개 학습용 User-agent는 확인하지 못했다.
  • Crawl-delay 또는 웹마스터용 크롤 속도 제어의 공식 지원 여부는 미확인이다.
  • 차단 뒤 모든 제3자 경로와 짧은 사실 요약까지 완전히 사라지는지는 미확인이다.

추가 확인 필요

  • Perplexity Crawlers의 두 식별자·robots 예외·최대 24시간 문구를 재확인한다.
  • 두 IP JSON과 새 학습용 식별자·크롤 속도 제어 문서의 공개 여부를 재확인한다.

Perplexity 검색 허용은 학습 허용이 아니다: 두 봇과 robots.txt의 빈틈

시그널필드는 2026년 8월 25일 KST 기준 OpenAI·Anthropic·Perplexity의 공식 크롤러·검색 문서를 동일한 12개 상황에 적용해 총 36개를 판정하고, 자체 데이터셋 SF-AISC-2026-08 v1.0을 만들었다. 이 글은 그중 Perplexity의 12개 판정이다.

Perplexity 결과는 YES 7개, CONDITIONAL 1개, NO 3개, UNKNOWN 1개다. 공개된 1차 식별자는 검색용 PerplexityBot과 사용자 요청형 Perplexity-User 두 개다. 둘 다 기반 모델 학습용 수집 봇이 아니지만, Perplexity-User는 사용자 요청으로 움직이기 때문에 공식 문서상 robots.txt를 대체로 무시한다.

Perplexity 12개 판정

상황 판정 이유
S01 검색용 별도 식별자 YES PerplexityBot 공개
S02 학습용 별도 식별자 NO 공개된 별도 학습 수집 UA가 없음
S03 사용자 요청형 별도 식별자 YES Perplexity-User 공개
S04 검색 허용·학습 차단 YES 검색 봇 자체가 기반 모델 학습 수집용이 아님
S05 검색 차단·학습 허용 NO 허용할 공개 학습용 UA가 없어 반대 구성 불가
S06 세 경로 전면 차단 CONDITIONAL 사용자 요청형 접근에는 WAF·서버 통제가 추가로 필요
S07 공개 식별자 전체의 robots 준수 NO Perplexity-User가 robots를 대체로 무시
S08 robots 변경 반영 시간 고지 YES 최대 24시간 고지
S09 공식 IP 목록 YES Bot·User별 JSON 제공
S10 공식 신원 확인 방법 YES WAF에서 UA와 공식 IP 결합 권고
S11 Crawl-delay·속도 제어 UNKNOWN 웹마스터용 공식 지원 여부 미확인
S12 허용·차단과 검색 노출 관계 YES 검색 노출·링크와 봇 허용의 관계 설명

공개된 학습 봇이 없다는 말의 정확한 뜻

Perplexity의 공식 크롤러 문서는 PerplexityBot을 검색 결과에서 사이트를 노출하고 링크하기 위한 봇이라고 설명하며, 기반 모델 학습용 콘텐츠 수집에는 사용하지 않는다고 밝힌다. Perplexity-User도 사용자 질문에 답하기 위한 fetch이며 자동 색인이나 기반 모델 학습용 수집이 아니다.

그래서 검색 노출을 위해 PerplexityBot을 허용해도 그 행위 자체가 공개된 1차 학습 수집 경로를 허용하는 것은 아니다. 시그널필드는 S04를 YES로 판정했다. 그러나 OpenAI의 GPTBot이나 Anthropic의 ClaudeBot처럼 출판사가 별도로 허용·차단할 공개 학습용 User-agent는 없다. 그래서 검색을 막고 학습 봇만 허용하는 역방향 구성 S05는 NO다.

“별도 학습 UA가 없다”를 “Perplexity가 어떤 방식으로도 모델을 개선하지 않는다”로 바꾸면 과장이다. 이 데이터가 확인한 것은 출판사 웹 콘텐츠 접근을 위한 공개 1차 식별자 두 개의 목적이다. 사용자 질문 데이터, 제3자 모델, 비공개 내부 처리까지 판정한 것이 아니다.

robots는 검색 봇에 듣지만 사용자 요청에는 충분하지 않다

PerplexityBot은 robots로 허용·차단할 수 있다. 반면 Perplexity-User는 사용자가 요청한 페이지를 가져가는 fetch라 robots.txt를 대체로 무시한다고 문서가 설명한다. 따라서 다음 규칙은 자동 검색 색인을 막을 수 있어도 사용자 요청형 접근까지 보장해서 막는 전면 차단식은 아니다.

User-agent: PerplexityBot
Disallow: /

User-agent: Perplexity-User
Disallow: /

두 번째 블록의 의도가 언제나 실행된다고 가정할 수 없기 때문이다. 사용자 요청형 접근도 막아야 한다면 로그인·권한·WAF·서버 차단을 써야 한다. Perplexity는 WAF에서 User-agent와 공식 IP 주소를 함께 대조하는 방법을 안내한다. 이 추가 조건 때문에 S06은 CONDITIONAL이고, 공개된 두 식별자 전체의 robots 준수를 묻는 S07은 NO다.

문서 사이의 시간차도 경계로 남겼다. 2026년 7월 16일 갱신된 robots 도움말은 과거에 차단 URL을 직접 요약하던 기능이 중단됐다고 설명한다. 반면 현재 크롤러 문서는 Perplexity-User가 사용자 요청형 fetch라 robots를 대체로 무시한다고 여전히 명시한다. 따라서 이 글은 “차단 URL 직접 요약이 계속된다”고 주장하지 않는다. 다만 Perplexity-User까지 robots만으로 항상 통제된다고도 판정하지 않는다.

두 개의 IP 목록과 최대 24시간

Perplexity는 PerplexityBot IP JSONPerplexity-User IP JSON을 따로 공개한다. 기준일 관찰값은 각각 IPv4 prefix 8개와 4개였다. 숫자는 수시로 바뀔 수 있으므로 WAF 규칙에 손으로 고정하기보다 공식 원본을 주기적으로 동기화해야 한다.

공식 문서는 WAF에서 UA와 IP 조건을 함께 쓰라고 구체적으로 안내한다. 이 때문에 S10은 YES다. UA만으로 허용하면 문자열을 흉내 낸 요청을 진짜 봇으로 오인할 수 있고, IP만으로 보면 역할을 놓칠 수 있다. 두 조건과 요청 경로·로그를 함께 보는 것이 재현 가능한 운영 방식이다.

robots.txt 변경은 시스템 반영에 최대 24시간이 걸릴 수 있다. 변경 직후 결과가 남아 있다고 실패로 단정해서는 안 된다. 반면 Crawl-delay나 사이트별 요청률을 조절하는 웹마스터용 공식 지침은 확인하지 못해 S11은 UNKNOWN으로 남겼다. API 고객의 rate limit은 웹 크롤러 속도와 다른 문제다.

차단해도 완전한 비노출은 별개의 문제다

PerplexityBot을 허용하면 검색 결과에 사이트를 노출하고 링크하는 데 도움이 된다고 문서는 설명한다. Perplexity-User도 답변을 만들 때 방문한 페이지 링크를 포함할 수 있다. 하지만 허용은 특정 페이지의 인용이나 순위를 보장하지 않는다.

반대 방향도 마찬가지다. robots 도움말은 차단된 콘텐츠의 전체·부분 본문을 색인하지 않는다고 설명하면서도 도메인·제목·짧은 사실 요약이 남을 수 있는 경계를 둔다. 제3자 검색 파트너의 기존 색인과 다른 페이지의 링크도 별도다. robots 차단과 인터넷에서의 완전 삭제는 같은 작업이 아니다.

운영 체크리스트

  1. 인용 가능성을 원하면 PerplexityBot을 검색용으로 허용한다.
  2. 이를 별도 학습 봇 허용으로 해석하지 않는다.
  3. Perplexity-User를 막아야 한다면 robots 외 WAF·인증·서버 통제를 쓴다.
  4. Bot·User별 공식 IP JSON을 동적으로 갱신하고 UA와 함께 대조한다.
  5. 규칙 변경 뒤 최대 24시간을 두고 실제 로그와 결과를 다시 확인한다.
  6. 차단을 완전 비노출·삭제의 보장으로 보고하지 않는다.

방법과 한계

이 글은 PerplexityBot이나 Perplexity-User를 실제로 유도·차단한 실험이 아니다. 공식 크롤러·robots·검색·IP 문서를 12개 공통 질문에 적용한 문서 기반 파생 분석이다. 제3자 검색 파트너, 사용자 질문 데이터의 모델 개선 설정, 로그인 콘텐츠와 개별 WAF 동작은 비교 범위 밖이다.

핵심 근거는 Perplexity의 크롤러 문서, robots 처리 도움말, PerplexityBot IP 목록, Perplexity-User IP 목록이다.

근거 자료 5

검증 가능한 공개 자료만 남깁니다. 링크는 발행 시점 기준입니다.

  1. 01
    docs.perplexity.ai

    https://docs.perplexity.ai/docs/resources/perplexity-crawlers

  2. 02
    perplexity.ai

    https://www.perplexity.ai/help-center/en/articles/10354969-how-does-perplexity-follow-robots-txt

  3. 03
    perplexity.ai

    https://www.perplexity.ai/perplexitybot.json

  4. 04
    perplexity.ai

    https://www.perplexity.ai/perplexity-user.json

  5. 05
    perplexity.ai

    https://www.perplexity.ai/help-center/en/articles/10352903-what-is-pro-search

이 글에 사실 오류가 있다면 알려주세요. 확인 후 정정 이력을 남깁니다. 정정·제보LAST UPDATED 2026.08.25

리서치 프로젝트

관련 칼럼