AI·디지털 · 필드 가이드 · 분석 대상 AI 검색 크롤러 통제
ChatGPT 검색에는 보이고 학습은 막을 수 있다: OAI-SearchBot·GPTBot의 분리
OAI-SearchBot·GPTBot·ChatGPT-User를 공식 문서 12개 상황으로 나눠 검색 노출, 학습 차단, 사용자 요청형 접근과 약 24시간 반영을 구분했다.
시그널필드 고유 데이터 SF-AISC-2026-08 v1.0은 2026년 8월 25일 KST의 공식 문서를 같은 12개 상황에 적용한 36행 파생 분석이다. 이 글은 OpenAI 12행이며 실제 크롤러·WAF 차단 실험이 아니다.

● 검증된 요약
- OAI-SearchBot·GPTBot·ChatGPT-User가 검색·학습 후보 수집·사용자 요청형 접근으로 분리된다.
- OAI-SearchBot을 허용하고 GPTBot을 차단하는 구성을 공식 문서가 직접 설명한다.
- 검색 robots 변경은 약 24시간 걸릴 수 있고 세 식별자별 공식 IP JSON이 제공된다.
● 미검증 요약
- ChatGPT-User를 robots.txt만으로 항상 차단할 수 있는지는 미확인이다.
- Crawl-delay 또는 웹마스터용 크롤 속도 제어의 공식 지원 여부는 미확인이다.
- 허용한 특정 페이지가 실제 검색 답변에 노출·인용되는지는 미확인이다.
● 추가 확인 필요
- OpenAI Crawlers의 UA 목적·robots 예외·약 24시간 반영 문구를 재확인한다.
- 세 공식 IP JSON과 crawler-wide 신원 검증·속도 제어 지침을 재확인한다.
ChatGPT 검색에는 보이고 학습은 막을 수 있다: OAI-SearchBot·GPTBot의 분리
시그널필드는 2026년 8월 25일 KST 기준 OpenAI·Anthropic·Perplexity의 공식 크롤러·검색 문서를 동일한 12개 상황에 적용해 총 36개를 판정하고, 자체 데이터셋 SF-AISC-2026-08 v1.0을 만들었다. 이 글은 그중 OpenAI의 12개 판정이다.
OpenAI 결과는 YES 8개, CONDITIONAL 2개, NO 1개, UNKNOWN 1개다. 가장 중요한 YES는 OAI-SearchBot은 허용하고 GPTBot은 차단할 수 있다는 것이다. 가장 중요한 경계는 ChatGPT-User다. 사용자가 요청해 페이지를 가져가는 이 경로에는 robots.txt 규칙이 적용되지 않을 수 있다.
OpenAI 12개 판정
| 상황 | 판정 | 이유 |
|---|---|---|
| S01 검색용 별도 식별자 | YES | OAI-SearchBot을 ChatGPT 검색용으로 공개 |
| S02 학습용 별도 식별자 | YES | GPTBot을 생성형 AI 기반 모델 학습 후보 수집용으로 공개 |
| S03 사용자 요청형 별도 식별자 | YES | ChatGPT-User를 사용자 행동에 따른 방문용으로 공개 |
| S04 검색 허용·학습 차단 | YES | 두 설정의 독립성을 공식 문서가 직접 예시 |
| S05 검색 차단·학습 허용 | YES | 독립 설정에서 반대 조합도 표현 가능 |
| S06 세 경로 전면 차단 | CONDITIONAL | ChatGPT-User에는 robots 규칙이 적용되지 않을 수 있음 |
| S07 공개 식별자 전체의 robots 준수 | NO | 자동 봇 둘과 달리 ChatGPT-User가 예외 |
| S08 robots 변경 반영 시간 고지 | YES | 검색 시스템 조정에 약 24시간이 걸릴 수 있음 |
| S09 공식 IP 목록 | YES | 세 식별자별 JSON을 각각 제공 |
| S10 공식 신원 확인 방법 | CONDITIONAL | UA·IP·WAF 권고는 있으나 전 식별자 공통 단일 절차는 아님 |
| S11 Crawl-delay·속도 제어 | UNKNOWN | 공식 크롤러 문서에서 지원 여부 미확인 |
| S12 허용·차단과 검색 노출 관계 | YES | 검색 포함 자격과 차단 효과를 공식 설명 |
검색과 학습은 같은 스위치가 아니다
OpenAI의 크롤러 문서는 OAI-SearchBot과 GPTBot 설정이 서로 독립적이라고 설명한다. 운영자가 원하는 결과가 “ChatGPT 검색에는 보이되 기반 모델 학습용 웹 수집에서는 제외”라면 개념상 아래처럼 역할을 나눌 수 있다.
User-agent: OAI-SearchBot
Allow: /
User-agent: GPTBot
Disallow: /
이 구성은 접근 목적을 분리하는 정책 신호다. GPTBot을 차단했다고 과거에 수집된 데이터가 삭제됐다는 뜻은 아니며, OAI-SearchBot을 허용했다고 특정 페이지가 반드시 검색 답변에 인용된다는 뜻도 아니다. 공식 문서가 보장하는 것은 두 경로를 다르게 설정할 수 있다는 것까지다.
반대 구성도 가능하다. OAI-SearchBot만 막고 GPTBot을 허용하면 검색 노출 경로는 닫고 학습 후보 수집 경로는 열 수 있다. 시그널필드는 이를 S05 YES로 판정했지만, 공식 문서가 반대 조합의 실제 결과를 별도 실험으로 보여준 것은 아니다. 독립 설정이라는 확정 사실에서 도출한 파생 판정이다.
세 번째 경로 ChatGPT-User가 robots만으로 끝나지 않게 한다
ChatGPT-User는 자동 색인 봇이 아니다. 사용자가 ChatGPT나 Custom GPT에서 질문하거나 외부 애플리케이션과 상호작용할 때 페이지를 방문할 수 있는 사용자 요청형 식별자다. OpenAI는 이런 요청에는 robots.txt 규칙이 적용되지 않을 수 있다고 밝힌다.
따라서 OAI-SearchBot과 GPTBot을 모두 막아도 공개 페이지가 사용자 요청형 fetch로 절대 읽히지 않는다고 단정할 수 없다. 전체 접근을 제한하려면 로그인·권한·서버 정책·WAF 같은 네트워크 경계를 별도로 설계해야 한다. robots.txt는 비밀문서의 접근통제 장치가 아니라 공개 웹을 향한 크롤링 정책 신호다.
이 예외 때문에 S06은 CONDITIONAL, “세 식별자 전체가 robots를 따르는가”를 묻는 S07은 NO다. 이 NO를 “OpenAI 자동 크롤러가 robots를 무시한다”로 읽으면 안 된다. 검색·학습 자동 봇 둘의 통제는 명확하고, 사용자 요청형 경로가 다른 것이다.
약 24시간과 세 개의 IP 원본
OpenAI는 검색 경로에서 robots.txt 변경이 시스템에 반영되기까지 약 24시간이 걸릴 수 있다고 고지한다. 운영자가 오늘 규칙을 바꾸고 즉시 검색 결과만 확인해 성공·실패를 판단하면 너무 이르다. 변경 시각, 24시간 뒤 재확인, 실제 로그의 User-agent와 소스 IP를 한 세트로 남기는 편이 안전하다.
OAI-SearchBot·GPTBot·ChatGPT-User에는 각각 검색 봇 IP JSON, GPTBot IP JSON, ChatGPT-User IP JSON이 있다. User-agent 문자열은 흉내 낼 수 있으므로, 방화벽에서 허용할 때는 고정 복사본보다 공식 JSON을 주기적으로 갱신하고 요청 로그와 함께 보는 것이 낫다.
다만 시그널필드는 S10을 CONDITIONAL로 뒀다. OpenAI의 운영 안내는 UA·공식 IP·WAF·검증 프로그램을 함께 보라고 권하지만 광고 심사 맥락도 포함한다. 세 식별자 전부에 적용되는 하나의 인증 절차나 역방향 DNS 성공 규칙까지 제시한 것은 아니다.
‘허용’은 인용 자격이지 인용 계약이 아니다
ChatGPT 검색 도움말은 사이트를 검색 결과 포함 대상으로 만들려면 OAI-SearchBot과 공식 검색 봇 IP를 허용하라고 안내한다. 동시에 검색 순위는 여러 요소를 사용하며 배치를 보장하지 않는다고 설명한다. 차단한 사이트도 탐색용 링크로 남을 수 있다.
결국 인용을 원한다면 두 종류의 조건을 따로 관리해야 한다. 기술적으로는 검색 봇이 읽을 수 있어야 하고, 편집적으로는 페이지가 답할 만한 고유 질문·명시적 데이터·업데이트 날짜·근거 링크를 가져야 한다. 첫째 없이 검색 후보가 되기 어렵고, 둘째 없이 후보가 돼도 인용될 이유가 약하다.
운영 체크리스트
- 검색 노출을 원하면
OAI-SearchBot을 별도 허용한다. - 학습 수집을 원치 않으면
GPTBot규칙을 별도로 둔다. ChatGPT-User접근은 robots와 별개의 권한·WAF 문제로 본다.- 공식 IP JSON을 주기적으로 동기화하고 UA와 함께 로그에서 확인한다.
- 변경 뒤 약 24시간의 검색 반영 창을 두고 다시 확인한다.
- 허용 여부와 실제 인용·추천·순위를 같은 지표로 기록하지 않는다.
방법과 한계
이 글은 실제 크롤러를 호출하거나 방화벽을 시험한 결과가 아니다. OpenAI의 공식 크롤러·검색·IP 문서를 12개 공통 질문에 적용한 문서 기반 파생 분석이다. Google·Bing 같은 검색 파트너, 과거 수집본, 로그인 뒤 콘텐츠, 개별 WAF 설정은 비교 범위 밖이다. 정책과 IP 목록은 바뀔 수 있으므로 운영 전 원문을 다시 확인해야 한다.
핵심 근거는 OpenAI의 크롤러 개요, ChatGPT 검색 도움말, 웹 크롤러 허용 운영 안내다.
● 근거 자료 6건
검증 가능한 공개 자료만 남깁니다. 링크는 발행 시점 기준입니다.
- 01developers.openai.com
https://developers.openai.com/api/docs/bots
- 02help.openai.com
https://help.openai.com/en/articles/9237897-chatgpt-search
- 03help.openai.com
https://help.openai.com/en/articles/20001243-advertiser-guidance-for-allowing-openai-web-crawlers
- 04openai.com
https://openai.com/searchbot.json
- 05openai.com
https://openai.com/gptbot.json
- 06openai.com
https://openai.com/chatgpt-user.json