Cấp phép AI Crawler nào trong robots.txt để site của bạn xuất hiện trong câu trả lời AI vào năm 2026?
OpenAI
Anthropic
Perplexity AI
Google/DeepMind
Яндекс
Сбер
Apple
Common Crawl
Bài viết xem xét vấn đề trang web bị vô hình trước trợ lý AI: thường robots.txt chặn quyền truy cập cho cả bot huấn luyện và bot thời gian thực, mặc dù lập chỉ mục thông thường vẫn hoạt động tốt. Nó cung cấp danh sách các crawler liên quan (GPTBot, PerplexityBot, Google-Extended, v.v.) cùng với các mẹo cấu hình quyền truy cập và kiểm tra nhật ký.
Tác giả mô tả một tình huống điển hình: một trang web được Google và Yandex lập chỉ mục tốt, nhưng không xuất hiện trong câu trả lời của ChatGPT vì tệp robots.txt có quy tắc Disallow dành cho GPTBot, ClaudeBot và PerplexityBot. Có hai loại trình thu thập dữ liệu AI: loại dùng để huấn luyện mô hình (GPTBot, ClaudeBot, CCBot) và loại thời gian thực (OAI-SearchBot, PerplexityBot, ChatGPT-User). Để xuất hiện trong câu trả lời AI, bạn cần cho phép truy cập đối với các bot trong danh sách hoạt động tính đến cuối tháng 7 năm 2026, bao gồm GPTBot, ChatGPT-User, OAI-SearchBot, ClaudeBot, anthropic-ai, PerplexityBot, Google-Extended, YandexBot/YandexAI, GigaChat, Applebot-Extended, CCBot. Nên kiểm tra robots.txt hàng quý, vì các tác nhân người dùng mới xuất hiện (ví dụ, Google đã đổi tên NotebookLM thành Google-GeminiNotebook). Robots.txt chỉ là lớp đầu tiên; các vấn đề có thể phát sinh từ Content-Security-Policy, thiếu SSR (bot không thể nhìn thấy nội dung do JavaScript tải) và cuộn vô hạn. Để kiểm tra truy cập, tác giả gợi ý dùng grep trên nhật ký và curl với giả mạo User-Agent. Ba sai lầm phổ biến: robots.txt lỗi thời, CDN bảo vệ chặn các bot hợp lệ, và sự tự tin sai lầm rằng lập chỉ mục đảm bảo quyền truy cập của trình thu thập AI. Việc sửa lỗi trong tình huống được mô tả chỉ mất 15 phút và nhanh chóng dẫn đến sự gia tăng số lần trích dẫn trong ChatGPT và Perplexity.
Nguồn: Habr — хаб ИИ —
bản gốc
