有开发者整理出一份清单,把九种有文档记录的AI爬虫用户代理与各自的用途、对robots.txt的态度逐一对齐,并写了一个记录访问的组件。结论里有一条出乎意料:Google-Extended与Applebot-Extended虽然经常出现在robots.txt模板里,却不会在任何访问日志中出现,因为两者根本不发起HTTP请求,前者没有独立的用户代理字符串,后者明确不抓取网页。
会留下记录的是那些真正发出请求的代理。清单覆盖了OpenAI的四个、Anthropic的三个与Perplexity的两个。按厂商文档,负责构建索引的爬虫会遵守robots.txt;而由用户当场触发的那一类,比如用户提问后去取页面的代理,厂商明确说明可能不适用robots.txt规则。
这个区别有实际意义。一条禁止规则可以挡住训练数据采集,但同一条规则挡不住五分钟之后由某个用户发起的页面抓取。真正需要留意的是后者,它的触发权在提问的用户手里,时间、频率与目标页面都无从预判;只做robots.txt配置而不看日志,容易得出已经封住了的判断,而这个判断并不成立。
另一个常被忽略的环节是CDN与防火墙层。页面在服务端返回403或429,往往不是内容问题,而是自动化流量被挑战、被限流或被规则拦住。分析这类流量时按状态码、爬虫、运营方与请求路径分开看,才能区分机器人没来和来了但没拿到内容这两种情况。
把日志当成常规体检项目,比一次性排查更有用。保留一段时间的爬虫访问记录、按周期对比、在站点结构改动后复查重点URL,这些动作最终回答一个很具体的问题:重要页面是否真的被读取过。被读取是进入索引与进入答案的前提,这一步没做,后面的优化都是在猜。
申请创业报道,分享创业好点子。点击此处,共同探讨创业新机遇!
