一家AI工具资讯站公布了自家服务器日志的对比结果:在约57天的观察窗口里,ChatGPT相关智能体带来的检索量下降了85%。该站同时说明,这是单个站点的日志,属于个例而非行业研究,数据分布也偏向AI工具类内容,恰恰是最容易受到官方来源优先级变化影响的一类。
该站把变化拆到了三个具体的爬虫身份上。GPTBot负责采集训练数据,OAI-SearchBot构建ChatGPT搜索背后的索引,ChatGPT-User则在用户会话中执行实时抓取,且只在思考模式下触发。三者的业务后果不同,如果在日志里混在一起统计,就无法判断自己遇到的是屏蔽问题还是收录问题,这也是该站下一步要做的拆分工作。
该站提出的可能原因有三条:一是8月上旬ChatGPT的检索开始按域名范围限定查询并优先展示官方品牌站点;二是9月15日Cloudflare的默认策略变更拦截了训练类与智能体类爬虫;三是实时页面抓取只在思考模式下发生,而这一模式受成本控制。前两条属于平台侧规则变化,第三条属于成本约束,性质并不相同。
值得单独提出的是第二条。对使用Cloudflare免费版且从未调整过设置的站点来说,9月15日起训练类与智能体类爬虫在广告页面上被默认拦截,而承载用户实时抓取的智能体流量恰好落在这一类里。这意味着部分站点可能在不知情的情况下屏蔽了AI助手访问自己页面的通道,排查方式是在安全设置里核对实际生效的控制项。
把个例当结论是这类日志分析最容易犯的错。更实际的用法是把它当成一份排查清单:先确认自己是否误拦了需要的爬虫身份,再把检索访问量与引用次数分开统计,最后接受无法用配置解决的部分,也就是平台对官方来源的偏好、以及AI回答占用点击的结构性变化。对内容站来说,能优化的部分主要在配置与内容结构,而不在流量数字本身。
申请创业报道,分享创业好点子。点击此处,共同探讨创业新机遇!
