当前位置:首页 >  站长 >  搜索优化 >  正文

抓取预算:大站收录慢的病根

 2026-09-09 10:50  来源: 互联网   我来投稿 撤稿纠错

  一键部署OpenClaw

大站的典型症状:新文章发出去一周还没收录,老内容倒是天天被抓。这不是蜘蛛偏心,是抓取预算被浪费了。官方定义说得很清楚:抓取预算是 Google 分配给一个主机名的抓取资源,由两块构成——抓取容量上限(服务器扛得住多少并发抓取,响应稳就升,5xx、429 多就降)和抓取需求(站点规模、更新频率、页面质量、热度共同决定蜘蛛想抓多少)。容量和需求都有限,浪费在垃圾 URL 上的每一次抓取,都是从正经内容嘴里抢的粮。

官方给的适用门槛也值得引用:百万级以上页面且每周更新,或万级以上页面且每日更新,才真正需要管理抓取预算。小站读这条的意义是别瞎折腾——官方原话就是内容更新当天就被抓的站,把 sitemap 维护好、定期看索引报告就够了。够格管预算的大站,四招按优先级排:整合重复内容、robots.txt 屏蔽无价值路径、永久移除的页面回 404/410、消除软 404。

# robots.txt:屏蔽无抓取价值的路径
User-agent: *
Disallow: /search*
Disallow: /tag/
Disallow: /*?sort=
Disallow: /*?page=
Disallow: /wp-json/

Sitemap: https://www.example.com/sitemap.xml

屏蔽名单不是拍脑袋写的,先去日志里看蜘蛛实际在抓哪些参数 URL,拿数据定名单。官方文档还特别点了一个反直觉的坑:别用 noindex 来省抓取预算——Google 要先抓取页面才能看到 noindex 标记,抓取一次没少花;robots.txt 屏蔽才是真省,蜘蛛根本不发起请求。但屏蔽的代价是页面彻底无法被索引,只对确实不需要收录的路径使用。

# 用数据定名单:蜘蛛抓了哪些带参数的 URL
grep -E "Baiduspider|Googlebot" /var/log/nginx/access.log \
| awk '{print $7}' | grep "?" \
| awk -F"?" '{print $1}' | sort | uniq -c | sort -rn | head -10

# 蜘蛛抓取的目录占比(对照 robots 名单查漏)
grep -E "Baiduspider|Googlebot" /var/log/nginx/access.log \
| awk '{print $7}' \
| awk -F/ '{print "/"$2}' \
| sort | uniq -c | sort -rn

改完 robots.txt 要走三道验证:资源平台的抓取诊断(或 Google 的 robots.txt 报告)确认文件语法没写错、规则生效;curl 直接拉 robots.txt 人肉过一遍;一周后重跑上面的日志统计,参数 URL 和被屏蔽路径的抓取占比应该明显下降,腾出来的抓取量流向内容页——这才是优化生效的铁证。

# 验证一:语法与生效
curl -s https://www.example.com/robots.txt

# 验证二:一周后对比参数 URL 抓取占比
# 改造前先跑一次留基线,改造后同命令对比
grep -E "Baiduspider|Googlebot" /var/log/nginx/access.log \
| awk '{print $7}' | grep -c "?"

最后两条官方警告务必记牢:一是不要玩“定期增删 robots.txt 规则来临时调预算”的花活,官方明确说这是要避免的做法,规则只用于长期不想被抓的路径;二是抓取容量上限跟着服务器健康走,响应时间稳定、5xx 归零,上限自然上调,配置层面的优化(缓存、压缩、数据库提速)和 robots.txt 是一体的,光堵不疏没有用。预算优化的本质就一句话:让蜘蛛的每一口都咬在值得收录的内容上。

相关阅读:抓取预算是收录问题的病根理论。《SEO 自动化总清单:日、周、月、季各该跑什么》的日志组篇目都在为它服务——预算花在哪、浪费在哪,按总纲的节奏每周对一次账。

申请创业报道,分享创业好点子。点击此处,共同探讨创业新机遇!

相关文章

  • 全站死链监控:别让烂内链拖住蜘蛛的后腿

    改版、删文章、换栏目,最先烂掉的不是页面而是内链。烂内链的代价常常被低估:用户点进去404是体验问题,更重的是蜘蛛顺着内链爬行时一遍遍撞墙,抓取预算被无谓消耗,深度页面的发现效率跟着下降。单页小站可以用W3C的LinkChecker在线查,几个URL等一分钟就出结果;页面一多就得自己动手了。自建监控

  • 收录流量对照日报:一张 CSV 看清抓取、收录、流量三本账

    收录涨了流量没涨,或者收录掉了流量反而稳着——只盯单一指标的人迟早被这种背离搞糊涂。原因很简单:抓取、收录、流量是链条上三道独立的工序,蜘蛛来了不代表收进索引,收进索引不代表有排名,有排名不代表有人点。任何一道出问题,表象都像“SEO变差了”,但药方完全不同。解法是把三本账放进同一张表里天天对照。日

  • 收录批量核查:200 个 URL 别再一条条搜了

    发了200篇文章,过了两周想确认哪些被百度收了。到搜索框一条条敲site:查询,查到第30条手就废了。批量核查收录是每个内容站的刚需,但这件事有个必须先说清楚的边界:搜索引擎没有公开的收录查询API,任何批量查询本质都是在和对方的反爬机制打交道,所以脚本的正确姿势是慢、稳、粗查,快准狠交给官方平台。

  • 把 access.log 转成 CSV:awk 之外的第二条路

    前几篇的awk报表很顺手,但它有两个天花板:一是结果只能打印在终端上,要给不懂命令行的同事看、要丢进Excel做透视表,就得有个通用格式;二是复杂逻辑(多条件组合、正则提取、跨行关联)用awk写起来越写越拧巴。这时候就该Python上场了——把日志解析成CSV,一条命令跑完,后面随便怎么加工。解析N

  • 软 404:页面活着,收录死了

    上面那篇说404要从日志里挖,这一篇说一个日志挖不出来的更阴险的坑:软404。它的定义Google官方写得很清楚——一个URL返回的是200成功状态码,但页面内容却在告诉用户“这个页面不存在”,有时甚至是没有主内容的空页面。从HTTP协议看它一切正常,从内容看它已经死了。软404的常见诱因官方也列了

热门排行

信息推荐