当前位置:首页 >  站长 >  建站经验 >  正文

robots.txt怎么写?规则语法与常用配置示例

 2026-09-22 11:23  来源: 互联网   我来投稿 撤稿纠错

  一键部署OpenClaw

robots.txt 是站点给爬虫的第一份说明书,写对了该抓的抓、该挡的挡,写错了轻则屏蔽一堆页面,重则把整站挡在门外。很多人不敢动这个文件,怕出问题;其实它的语法就几条,把位置、大小写和几个指令记牢,剩下的都是填空。下面从放到哪、写什么、怎么验证三步讲,末尾给一份可以直接抄的常用配置。

一、先放对位置、写对文件名

现象:有人把 robots.txt 放进子目录,或者命名成 robot.txt,改了半天一点效果都没有。

原因:爬虫只会读取站点根目录下的 robots.txt,路径固定是 https://你的域名/robots.txt,文件名必须全小写、带 .txt 后缀,放错位置等于没写。

做法:把文件放到网站根目录,用浏览器直接访问 /robots.txt 确认能看到内容。如果访问返回 404,说明路径不对,先解决路径再谈规则。另外注意子域名是各算各的,主站的 robots.txt 管不到子域名。

二、四条指令就够覆盖日常

一是 User-agent,指定这条规则对哪个爬虫生效,用星号表示所有爬虫;二是 Disallow,声明不允许抓取的路径,写 Disallow: / 就是整站禁止;三是 Allow,用于在整体禁止的前提下开口子,比如允许抓取某个目录;四是 Sitemap,指向你的 sitemap 文件地址,方便爬虫一次找到全站页面。写的时候记住一个细节:Disallow 后面的路径区分大小写,别把 /Admin/ 写成 /admin/。

三、一份可以直接用的常用配置

下面这份配置适合大多数内容站:允许所有爬虫抓取全站,只挡住后台、程序目录和带参数的搜索结果页,同时在末尾声明 sitemap 位置。要改的地方只有两处:把 Sitemap 那一行的域名换成你自己的,把 Disallow 里的后台路径换成你程序实际的后台目录。改完保存到网站根目录即可。

# robots.txt 常用配置示例(放到网站根目录,文件名 robots.txt)

User-agent: *

Allow: /

Disallow: /admin/

Disallow: /install/

Disallow: /search?

Disallow: /*?page=

Sitemap: https://www.example.com/sitemap.xml

配完别急着关,逐行核对一遍:Allow: / 要在前面,Disallow 只挡该挡的目录,星号和问号这类通配符只在你确实理解含义时才用。后台目录写成 /admin/ 这种带前后斜杠的形式,避免误伤同名前缀的正常页面。

四、改完怎么验证生效

验证分两步。第一步,用浏览器访问 /robots.txt,确认文件内容就是刚写的那份,没有被服务器缓存成旧版。第二步,挑一个你明确禁止的地址,比如后台登录页,在百度搜索资源平台的抓取诊断工具里测一下,看返回的是不是“被 robots.txt 拒绝”。再挑一个正常页面测,确认仍然可以抓取。两步都通过,才算真正生效。改动频繁时,记得每次改完都重跑一遍诊断,别只看文件内容对不对。

robots.txt 的写法就三件事:放对根目录、用对四条指令、改完做一次抓取诊断;把 Disallow 和 Sitemap 两行管好,其余保持简单,就不容易出问题。

相关阅读:

《robots.txt写错把整站屏蔽了?先记住这条底线》

《sitemap怎么生成?生成、提交与自动更新一条龙》

《sitemap提交了却没动静?先检查地址和格式》

申请创业报道,分享创业好点子。点击此处,共同探讨创业新机遇!

相关文章

热门排行

信息推荐