robots文件是网站根目录下名为robots.txt的文本文件,用来向搜索引擎蜘蛛说明哪些目录或页面允许抓取、哪些需要屏蔽。合理设置能节省蜘蛛抓取额度,把精力集中到有价值的内容上,从而提升整体SEO表现。

一、robots文件的基本语法与规则
robots文件由一条条记录组成,最核心的指令是User-agent和Disallow,此外还有Allow与Sitemap。User-agent用来指定生效的蜘蛛类型,比如写成User-agent: Baiduspider就只对百度蜘蛛有效,写星号则代表所有蜘蛛。Disallow后面跟目录或文件路径,表示禁止抓取;若Disallow后面为空,则表示不限制任何内容。
Allow指令一般在有通配符的拦截规则中使用,用来放开被父目录屏蔽的个别文件。例如先写Disallow: /tmp/屏蔽临时目录,再写Allow: /tmp/important.html放开其中某个页面。Sitemap指令则直接给出网站地图地址,引导蜘蛛快速发现全站链接。需要注意的是,robots文件区分大小写,且每行只能写一条规则,写法不规范可能导致整份文件失效。
二、用robots引导蜘蛛抓取的核心做法
最先要做的,是屏蔽对SEO无益或易产生重复内容的路径。后台登录页、会员中心、站内搜索结果页、测试目录等,都应写进Disallow。以常见建站程序为例,可加入Disallow: /admin/、Disallow: /search/,避免蜘蛛把精力耗费在低质量页面上,也防止搜索页被当成垃圾聚合页处罚。
其次要主动开放核心内容并推送地图。在文件末尾写上Sitemap: https://www.ippipp.com/sitemap.xml,让蜘蛛一来就拿到全量链接。同时检查CSS、JS目录是否被误屏蔽,现代搜索引擎需要抓取这些文件来渲染页面,若写错Disallow: /js/会导致页面无法被正确理解。通过放行重要资源、收缩无用路径,蜘蛛的抓取预算就能落在文章、商品页等真正参与排名的内容上。
三、常见错误写法与检测方式
新手常犯的错误是用错通配符或漏写斜杠。robots支持星号代表任意字符、美元符代表结尾,比如Disallow: /*.php$可屏蔽所有以php结尾的页面;但若写成Disallow: *.php就不符合标准,部分蜘蛛不识别。还有人把整站屏蔽写成Disallow:/ 却忘了删掉,上线后直接导致零收录。
检测时可使用百度搜索资源平台或谷歌Search Console的robots测试工具,输入具体网址看是否被允许抓取。也可用curl命令直接访问域名加/robots.txt查看原始内容。发现错误要及时修改并提交更新,通常几天内蜘蛛会重新读取规则。下面用表格列出典型场景的正确示例:
| 目标 | 正确写法 | 错误写法 |
|---|---|---|
| 屏蔽后台 | Disallow: /admin/ | Disallow: admin(缺斜杠) |
| 屏蔽动态参数页 | Disallow: /*?* | Disallow: ?(无效) |
| 放开地图 | Sitemap: https://www.ippipp.com/sitemap.xml | 把sitemap写进Disallow |
四、结合抓取日志持续优化
配置好robots只是第一步,还要看蜘蛛是否真的按规则走。服务器日志里会记录Baiduspider、Googlebot的访问路径与返回码。若发现被Disallow的页面仍频繁出现200状态码,可能是其他外链引导或规则未生效;若核心页返回403、404,就要检查是否被误屏蔽。
每隔一段时间根据日志调整规则,比如新上线的活动页要及时从屏蔽名单移除,废弃频道则可加入屏蔽。这种动态维护能让蜘蛛始终以最小成本抓到最新、最重要的内容,长期坚持,网站收录速度与关键词排名都会有明显改善。