Robots.txt生成
在线Robots.txt生成工具,支持Google、Baidu、Bing、Yahoo等18种搜索引擎爬虫的Allow/Disallow规则配置,自定义Crawl-delay、Sitemap地址与限制目录,一键生成标准robots.txt文件,适用于网站SEO优化和爬虫访问管理。
通用配置
普通搜索机器人
12 种 · 默认 / 允许 / 禁止
Googlegooglebot
Baidubaiduspider
MSN Searchmsnbot
Yahooyahoo-slurp
Ask/Teomateoma
Cuiltwiceler
GigaBlastgigabot
ScrubTheWebscrubby
DMOZrobozilla
Nutchnutch
Alexa/Waybackia_archiver
Navernaverbot, yeti
特殊搜索机器人
6 种 · 图片/移动/多媒体等
Google Imagegooglebot-image
Google Mobilegooglebot-mobile
Yahoo MMyahoo-mmcrawler
MSN PicSearchpsbot
SingingFishasterias
Yahoo Blogsyahoo-blogs/v3.9
限制目录
对所有爬虫生效 · 以 / 开头
生成结果
robots.txt
功能特性
18种爬虫配置
覆盖Google、Baidu、Bing、Yahoo等12种普通搜索机器人,以及Google Image/Mobile等6种特殊爬虫,逐一设置访问规则。
Crawl-delay控制
支持设置5/10/20/60/120秒抓取延迟,限制爬虫访问频率,减轻服务器压力,防止恶意爬虫过度抓取。
Sitemap声明
一键配置站点地图地址,帮助搜索引擎更快发现和索引网站内容,提升SEO收录效率。
限制目录管理
支持配置5个限制访问目录,保护后台、临时文件、配置目录等敏感路径不被搜索引擎收录。
下载与复制
生成结果支持一键复制到剪贴板或下载为robots.txt文件,直接部署到网站根目录即可生效。
本地纯前端
生成逻辑完全在浏览器本地完成,无需后端API,不传输任何配置数据,安全可靠。
使用说明
基础配置
- 在「通用配置」中选择默认对所有爬虫的访问策略:允许(Allow)或禁止(Disallow)。
- 如需限制爬虫抓取频率,在「Crawl-delay」中选择延迟秒数;选择「无限制」则不输出该指令。
- 在「Sitemap」中填写站点地图地址,默认为
sitemap.xml,也可填写完整URL(如https://www.example.com/sitemap.xml)。
爬虫规则配置
- 在「普通搜索机器人」和「特殊搜索机器人」卡片中,针对每种爬虫独立选择:默认(跟随通配规则)、允许(强制允许)、禁止(强制禁止)。
- 显式设置(允许/禁止)的爬虫会单独输出
User-agent块;选择「默认」的爬虫则由User-agent: *统一管理。 - 特殊爬虫如Google Image、Google Mobile可单独控制,避免图片或移动版本被索引。
限制目录
- 在「限制目录」中填写需要禁止爬虫访问的目录路径,以
/开头,如/private/、/admin/。 - 最多支持5个限制目录,留空的输入框会被自动忽略。
- 限制目录对所有爬虫生效(输出在
User-agent: *块内)。
生成与部署
- 点击「生成 Robots.txt」按钮,结果将显示在下方文本域中。页面加载时会自动生成默认配置。
- 点击「复制结果」将内容复制到剪贴板,或点击「下载文件」保存为robots.txt。
- 将robots.txt文件上传到网站根目录(如
https://www.example.com/robots.txt)即可生效。
典型使用场景
- SEO优化:允许搜索引擎抓取公开内容,禁止抓取后台、搜索结果页、分页等低质量页面。
- 服务器保护:通过Crawl-delay限制爬虫抓取频率,防止高频爬虫拖慢服务器响应。
- 敏感目录隔离:禁止爬虫访问/private/、/admin/、/tmp/等敏感目录,避免敏感信息泄露。
- 爬虫精细管理:单独禁止某些爬虫(如ia_archiver归档爬虫),允许Google、Baidu等主流搜索引擎。
- 站点地图提交:通过Sitemap指令声明站点地图位置,加速新内容被发现和索引。
常见问题
什么是robots.txt?
robots.txt是放置在网站根目录的纯文本文件,用于告诉搜索引擎爬虫(如Googlebot、Baiduspider)哪些页面可以抓取、哪些页面禁止抓取。它遵循Robots Exclusion Protocol(爬虫排除协议),是网站SEO优化和爬虫管理的基础配置。访问路径通常为
https://www.example.com/robots.txt。
User-agent指令是什么意思?
User-agent用于指定后续规则适用的爬虫。User-agent: *表示对所有爬虫生效;User-agent: googlebot表示仅对Google爬虫生效。每个User-agent块下可以包含多条Disallow、Allow、Crawl-delay指令。爬虫会优先匹配与自己名称最具体的User-agent块,未匹配到则使用*通配规则。
Disallow和Allow指令如何使用?
Disallow: /表示禁止访问整个站点;Disallow: /private/表示禁止访问/private/目录下所有内容;Disallow:(值为空)表示允许访问所有内容。Allow指令用于在禁止的目录中放行特定路径,如Allow: /private/public/。本工具中「允许」对应Disallow:(空值),「禁止」对应Disallow: /。
Sitemap指令有什么作用?
Sitemap指令用于声明网站地图(XML Sitemap)的位置,帮助搜索引擎更高效地发现和索引网站页面。该指令独立于User-agent块,通常放在robots.txt末尾,可填写相对路径(如sitemap.xml)或完整URL(如https://www.example.com/sitemap.xml)。一个robots.txt可以声明多个Sitemap。
Crawl-delay指令所有搜索引擎都支持吗?
Crawl-delay指令用于设置爬虫两次请求之间的延迟秒数,主要用于减轻服务器压力。需要注意的是:Bing、Yandex支持该指令;Google不完全支持(Googlebot通过Search Console单独配置抓取速度);Baidu部分支持。建议作为辅助手段,关键限流应通过服务器端实现。
robots.txt能完全阻止页面被索引吗?
不能。robots.txt只是建议爬虫不要抓取,但不能阻止页面被索引。如果其他页面链接到该页面,搜索引擎仍可能在搜索结果中展示该URL(不显示摘要)。若要彻底阻止索引,应使用
<meta name="robots" content="noindex">标签或HTTP响应头X-Robots-Tag: noindex。
本工具是免费的吗?数据安全吗?
完全免费,无需注册登录。Robots.txt生成逻辑完全在浏览器本地运行(纯JavaScript),不向后端传输任何配置数据,也不持久化存储。生成的robots.txt由你自己部署到网站,安全可靠。