Robots.txt生成

在线Robots.txt生成工具,支持Google、Baidu、Bing、Yahoo等18种搜索引擎爬虫的Allow/Disallow规则配置,自定义Crawl-delay、Sitemap地址与限制目录,一键生成标准robots.txt文件,适用于网站SEO优化和爬虫访问管理。

通用配置
普通搜索机器人 12 种 · 默认 / 允许 / 禁止
Googlegooglebot
Baidubaiduspider
MSN Searchmsnbot
Yahooyahoo-slurp
Ask/Teomateoma
Cuiltwiceler
GigaBlastgigabot
ScrubTheWebscrubby
DMOZrobozilla
Nutchnutch
Alexa/Waybackia_archiver
Navernaverbot, yeti
特殊搜索机器人 6 种 · 图片/移动/多媒体等
Google Imagegooglebot-image
Google Mobilegooglebot-mobile
Yahoo MMyahoo-mmcrawler
MSN PicSearchpsbot
SingingFishasterias
Yahoo Blogsyahoo-blogs/v3.9
限制目录 对所有爬虫生效 · 以 / 开头
生成结果
robots.txt

功能特性

18种爬虫配置

覆盖Google、Baidu、Bing、Yahoo等12种普通搜索机器人,以及Google Image/Mobile等6种特殊爬虫,逐一设置访问规则。

Crawl-delay控制

支持设置5/10/20/60/120秒抓取延迟,限制爬虫访问频率,减轻服务器压力,防止恶意爬虫过度抓取。

Sitemap声明

一键配置站点地图地址,帮助搜索引擎更快发现和索引网站内容,提升SEO收录效率。

限制目录管理

支持配置5个限制访问目录,保护后台、临时文件、配置目录等敏感路径不被搜索引擎收录。

下载与复制

生成结果支持一键复制到剪贴板或下载为robots.txt文件,直接部署到网站根目录即可生效。

本地纯前端

生成逻辑完全在浏览器本地完成,无需后端API,不传输任何配置数据,安全可靠。

使用说明

基础配置

  • 在「通用配置」中选择默认对所有爬虫的访问策略:允许(Allow)或禁止(Disallow)。
  • 如需限制爬虫抓取频率,在「Crawl-delay」中选择延迟秒数;选择「无限制」则不输出该指令。
  • 在「Sitemap」中填写站点地图地址,默认为sitemap.xml,也可填写完整URL(如https://www.example.com/sitemap.xml)。

爬虫规则配置

  • 在「普通搜索机器人」和「特殊搜索机器人」卡片中,针对每种爬虫独立选择:默认(跟随通配规则)、允许(强制允许)、禁止(强制禁止)。
  • 显式设置(允许/禁止)的爬虫会单独输出User-agent块;选择「默认」的爬虫则由User-agent: *统一管理。
  • 特殊爬虫如Google Image、Google Mobile可单独控制,避免图片或移动版本被索引。

限制目录

  • 在「限制目录」中填写需要禁止爬虫访问的目录路径,以/开头,如/private//admin/
  • 最多支持5个限制目录,留空的输入框会被自动忽略。
  • 限制目录对所有爬虫生效(输出在User-agent: *块内)。

生成与部署

  • 点击「生成 Robots.txt」按钮,结果将显示在下方文本域中。页面加载时会自动生成默认配置。
  • 点击「复制结果」将内容复制到剪贴板,或点击「下载文件」保存为robots.txt。
  • 将robots.txt文件上传到网站根目录(如https://www.example.com/robots.txt)即可生效。

典型使用场景

  • SEO优化:允许搜索引擎抓取公开内容,禁止抓取后台、搜索结果页、分页等低质量页面。
  • 服务器保护:通过Crawl-delay限制爬虫抓取频率,防止高频爬虫拖慢服务器响应。
  • 敏感目录隔离:禁止爬虫访问/private/、/admin/、/tmp/等敏感目录,避免敏感信息泄露。
  • 爬虫精细管理:单独禁止某些爬虫(如ia_archiver归档爬虫),允许Google、Baidu等主流搜索引擎。
  • 站点地图提交:通过Sitemap指令声明站点地图位置,加速新内容被发现和索引。

常见问题

什么是robots.txt?
robots.txt是放置在网站根目录的纯文本文件,用于告诉搜索引擎爬虫(如Googlebot、Baiduspider)哪些页面可以抓取、哪些页面禁止抓取。它遵循Robots Exclusion Protocol(爬虫排除协议),是网站SEO优化和爬虫管理的基础配置。访问路径通常为https://www.example.com/robots.txt
User-agent指令是什么意思?
User-agent用于指定后续规则适用的爬虫。User-agent: *表示对所有爬虫生效;User-agent: googlebot表示仅对Google爬虫生效。每个User-agent块下可以包含多条Disallow、Allow、Crawl-delay指令。爬虫会优先匹配与自己名称最具体的User-agent块,未匹配到则使用*通配规则。
Disallow和Allow指令如何使用?
Disallow: /表示禁止访问整个站点;Disallow: /private/表示禁止访问/private/目录下所有内容;Disallow:(值为空)表示允许访问所有内容。Allow指令用于在禁止的目录中放行特定路径,如Allow: /private/public/。本工具中「允许」对应Disallow:(空值),「禁止」对应Disallow: /
Sitemap指令有什么作用?
Sitemap指令用于声明网站地图(XML Sitemap)的位置,帮助搜索引擎更高效地发现和索引网站页面。该指令独立于User-agent块,通常放在robots.txt末尾,可填写相对路径(如sitemap.xml)或完整URL(如https://www.example.com/sitemap.xml)。一个robots.txt可以声明多个Sitemap。
Crawl-delay指令所有搜索引擎都支持吗?
Crawl-delay指令用于设置爬虫两次请求之间的延迟秒数,主要用于减轻服务器压力。需要注意的是:Bing、Yandex支持该指令;Google不完全支持(Googlebot通过Search Console单独配置抓取速度);Baidu部分支持。建议作为辅助手段,关键限流应通过服务器端实现。
robots.txt能完全阻止页面被索引吗?
不能。robots.txt只是建议爬虫不要抓取,但不能阻止页面被索引。如果其他页面链接到该页面,搜索引擎仍可能在搜索结果中展示该URL(不显示摘要)。若要彻底阻止索引,应使用<meta name="robots" content="noindex">标签或HTTP响应头X-Robots-Tag: noindex
本工具是免费的吗?数据安全吗?
完全免费,无需注册登录。Robots.txt生成逻辑完全在浏览器本地运行(纯JavaScript),不向后端传输任何配置数据,也不持久化存储。生成的robots.txt由你自己部署到网站,安全可靠。