功能说明
围绕站点收录做的三件事:按规则生成 robots.txt、把一批网址打包成标准 sitemap.xml、以及把别人的 sitemap 拆回纯网址列表。三个标签页互相独立,全部在浏览器本地完成,不会读取或访问任何线上站点。
一、生成 robots.txt
robots.txt 用来告诉搜索引擎哪些路径可以抓、哪些不要抓。按 User-agent 分组配置,每组下可添加任意条 Allow 或 Disallow 规则:
- User-agent:填
* 表示对所有爬虫生效,也可以针对特定爬虫单独建一组,写更严格或更宽松的规则。 - Disallow:禁止抓取的路径,以斜杠开头。填
/ 表示整站禁止,留空表示不限制。 - Allow:在被禁止的目录中开一个例外,通常配合 Disallow 使用。
- Crawl-delay:建议的抓取间隔秒数,用于减轻服务器压力,设为 0 时不输出该行。注意部分主流搜索引擎会忽略这一指令。
- Sitemap:站点地图的完整地址,建议填写绝对路径,可以写多行。
三个预设按钮可以快速铺底:全站开放、全站禁止、以及屏蔽常见后台与接口目录。
二、生成 sitemap.xml
每行填一个网址,也可以在网址后面用逗号或制表符附加两个可选字段,顺序为「最后修改日期, 优先级」,例如 https://example.com/about,2026-08-01,0.8。没有单独指定的条目会使用下方设置的默认值。
- lastmod:最后修改日期,推荐 YYYY-MM-DD 格式,可一键填入今天。
- priority:相对优先级,取值 0 到 1,只表示站内页面之间的相对重要性。
- changefreq:预计更新频率,可选择不输出。
- 不以 http 或 https 开头的行会被忽略,界面会提示被忽略的行数;网址中的特殊字符会做 XML 转义。
三、解析 sitemap.xml
粘贴任意 sitemap.xml 内容,工具会提取全部 loc 标签中的网址,同时读取对应的 lastmod 与 priority。支持去重和按字母排序,结果可复制、下载为 TXT,或导出成包含三列的 CSV 便于进一步整理。即使粘贴的是不完整的 XML 片段,也能尽量提取出其中的网址。
使用建议
单个 sitemap 文件建议不超过 5 万条网址且未压缩时小于 50MB,超出时应拆分成多个文件并用 sitemap 索引文件组织。robots.txt 与 sitemap.xml 都要放在站点根目录才能被正确读取。