# llms.txt / AI 爬虫审计生成器

从实站爬取或粘贴的页面清单生成 llms.txt（llmstxt.org v2 格式：H1、引用块摘要、H2 文件列表），并按 RFC 9309 匹配算法审计 robots.txt 对 GPTBot、ClaudeBot、PerplexityBot、Bytespider 的策略——附 allow/block 预览与可直接粘贴的指令。

> 标准页面: https://elysiatools.com/zh/tools/llms-txt-and-ai-crawler-audit

- **分类:** Network

- **关键词:** llms.txt, robots.txt, ai 爬虫, gptbot, claudebot, perplexitybot, bytespider, 生成式引擎优化

## 概述

llms.txt / AI 爬虫审计生成器支持通过输入目标站点 URL 实时爬取或手动粘贴页面清单与 robots.txt 规则，依据 llmstxt.org v2 规范生成包含项目名、引用摘要及分级文件清单的 llms.txt 文件，并基于 RFC 9309 算法审计 GPTBot、ClaudeBot、PerplexityBot 与 Bytespider 的访问权限与放行状态。

## 输入项

- **要爬取的站点 URL（实爬模式）** (text): https://example.com — homepage links, plus sitemap.xml fallback for JS-rendered sites (max 25 pages)
- **或粘贴页面清单（离线：URL | 标题 | 描述）** (textarea): https://example.com/docs/quickstart | Quickstart | Install and run your first job https://example.com/docs/api | API reference | Endpoint catalog
- **或粘贴 robots.txt（离线）** (textarea): User-agent: GPTBot Disallow: / User-agent: * Disallow: /private/
- **站点/项目名（llms.txt 的 H1）** (text): Example Platform
- **一句话摘要（引用块）** (text): Example Platform lets teams ship scheduled data jobs without infrastructure.
- **补充说明（可选正文）** (textarea): Anything an LLM should know before using these pages…
- **分组方式** (select)

## 适用场景

- 为网站或文档库生成标准化 llms.txt 文件以优化大语言模型与 AI 搜索索引时
- 需要评估 robots.txt 对主流 AI 爬虫（如 GPTBot、ClaudeBot 等）的放行或屏蔽策略时
- 重构站点路由或隐私目录前，需要验证各爬虫对特定子路径的匹配与拦截结果时

## 工作原理

- 输入线上站点 URL 进行页面爬取，或在离线模式下直接粘贴页面清单（URL | 标题 | 描述）与 robots.txt 内容
- 配置站点名称、引用块摘要、补充说明正文以及页面分组方式（按一级路径自动分组或单一扁平列表）
- 系统依据 RFC 9309 路径规则评估各大 AI 爬虫的放行状态，输出审计矩阵、可复用的 robots 指令卡片以及标准的 llms.txt 格式内容

## 使用案例

- 开源项目或 API 文档维护者生成 llms.txt 供 AI 工具高效读取核心接口
- 站点 SEO 与合规团队排查 robots.txt 是否意外封禁了期望被收录的 AI 搜索引擎爬虫
- 内容运营团队针对不同业务子目录制定精细化的 AI 爬虫放行与拦截策略

## 常见问题

### 什么是 llms.txt 规范？

llms.txt 是为大模型提供站点核心内容的 Markdown 文件，包含 H1 站点名、引用块摘要及 H2 页面清单链接。

### 工具支持审计哪些 AI 爬虫？

支持审计 OpenAI 的 GPTBot、Anthropic 的 ClaudeBot、Perplexity 的 PerplexityBot 以及字节跳动的 Bytespider。

### 没有提供 robots.txt 时审计结果会如何？

根据 RFC 9309 规范，若未检测到或未提供 robots.txt，系统将默认判定所有 AI 爬虫对全部路径处于放行状态。

### 页面分组选项有哪些作用？

“按 URL 一级路径分组”会依路径前缀生成多个 H2 章节，“单一扁平列表”则将所有页面收纳在一个统一章节下。

### 实爬模式对页面数量有限制吗？

实爬模式会基于主页链接并结合 sitemap.xml 进行解析，单次最多爬取 25 个页面。

## 相关工具

- [可变字体轴实例与 CSS font-variation-settings 构建器](https://elysiatools.com/zh/tools/variable-font-axis-instance-and-css-font-variation-settings-builder): 上传可变字体（TTF/OTF/WOFF/WOFF2），检视 fvar 轴与命名实例，浏览器内实时预览插值效果，并生成可直接复制的 font-variation-settings CSS、高级属性等价写法与可变 @font-face 声明。
- [AI货币和数字提取器](https://elysiatools.com/zh/tools/ai-currency-extractor): 使用AI智能提取文本中的数字、货币和金融金额，保留原始格式
- [AI图片转Markdown](https://elysiatools.com/zh/tools/ai-image-to-markdown): 使用AI视觉模型从图片中提取文本并转换为Markdown格式
- [跟读提示生成器](https://elysiatools.com/zh/tools/audio-read-along-cue-generator): 从旁白音频及其脚本生成句子或单词级时间戳提示,用于卡拉OK式跟读和语言学习。
- [CSS 流体排版 Clamp 计算器](https://elysiatools.com/zh/tools/css-fluid-typography-clamp-calc): 输入最小/最大视口与字号边界，输出 clamp() 表达式、可复制 CSS 与实时预览数据
- [数据交叉表生成器](https://elysiatools.com/zh/tools/data-crosstab-generator): 高级交叉表（数据透视表）生成器，从您的数据创建强大的交叉表分析。完美适用于商业智能、统计分析、数据探索和报告。 功能特点： - 多种聚合函数（求和、计数、平均值、最小值、最大值、中位数） - 灵活的行和列分组 - 百分比和比率计算 - 行/列总计和总计 - 多维分析 - 条件格式支持 - 统计显著性检验 - 自定义排序和过滤 - 导出就绪格式 常见用途： - 按地区和产品的销售分析 - 客户人口统计分析 - 财务报表分析 - 调查结果分析 - 库存周转分析 - 绩效指标跟踪
- [日期提取器](https://elysiatools.com/zh/tools/date-extractor): 从文本中提取多种格式的日期，包括中文、ISO和美国格式，提供详细分析和摘要
- [DNS 区域文件记录生成器](https://elysiatools.com/zh/tools/dns-zone-file-record-builder): 表单式生成 SOA / NS / A / AAAA / CNAME / MX / TXT (SPF / DKIM / DMARC) / SRV / CAA / TLSA / NAPTR / DS 记录。输出 RFC 1035 zone-file 文本和人类可读摘要表,支持 TTL 和多记录。

## 示例

- [Web Python 图像处理示例](https://elysiatools.com/zh/samples/web-image-processing-python): Web Python 图像处理示例，使用 PIL/Pillow 包括读取、保存、缩放和格式转换
- [文本示例文件](https://elysiatools.com/zh/samples/txt-samples): 不同语言和编码的文本示例文件
- [Android Java 图像处理示例](https://elysiatools.com/zh/samples/android-image-processing-java): Android Java 图像处理示例，包括图像读取保存、缩放和格式转换
- [Android Kotlin 图像处理示例](https://elysiatools.com/zh/samples/android-image-processing-kotlin): Android Kotlin 图像处理示例，包括图像读取保存、缩放和格式转换
