原创 ShowHN Today
实战分享:robots.txt与llms.txt优化对AI流量的影响
1. 背景介绍
几天前,我分享了一篇关于如何提升网站AI友好度的实用指南,主要介绍了通过优化robots.txt和创建llms.txt文件来让网站更好地被ChatGPT、Claude等AI系统识别和推荐。当时的文章主要是理论和操作方法,而今天我想分享一些实际的数据反馈,看看这些优化策略是否真的有效。
2. 实施前的疑问
在实施这些优化策略前,我有几个主要疑问:
各大AI模型厂商真的会派专门的爬虫来抓取网站内容吗? 用户真的会通过AI系统的引荐而访问网站吗? 通过llms.txt文件提供结构化内容,真的能提高AI对网站的理解和推荐率吗? 不同的AI系统对这些优化会有不同的反应吗?
这些问题在理论上有答案,但需要实际数据来验证。
3. 数据反馈和对比
在实施优化策略后的第四天,我通过Cloudflare收集到了一些有趣的数据。我对比了两个网站的AI爬虫访问情况:一个实施了AI友好度优化,另一个没有进行任何优化。
实施了AI友好度优化的网站:
ClaudeBot (Anthropic) - 3340请求 Bytespider (ByteDance) - 621请求 Amazonbot (Amazon) - 83请求 ChatGPT-User (OpenAI) - 17请求 OAI-SearchBot (OpenAI) - 6请求 PerplexityBot (Perplexity) - 5请求 Applebot (Apple) - 4请求
未实施AI友好度优化的网站:
ChatGPT-User (OpenAI) - 1665请求 Bytespider (ByteDance) - 552请求 ClaudeBot (Anthropic) - 144请求 OAI-SearchBot (OpenAI) - 119请求 PerplexityBot (Perplexity) - 116请求 Amazonbot (Amazon) - 75请求 GPTBot (OpenAI) - 51请求 Applebot (Apple) - 33请求 archive.org_bot (Internet Archive) - 2请求
从数据中可以看出一些明显的差异:
优化后的网站吸引了显著更多的ClaudeBot访问(3340 vs 144) 而ChatGPT-User在未优化的网站上访问量更高(1665 vs 17) 这可能表明不同的AI公司对网站结构和内容的偏好存在差异
另外值得注意的是,我确实观察到有实际用户通过这些AI系统的引荐访问了网站,证明这种优化不仅影响爬虫行为,也间接影响了实际流量。
4. 反思
基于这些数据,我有以下几点反思:
AI爬虫确实活跃且各有偏好:数据清晰地表明,各大AI公司确实在积极爬取网络内容,但它们似乎有不同的偏好和策略。特别是Anthropic的ClaudeBot对结构化内容似乎更为敏感。
优化策略有效但影响各异:优化确实能增加部分AI爬虫的访问量,但对不同AI系统的影响程度不同。这提示我们可能需要针对特定的AI系统调整优化策略。
新的流量来源正在形成:就像过去我们优化SEO以获取搜索引擎流量一样,现在开始关注和优化AI系统的引荐流量可能是明智之举。随着AI助手使用率的提高,这部分流量可能会变得越来越重要。
早期布局的价值:虽然现在AI引荐流量可能只占总流量的一小部分,但现在开始优化可能会在未来获得先发优势。
对内容创作的启示:这种差异也提示我们,在创作内容时可能需要思考如何同时满足人类读者和AI系统的需求,就像我们考虑SEO和用户体验的平衡一样。
5. 之前操作经验完整详情
为了方便刚看到这篇文章的朋友,以下是我之前分享的完整操作指南:
提升网站AI友好度的实用指南:robots.txt与llms.txt整合
为什么需要这么做?随着ChatGPT、Claude等AI系统越来越普及,越来越多人通过AI获取信息。但问题来了:即使你的网站在Google排名很好,AI系统可能依然无法准确引用或推荐你的内容,那么如何从ChatGPT、Claude、Gemini、deepseek这些模型中能推荐自己的网站呢?。 原因很简单:AI系统处理网页时,其上下文窗口有限,难以消化复杂的HTML、导航元素和JavaScript。它们需要一种更直接的方式来理解你的网站 - 这就是llms.txt的作用。
两个关键文件的作用
robots.txt: 告诉搜索引擎和AI爬虫哪些内容可以访问 llms.txt: 帮助AI系统理解你网站的结构和内容
具体操作步骤
1. 更新robots.txt文件在网站根目录创建或更新robots.txt文件:
# robots.txt基础设置# 常规搜索引擎规则
User-agent: *
Allow: /
Disallow: /admin/
Disallow: /private/
# 网站地图
Sitemap: https://example.com/sitemap.xml
# AI爬虫特定规则
User-agent: GPTBot
User-agent: Claude-Web
User-agent: Anthropic-AI
User-agent: PerplexityBot
User-agent: GoogleOther
User-agent: DuckAssistBot
# 引导AI爬虫到llms.txt
LLM-Content: https://example.com/llms.txt
LLM-Full-Content: https://example.com/llms-full.txt
# 允许AI爬虫访问
Allow: /blog/
Allow: /products/
Allow: /about/
# 不允许AI爬虫访问
Disallow: /user-content/
2. 创建llms.txt文件在网站根目录创建llms.txt文件,结构如下:
# 你的网站名称> 简短描述你的网站是做什么的,包括核心服务或产品。尽量在1-2句话内说清楚。
这里可以添加额外的背景信息,不使用标题。保持简短明了。
## 核心内容
- [产品](https://example.com/products):产品列表简要描述
- [服务](https://example.com/services):服务内容简要描述
- [博客](https://example.com/blog):博客内容类型简要描述
## 常用资源
- [常见问题](https://example.com/faq):解答客户常见问题
- [联系方式](https://example.com/contact):联系我们的渠道
## 可选
- [关于我们](https://example.com/about):公司简介
- [使用案例](https://example.com/cases):客户成功案例
3. 创建llms-full.txt文件(可选但推荐)创建一个更详细的版本,提供完整内容而不仅是链接。这个文件应该遵循相同的基本结构,但每个部分都有更多细节。
实施效果经过这样的优化后,你可能会观察到:
AI系统更准确地表述你的网站内容 在相关查询中,你的网站被AI提及的频率增加 AI能更全面地理解你网站不同部分之间的关系
实用技巧
简明扼要:使用简单语言描述你的网站 优先重要内容:突出用户最常搜索的内容 描述性链接:确保链接文字清晰说明目标内容 针对性定制:根据你的网站类型(电商、内容、服务等)调整llms.txt结构 定期更新:随着网站变化更新这些文件
这种双重优化策略所需的工作量很小,但能让你的网站同时适应传统搜索引擎和新兴AI系统,在未来的数字营销中占据优势地位。
结语
通过实际数据的验证,我们可以看到AI友好度优化确实有实际效果。虽然这只是初步的数据,但它已经提示我们,未来的网站优化可能需要同时考虑传统SEO和AI系统的可访问性。
我会继续跟踪这方面的数据变化,看看这种效果是否持续,以及不同AI系统的偏好是否会随时间变化。如果你已经实施了类似的优化策略,欢迎分享你的经验!如果还没有,希望这篇实战分享能给你一些启发。