ShowHN Today ShowHN Today

实战分享:robots.txt与llms.txt优化对AI流量的影响

1. 背景介绍

几天前,我分享了一篇关于如何提升网站AI友好度的实用指南,主要介绍了通过优化robots.txt和创建llms.txt文件来让网站更好地被ChatGPT、Claude等AI系统识别和推荐。当时的文章主要是理论和操作方法,而今天我想分享一些实际的数据反馈,看看这些优化策略是否真的有效。

图片

2. 实施前的疑问

在实施这些优化策略前,我有几个主要疑问:

  • 各大AI模型厂商真的会派专门的爬虫来抓取网站内容吗?
  • 用户真的会通过AI系统的引荐而访问网站吗?
  • 通过llms.txt文件提供结构化内容,真的能提高AI对网站的理解和推荐率吗?
  • 不同的AI系统对这些优化会有不同的反应吗?

这些问题在理论上有答案,但需要实际数据来验证。

3. 数据反馈和对比

在实施优化策略后的第四天,我通过Cloudflare收集到了一些有趣的数据。我对比了两个网站的AI爬虫访问情况:一个实施了AI友好度优化,另一个没有进行任何优化。

实施了AI友好度优化的网站:

  1. ClaudeBot (Anthropic) - 3340请求
  2. Bytespider (ByteDance) - 621请求
  3. Amazonbot (Amazon) - 83请求
  4. ChatGPT-User (OpenAI) - 17请求
  5. OAI-SearchBot (OpenAI) - 6请求
  6. PerplexityBot (Perplexity) - 5请求
  7. Applebot (Apple) - 4请求

未实施AI友好度优化的网站:

  1. ChatGPT-User (OpenAI) - 1665请求
  2. Bytespider (ByteDance) - 552请求
  3. ClaudeBot (Anthropic) - 144请求
  4. OAI-SearchBot (OpenAI) - 119请求
  5. PerplexityBot (Perplexity) - 116请求
  6. Amazonbot (Amazon) - 75请求
  7. GPTBot (OpenAI) - 51请求
  8. Applebot (Apple) - 33请求
  9. archive.org_bot (Internet Archive) - 2请求

从数据中可以看出一些明显的差异:

  • 优化后的网站吸引了显著更多的ClaudeBot访问(3340 vs 144)
  • 而ChatGPT-User在未优化的网站上访问量更高(1665 vs 17)
  • 这可能表明不同的AI公司对网站结构和内容的偏好存在差异

另外值得注意的是,我确实观察到有实际用户通过这些AI系统的引荐访问了网站,证明这种优化不仅影响爬虫行为,也间接影响了实际流量。

4. 反思

基于这些数据,我有以下几点反思:

  1. AI爬虫确实活跃且各有偏好:数据清晰地表明,各大AI公司确实在积极爬取网络内容,但它们似乎有不同的偏好和策略。特别是Anthropic的ClaudeBot对结构化内容似乎更为敏感。

  2. 优化策略有效但影响各异:优化确实能增加部分AI爬虫的访问量,但对不同AI系统的影响程度不同。这提示我们可能需要针对特定的AI系统调整优化策略。

  3. 新的流量来源正在形成:就像过去我们优化SEO以获取搜索引擎流量一样,现在开始关注和优化AI系统的引荐流量可能是明智之举。随着AI助手使用率的提高,这部分流量可能会变得越来越重要。

  4. 早期布局的价值:虽然现在AI引荐流量可能只占总流量的一小部分,但现在开始优化可能会在未来获得先发优势。

  5. 对内容创作的启示:这种差异也提示我们,在创作内容时可能需要思考如何同时满足人类读者和AI系统的需求,就像我们考虑SEO和用户体验的平衡一样。

5. 之前操作经验完整详情

为了方便刚看到这篇文章的朋友,以下是我之前分享的完整操作指南:

提升网站AI友好度的实用指南:robots.txt与llms.txt整合

为什么需要这么做?随着ChatGPT、Claude等AI系统越来越普及,越来越多人通过AI获取信息。但问题来了:即使你的网站在Google排名很好,AI系统可能依然无法准确引用或推荐你的内容,那么如何从ChatGPT、Claude、Gemini、deepseek这些模型中能推荐自己的网站呢?。 原因很简单:AI系统处理网页时,其上下文窗口有限,难以消化复杂的HTML、导航元素和JavaScript。它们需要一种更直接的方式来理解你的网站 - 这就是llms.txt的作用。

两个关键文件的作用

  • robots.txt: 告诉搜索引擎和AI爬虫哪些内容可以访问
  • llms.txt: 帮助AI系统理解你网站的结构和内容

具体操作步骤

1. 更新robots.txt文件在网站根目录创建或更新robots.txt文件:

# robots.txt基础设置

# 常规搜索引擎规则
User-agent: *
Allow: /
Disallow: /admin/
Disallow: /private/

# 网站地图
Sitemap: https://example.com/sitemap.xml

# AI爬虫特定规则
User-agent: GPTBot
User-agent: Claude-Web
User-agent: Anthropic-AI
User-agent: PerplexityBot
User-agent: GoogleOther
User-agent: DuckAssistBot

# 引导AI爬虫到llms.txt
LLM-Content: https://example.com/llms.txt
LLM-Full-Content: https://example.com/llms-full.txt

# 允许AI爬虫访问
Allow: /blog/
Allow: /products/
Allow: /about/

# 不允许AI爬虫访问
Disallow: /user-content/

2. 创建llms.txt文件在网站根目录创建llms.txt文件,结构如下:

# 你的网站名称

> 简短描述你的网站是做什么的,包括核心服务或产品。尽量在1-2句话内说清楚。

这里可以添加额外的背景信息,不使用标题。保持简短明了。

## 核心内容
- [产品](https://example.com/products):产品列表简要描述
- [服务](https://example.com/services):服务内容简要描述
- [博客](https://example.com/blog):博客内容类型简要描述

## 常用资源
- [常见问题](https://example.com/faq):解答客户常见问题
- [联系方式](https://example.com/contact):联系我们的渠道

## 可选
- [关于我们](https://example.com/about):公司简介
- [使用案例](https://example.com/cases):客户成功案例

3. 创建llms-full.txt文件(可选但推荐)创建一个更详细的版本,提供完整内容而不仅是链接。这个文件应该遵循相同的基本结构,但每个部分都有更多细节。

实施效果经过这样的优化后,你可能会观察到:

  1. AI系统更准确地表述你的网站内容
  2. 在相关查询中,你的网站被AI提及的频率增加
  3. AI能更全面地理解你网站不同部分之间的关系

实用技巧

  • 简明扼要:使用简单语言描述你的网站
  • 优先重要内容:突出用户最常搜索的内容
  • 描述性链接:确保链接文字清晰说明目标内容
  • 针对性定制:根据你的网站类型(电商、内容、服务等)调整llms.txt结构
  • 定期更新:随着网站变化更新这些文件

这种双重优化策略所需的工作量很小,但能让你的网站同时适应传统搜索引擎和新兴AI系统,在未来的数字营销中占据优势地位。

结语

通过实际数据的验证,我们可以看到AI友好度优化确实有实际效果。虽然这只是初步的数据,但它已经提示我们,未来的网站优化可能需要同时考虑传统SEO和AI系统的可访问性。

我会继续跟踪这方面的数据变化,看看这种效果是否持续,以及不同AI系统的偏好是否会随时间变化。如果你已经实施了类似的优化策略,欢迎分享你的经验!如果还没有,希望这篇实战分享能给你一些启发。