// 指南
如何才能被 Claude 引用?
更新于: 2026-08-10
// 简短答案
Claude 可以用两种方式提及你的品牌,只有一种可以主动优化:它可以基于模型已有知识回答,也可以实时搜索网络,并为所用来源附上引用。第二条路径在你的控制范围内:让正确的 Anthropic 爬虫进入,确认自己是否在 Claude 搜索实际查询的索引中,并发布 Claude 更愿意引用的第一方深度内容。
三个 Anthropic 爬虫,三个开关
这里正是 Claude 与相邻产品差异最大的地方。在一项覆盖 SaaS 和技术查询、16,406 个域名的 379,321 条 Claude 引用研究中,64% 指向品牌和公司网站,0.9% 指向社交媒体,而 Reddit 恰好为零。为 ChatGPT 可见性设计的策略不能直接迁移:Claude 中的品牌可见性主要建立在你自己的网站上。当然,前提是 Claude 能访问该网站,因此先从这里开始。
Anthropic 运行三个独立机器人,各有 user-agent 和职责。大多数站长把三者当成一个决定;其实不是。
ClaudeBot — 收集网页内容以改进生成式 AI 模型(训练)。屏蔽的代价:未来内容被标记为从训练数据集中排除。
Claude-SearchBot — 为提高搜索结果质量而索引内容。屏蔽的代价:不进入搜索索引——“可能降低你网站的可见性”。
Claude-User — 当 Claude 用户的问题需要时抓取页面。屏蔽的代价:无法按用户请求抓取。
三个机器人都遵守 robots.txt。Anthropic 表示其机器人遵循标准 robots.txt 指令,也遵守非标准的 Crawl-delay。这与 Perplexity 有真实区别:后者由用户发起的抓取器通常忽略 robots.txt。对 Claude 而言,disallow 对全部三个机器人都有效。
这也让一个实用选择成为可能:屏蔽训练并不等于从 Claude 消失。如果你反对的是模型训练而不是可见性,就屏蔽 ClaudeBot,让另外两个保持开放。引用来自搜索和用户发起的抓取,而非训练语料。
User-agent: ClaudeBot
Disallow: /
User-agent: Claude-SearchBot
Allow: /
User-agent: Claude-User
Allow: /在审计中,我们更常看到相反情况:为了退出训练而写下的全局 Disallow,悄然一并失去了所有引用。
要验证自称 Anthropic 的爬虫,请将其 IP 与 claude.com/crawling/bots.json 发布的列表比对。这是一份统一的爬虫地址列表而非按机器人细分;用它确认流量确属 Anthropic,再读取 user-agent 判断是哪一个机器人在访问。
Claude 的网页搜索如何运作?
Claude-SearchBot 为搜索索引编入你的页面。更有趣的问题是:哪个索引。
当问题需要最新信息时,Claude 会执行搜索并处理结果。Anthropic 文档称,“每个回答都包含引用,因此你可以轻松自行验证来源。”但产品文档从未点名网页搜索提供商。已知事实是:Brave Search 于 2025 年 3 月加入 Anthropic 的公开子处理商列表;Claude 的 web_search 工具定义含有名为 BraveSearchParams 的参数;且一项有记录的测试中,Claude 返回的十条引用与相同关键词的 Brave 搜索完全一致。Anthropic 帮助中心另称图片结果“由 Bing 提供支持”。
无论如何,做法相同:针对希望赢得的查询搜索 Brave,看看自己是否出现。这只需一分钟、没有成本,而且比 Google 排名更接近 Claude 的检索代理。
哪些已确认,哪些是研究,哪些只是推测
大多数 Claude SEO 建议都是言之凿凿却没有依据的说法。以下是我们在依据任何建议行动前所做的区分。
两份数据集都显示同一个二阶模式,而且它比任何单独策略都重要:Claude 的引用高度集中。16,406 个域名中,500 个获得 59.9% 的 SaaS 和技术引用;健康领域中,10 个机构贡献 57.8%。Claude 不会把引用分散给长尾,而是反复回到它认为达到参考资料级别的来源。能否加入这个集合取决于你的页面是什么,而不是页面如何格式化——这才是真正的竞争。
像参考资料一样写作,而非像落地页
提取的基础原则在这里与其他地方相同:先回答、每段一个主张、可比较数据用表格、具体信息列明来源。Claude 的不同之处在于它奖励的语体;能否出现在 Claude 回答中,主要取决于这种语体。
在 SaaS 和技术数据集中,64% 的引用落在公司自有域名上。因此产品文档、技术规格、方法论页面和比较表格是最强的引用资产——而它们常常写得像销售文案,实际应当像文档。具体来说:
- 发布规格,而非形容词。数字、限制、支持的版本,以及产品不能做什么。让模型无需添加自己的保留条件即可引用。
- 展示你的方法。如果有数据,说明如何收集:样本量、收集时间窗口和排除项。主导健康研究的机构靠程序性权威获得引用,不靠推广语言。
- 说明限制。警示部分会让页面更安全可引,而非更弱。这决定了模型能否替你加限定,还是必须自己加限定。
- 给所有内容标日期并保持真实。带日期的更新日志、表格中的 API 限制、“最后审核”标记。页面因准确被引用一次,只有持续准确才会继续被引用。
| 主张 | 状态 | 来源 |
|---|---|---|
| 三个职责不同的机器人:ClaudeBot(训练)、Claude-SearchBot(搜索索引)、Claude-User(用户发起的抓取) | 官方 | Anthropic 爬虫文档 |
| 三者都遵守 robots.txt;分别屏蔽会产生有文档记录的不同后果 | 官方 | Anthropic 爬虫文档 |
| Anthropic 发布爬虫 IP 以供验证 | 官方 | claude.com/crawling/bots.json |
| 每个网页搜索回答都会附上所用来源的引用 | 官方 | Claude 帮助中心 |
| Claude 的网页搜索使用 Brave | 证据充分,但产品文档未明确说明 | 子处理商列表(2025 年 3 月)+ BraveSearchParams + 匹配的结果集 |
| 64% 的引用去往品牌/公司域名,0.9% 去往社交媒体,Reddit 为零;前 500 个域名获得 59.9% | 研究 | Otterly,16,406 个域名中的 379,321 条引用,2026 年 6 月——SaaS/技术查询 |
| 健康查询中,97.8% 的引用去往成熟机构;十个组织提供 57.8%,Mayo Clinic 单独占 24.7% | 研究 | Jacques 等,3,075 个问题的 10,038 条引用,arXiv 2026 |
| “在 Reddit 发帖让 Claude 收录” | 推测——已被证伪 | Otterly 数据集中 Reddit 引用为零 |
| 泄露的“排名参数”、加权因素清单、评分阈值 | 推测 | Claude 没有公开此类数据 |
相关问题
应当屏蔽 ClaudeBot 吗?
只有当你反对模型训练时才应屏蔽。屏蔽 ClaudeBot 表示未来内容应从 Anthropic 的训练数据集中排除;搜索索引和用户发起的抓取由独立机器人进行,你可以让它们保持开放。屏蔽全部三个才是会失去引用的选择。
在 Brave Search 中排名重要吗?
根据现有证据,很可能重要;并且罕见地,它检查起来很便宜。把十个目标查询放进 Brave,记录哪些会在首屏返回你的页面;该列表可以真实呈现 Claude 今天能够检索到什么。把它视为强代理,而不是已记录的机制。
需要出现在 Claude 的训练数据中吗?
不需要。训练决定模型在版本更新之间知道你的品牌什么;引用来自实时检索。若想被引用,应优化搜索路径:它更快、可检查,也不依赖训练截止日期。
这与 ChatGPT 和 Perplexity 有何不同?
爬虫、索引和规则都不同。被 ChatGPT 引用经由 OpenAI 自己的搜索爬虫和索引。Perplexity 的引用路径实时检索,强烈偏向近期页面,其用户抓取器通常忽略 robots.txt。Claude 的三个机器人都遵守 robots.txt,依赖第三方索引,并且依现有数据将大多数引用给到品牌自有页面。一份 robots.txt 政策和一种内容策略无法同时很好地服务三者。
相关指南
来源
// 分享