AI 搜索正在吃掉你的自然流量:独立站被 ChatGPT 引用的完整实操指南

📌 写在前面:这篇是写给有自己网站的人的——独立站站长、做内容变现的、靠 Google 自然流量吃饭的跨境卖家。晨飞博客从 2014 年写到现在,我这十几年的流量几乎全是自然搜索给的,所以 AI 搜索这件事对我来说,远比”行业趋势”四个字沉重——它直接砸在我的饭碗上。这篇文章我把 Google、OpenAI、Perplexity、Anthropic 四家的官方文档挨个翻了一遍,把”官方到底怎么说”和”网上都在传什么”分开摆给你看。另外说明一句:这类话题满篇都是技术黑话,我会把每个绕不开的名词都用大白话解释一遍,保证你不懂技术也能照着做。

文中涉及的爬虫名称、控制指令、官方政策,均以写作时(2026 年 8 月)各家官方文档页面为准,出处在文末统一列出。这些东西变得很快,你真要动手改配置之前,请点开链接确认一遍最新版本。本文含推荐链接,通过链接注册我可能获得少量佣金,不影响你的价格,详见晨飞博客的佣金披露说明

先说一句可能让你不太舒服的话:过去两年里,如果你的网站自然流量在掉,而你排名其实没怎么变,先别急着怀疑自己的 SEO 出了问题,更大的可能在于:搜索结果页本身变了。

皮尤研究中心(Pew Research Center)在 2025 年做过一次很扎实的追踪调查,找了 900 位美国成年人,同意共享自己的浏览记录,统计了 2025 年 3 月一整个月、总共 68,879 次 Google 搜索的真实行为。结论是这样的:当搜索结果页顶部出现 AI 摘要时,用户点击下方任何一条传统搜索结果的比例是 8%;没有 AI 摘要的时候,这个比例是 15%。差不多是砍掉一半。

更让人心凉的是另外两个数字。用户点击 AI 摘要里那些引用链接的比例,只有 1%。而且看到 AI 摘要之后直接关掉、结束整个浏览会话的比例是 26%,没有 AI 摘要的页面是 16%。翻译成人话就是:AI 摘要不但抢走了你的点击,它还让相当一部分人看完就走,连搜第二次的兴趣都没有了。

这里得先交代一下我的底气从哪来,免得你觉得我在跟风唱衰。Google SEO 这门手艺我练了十几年,晨飞博客的流量几乎全靠自然搜索喂大:多个竞争激烈的热门关键词,我把它们做到过 Google 搜索结果第一名,一挂就是好几年;网站速度指标我优化到过满分,长尾词怎么抢、内容怎么布局,我都写过完整的方法论,就在文末的相关阅读里。按资历说,我这样的人最有理由守着老一套继续吃红利。

可正因为盯着排名和流量盯了十几年,我才比多数人更早感到不对劲。以往每一轮算法更新,改的都是”谁排第一”;这一轮,改的是”用户还点不点链接”。身边越来越多人遇到问题的第一反应已经变成打开 ChatGPT 或者 Claude,连”去 Google 搜一下”这个动作本身都在被跳过。我那些辛苦挣来的第一名还挂在原位,含金量却一天天在被稀释——皮尤那组数据,量化的就是我这两年的切身体感。

这就是我们现在要面对的局面。接下来这篇文章我不打算跟你聊”AI 时代的变革与机遇”这种废话,我们只聊具体的:AI 搜索到底是怎么找到你的内容的、四家主要玩家各自的规则是什么、你的 robots.txt 该怎么写、内容该怎么调整、以及最后——怎么判断这件事到底值不值得花力气。

一、AI 搜索找到你的内容,走的是三条完全不同的路

市面上绝大部分讲”GEO”(Generative Engine Optimization,生成式引擎优化)的中文文章,最大的问题是把所有 AI 产品混成一锅粥讲,然后给你一套万能配方。实际上你至少要分清三条路径——也就是 AI 拿到你内容的三种方式,每一种的应对办法都完全不同。

第一条——训练语料。说白了,这就是 AI 上学时读过的”课本”:模型在训练阶段吃掉的公开网页内容。这条路径的特点是:滞后性极强(训练数据有截止日期)、不给你任何链接、也基本不可能给你带来流量。你的内容进了训练集,最多是让模型”知道”某个事实,但用户看不到出处,你一分钱好处也拿不到。

第二条——检索式引用。用户提问的时候,产品实时去搜索一遍网页,抓几个来源,生成答案并附上引用链接。ChatGPT 的搜索功能、Perplexity、Google 的 AI Overviews 和 AI Mode,都属于这一类。这条路径是唯一真正可能给你带来点击和品牌曝光的,也是这篇文章的重点。

第三条——用户主动触发的抓取。用户在对话里直接甩给 AI 一个网址,或者 AI 为了回答某个具体问题去访问某个页面。这类请求各家通常算作”替用户跑腿”,跟机器人自己主动上门抓取是两回事,所以处理规则也往往不一样,下一段会讲到。

把这三条分开的实际意义在于:你可以选择性地放行。比如你完全可以拒绝自己的内容被拿去训练模型,但同时欢迎检索式引用——因为前者不给你回报,后者会给你链接。先把两个绕不开的名词说清楚。爬虫:各家派出来自动读网页的程序,你可以把它想成挨家挨户上门的抄表员,每个都有自己的名字(比如 Google 的叫 Googlebot)。robots.txt:放在你网站根目录的一个纯文本小文件,相当于贴在大门口的告示,写着”哪个抄表员能进、哪个不能进”。各家现在都支持你分开对待它们的不同爬虫——训练的拒之门外、引用的开门欢迎,具体怎么写,下面挨个说。

二、Google 已经把话说死了:没有”AI 专用优化”这回事

这一节可能是整篇文章里最值钱的。因为过去两年,中文互联网上关于”怎么优化才能进 AI Overviews”的说法多得离谱,卖课的、卖工具的、做代运营的,每家都有一套秘籍。而 Google 在 2026 年正式出了一份官方文档,标题就叫《Optimizing your website for generative AI features on Google Search》,直接把这些说法一条条否掉了。

先看 Google 明确说你不需要做的事,这份清单我建议你截图存下来,下次有人跟你推销 AI 优化服务的时候拿出来对照:

  • 不需要创建任何新的机器可读文件、AI 文本文件、标记或 Markdown 版本。原文特别点名了 llms.txt——Google 搜索直接忽略这个文件。
  • 不需要把内容切成小块(所谓 chunking)让 AI 更好理解。
  • 不需要为了生成式搜索用某种特定的写法。
  • 不需要刻意堆关键词的各种变体,系统能理解同义词。
  • 不需要去外面刷所谓的”品牌提及”。
  • 不需要过度投入结构化数据(在网页代码里按固定格式给机器标注”这是评分””这是价格”的那种标签)——原文用的词是”overfocusing on structured data”,明确说它对 AI 功能算不上必要条件。
  • 没有所谓的理想页面长度。

llms.txt 这一条我要多说两句。过去一年,中文圈里有大量文章教你怎么写 llms.txt,说这是”AI 时代的 robots.txt”,不做就落后了。现在 Google 官方文档白纸黑字说搜索侧忽略它。平心而论,这个提案作为社区标准自有它的想法,将来会不会有别家采用也不好说,但至少在 Google 这一侧,你花时间维护它是纯粹的浪费。

那 Google 说要做什么呢?说白了就一句话:把 SEO 的基本功做好,AI 功能没有额外要求。具体展开是这几条——内容要有价值、不是”commodity content”(人云亦云的通货内容),要有独到视角和真实的专业见解;内容必须可抓取,因为生成式 AI 用的就是公开可抓取的内容;要满足搜索的基本技术要求,包括可索引、且符合摘要(snippet)展示的条件;用了 JavaScript 框架的话要遵守 JS SEO 的最佳实践;页面体验要好;减少重复内容;配图和视频要有质量。

我个人对这份文档的解读是:Google 在传递一个非常明确的信号——AI Overviews 和 AI Mode 的内容来源,就是它现有的那个搜索索引,Google 并没有为 AI 另起炉灶再建一套系统。所以你能不能进 AI 摘要,前置条件是你能不能进普通搜索结果,以及你的页面允不允许展示摘要。

关于”query fan-out”,这个机制值得你理解

Google 在 AI 功能的官方说明页里提到了一个技术细节:AI Overviews 和 AI Mode 会使用”query fan-out”(查询扇出)技术,也就是针对用户的一个问题,同时向底层发起多个相关子问题的搜索,然后综合结果生成答案。打个比方:你问它”怎么去加拿大留学”,它会自己拆成”要什么条件””学费多少””签证怎么办”一堆小问题,分头去搜,再把搜到的东西拼成一个完整回答。Google 自己的说法是,这让它能展示”比传统搜索结果更宽、更多样的有用链接”。

这个机制对你意味着什么?意味着排名逻辑变了。传统 SEO 里,你要为”某个关键词”抢第一名。在扇出机制下,用户问的那个大问题会被拆成一堆小问题,你的页面只要在其中某一个子问题上是最好的答案,就有机会被引用进去。

所以那种覆盖面很宽、什么都讲一点但什么都不深的”大而全”文章,反而吃亏;而把一个具体问题讲透、讲到别人没讲的深度的文章,机会更大。这一点跟我多年做长尾内容的经验完全吻合,我在如何通过内容营销与 Google SEO 抢占竞争度低却转化高的自然搜索流量那篇里写过的思路,在 AI 搜索时代不但没过时,权重反而更高了。

你能控制的只有”露多少”,不能控制”露不露”

很多站长最想问的其实是:我能不能不进 AI Overviews,但保留在普通搜索结果里?

按 Google 现在的官方文档,你手上的控制杆只有这么几个:nosnippet(完全不展示摘要)、max-snippet(限制摘要长度)、data-nosnippet(屏蔽页面里的特定段落)、noindex(干脆不收录)。原文的表述是,要限制搜索里展示你页面的信息,就用这几个控制项。

看明白了吗——这里面没有一个是”只退出 AI 功能”的开关。你用 nosnippet 把 AI 摘要挡掉,代价是普通搜索结果里你的描述文字也没了,那对点击率是毁灭性的。所以对绝大多数靠流量吃饭的站来说,这个选项等于不存在。

另外还有一个叫 Google-Extended 的标识,它控制的是 Google 在搜索之外的其他系统里对你内容的训练与调用(比如 Gemini 的模型训练)。这个可以放心屏蔽,不影响你在搜索和 AI Overviews 里的表现——它管的本来就不是搜索这一摊。

补一个刚出现的变化:Google 在 2026 年 6 月发布生成式 AI 报告的那篇官方博客里预告,Search Console 将上线一个新控制项,让站点可以单独阻止内容出现在 AI Overviews、AI Mode 这些 AI 功能里,普通搜索结果照旧保留。截至我修订这篇文章时,这个开关还没铺开到所有站点。它真正上线之后,本节说的”要挡 AI 摘要就得连普通摘要一起牺牲”这个两难,才算有解。我会盯着它的进展更新这一段——这也正好说明这个领域变化有多快,隔两个月回来看一眼,结论就可能不同。

三、ChatGPT 的规则不一样:决定你能不能被引用的是 OAI-SearchBot

OpenAI 这边的机制比 Google 清晰得多,而且给了你真正意义上的分离控制。它一共跑四个爬虫,各管各的:

爬虫标识 用途 屏蔽的后果
OAI-SearchBot 为 ChatGPT 的搜索功能收录网页 官方明确说:屏蔽它,你就不会出现在 ChatGPT 的搜索答案里
GPTBot 为训练生成式基础模型抓取内容 官方明确说:屏蔽它不影响搜索可见性,只是不给训练用
ChatGPT-User 用户提问时 ChatGPT 实时访问页面 不参与搜索结果资格判定;因为是用户主动触发,robots.txt 规则可能不适用
OAI-AdsBot 校验投放到 ChatGPT 广告里的落地页安全性 与搜索无关

这张表里最关键的是前两行的对比。OpenAI 把”要不要被引用”和”要不要被拿去训练”这两件事彻底分开了,而且把话说得很明白。这意味着一个内容站最优的配置其实非常明确:放行 OAI-SearchBot,屏蔽 GPTBot。前者给你曝光和链接,后者只拿走不给。

我知道有人会说,屏蔽训练是不是太小气了,万一模型记住我的品牌呢。我的看法是:模型训练是个黑箱,你的内容进去之后,用户看到的答案里既没有你的名字也没有你的链接,这笔交易对你没有任何可衡量的回报。而检索式引用是有链接的,那才是能带来点击的东西。这两者的性价比差得太远,没什么好纠结的。

顺带提醒一件很多人踩过的坑。robots.txt 里有个容易想当然的规则:你一旦为某个爬虫单独写了一节,这个爬虫就只看自己那一节,原来写给”所有爬虫”(就是通配符 * 那一节)的规矩,它一概无视。所以给谁单独开了小灶,原来大锅饭里你希望它继续遵守的禁令(那些 Disallow 行,意思是”这个目录禁止进入”),必须在它的小灶里重新抄一遍。我见过不少站长就是这么把自己的后台目录给暴露出去的。

四、Perplexity、Claude、Copilot 这几家怎么抓

Perplexity

Perplexity 的文档写得很清楚,它跑两个爬虫。PerplexityBot 负责”在 Perplexity 搜索结果里呈现并链接网站”,官方特别注明它用于抓取内容训练基础模型——所以这个爬虫对内容站来说是纯利好,没有理由屏蔽。另一个是 Perplexity-User,对应用户提问时系统去访问页面的行为,官方说明里提到由于是用户发起的,它通常不遵循 robots.txt 规则。

官方给的建议也很直白:想出现在 Perplexity 的结果里,就在 robots.txt 里放行 PerplexityBot,并且允许来自它公布的 IP 段的请求。IP 段是以 JSON 文件的形式公开发布的,如果你的站前面挂了防火墙或者做了比较激进的 bot 拦截,这一步值得去核对一下——我见过好几个案例是安全插件把这些爬虫当恶意流量拦了,站长自己完全不知情。

Anthropic(Claude)

Anthropic 同样是三个爬虫的结构:ClaudeBot 抓取内容用于模型训练与开发;Claude-User 对应用户在 Claude 里提问时系统去取网页;Claude-SearchBot 用于索引内容以改进搜索结果质量。

逻辑和 OpenAI 那套是对应的——如果你的取舍是”要曝光、不要白给训练”,那就屏蔽 ClaudeBot,放行 Claude-SearchBot 和 Claude-User。Anthropic 的支持文档里还有一条提醒我觉得很实在:它明确说靠封 IP 来实现退出是不可靠的,”可能无法正确工作,也无法持续保证退出”,正确的做法是用 robots.txt。它同样公布了自己的 IP 列表供你核验请求真伪。

微软这一侧(Bing 与 Copilot)

微软的情况相对特殊:它没有像 Google、OpenAI 那样单独设一个 AI 爬虫,Bingbot 一套抓取同时服务传统搜索和 AI 答案。所以你在这一侧要做的事其实回到了最传统的动作——确认站点已经被 Bing 正常收录。

很多做外贸独立站的朋友早就放弃了 Bing,觉得流量太少不值得管。我的建议是至少花二十分钟把 Bing Webmaster Tools 配上,提交站点地图(sitemap,一份列着你全站所有网址的清单文件,搜索引擎照着它来收录),跑一遍 URL 检查。成本极低,而现在 Bing 索引的意义已经不只是那点搜索流量了。

另外值得配的是 IndexNow。它是微软牵头搞的一个通知机制,作用一句话就能说清:你的网站一有新内容,主动喊一嗓子告诉搜索引擎,省得干等它们自己来发现。官方的说法是,能把”新内容被发现”的时间从几周缩短到即时。目前官网上列出的参与方是 Microsoft Bing、Naver、Seznam.cz、Yandex 和 Yep——注意,Google 不在这个名单里,所以别指望它能加速 Google 收录。WordPress 站装个 IndexNow 插件就行,配置一次基本不用再管。

五、一份可以直接抄的 robots.txt

把上面几节的结论落到配置上。先说清楚这份配置背后的取舍:凡是能给我带来引用链接的爬虫,全部放行;凡是只拿内容去训练、不给任何回报的爬虫,一律屏蔽。如果你的判断和我不同(比如你觉得进训练集对品牌有长期价值),照着改就行,逻辑是通的。

# ===== 放行:这些爬虫会给你带来引用和链接 =====
User-agent: Googlebot
Allow: /

User-agent: Bingbot
Allow: /

User-agent: OAI-SearchBot
Allow: /

User-agent: PerplexityBot
Allow: /

User-agent: Claude-SearchBot
Allow: /

# ===== 屏蔽:这些只用于模型训练,不给回报 =====
User-agent: GPTBot
Disallow: /

User-agent: ClaudeBot
Disallow: /

User-agent: Google-Extended
Disallow: /

# ===== 通用规则 =====
User-agent: *
Disallow: /wp-admin/
Allow: /wp-admin/admin-ajax.php

Sitemap: https://你的域名.com/sitemap_index.xml

几点使用说明。第一,把最后那行站点地图地址换成你自己的,Rank Math 和 Yoast 生成的路径不一样,去插件里确认一下。第二,前面提过的覆盖问题——因为我给多个爬虫单独开了规则块,如果你在 * 下面还有别的 Disallow 是你希望对 Googlebot 也生效的,记得在对应块里重写一遍。第三,Google-Extended 屏蔽掉不影响搜索和 AI Overviews,这一点前面说过,放心。

还有一个常被忽略的地方:robots.txt 只是”君子协定”,真正的拦截往往发生在更前面。如果你用了 Cloudflare、Wordfence 之类的安全层,或者主机商自带 bot 防护,很可能在 robots.txt 起作用之前,就已经把这些爬虫拒之门外了(访问日志里表现为 403、429 这类错误代码)。改完 robots.txt 之后,去服务器访问日志里搜一下 OAI-SearchBotPerplexityBot 这些名字,看两件事:它们到底来没来,拿到的是不是 200——200 就是”正常放行”的意思。这一步比什么都实在。

一个人在书桌前用笔记本电脑写作,代表持续产出原创内容
技术配置一个下午就能改完,真正拉开差距的还是内容本身。

六、内容怎么写才容易被引用:写了十二年博客的几点体会

技术配置那部分做完,其实就到头了——剩下的全是内容功夫。这一节是我个人主观成分最多的部分,但也是我最有底气讲的部分,毕竟这个博客我从 2014 年写到现在,没断过。

第一,把一个问题彻底讲完,别贪求覆盖很多问题。前面说的 query fan-out 机制决定了,你需要的是在某个具体子问题上成为最好的答案。一篇泛泛而谈的”跨境电商完全指南”,在扇出的每一个子问题上都竞争不过那些专门写这一个子问题的文章。这几年我自己写作的重心一直在往”更窄、更深”移,现在看这个方向是对的。

第二,把结论前置。AI 在生成答案时需要从你的页面里提取可用的片段。如果你的文章前八百字都在铺垫背景,真正的结论藏在第五节,那被准确提取的概率就低。我的习惯是每个小节的第一句话就是这一节的结论,后面才是论证过程。这个写法对人类读者也友好——大部分人本来就是扫读的。

第三,给出别人给不了的一手信息。Google 官方文档里那个词我觉得用得特别准:”non-commodity content”,非通货内容。你去搜任何一个跨境相关的问题,前十条里有八条是互相抄的,参数一样、结构一样、连错误都一样。这种内容对 AI 来说是完全可替代的——它引用谁都行,那大概率不会引用你。

能让你不可替代的东西通常只有几类:你自己实际操作过的流程和结果、你付过的真实费用、你踩过的具体的坑、你能拿到而别人拿不到的一手材料。我做了十几年跨境电商,从 Amazon、eBay 一路做到 Lazada、Shopee,加上后来在加拿大处理美加两边的业务,这些经历本身就是别人抄不走的部分。你也一样,你手里一定有一些东西是搜不到的,那才是你内容的护城河。

第四,标注时效和出处。费率、政策、产品参数这类会变的东西,写清楚”截至某年某月,以官方页面为准”并附上官方链接。这件事的好处是双向的:对读者是负责,对 AI 系统而言,一篇标注了时间和权威出处的文章,可信度判断上是占便宜的。我这几年所有涉及数字的文章都是这么处理的。

第五,不要为了 AI 去写 AI 能写的东西。这条听起来有点绕,但很重要。如果一篇文章的内容,AI 不看你的网站也能生成出来,那你写它的意义在哪?流量逻辑上讲不通,商业逻辑上也讲不通。真正安全的内容,是那些必须有人真的去做过、去付过钱、去等过那个结果才能写出来的东西。

💡 顺便说一句:这类”怎么把一手经验变成内容、再变成收入”的具体打法,包括我自己在用的选题、写作和变现流程,平时都放在晨飞博客的付费会员区里持续更新(980 元/年)。博客上是公开的方法论,会员区是我自己实际在跑的那一套。如果你正好在做内容站,可以去看看再决定。

七、技术地基:抓不到,写得再好也没用

这一节讲的东西不性感,但它是前置条件。AI 爬虫的耐心比 Googlebot 差得多——Googlebot 会为一个重要页面反复回来,很多 AI 检索是实时的,你这次没在超时前返回,这次的引用机会就没了。

要检查的清单其实不长:

  • 服务器响应速度。实时检索场景下,慢就是直接出局,没有第二次机会。
  • 正文文字别藏在”要跑程序才能看到”的地方。有些网站打开时是一个空壳,正文要靠浏览器再运行一段 JavaScript 程序才显示出来。Google 有耐心等这一步,很多 AI 爬虫没有——它们看到的就是一片空白。你的核心内容直接写在网页源代码里、打开就有,是最保险的做法。用了 React、Vue 这类框架建站的人尤其要检查这一条。
  • 安全插件和 CDN 的 bot 规则。前面说过,很多屏蔽是在这一层无声发生的。
  • 站点地图是否正常、是否包含所有你想被收录的页面。
  • 重复内容。Google 的文档里明确提到要减少重复内容,分类页、标签页、分页产生的重复是 WordPress 站的重灾区。

关于主机这件事我多说一句,因为它是我少数有长期一手经验的话题。晨飞博客在 Cloudways 上跑了七八年,中间服务器机房从纽约搬到多伦多、新加坡、日本,最后落在香港,主机商一次都没换过。托管云主机比共享虚拟主机贵不了多少(我在独立站主机怎么选那篇里把三类主机的真实成本算过一遍),但在响应速度和资源独享上是两个世界。如果你现在还在共享主机上,访客点开你的网站要干等一两秒才有反应(这个等待时间行话叫 TTFB),那 AI 搜索这一波你先天就吃亏。想看具体配置和迁移过程可以看Cloudways,也可以直接读我那篇长测。

八、怎么衡量效果:三个层面的数据

做了这么多,怎么知道有没有用?说实话,AI 搜索的数据可见性目前远不如传统 SEO,这是现状,你得接受。但有三个层面的东西是能看的。

第一层,Google Search Console。Google 在 2026 年 6 月通过官方博客宣布推出了 Search 生成式 AI 效果报告(Search Generative AI performance reports),专门给你看内容在 AI Overviews、AI Mode 这些生成式功能里的展示情况。这份报告 2026 年 6 月 3 日官宣,先在英国的一批站点试点,随后逐步铺开,你登录 Search Console 看一眼有没有就知道了。它给你五个维度:展示次数、被引用的页面、国家、设备、日期(细到小时)。两个要紧的限制先说清楚,免得你抱错期待:一是目前只有展示数据,没有点击、点击率和查询词;二是数据从 2026 年 5 月 18 日起算,之前没有历史回填。所以它现在能回答”我的页面有没有出现在 AI 功能里”,还回答不了”AI 给我带来了多少点击”。

第二层,服务器访问日志。这是最诚实的数据,也是我个人最看重的。直接在日志文件里搜索那几个爬虫的名字(OAI-SearchBot、PerplexityBot 这些),你能看到三件事:它们来没来、来的频率是多少、拿到的是不是代表”正常放行”的 200。如果你放行了 OAI-SearchBot 但日志里一次都搜不到,那就说明中间有环节把它挡了,或者你的站根本没进它的抓取队列——这两种情况的处理方式完全不同,但都得先从日志确认。

第三层,最土也最有效的办法:自己去问。把你最想拿排名的那几个问题,用中文和英文分别去 ChatGPT、Perplexity、Google AI Mode 里问一遍,看它引用了谁。这个动作没有任何技术含量,但它给你的信息量比任何第三方工具都大——你能直接看到在你这个细分领域里,AI 现在认谁。如果引用的全是几个大站,那说明这个词你短期内抢不动;如果引用的是一些内容质量一般的小站,那机会就在。

我建议把这个检查做成固定动作,每个月跑一遍,把结果记下来。市面上现在有不少号称能追踪 AI 引用的付费工具,我的态度是:在这些工具的方法论还没被验证之前,别急着花钱,手动查一遍的准确度更高,成本只是十几分钟。

九、被引用不等于有流量:怎么把曝光变成你自己的东西

这一节是我觉得大部分讲 GEO 的文章都漏掉的,但它其实是整件事里最要命的部分。

回头看开头皮尤那组数字:用户点击 AI 摘要里引用链接的比例是 1%。也就是说,哪怕你把上面所有事情都做对了,成功被 AI 引用了,绝大多数看到你名字的人也不会点进来。如果你的整个商业模式建立在”用户必须点进我的网站、看到我的广告或者我的产品页”这个前提上,那被引用这件事给你带来的实际收入,可能远低于你的预期。

所以我的看法是:在 AI 搜索时代,”被引用”的价值正在从流量价值向品牌价值迁移。用户看到的可能只是答案里一句”根据晨飞博客的说法……”,他没点进来,但这个名字在他脑子里过了一遍。这跟传统 SEO 的逻辑完全不同——传统 SEO 里排名就是流量,流量就是钱;现在中间多了一层,曝光和点击之间的转化率被砍掉了一大截。

认清这一点之后,有几件事的优先级就该往上提了。

把名字做成可被记住的东西。如果 AI 引用你的时候只显示一个域名,那这个域名值不值得记,差别很大。这也是为什么我一直用”晨飞博客”这个带人名的叫法,没去起一个听起来很像公司的名字——个人品牌在被口头转述、被 AI 复述的场景下,比机构名好记得多。

把能沉淀的关系沉淀下来。搜索流量从来都是租来的,平台规则一变就没了,这个道理做过跨境电商的人应该都懂——被平台封过号的人尤其懂。AI 搜索只是把这件事的紧迫性又提前了几年。邮件列表、会员社群、任何能让你不经过第三方直接触达读者的渠道,现在的价值都比三年前高。我自己运营付费会员以来,最大的体会和收入无关:有一批读者是真的能找到我的,任何算法都拦不住。

重新算一遍单页价值。如果你的站是靠展示广告变现的,那 AI 搜索对你的冲击是最直接的,因为广告收入严格正比于访问量。如果是靠联盟营销或者自有产品变现的,冲击相对小一些——访问量少了,但来的人意图更明确、转化率往往更高。这两年我自己的感受也是这样:流量结构在变,但成交的那批人质量并没有下降。如果你还在纯靠广告位吃饭,这可能是个该认真考虑转型的时间点。

接受一部分内容注定”只被读、不被点”。那些答案很短、很事实性的问题——比如某个表格的截止日期是几号、某个费率是多少——用户在 AI 里问完就走了,你永远拿不到这个点击。这类内容以后基本只剩品牌曝光价值。真正还能带来点击的,是那些用户看完摘要还是觉得”我得去看看原文”的内容:完整的操作流程、真实的成本拆解、带个人判断的取舍分析。写作精力该往哪边倾斜,很清楚。

十、另一半答案:与其防着 AI,先让它替你干活

写到这里,我意识到前面九节都在讲同一个方向的事:怎么在 AI 的分发规则下保住自己的位置。这是守。但对一个独立站站长来说,AI 时代还有进攻的一半,而且我认为进攻这一半的回报更大。

摊开说我自己的账本。我是 Claude 的重度用户,每月 200 美元的订阅,雷打不动。第一次付这笔钱的时候我也犹豫过——200 美元一个月,一年就是 2400 美元,够付这个博客好几年的主机费。但现在回头算账,这笔钱给我带来的回报,保守说也有几十倍。

几十倍这个数字怎么来的,我举几件它实际替我干的活。写这篇文章时,四家厂商官方文档的核对、爬虫标识的交叉验证,AI 帮我把原本要一整天的案头工作压缩到一两个小时;博客上那个每天自动更新的 SpaceX 实盘页面,从数据抓取到图表渲染,整套代码是我和 AI 一起搭的,搁两年前我得雇一个开发者;主题代码的修改调试、日常的站点维护,这些以前要么外包要么熬夜的活,现在大部分是它在干。我一个人加一个 AI 订阅,干着过去要一个小团队才能干完的活——这就是几十倍的来历。

所以我对 AI 时代的判断可以压缩成一句话:主动学着用它的人,等于给自己配了一支不知疲倦、按月付费的团队;拒绝碰它的人,竞争力会以肉眼可见的速度掉队。这一轮淘汰不看年龄、也不看资历,只看你愿不愿意把它用起来。我见过太多做了十年 SEO 的老手还在嘲笑 AI 写的东西没有灵魂——东西有没有灵魂另说,人家的产出效率已经是他的十倍了。

把这一节和前九节合起来看,其实是同一枚硬币的两面:内容上,写 AI 抄不走的一手经验,让它不得不引用你;工作流上,把 AI 用到极致,让你的产出速度别人追不上。守和攻都做的人,这个时代对他反倒比以前更友好。

十一、如果是我,现在会做什么、不会做什么

把上面所有内容压缩成一份行动清单。这是我自己的取舍,不一定适合每个人,但理由我都写清楚了,你可以自己判断。

会做的:

  1. 按第五节那份配置改 robots.txt,放行检索类爬虫、屏蔽纯训练类爬虫。这件事半小时能做完,是投入产出比最高的一步。
  2. 去日志里确认这些爬虫真的能进来、拿到的是 200。改完配置不验证等于没改。
  3. 配好 Bing Webmaster Tools 和 IndexNow。成本极低。
  4. 把 Search Console 的生成式 AI 报告(如果你的站已经有了)加进每月例行检查。
  5. 内容策略上继续往窄和深走,每篇文章结论前置,涉及数字的地方标时效、附官方链接。
  6. 每月手动去几个 AI 产品里搜自己的核心问题,看引用了谁。

不会做的:

  1. 不写 llms.txt。Google 官方说搜索侧忽略它,其他家目前也没有明确承诺,等有人真正承诺支持了再说。
  2. 不为了”AI 更好理解”去把文章切成碎块或者改写文风。Google 明确说了不需要,为了一个不存在的规则牺牲人类读者的阅读体验,这买卖不划算。
  3. 不去买所谓的”AI 提及”和品牌曝光服务。Google 文档里点名说了刷 mention 属于不真实的手段。
  4. 不在结构化数据上过度投入。基础的该做(它对传统富媒体结果仍然有用),但别指望它能撬动 AI 引用。
  5. 暂时不买 AI 排名追踪工具。

最后说一个可能有点反直觉的判断。我不认为现在应该为了 AI 搜索去大改内容策略,因为 Google 那份官方文档其实已经把答案给出来了——它反复强调的就是”做好原来该做的事”。真正会被 AI 时代淘汰的,是那些本来就靠洗稿、靠信息差、靠把公开信息重新排列组合活着的站。这类站以前能活,是因为搜索引擎需要一个链接把用户送过去;现在 AI 直接把答案说了,中间商就没有存在意义了。

而如果你的内容里有真东西——你自己做过的、付过钱的、等过结果的——那 AI 反而需要你,因为它没有别的地方能拿到这些。这也是我这十几年一直坚持写一手经验、不写二手汇编的原因。当时是出于职业习惯(我是文案出身,做过这一行),现在看,运气好,方向没错。

常见问题 FAQ

屏蔽 GPTBot 会不会让我在 ChatGPT 里彻底消失?

不会。OpenAI 的官方文档写得很明确:GPTBot 用于训练基础模型,屏蔽它不影响搜索可见性;真正决定你能不能出现在 ChatGPT 搜索答案里的是 OAI-SearchBot,官方原话是”退出 OAI-SearchBot 的站点将不会出现在 ChatGPT 的搜索答案中”。所以只要你放行了 OAI-SearchBot,屏蔽 GPTBot 是安全的。

llms.txt 到底还要不要做?

就 Google 搜索而言,不需要——官方文档明确说了会忽略这个文件,并且把它归入”不需要创建的机器可读文件”那一类。其他厂商目前也没有做出明确的支持承诺。它是个社区提案,将来可能有人采用,但现阶段把时间花在这上面,性价比很低。等哪家官方文档正式写明支持了,再花十分钟加上也不迟。

我的网站流量掉了,怎么判断是不是 AI 摘要造成的?

看 Search Console 里”展示次数”和”点击次数”的背离。如果展示次数基本持平甚至上升,但点击次数明显下滑,平均排名也没有恶化,那大概率就是结果页顶部多了 AI 摘要,用户看完不点了——这和皮尤那组数据反映的是同一件事。反过来,如果展示次数本身在掉,那问题多半出在收录或者排名上,属于传统 SEO 范畴,得另外查。

对中文内容来说,这些规则一样适用吗?

爬虫标识、robots.txt 控制、Search Console 报告这些技术层面的东西是不分语言的,完全通用。差别在竞争强度上:中文领域高质量的一手内容供给比英文少得多,很多细分问题下 AI 能找到的可靠中文来源就那么几个。这对认真做内容的中文站来说其实是好事——你成为那个”唯一可靠来源”的门槛,比在英文市场低不少。

只做 Google 的 SEO 够不够,需要单独为每家 AI 做优化吗?

内容层面不需要分开做,各家对”什么是好内容”的判断标准高度趋同,这也是 Google 那份文档反复在说的意思。真正需要分开处理的只有技术层面的放行配置——因为各家的爬虫标识不同,你必须在 robots.txt 里逐个写明。换句话说:内容一套,配置多套。

写在最后

这件事我的总体感受是:噪音远大于信号。过去两年围绕 AI 搜索优化产生的说法里,绝大部分在 Google 那份官方文档出来之后都被证伪了,而真正有效的动作——改好 robots.txt、确认爬虫能进来、把内容写得别人抄不走——加起来一个下午就能做完,剩下的全是长期功夫。

我从 2014 年开始写这个博客,中间经历过好几轮”SEO 已死”的恐慌,熊猫算法、企鹅算法、移动优先索引、核心更新,每一次都有人说自然流量到头了。这一次的冲击确实比前几次都大,我不想淡化它——皮尤那组数据是实打实的。但底层的东西没变:有人愿意花时间做真东西、写真经历,这种内容永远稀缺,无论中间的分发层是十条蓝色链接还是一段 AI 生成的摘要。

还有一句话想留给和我一样从传统 SEO 时代走过来的人。我们这批人手里的老手艺没有作废,判断内容好坏的眼光、对搜索意图的理解,这些在 AI 时代反倒更值钱了。真正需要换掉的只有姿势:以前我们研究怎么讨好算法,现在得两条腿走路——写 AI 抢不走的内容,用 AI 干人干不过来的活。这两件事,哪件都不难开始,难的只是承认”一切确实变了”这个事实。我承认得不算早,但好在够彻底。

如果你正在做内容站,或者准备开始做,欢迎来晨飞博客会员区看看,我把自己实际在跑的选题、写作和变现流程都放在那里,也有一群同样在做独立站的人在讨论。

信息来源与时效说明

本文所有技术细节与政策表述均来自以下官方页面,核实时间为 2026 年 8 月。这些页面更新频繁,动手改配置前请自行确认最新版本:

图片署名

题图:Search Engine Results Page (SERP) Graphic Illustration,作者 Muhammad Rafizeldi,来源 Wikimedia Commons,许可证 CC BY 4.0。

正文配图:Person writing in notebook while using laptop at a modern workspace,作者 Shixart1985,来源 Wikimedia Commons,许可证 CC BY 2.0。

免责声明

本文为一般性信息分享与个人经验总结,不构成任何形式的商业或技术承诺。各搜索引擎与 AI 厂商的爬虫政策、控制方式和产品功能随时可能调整,文中提及的所有配置与政策细节,请以各家官方文档页面的最新版本为准。按本文方法调整网站配置产生的任何结果,请自行评估与承担。

还没想好加入会员?先订阅邮件
有新文章、会员区有值得一提的更新时,我写一封邮件告诉你。频率不高,一般一个月一两封。
免费,随时可一键退订,邮箱不会给任何第三方。

关于作者 · 晨飞(Lifei Zhou)

跨境创业者 · CBPath 创始人

十二年从义乌外贸、亚马逊与独立站做起,以文案作家身份 DIY 移民加拿大,现居多伦多,从事美加公司注册与税务合规。持有两年制商业会计文凭与两个加拿大研究生证书,修完税务合规课程。本文基于我的亲身实操与一手记录。

有问题想和我深入聊?加入会员,会员中心可以直接联系到我。