让 AI 引用你的网站:三个最容易忽略的技术细节
抓取器拿到的是初始 HTML,不是浏览器渲染后的页面。这个差别决定了你的内容是否会被 AI 引用。
生成式引擎不是搜索引擎。搜索引擎返回十条蓝色链接,由人来判断哪条值得点;生成式引擎直接给出答案,你的站点要么被引用,要么根本不存在。
三条最容易忽略的
1. robots.txt 里没放行 AI 抓取器
大多数站点的 robots.txt 是十年前写的,只考虑了 Googlebot。GPTBot、ClaudeBot、PerplexityBot 这些抓取器遵守 robots.txt,你没显式放行,它们就不会来。
User-agent: GPTBot
Allow: /
User-agent: ClaudeBot
Allow: /
2. 关键内容由客户端渲染
抓取器拿到的是初始 HTML。如果你的正文是 useEffect 里 fetch 回来再插进 DOM 的,它们看到的就是一个空壳。服务端渲染不是性能优化,是可见性的前提。
3. 没有 llms.txt
这是个新约定:在站点根放一份 llms.txt,用 Markdown 列出你希望被引用的页面。它不是必需品,但成本极低,而且明确告诉模型「这些是我的核心内容」。
怎么验证
最直接的办法是把自己的站点当成抓取器来访问:
curl -A "GPTBot" https://your-site.com/ | head -50
看看返回的 HTML 里有没有真正的内容。如果只有一堆 <script> 标签和一个空的 <div id="root">,那就是问题所在。