做 AI 搜索优化时,人们很容易先找一个新文件名或一段神奇标记,盼着模型第二天就引用自己的网站。我把 robots 协议、Sitemap 规范、Bing 的提交说明和 OpenAI 公布的搜索爬虫地址看了一遍。它们解决的事情很朴素,帮助机器找到页面,并知道页面何时变化。

被发现以后,网页仍要回答另一个问题。这里有没有一条值得引用、又能核对的材料。

抓取规则只管门口

robots.txt 使用的是公开规则。RFC 9309 说明了爬虫怎样读取用户代理分组和允许、禁止路径。这个文件不能保护秘密,因为任何人都能访问它。需要登录的客户资料和后台页面,应由身份验证与权限系统保护。

搜索爬虫能不能进来,还会受到防火墙、CDN 和机器人拦截影响。OpenAI 公开的 searchbot.json 只列出 OAI-SearchBot 使用的 IP 范围,方便站点核对流量或配置网络规则。这份 JSON 没有排名公式,也没有承诺某个页面一定出现在回答里。

所以技术检查可以很具体。目标页面是否返回成功状态,robots 是否允许访问,正文是否在无需登录的页面里,服务器有没有把正常爬虫拦成四百零三。四件事有一件没过,后面的内容讨论都还没开始。

站点地图负责报地址

Sitemap 协议要求每条记录给出 URL,还可以写最后修改日期。单个文件最多放五万个 URL,未压缩大小不能超过五十 MB,更大的站点要用索引文件拆开。规范也明确提醒,提交 Sitemap 不能保证搜索引擎收录页面。

Bing 推荐网站使用 IndexNow 通知页面新增、更新或删除。它比等待爬虫偶然经过更及时,提交活动还能在 Webmaster Tools 里查看。主动通知仍然只是报地址。页面重复、内容空薄或来源不明,通知发得再快也不会增加可信度。

日更网站最该核对的是日期是否真实。文章在八月二十六日修改,Sitemap 的最后修改时间也应反映这次变化。旧文章没有变化,就不要每天把全部日期刷成今天。错误时间会让机器和读者都难以判断哪些内容真的更新了。

引用从可核对的句子开始

一页内容值得引用,通常能回答谁发布、何时发布、依据什么,以及这个判断到哪里为止。产品测评可以给出版本和测试步骤,行业文章可以链接正式文件,项目记录应写清成功条件与失败结果。页面里只有一串概念解释,搜索系统即使抓到了,也很难从中挑出独有材料。

作者信息也要前后一致。文章页、关于页和结构化数据里的名称若各写一套,系统要花更多力气判断它们是否属于同一个人。日期、标题和摘要同样如此。机器可读信息应当对应页面上真实可见的内容。

我的判断是,GEO 的日常工作可以按两个清单来做。技术清单检查页面能否发现和更新,内容清单检查事实能否核对。前一张表靠状态码、robots、Sitemap 和提交记录验收。后一张表要打开文章,沿来源链接读一遍,再看作者的判断有没有超出材料。

这套办法没有立刻上榜的承诺。它能让每次发布留下可检查的结果。搜索平台怎样变化,站点至少一直提供能访问、能核对、值得读完的页面。

参考资料