要判断某个网址在搜索引擎索引中的状态,可复查的证据不是“我搜到了”或“后台显示已提交”,而是能固定时间、请求对象与返回内容的记录:一次带完整URL和时间的查询结果截图、一次对搜索引擎返回页面的原始抓取存档、一次服务器日志中对应搜索引擎爬虫的访问条目,以及站内对该URL当前状态(可访问、返回码、canonical、robots元标签)的直接响应。把这些放在一起,才能让别人按同样步骤复现你的判断。
“是否被索引”至少有几种不同含义,取证对象也不同:
先写清你要证明哪一项,再决定收集什么。否则容易拿“已提交”当“已收录”,结论会偏。
查询结果存档。用站点限定查询(如 site: 加具体URL)截图,记录查询时间、查询词、返回条数与目标URL是否出现。局限:结果因人、因地区、因时间而异,截图只能证明“当时该查询返回了什么”,不能证明索引库的绝对状态。
搜索引擎返回页面的原始响应。直接请求该URL,记录HTTP状态码、响应头、正文中的 robots 元标签与 canonical 链接。局限:这证明的是页面当前输出,不是搜索引擎已处理的结果。
服务器访问日志。筛出对应搜索引擎爬虫的 User-Agent,记录访问时间、请求URL、返回码。局限:日志只证明爬虫来过,不证明内容被收录;爬虫可能多次抓取后仍不索引。
站长平台或提交记录。保存提交时间、提交的URL、平台返回的受理状态。局限:受理不等于收录,平台状态是过程记录,不是索引结果。
假设某产品页在查询中消失,你手上有日志显示爬虫三天前访问并得到200,但页面此刻返回404。这组证据指向“页面已不可访问”,而不是“搜索引擎无故删除”。若日志显示爬虫得到的是503,则方向又不同。现象相同,原因可能多个,不要只凭一条日志下结论。
可复查的关键是“别人能按你的记录重做一遍”。建议每次检查固定以下字段:
把这些写进一份简单记录,比零散截图有用得多。若多人协作,字段统一后可以直接比对两次检查之间的变化。
如果问题是“页面迟迟不出现”,先取证可抓取性:robots.txt 是否放行、服务器是否稳定返回200、页面是否被 noindex 标记。若这几项有问题,先修,再谈收录。若这几项正常,再取证提交记录与爬虫日志,确认抓取是否发生。
如果问题是“原本有、现在没了”,先对比两次检查的状态码与 canonical,再查是否有改版、跳转或删除。此时历史记录比当下单次检查更有价值。
如果问题是“要不要移除”,注意 robots.txt 的抓取限制不等于可靠的索引移除:它阻止抓取,已收录的URL仍可能出现在结果中。需要移除索引时,应使用对应的移除机制并单独验证,不能拿 robots.txt 当移除证据。
取证有代价:日志留存、截图归档、多次检查都要花时间。对少量关键页面值得做完整记录;对海量URL,优先抽样并统一字段,避免逐条人工核对。
不同搜索引擎的支持情况须分别核查:同一URL在不同引擎下的抓取、索引与移除机制可能不同,一份证据不能直接套用到另一家。
下一步:挑一个你正在关注的URL,按上面七个字段做一次完整记录,隔几天再做一次,比对变化。两次记录之间的差异,通常比单次结果更能说明问题出在哪一环。