当筛选、排序、分页、会话标识等参数可以自由组合,地址空间会接近无限;百度收录情况查询此时的关键不是逐个提交,而是先定义“有效地址集合”——即哪些参数组合代表独立内容、值得被抓取,哪些只是同一内容的变体。可选情境是:站点已用robots.txt屏蔽部分参数、也提交了站点地图,但查询结果仍显示大量低价值参数地址。此时应把工作重心从“屏蔽”转向“规范化与集合边界定义”。
两种条件下的选择完全不同。若有效组合可以被业务规则穷举(例如只有颜色、尺寸两个维度,且每个维度取值有限),那么有效地址集合就是这些组合的笛卡尔积,可以生成清单、逐条核对收录情况,并让站点地图只包含这批地址。若参数本质上是连续的或可自由排列的(例如价格区间、任意关键词、多选排序、时间戳),组合数随参数个数指数增长,无法穷举,此时不应试图“提交全部有效地址”,而应定义一条正则或规则来描述有效形态,把其余形态归入同一规范地址。
判断依据不是参数个数,而是“是否存在一个有限的业务枚举”。可以问:运营人员能否在一张表里列出所有应该被收录的地址?能,走枚举路线;不能,走规则路线。选错路线的典型后果是:对不可枚举集合做穷举提交,站点地图体积失控,且每次业务调整都要重做清单。
实施动作是建立一份“允许索引的参数组合表”,每个组合对应一个规范地址,并确保页面自身输出对应的规范标签。随后只把这份清单放进站点地图,同时用查询工具抽样核对清单内地址的收录情况。结果是:你能明确说出“集合内有多少条、收录了多少条”,而不是面对一个无法收敛的总数。下一步的决策依据也随之清晰——若清单内地址大量未收录,问题在内容质量或抓取预算;若清单外地址仍被收录,问题在链接暴露或规范标签缺失。
例外在于:清单需要随业务维度变化而更新。若维度经常增减,维护成本会超过收益,此时应退回规则路线。
此时有效地址集合应被定义为一个“形态集合”:规定哪些参数键允许出现、取值格式是什么、参数顺序是否固定、超出范围的取值如何处理。可落地的动作包括:统一参数顺序、把无意义参数(如会话ID、追踪参数)在服务端重定向到无参数版本、对多选参数按固定顺序拼接。这样做的结果是,同一内容的多种排列会收敛到少数几个规范地址,查询收录情况时观察的对象从“无限地址”变成“有限形态”。
需要说明的是,robots.txt的抓取限制不等于可靠的索引移除:被屏蔽抓取的地址仍可能因外链而出现在结果中,只是摘要信息可能陈旧。因此规则路线不能只靠robots.txt,必须配合规范标签和站内链接只指向规范形态。
假设某列表页支持sort、page、brand三个参数,sort有3种取值,page最多20页,brand有50个取值。若全部组合都视为有效,地址数约为3×20×50=3000;但其中只有brand与page的组合代表不同内容,sort只是同一批内容的排序变体。此时有效集合应定义为“brand×page”的1000条以内,sort统一收敛到默认排序。动作是把带sort的地址重定向到默认排序版本,再查询收录情况。若重定向后带sort的地址仍大量出现,合理解释包括外链仍指向旧地址、重定向未被及时处理、或站内仍有入口链接指向旧地址——这些都不能单独证明重定向无效,需要分别核查。
无论走哪条路线,最终都要让“有效地址集合”成为一个可陈述的边界:要么是一份清单,要么是一条规则。只有边界确定后,百度收录情况查询的分子分母才有意义,收录比例的变化才能指向具体原因。站点地图不保证收录,HTTPS也不保证安全无漏洞或排名,它们都不替代集合定义本身。若边界仍模糊,先不要扩大提交量,而应回到规则或清单,把集合收敛到可解释的范围。