先给结论:当筛选参数可以任意叠加时,有效地址集合应当由“能被独立检索到的内容状态”定义,而不是由参数本身定义。做法是为你手上的页面列出全部参数,逐个判断它是否改变主体内容,再按“保留、规范化、丢弃”三档处理,最后只把保留档的地址写进站点地图和站内链接。
假设你手上是一个商品列表页,地址后面可以带排序、每页条数、价格区间、颜色、库存状态、来源渠道等参数。参数组合在数学上接近无限,但真正对应不同内容的组合很少。判断标准只有一条:改变参数后,页面主体内容是否出现用户可感知的差异。
三档分完之后,有效地址集合就是保留档的并集,加上规范化档指向的那个唯一地址。丢弃档不进入集合,但也不等于要立刻封禁抓取。
规范化档有两种常见做法,选择条件不同。
做法一:用 canonical 指向无参数版本。适用条件是参数只影响排序或视图,内容主体一致,且你希望这些带参数地址仍可被抓取、被发现。代价是百度需要自行处理这些信号,canonical 是提示而非强制指令,带参数地址仍可能作为独立结果出现。
做法二:在 robots.txt 中禁止抓取这些参数。适用条件是这些地址确实没有独立价值,且你确认站内没有任何链接依赖它们。代价更直接:robots.txt 的抓取限制不等于可靠的索引移除。已经进入索引的地址不会因为加了禁止规则就立刻消失,你只是阻止了后续抓取,无法用这个动作控制已有结果。
一个可执行的判断动作:从站内导航、分页、面包屑、站点地图里各抽一条指向该页的链接,检查它们是否带参数。如果带,先改链接,再考虑封禁;如果不带,封禁的副作用较小。这个动作的结果决定了下一步该做规范化还是做抓取限制——链接清理没做完就封禁,等于把发现路径一起切断。
保留档最容易失控,因为每加一个筛选维度,组合数就翻倍。你可以用一条规则收口:只有当一个参数值能形成稳定的、有搜索意图的主题,才允许它单独成为可索引地址。两个以上筛选条件叠加产生的地址,通常不进入有效集合。
假设一个列表页有颜色和尺码两个筛选维度,各自有若干取值。单维度的颜色页可能对应“某类商品的某颜色”这种稳定需求,值得保留;颜色加尺码的组合页数量成倍增加,但每个组合的独立需求很弱。此时把单维度页保留、组合页指向最接近的单维度页,集合规模就从乘积级降回加法级。
这个取舍的代价是:部分长尾组合需求失去独立入口。你需要接受这一点,否则集合无法收敛。判断是否值得保留某个组合,可以看它是否有站外链接、是否有站内其他页面主动指向它、是否在访问日志里出现过真实进入。这三个证据任意一个成立,才考虑破例。
把保留档地址写进站点地图,但要注意站点地图不保证收录,它只是提交候选地址的方式。验证收敛不能只看提交数量,要看抓取行为。
这里有一个容易误判的现象:带参数地址的抓取量下降,既可能是你的收敛策略生效,也可能是整站抓取频次下降的连带结果。区分方法是同时看保留档地址的抓取量。如果保留档抓取稳定而丢弃档下降,收敛成立;如果两类同步下降,问题在整站层面,不在参数治理。
回到你手上的那个页面,完整的处理方案应当包含四列:参数名、所属档位、处理动作、验证方式。保留档写“可索引,进入站点地图”;规范化档写“canonical 指向某地址”或“robots.txt 禁止,前提是站内链接已清理”;丢弃档写“不进入站点地图,不主动链接”。
方案交付后,下一步动作是检查站内链接是否与档位一致。链接和档位不一致是最常见的返工原因:你把某个参数判为丢弃档,但分页组件仍在生成带该参数的链接,抓取就会持续发生。先改链接,再谈收录,顺序反了就要多做一轮。
最后提醒一点:这套集合定义只解决“哪些地址值得被处理”,不解决“处理完一定被收录”。收录还取决于内容质量、站点整体可信度和抓取资源分配,这些不在参数治理的范围内,也不应该用参数治理的动作去承诺。