先给结论:升级后评分变化,通常不是“数据变准了”或“工具变差了”,而是评分口径换了。你要做的不是解释谁对谁错,而是判断新旧分数是否还能直接比较。如果两次评分用的是不同规则版本,就应把它们当作两套不同指标,先各自记录原始依据,再决定是否重跑、是否沿用旧结论。
评分数值变动,原因至少有两类。第一类是口径变化:升级后对某些因素的取舍、归一化方式或分组方式调整了,导致同一批查询得到不同分数。第二类是数据变化:查询量、竞争程度或样本覆盖本身发生了变动。两者可能同时出现,所以不能只看分数高低就下判断。
一个可操作的区分方法是:挑一小批你熟悉的查询,在新旧两个版本下分别记录分数和当时的判断依据。如果分数变了,但你手头能看到的原始信号(比如相对高低关系、分组结果)没变,那更可能是口径变化;如果连相对高低关系都变了,才需要怀疑数据或样本层面也发生了变动。
需要提醒的是,缺少完整数据或权限时,你无法验证工具内部的归一化逻辑。这时只能确认“分数变了”,不能确认“哪个分数更接近真实需求”。把评分变化解释成市场变化,是把相关当因果。
条件一:你只关心相对排序,不依赖绝对分数。这种情况下,优先看同一版本内的排序是否稳定。做法是:用同一批查询、同一版本重新跑一次,观察排序是否可复现。如果可复现,就继续用这一版的相对排序做取舍;如果不可复现,说明样本或分组还不够稳,先缩小到更小的一组查询再验证。动作的结果会影响下一步:排序稳定,就可以进入内容规划;不稳定,就先补样本,而不是急着改策略。
条件二:你要把分数写进报告或对外交付。这种情况下,必须标注评分版本和记录时间。做法是:在交付物里写清“此分数来自某次升级后的规则版本”,并保留升级前的记录作为对照。如果对方要求解释差异,就并列展示两次分数及各自对应的判断依据,而不是只给一个新分数。动作的结果是:对方能看出差异来自口径,而不是被暗示成业绩变化。
两种条件的分界点在于:分数是否要跨版本比较。不跨版本,相对排序通常够用;跨版本,就必须先对齐口径,否则比较没有意义。
如果你没有导出权限、看不到历史记录,也不清楚升级改了哪些字段,仍然可以做三件事:
这些动作不能推出“新版本更准”或“旧版本更好”。它们只能帮你判断差异是否可复现、是否影响相对排序。假设某次升级后,一组查询的分数整体下移,但组内排序不变,那么对“先做哪几个词”的决策影响有限;如果组内排序也变了,才需要重新评估优先级。这个例子只说明比较方法,不代表真实升级结果。
如果升级刚发生,样本还没稳定,或者你手头的查询量本身很小,那么分数波动可能只是噪声。这时更合理的动作是等待或补样本,而不是立刻给差异找原因。另一种例外是:评分变化伴随明显的分组边界调整,比如原本同组的查询被拆开,这时旧结论可能整体失效,需要按新分组重新看。
总之,解释前后差异的关键不是判断哪个分数正确,而是先确认两次评分是否可比。可比就继续用,不可比就分开记录、分别解释,并把无法验证的部分明确留白。