做法是给项目建立可核验的“人工判断凭证”,并让自动评分只承担排序和提示,不承担最终结论。具体来说:把每个需要人工判断的项目拆成可观察事实、判断理由和证据来源三部分,自动评分只读取可观察事实,人工判断结果单独记录并定期抽样复核。这样既能保留自动化的效率,又不会让评分替代判断。
百度关键词排名查询中,自动评分擅长处理可批量获取、口径稳定的信息,例如某词在固定地区、固定设备、固定时间点的位次区间。但以下三类项目天然需要人工判断:
判断标准很简单:如果一个项目的结论会直接改变后续动作,而自动评分无法说明“为什么是这个结果”,它就不该被评分替代。
当关键前提发生变化,例如查询范围从全国改为某城市、从PC端改为移动端,或者业务线调整导致部分词不再相关,需要决定原有项目是保留、改写还是退出。
项目仍然对应真实业务需求,且变化只影响观测口径,不影响判断逻辑。此时应保留项目,但把变化前后的数据分开记录,避免把不同口径的数值直接比较。动作示例:在记录中增加“地区=某城市”“设备=移动端”两个字段,自动评分继续运行,但人工复核时只比较同口径数据。结果是后续决策不会因为口径混用而误判。
项目对应的业务含义已经变化,例如原词指向的功能已下线,但同一用户需求转移到了新表达。此时应改写项目,而不是直接删除。改写时要同时更新人工判断标准,否则自动评分会继续按旧标准打分。动作示例:把旧词的判断依据从“功能页排名”改为“替代方案页排名”,并重新定义人工复核的检查点。结果是评分对象和业务目标重新对齐。
项目对应的需求已经消失,或该词带来的流量无法转化为业务动作,且人工复核连续多次确认无价值。退出不是简单删除,而是先归档判断记录,再停止自动评分。动作示例:把项目标记为“已退出”,保留最近一次人工判断的理由和证据,后续不再纳入评分排序。结果是资源集中到仍有判断价值的项目上。
核心做法是让每个需要人工判断的项目都留下可追溯的凭证。凭证至少包含三项:
自动评分只读取第一项,第二、三项由人工填写。复核时,先看人工判断理由是否仍然成立,再看自动评分是否与理由冲突。如果冲突,以人工判断为准,并记录冲突原因。这样评分不会悄悄替代判断,而是成为提示工具。
假设一个场景:某项目自动评分从80降到60,系统提示“排名下降”。人工复核发现,下降原因是查询地区从全国切换到了某城市,而该城市结果页构成完全不同。此时正确动作是修正口径并重新评分,而不是直接按60分安排补救工作。这个假设说明:评分变化本身不构成行动依据,口径和判断理由才是。
人工判断不能只做一次。建议按固定周期抽样复核,抽样比例根据项目对业务的影响程度决定,而不是根据评分高低决定。影响越大的项目,越应该优先复核。
复核后会出现两种结果:
这个动作的结果直接影响下一步:冲突记录积累到一定程度,说明评分规则需要整体调整,而不是逐个修补。此时应暂停用评分安排优先级,先完成规则修订和人工判断标准对齐,再恢复自动排序。
不同查询工具对地区、设备、时间的支持程度不同,具体字段和限制需要以实际使用的工具为准,不能假定所有工具都提供相同口径。如果工具本身不记录查询条件,人工判断凭证就必须由使用者自行补充,否则后续无法区分“排名变化”和“口径变化”。
另外,请求量、抓取量或某项统计归零,不能单独证明处理正确。它也可能来自统计延迟、采集范围调整或工具侧变更。遇到这类现象,应先核对查询条件和数据来源,再决定是否调整项目状态。适用条件很明确:只有当人工判断凭证完整、口径可追溯时,自动评分才可以作为排序参考;否则应退回人工复核,不把评分当作结论。