Back to blog

人才搜索怎么测,才不会被“看起来挺准”骗过?

人才搜索怎么测,才不会被“看起来挺准”骗过?

人才搜索最危险的验收方式,是让几位招聘顾问现场输入三四个职位名称,然后凭第一屏“感觉不错”就通过。

演示查询通常短、常见、答案明显,供应商也容易提前调优。真实使用却包含缩写、技能组合、否定条件、行业语境和不完整表达。更麻烦的是,搜索返回的不是文档,而是候选人:同一个人可能有多段经历,某一段命中并不等于整个人适合,整份简历没出现某个词也不等于没有相关能力。

因此,人才搜索评测不能只问“结果相关吗”,还要回答:相关性的对象是谁、由哪段证据支持、漏掉了谁、排序为什么变化,以及不同岗位和查询类型是否同样可靠。

先定义一次搜索的评测单元

信息检索研究通常以查询、文档和相关性判断组成测试集合。NIST 的 TREC 长期使用查询主题与人工相关性判断来评价检索系统,并强调判断集合必须与对应语料一致。人才库可以借鉴这个结构,但需要多加一层“候选人聚合”。

一个可复现样本至少包含:查询文本、结构化过滤条件、查询意图、人才库快照、候选人相关性、支持判断的经历片段,以及标注时间。缺少人才库版本时,后来新增或修改的简历会让同一查询无法复现;缺少证据片段时,“相关”会退化为无法讨论的主观印象。

人才搜索评测要把查询、片段、候选人和业务动作分层测量
人才搜索评测要把查询、片段、候选人和业务动作分层测量

建议同时保存两个标签:片段相关性表示某段经历是否回答查询,候选人相关性表示综合多段证据后,这个人是否值得进入下一步。这样才能识别“召回到了正确片段,却在候选人聚合时被其他内容稀释”的错误。

查询集要覆盖真实意图,而不是只覆盖关键词

一套查询集应从脱敏的真实搜索日志、招聘任务和专家设计的挑战样例共同构成。随机抽样能代表日常流量,挑战集则主动覆盖低频但高价值的难题。

可以按意图分层:

  • 精确实体:公司、学校、证书、产品或技术名称;
  • 能力组合:同时具备数据治理、金融风控和团队管理;
  • 职业迁移:标题不同但技能结构相近的候选人;
  • 经历约束:最近三年使用某技术,或在特定规模团队中负责过上线;
  • 排除与布尔逻辑:需要 A 或 B,但排除只做过 C 的人;
  • 模糊探索:招聘者尚不知道准确职位名称,只能描述问题。

每类查询还要切分语言、岗位族、资历、地区和人才库规模。BEIR 基准的一个重要提醒是:检索模型在一个数据集上的优势不必然迁移到另一种领域和任务。招聘系统也不能用互联网问答或通用语义相似度的成绩代替自有人才库评测。

标注不是“合适/不合适”两个按钮

相关性最好采用分级标签,而不是单一二元判断。例如:

  • 3:有直接、近期且充分的经历证据;
  • 2:有相关证据,但年限、角色或场景仍需确认;
  • 1:只有邻近技能或可迁移经验;
  • 0:没有支持证据,或与硬条件冲突。

标注员必须看到相同的查询解释和候选人证据。对争议样本,应保存两位标注者的原始判断、最终裁定和原因,而不是只留下一个被“平均”后的数字。否则系统迭代后无法判断变化来自模型还是标注口径。

不要把历史联系、面试或录用直接当成相关性真值。招聘者只会联系当时被系统展示的人,未曝光候选人没有行为标签;录用还受薪资、地点、时间和沟通等因素影响。行为数据有价值,但天然带有曝光偏差。

召回与排序必须分开测

人才搜索通常包含结构过滤、稀疏或稠密召回、融合、重排和候选人聚合。只看最终第一页,无法判断漏失发生在哪一层。

召回阶段重点看 Recall@K:所有被标为相关的候选人中,有多少在前 K 个召回集合里出现。排序阶段可以看 Precision@K、MRR 和 nDCG。nDCG 能利用分级相关性,并对靠前结果给予更大权重,适合区分“强相关在第一位”和“强相关埋在第二十位”。

但任何指标都要和任务绑定。猎头做稀缺岗位寻访时,漏掉一个关键候选人的代价很高,应扩大召回并允许更多人工筛选;高频批量岗位可能更重视第一页精度和处理速度。指标权重不是数学常量,而是业务错误代价的表达。

ColBERTv2 等迟交互检索工作展示了词元级交互在效果与效率之间的一条路线,但论文排名不能直接决定人才搜索架构。真正要验证的是:在自己的查询集、人才库规模和延迟预算下,稀疏、稠密、混合与重排各自增加了多少有效召回。

切片看板比一个总分更能发现问题

总分要继续拆成查询、岗位、语言、资历和失败类型切片
总分要继续拆成查询、岗位、语言、资历和失败类型切片

总 nDCG 上升,可能只是高频的软件工程查询变好,而少数销售、制造或医疗岗位显著退化。评测报告至少应按以下维度切片:

  • 查询意图与长度;
  • 岗位族和资历层级;
  • 中英文及混合语言;
  • 常见技能与长尾技能;
  • 有无硬条件、否定条件和时间条件;
  • 新入库与长期未更新候选人;
  • 召回失败、聚合失败、排序失败和过滤错误。

每次模型或词表升级,都应在固定回归集上比较,同时保留一组近期真实查询检查分布变化。固定集保证版本可比,滚动集避免系统只对旧题过拟合。

线上实验要测“搜索帮助”,不是只测点击

点击率容易被标题、照片、排序位置和界面样式影响。更接近业务价值的信号包括:招聘者保存或加入项目的比例、查看证据后撤回的比例、首次获得合格候选人的查询次数、查询改写次数、人工翻页深度和后续复核结果。

上线实验还要设置护栏:无结果率、响应延迟、敏感条件使用、不同人群的曝光差异,以及投诉和撤销。某个版本即使提高保存率,如果同时通过不合适的代理变量缩小候选人范围,也不能只按转化率宣布胜利。

一套可执行的验收流程

  1. 冻结一份脱敏人才库快照和查询集;
  2. 写清相关性分级规范,完成双人标注与争议复核;
  3. 分别保存各召回器、融合、重排和聚合阶段的输出;
  4. 报告 Recall@K、nDCG@K 及主要切片,不只给总分;
  5. 对每次退化抽样做错误分类;
  6. 小流量上线,结合业务动作和风险护栏观察;
  7. 把新失败样本加入滚动集,但不污染固定回归集。

人才搜索评测的目的不是制造一个漂亮分数,而是建立一套能回答“漏在哪里、错在哪里、改动影响了谁”的测量系统。只有做到这一点,模型升级才是可控工程,而不是每次上线后重新靠感觉验收。

资料来源

Back to blogRequest a trial