文章摘要
作者测试了HackerRank的开源ATS系统,发现同一份简历在仅删除调试打印语句后,评分从90分降至74分,表明该系统的评分结果不稳定且不可靠。
文章总结
HackerRank 开源了一款简历筛选工具(ATS),近期在 GitHub 上热度飙升,获得近 3000 星标,并在 LinkedIn 和 Reddit 上引发广泛讨论。我决定亲自测试它。
首次运行,我的简历得了 90/100 分,感觉不错。但清理调试代码后再次运行,同一份简历、同一命令,分数却降到了 74/100。我关闭开发模式,循环运行 100 次,发现分数在 66 到 99 之间波动。如果公司以 85 分为筛选线,我有 65% 的概率被淘汰——同一份简历,全凭运气。
该工具的工作流程是:将 PDF 简历解析为文本,调用大语言模型(LLM)六次提取结构化信息(基本信息、工作经历、教育、技能、项目、奖项),再抓取 GitHub 资料和热门仓库作为补充,最后统一评分。评分满分 100,另有 20 分加分项:开源贡献 35 分、个人项目 30 分、工作经验 25 分、技术技能 10 分,创业经历、个人网站等可获最多 20 分加分。默认模型为 gemma3:4b,温度设为 0.1(旨在提高输出确定性)。
分析各分类得分发现:技术技能几乎完全一致(98/100 次得 8/10),因为它是核对清单;但项目评分波动极大,LLM 难以稳定判断“架构复杂度”或“实际部署能力”。即使温度降至 0,问题依然存在——有用户报告连续六次运行得分分别为 27、34、32、34、34、30。这种非确定性不是可微调的 bug,而是根本设计缺陷。
改用 Gemini 模型后,分数分布更集中(48-64 分),但若以 60 分为线,仍有 28% 的失败率。开源评分变得稳定,项目评分仍混乱。最令人担忧的是工作经验评分:每次都得 25/25,甚至一份只有一次实习经历的旧简历也如此。评分提示仅两行,无评分标准、无示例、无锚点——初级工程师和资深架构师都得满分,评分一致但毫无区分度。
该工具将 65% 权重放在开源和项目上,意味着拥有 30 年经验、构建过 S3 的工程师可能输给只有两次实习和开源项目的候选人。许多优秀工程师的成果从未上传 GitHub,却因此损失过半分数。
如果你对公司的简历筛选有发言权,请谨慎使用 AI 筛选工具。无法区分质量的工具只是在随机过滤,不如直接扔掉一半简历,告诉应聘者“你运气不好”。
评论总结
根据评论内容,总结如下:
主要观点与论据:
AI筛选简历的随机性与不可靠性(评分:无,但多篇评论支持)
- 评论1:HR可能连前10份简历都看不懂,AI筛选只是形式。
- 评论4:LLM本质是随机过程,温度参数无法保证确定性输出,导致结果不可靠。
- 关键引用:评论1 "I guess at least HR doesn’t have to read 1,000 resumes... could they make sense of the first 10 resumes?";评论4 "LLMs work via purely stochastic processes... temperature is not some kind of 'deterministic' switch."
评分标准不合理(评分:无,评论2)
- 评论2:开源贡献(35分)和个人项目(30分)占比过高(65%),而15年工作经验仅值25%,导致有经验但无开源贡献的候选人被排除。
- 关键引用:"Open source and personal projects are fine, but in no sane world are they worth 65% of a resume's score."
高申请量下的无奈现实(评分:无,评论3)
- 评论3:即使AI筛选有缺陷,但申请量极大(每小时100+),35%的通过率已算不错,否则候选人更难被看到。
- 关键引用:"The volume of applicants is SO HIGH such that your chances of getting moved to the next stage are actually markedly worse if AI isn’t involved."
对HR职能的讽刺与质疑(评分:无,评论5、6、8、10)
- 评论5、6、8:AI模仿了HR“随机扔掉一半简历”的旧把戏,认为这是筛选“不幸运的人”。
- 评论10:质疑HR自动化筛选的合法性,认为HR既不为员工也不为雇主服务。
- 关键引用:评论5 "The AI learned the old HR trick: take 50% of resumes and throw them out without looking.";评论10 "I wonder how is this even legal? ... what exactly does HR accomplish?"
系统可被优化与滥用(评分:无,评论7、12、13)
- 评论7:可用于自我评估,调整简历以匹配公司期望。
- 评论13:一旦系统公开,求职者会优化简历,导致优势消失。
- 关键引用:评论7 "This could be used as a good way to self-evaluate one's current position from the company's point of view.";评论13 "I'll optimize my resume for this and so will many other people that any edge disintegrates."
模型规模与可靠性问题(评分:无,评论14)
- 评论14:使用4B小模型(gemma3:4b)如同随机数生成器,无法作为可靠判断工具。
- 关键引用:"a tiny 4B model is like plugging an RNG into this system."
平衡性总结: - 支持AI筛选的视角:评论3指出高申请量下AI筛选是无奈但必要的工具,能提高效率。 - 反对AI筛选的视角:多数评论(1、2、4、5、6、8、10、14)强调其随机性、标准不合理、缺乏问责性,并讽刺HR职能。 - 中立/实用视角:评论7、13认为系统可被利用或优化,但优势短暂。
总体结论: 评论普遍对AI简历筛选系统持批评态度,认为其随机性强、标准偏颇,且可能加剧求职不公;但部分承认在高申请量下,AI筛选是现实妥协。