说实话,我一开始对AI面试官是抱着怀疑态度的。在做了几年商业IP教练之后,我接触了不少HR和高管,大家对AI面试的普遍评价是:"挺快的,但总觉得不靠谱。"我寻思,这个"不靠谱"到底是感觉,还是事实?于是我做了一个实验:用AI面试了50个候选人,和人工面试做对比。今天我把结果摊开讲,有些数据我自己都吃了一惊。

实验是这么设计的:两个面试官,一AI一真人

我找了一家朋友公司的真实招聘场景,他们正在招销售和客户成功岗位。我让他们把初试环节同时开放给两个通道:一个是我亲自用飞书视频面试,另一个是用市场上主流的AI面试工具(不说名字了,免得有广告嫌疑)。50个候选人,全部走两轮:先AI面,再我面。AI面试时我把题目设置成完全一样的——就是我这边的面试题纲,确保公平。最后我把AI的打分和我自己的打分做了对比,再结合候选人入职后的实际表现来反推准确率。

这个实验不完美,但足够真实。因为候选人并不知道自己同时被两种方式评估,所有人的心态都是正常面试状态。AI面试官那边,我只告诉候选人是"初筛系统",大多数人并没太在意。这样避免了他刻意讨好AI或者敷衍AI的情况。

先上结论:AI面试在初筛环节确实有用,效率惊人,但如果你把它当成终审裁决,那就是给自己挖坑。数据说话——AI面试官在技术相关问题的回答上(比如销售技巧、话术掌握、案例复盘),和我人工评估的一致性达到了76%。这个数字和我在哈佛商业评论一篇2024年的文章中看到的研究很接近:他们汇总多家公司数据,发现AI面试官在技术岗位的准确率约为78%。但问题出在软技能上。

软技能一塌糊涂:沟通、协作、抗压,AI根本不会判断

图片来源: Unsplash (CC0)

同样那篇HBR的研究指出,当评估沟通能力、团队协作等软技能时,AI的准确率直接掉到62%。我的实验数据更扎心:在"抗压能力"和"价值观匹配度"这两个维度上,AI和我的一致率只有不到55%,几乎等于抛硬币。有个候选人,做销售多年,性格偏内向,回答问题时语气平稳、逻辑清晰,AI给他打了高分。但我在面试中明显感觉到他缺乏狼性,推进成交的意愿一般。后来试用期表现证实了我的判断:他更适合做客户成功的续费岗,而不是攻坚性质的新客开发。

还有一个更让我意外的现象:AI面试官对非母语候选人和不同文化背景的人判断失准。我做实验的这50人里,有3位母语不是中文,其中一个是英语母语但中文流利。AI在评估这3人时,多次因为"停顿时间过长""重复词汇"给低分。但实际上这三人的沟通能力非常强,只是一边组织语言一边翻译,导致回答不够流畅。这正是HBR提到的:AI容易误判非母语候选人或来自不同文化背景的人。如果你公司有海外业务或者需要跨文化人才,AI面试的效度就要大打折扣。

MIT在2025年2月发表的一项针对500名候选人的实验也佐证了这点:AI面试官在10分钟的模拟面试中,对女性候选人的评分平均比男性低12%,可这些候选人的实际工作表现差异只有2%。这个数据太可怕了。AI会放大训练数据中的隐性偏见,而我们自己很可能完全意识不到。我问了那个AI工具的技术支持,他们承认训练数据主要来自过往几年的面试记录,而这些记录本身就包含了大量人工面试的偏见。

成本对比:钱省了,但时间真的省了吗?

做这个实验之前,我预期AI最大的优势是成本。果然,AI面试50人,我几乎没花额外费用——只花了软件订阅费,折算下来每人不到10块钱。而我自己面试50人,花了整整25个小时(每人30分钟加上复盘)。HR们看到这个对比应该会心动:效率提升40%以上,这和我看到的《2024中国招聘科技白皮书》数据吻合。白皮书还提到,使用AI面试后初筛效率提升约40%,但候选人对公平性的投诉比例从3%上升到了8%。我在实验中也验证了这一点:面试结束后我问候选人感受,不少人说"AI问的问题太死板""感觉像在填表,没有交流感"。有个人直接说:"我宁愿跟人聊,哪怕聊崩了,至少是个活人。"

但我想说一个更深层的问题:AI面试节省的是初筛的时间,但它可能额外增加了后续环节的内耗。为什么?因为AI打高分的人,可能在软技能上完全不过关,你用人部门还要花更多时间去辨别。我实验中有个候选人,AI给了他前10%的评分,我人工面完后直接给挂了。后来HR跟我反馈,他们团队内部也做了类似测试:AI筛选出来的前20%,人工复试通过率只有60%左右;而人工初筛,复试通过率通常在75%以上。这多出来的15%误差,就变成了面试官、用人部门、HR三方反复拉扯的成本。

有个数据特别值得注意:白皮书里提到,AI对某些特定词汇的偏好性评分可能导致真实能力被低估。比如,频繁使用"我们"而不是"我"的候选人,AI会认为团队协作能力强;但实际工作中,过度使用"我们"的人可能是在模糊责任边界。我实验中的确出现了这种情况:一个销售非常喜欢说"我们团队",AI给协作打了高分,但我追问后发现,实际上他在团队中经常拖后腿。

我给老板们的行动建议:别全信,也别不用

做完这个实验后,我对AI面试的态度变成了"工具化信任"——把它当成初筛的加速器,而不是决策的裁决者。具体来说,我有三条建议:

第一,把AI面试定位在"漏斗上半层"。适用于海量简历的初筛阶段,用来过滤明显不匹配的候选人。比如学历、经验年限、硬技能关键词等结构化问题,AI做得又快又准。但对于需要判断"这人值不值得花一小时深聊"的问题,乖乖交给人工。

第二,建立人工复核机制。我推荐一个"双校对"流程:AI打完分,HR或业务主管用5分钟快速看AI生成的面试摘要——注意,不是看分数,而是重点关注AI标记的"异常项"。比如AI觉得候选人回答很流畅但逻辑跳跃,或者AI解释不通的停顿,这些恰恰是人工复核的关键点。我实验中发现,AI的低分完全可以直接过滤掉(准确率较高),但AI的高分一定要人工再验证。

第三,定期校准AI模型。如果你用同一个AI工具超过半年,一定要拿一批人工面试的数据去反测它。很多公司导入AI面试后就不管了,导致AI越来越偏离真实需求。我建议每个季度拿20个人(已经入职且稳定工作3个月以上的员工)回测一下,看看AI当初给这些人的评分是不是靠谱。如果不靠谱,就要重新调整模型参数或者更换工具。

最后说一句扎心的话:AI面试官现在就像刚毕业的大学生——死记硬背强,灵活应变差。你可以让他帮你做第一轮海选,但千万别让他拍板。面试这件事,说到底是个"读懂人"的活,而"读懂人"目前还是我们人类最擅长的。别让AI替你做决策,而是让AI帮你更快地发现值得你决策的人。