洞察

AI评价系统正在制造"表演型员工"——当你的一切数据都被评估,人就开始"表演数据"

2026年7月7日
0 阅读
原创

•古德哈特定律在AI时代爆发:指标变目标就不再是好指标 •MIT研究:AI绩效评估上线6个月后效率指标上升,但客户满意度下降21%,离职率上升15% •三种典型表演行为:数据刷手、安全演员、数据洁癖 •AI无法识别表演因为AI不看"是否自然"只看数据模式是否达标 •三个解法:设立"反指标"体系、保留人工复核机制、设立不被AI评估的零表演区

AI评价系统正在制造"表演型员工"——当你的一切数据都被评估,人就开始"表演数据"
颠覆类

AI评价系统正在制造"表演型员工"——当你的一切数据都被评估,人就开始"表演数据"


上周一个HRVP跟我说了他们公司的"奇观":

自从上线了AI绩效分析系统,公司的代码提交量上升了42%。CEO非常满意。但CTO私下跟她说——"代码质量在下降,很多人把一个大功能拆成十几个小commit来刷提交量。"

然后运营团队也学精了。他们发现系统把"回复客户速度"作为考核指标之一,于是客服开始疯狂秒回:"亲,我帮你查一下哦~"——然后你等六小时。回复速度拉满了,问题解决率降了。

这不是人的问题。这是数据驱动评价系统的必然副作用

古德哈特定律在AI时代爆发了

英国经济学家古德哈特说过一句被无数人引用的话:"当一个指标变成目标时,它就不再是一个好指标了。"

几十年前它适用于GDP和货币政策。几十年后它精准描述了AI评价系统最大的坑。

为什么?因为AI评价系统的能力太强了。它不满足于看一个指标,它看你能想到的所有指标:代码行数、工单关闭数、会议发言时长、邮件回复速度、文档贡献字数、跨部门@次数……然后告诉你"这些就是你的价值"。

员工不傻。他们很快就发现:与其把事做好,不如让AI觉得你在把事做好

一项MIT的研究追踪了一家引入AI绩效评估的科技公司——6个月后,员工的"执行效率指标"全面上升,但客户满意度下降21%,离职率反而上升了15%。因为人在做给AI看的事,而不是做正确的事。

"表演型员工"的三种典型画像

我和十几位亲身经历过AI评估的一线管理者和员工深聊过,归纳出三种最典型的表演行为:

1. "数据刷手":我熟练掌握了系统的计分规则。 比如:知道AI把"文档更新"列为高价值行为后,每周改几个标点符号也算一次更新。知道"跨团队沟通"权重高后,任何小事都拉个群@一堆人——不是有需求,是想刷一次沟通记录。

2. "安全演员":我不犯错,但也不冒任何风险。 AI系统的一大特点是"对异常敏感"。一个偏离常规的行为会触发系统的警报。所以员工学会了——只做系统里"有先例"的事。不创新的原因不是不想,是"创新的初始数据跟系统预期的不一样,AI评分会打低"。

3. "数据洁癖":我在AI面前只展示"被加工过的自己"。 每一封邮件都要先用AI润色一遍。每一次周报都要让AI"优化"措辞。不是坏事,但问题是——你看到的员工,是被层层修饰过的数据化人格。真实的困顿、犹豫、试错——这些最有价值的学习过程,在数据里消失了。

这三种行为的共同点是:员工不是在做事,是在"做数据"

比表演更可怕的是——AI开始"认可"表演

一个更深层的问题是:AI系统没有"直觉"来识别你在表演。

人在评估另一个人的时候,会有一种奇妙的察觉:"这个人在'做'什么,这不是他自然的状态。"AI没有这种能力。它只会看数据模式是否"健康"。

当表演开始覆盖真实数据,AI的模型就会被污染。你用一个被污染的数据集来评估下一批员工——他们就更努力地表演。系统陷入了正反馈造假循环

有家电商公司出现了这个情况:AI推荐系统中,客户评价越高的商品越容易被推荐,销量越高,评价越多。但在员工评估领域,同样的循环在发生——"会表演"的员工获得更高的系统评分→获得更多资源→产生更多数据→评分更高。那些确实在做事但不擅长表演的员工,系统评分越来越低,资源越来越少。

AI评价系统不会淘汰不做事的人,它最先淘汰的是"不会表演的人"。

怎么破?三条规则

1. 把"数据异质性"作为系统质量的核心指标。 如果你的员工数据太完美了——每周都是一样的节奏、一样的行为模式——不是公司管理得好,是员工在刷数据、在做表演。真实的组织数据应该是有波动的,有高峰有低谷。系统要识别"表演型数据"和"真实型数据"的差异,而不是鼓励那些看起来"太完美"的行为模式。

2. 让人工判断作为AI评估的"异常捕捉器"。 不要指望AI知道自己被"演"了。每月抽5%-10%的高分员工做深度人工复核——不是重新打分,而是看:这个人的表演指数有多高?他做的事是真的有质量还是只是数据好看?这个人工环节的价值不是"纠偏"而是"校准系统"——发现的问题要反馈回模型训练。

3. 引入"反指标":系统要同时看正面指标和负面信号。 如果只看"做了多少"就会出现刷量。要同时看"哪些本应该做但没做"——比如一个客服秒回率高得离谱,但他的二次解决率是不是也在上升?一个人跨群次数很多,但每个群他是不是只发了一句"收到"?正面数据+负面信号才是真实画图。


AI评估员工不是不对。但如果你只看到指标上升,看不到"表演"在同步上升——你其实在一个正在被"污染"的数据集上做管理决策。

最讽刺的事是:AI评价系统的最大风险,不是数据不准,而是数据"太准"——准到每个人都学会了怎么让自己变"准"。

配套行动工具

#AI

相关洞察