← All posts

AI给每个CEO的建议,都一模一样

X上一个工程师Mo发了条推文:

"AI is giving every CEO the same advice."

他的原话是:研究者拿同一个问题—"我该怎么制定商业战略?" 去问GPT-5、Claude、Gemini、Grok四个主流大模型。问了三万次。换措辞,换语境,换行业,换规模。

每一次,四个模型都给出同一套答案:

差异化(Differentiate)。合作(Collaborate)。长期主义(Think long-term)。增强(Augment)。

最火的那条回复,来自一个叫Patrick Evans的人。他只说了一句:

"信念、艺术、品味、判断、直觉——这些,只能从你身上来。"


一、三万次推文背后,是NeurIPS最佳论文

Mo的推文是大众版。学术版在2025年12月,在圣迭戈举行的NeurIPS年会上发布的Best Paper。

论文标题很直白:《Artificial Hivemind:语言模型的开放式同质化》。

作者是华盛顿大学博士生Liwei Jiang,团队来自华大、CMU、斯坦福、Allen AI研究院。

她做了一件"看起来很简单但没人这么系统做过"的事:

构建了一个叫Infinity-Chat的数据集,收录了26,000个真实的开放式问。没有标准答案的问题。写一段关于时间的隐喻,给咖啡店起个名字,写50字的小故事。

然后把这些问题丢给70多个主流大模型 ,包括GPT-4o、Claude 3.5 Sonnet、Llama 3.1、Qwen 2.5、DeepSeek。每个问题每个模型跑50次。

再请25个独立标注员 ,做了31,250条人工对照

让25个来自不同公司不同架构的模型写"关于时间的隐喻"。一千多条回答在语义空间里的分布不是散开的,是聚成两团:

一团是"时间是一条河"。 一团是"时间是一个编织者"。

再让它们给"成功"写一句座右铭。不同公司的多个模型,生成了一模一样的字符串

"Empower Your Journey: Unlock Success, Build Wealth, Transform Yourself."

一字不差。

Jiang她们给这个现象起了个名字:Artificial Hivemind,人工蜂群


二、温度参数救不了它

懂大模型的朋友都知道,temperature是控制输出随机性的参数。调高,模型就天马行空;调低,模型就保守。这是工程师手里最直接的"创意旋钮"。

Jiang把temperature拉到最高(T=1.0),top_p也开到0.9。参数设置已经在"极度发散"那一档。

没有用。

她让Claude 3.5 Sonnet写"彩色蟾蜍去冒险的50字故事",跑几十次。蟾蜍反复被命名为Ziggy或Pip。故事里反复出现一只饥饿的老鹰,和一片蘑菇。

成对相似度依然超过0.8。

调高温度不会让它想出新角色。它只是在同一个狭窄的范围里换排列组合。

这不是bug。


三、RLHF是什么

要理解为什么所有模型都这样,你得先理解一个词:RLHF

Reinforcement Learning from Human Feedback,基于人类反馈的强化学习。

这是2022年底ChatGPT能从"AI实验室里的玩具"变成"全世界的对话助手"的那个核心技术。它的逻辑说穿了其实很朴素:

第一步 ,预训练。让大模型把互联网的文本吃一遍,学会语言的一般规律。这时候的模型是原始的、粗野的、没人管的——你问它一个问题,它可能回你一段通顺但跑题的话。

第二步 ,请大量人类标注员来打分。同一个问题,模型吐出A和B两个答案,人类选哪个更好。OpenAI给ChatGPT做这一步的时候,发到肯尼亚的外包公司,雇了几万人做了几个月。

第三步 ,用这些打分数据训练一个"奖励模型"——它学会了"人类大概会喜欢什么样的答案"。

第四步 ,用这个奖励模型当裁判,反过来训练原始的大模型,让它输出越来越"人类会喜欢"的答案。

RLHF是2022年到2026年整个生成式AI爆发的地基。没有它,就没有ChatGPT、Claude、Gemini的对话能力。

但Jiang的论文,和另一篇2026年1月刚出来的论《The Alignment Tax》给出了同一个结论:

RLHF是有代价的。代价叫单一化。

《Alignment Tax》做了一个决定性实验:拿同一个模型Qwen3-14B,一个是base版本(只预训练,没做RLHF),一个是Instruct版本(做过RLHF对齐)。用同样的问题去测它们的回答多样性。

结果:

  • Base版本:平均每个问题产生9.26个不同的回答聚类,只有1%的问题只收敛到一个答案。
  • Instruct版本:平均3.58个聚类,28.5%的问题只给出一个答案

28 倍的差距。

原因不是架构,不是数据,不是参数量。原因就是RLHF。

因为RLHF的逻辑本质是:让模型学习"人类会喜欢什么样的答案"。当你把"人类偏好"压缩成一个奖励信号训练所有模型,所有模型都会收敛到那个信号的中位数——安全的、稳妥的、共识性的、不会冒犯任何人的答案。

原创性,在这个过程里,是被剪掉的枝条。


四、在一个9亿周活的基础设施上,这意味着什么

2026年2月27日,OpenAI宣布:ChatGPT周活跃用户达到9亿

这个数字是什么概念?

2025年2月,ChatGPT是4亿周活。 2025年10月,8亿。 2026年2月,9亿。

12个月从4亿到9亿,翻了一倍多。

同一份公告里还有三个数字:

5000万 消费者付费用户。900万 付费商业用户——半年翻了4倍。92%的《财富》500强企业 在用ChatGPT。

再加上Claude的付费用户年增长200%,Gemini月活7.5亿,DeepSeek在中国的渗透率,以及各种国内的Kimi、豆包、Qwen

2026年的商业世界有一个不容易看见的底座:绝大多数决策者,都在问同一组基于RLHF训练的大模型要战略建议。

不是请麦肯锡。是打开ChatGPT。 不是开董事会前夜脑暴。是让Claude列一个"差异化路径的五种可能"。 不是翻战略管理的经典著作。是问Gemini"像我这个规模的公司,应该怎么布局AI?"

这事情在2024年还是极少数人的秘密。2026年已经是常态。

如果把两件事串联起来

9亿人每周在用ChatGPT。92%的财富500强在用。而这组模型,因为RLHF的结构性特征,倾向于给每个人相似的答案:差异化,合作,长期主义,增强。

那么整个商业世界的战略图谱,会发生一件很隐蔽的事:

它会慢慢塌缩到一个狭窄的共识带里。

每家公司都说要做"AI Native"。 每份pitch deck都在强调"网络效应"和"护城河"。 每份战略备忘录都在谈"人机协同"。 每个产品介绍都在说"无缝协作体验"。

不是因为它们商量好的,而是因为它们在问同一组模型。


五、74% vs 20%,这个缺口是什么

德勤《State of AI in the Enterprise 2026》调研了24个国家、3,235位C-Suite级别的企业高管。

报告里有一组数字我看了之后一直在想:

74%的企业 说,他们做AI投入的目的是带动营收增长。 只有20%说,他们已经真的看到了营收增长。

54 个百分点的缺口。

PwC另一份对4,454位CEO的调研,数字更难看:只有12%的CEO 说,他们的AI投入同时带来了成本下降和收入增长。

钱花了。董事会PPT里写满了"AI-First"。员工的Excel还是那个Excel。

德勤的报告给了一个委婉的解释:"大多数企业还在用AI优化既有流程,而不是重新思考业务本身。"

我的解读更直接:

当所有企业都在问同一组模型拿战略,所有企业拿回来的都是同一份"差异化、合作、长期主义、增强"的模板。

模板本身没有错。它是对的。它是温和的、正确的、所有人都能接受的。

但"所有人都能接受"本身,就是商业世界里最危险的一个属性。

因为商业的本质是差异。是你看到了别人没看到的东西,然后赌一把。

AI不能替你赌。它只能告诉你"上次有人赌赢的路径是什么样"。

那条路径,已经不是别人的路径了。它是所有人的路径。


六、"扮演消费者"和"塑造生产者"是同一个病

两个月前我写过广告业的"合成消费者"。WPP用25个AI虚拟人格代替真实消费者做调研。Qualtrics预测三年内超过一半的市调会用AI生成的受访者。

当时我写的是:如果AI不知道自己在扮演谁,我们凭什么相信它扮演的是真实的消费者?

现在Hivemind这篇论文,加上德勤那54个百分点的缺口,给了一个更深的答案:

消费者端同质,生产者端也同质。中间那点本应存在的差异化张力,被两头拉平了。

合成消费者让AI替你"扮演"市场需要的人。 AI战略顾问让AI替你"扮演"一家应该这样做的公司。

两者合起来,是一个正在成型的闭环:

  • AI模拟消费者,告诉你市场需要什么。
  • AI制定战略,告诉你应该怎么做。
  • AI写广告,告诉消费者这是他们应该喜欢的。
  • 真实的消费者被这些内容训练成"像AI模拟的那样"的消费者。
  • 下一轮,AI再去模拟,像那样的消费者……

Jiang她们在论文里留了一句话:

"我们担心,通过反复接触相似的AI输出,人类思想会被逐渐同质化。"

她们不是在写科幻。她们是在描述一个已经在发生的过程。


七、那到底怎么办

RLHF带来的单一化,是技术问题,学术界在想办法。已经有Preference Matching RLHF、diversity-aware training、pluralistic alignment等方向的尝试。

但这些在真正进入主流模型之前,还有几年。

在那之前,一个使用AI的个人或者一家企业能做的,只有一件事:

把"AI告诉你的答案"当成起点,不是终点。

这话听起来像鸡汤,但它有具体的操作含义

当ChatGPT说你应该做差异化,追问一句:差异化不是结论,是过程。具体差异化哪一点?

当Claude说你应该注重长期主义,追问一句:这个长期具体是几年?长期和我现在的现金流之间有多少个月的耐心缓冲?

当Gemini说你应该拥抱协作,追问一句:协作的前提是有独立的能力。我手里那个"独立的能力"是什么?

这些追问听起来琐碎。但AI不会主动这么问自己。

只有你会。因为你有一件AI没有的东西 - 你为结果负责


八、回到Patrick Evans那句话

信念、艺术、品味、判断、直觉。这些,只能从你身上来。

我写这个文章的时候,反复想起《人间词话》里的一句话:

"词以境界为最上。有境界则自成高格,自成名句。"

境界是什么?境界不是RLHF能训练的东西。境界是你在下午三点那场客户会议里走神时看到窗外阳光打在玻璃上的那种光的颜色。境界是你女儿第一次说出你新发型不好看时她的那个语气。境界是你2016年做了一个错的决定,后悔到现在的代价。

那些东西都不在任何训练集里。

那些东西都不能被26000个开放式问题、50次采样、31250条人工标注所穷尽。

那些东西是你之所以是你 的全部理由。

9亿人每周都在问ChatGPT。4个主流模型在这9亿次对话里给出高度相似的答案。

那条答案不属于任何一个人。它属于"所有人的平均值"。

而你能赢的唯一机会

就是你不是平均值。


研究来源:Liwei Jiang et al., "Artificial Hivemind: The Open-Ended Homogeneity of Language Models (and Beyond)," NeurIPS 2025 Best Paper. arXiv: 2510.22954

企业数据来源:Deloitte, "State of AI in the Enterprise 2026"(3,235位高管调研);PwC CEO Survey(4,454位CEO调研);OpenAI公告,2026年2月27日。

推文来源:@atmoio on X,2026年4月14日。

Follow my WeChatWeChat 公众号 QR codeScan to follow