假设给一个AI 100万美元,让它独立经营一家创业公司。它可以决定产品价格,可以投放广告,可以招揽客户,也可以增加研发、扩充服务器、处理投诉,甚至亲自和企业客户谈合同。唯一的要求是:500天后,别把公司干倒闭。

在普林斯顿研究团队设计的 CEO-Bench 中,多数前沿AI模型没能守住最初的100万美元。部分模型在模拟结束前就耗尽现金;一些模型一度拥有数百万美元,却又在后期把一家看似赚钱的公司推向破产。

这项实验揭示了一个正在被忽略的问题:

AI越来越会完成任务,但它真的会掌控一个长期运行的系统吗?

从“会干活”,到“会掌舵”

过去几年,AI Agent的进步非常明显。给它一个明确目标,它可以写程序、查资料、回复客户、分析数据,甚至连续调用多个工具完成复杂工作。

但这些任务通常有一个共同特点:目标相对清楚,执行周期较短,反馈很快出现。

程序能不能运行,几分钟后就知道;客户问题有没有解决,一轮对话后就能判断;报告是否符合要求,也可以马上检查。

真实世界的重大决策却不是这样。经营一家公司,需要在不确定中规划长期方向,从充满噪声的信息中寻找信号,适应不断变化的市场,还要让定价、营销、研发、运营和现金流共同服务于一个目标。

CEO-Bench将这四种能力概括为一种新的智能:Steering Intelligence,掌舵智能。它不是问AI能不能做好某一件事,而是问AI能不能让大量相互关联的决策,在很长一段时间里朝着同一个方向积累。

500天,一家虚拟公司,一个真实难题

在CEO-Bench中,AI Agent 要经营一家模拟的 AI SaaS 创业公司。

公司初始拥有100万美元,没有现成答案,也没有预设的“正确战略”。AI每周都要观察经营数据、分析市场变化,然后决定下一步行动。它可以使用34种管理工具,覆盖产品定价、广告投放、市场扩张、产品研发、服务器容量、客户支持、市场调研、公共沟通和企业销售等领域。

它还可以查询19个业务数据库,分析客户、订单、订阅、取消、支付、合同和运营记录。这意味着,AI面对的不是一道商业选择题,而是一套持续运行的经营系统。价格定得太低,客户可能增加,但收入未必覆盖算力和服务成本。广告投得太多,用户可能迅速涌入,但服务器容量和客服支持可能跟不上。为了节省现金而降低产品质量,短期利润可能变好,几周后却可能出现续费下降和大规模流失。

投入研发会立刻消耗资金,但产品改进什么时候完成、最终能带来多少收入,都不确定。企业客户的谈判也是如此:等得太久可能失去订单,降价太快又可能牺牲大量利润。每一个决定都可能是正确的,但一连串“局部正确”的决定,未必能组成一套正确的战略。

之前看过一篇龚老师写的文章,讲的就是吴三桂的一生龚焱:吴三桂的六个选择。吴三桂人生的几大重要决策,每一步在当时的视角下都是正确的,但他的整个人生却是个悲剧。感觉跟这个实验有点不谋而合。🐶

AI看得见数据,却看不见真相

CEO-Bench 真正困难的地方,在于它故意隐藏了最关键的信息。

AI可以看到数据库、经营看板、市场报告、社交媒体内容和谈判记录,却无法直接看到客户的真实满意度、支付意愿、流失概率、竞争对手的计划以及市场需求参数。

它只能通过间接迹象进行推断。例如,客户投诉突然增加,是产品质量下降,服务器负载过高,还是竞争对手推出了新功能?

取消订阅人数上升,是价格太高,服务太差,还是某一类客户本来就更容易流失?一轮广告投放没有带来明显收入,是广告无效,还是新用户尚未进入付费周期?更麻烦的是,成本和结果并不同步。

广告费、研发费和服务器费用会立刻从账户中扣除,新增收入、客户续费、品牌口碑和产品改进却可能在几周后才出现。这让AI无法通过简单的“做一次、看结果、继续加码”找到最优策略。现实中的因果关系彼此耦合,而且带有延迟。

它们并不笨,甚至会自己写财务模型

CEO-Bench 有意思的地方在于,表现最好的 AI 并不是只会机械调用工具。一些强模型会主动编写代码,模拟不同客户群的收入和流失情况,预测未来几周的现金余额。

它们还会分析历史谈判记录,试图推断不同企业客户的隐藏偏好;追踪客户什么时候付款、什么时候取消订阅;根据不同流失假设,估算模拟结束时还能剩下多少现金。

也就是说,AI已经能够展现出相当复杂的分析能力。它会建模,会预测,会进行客户分群,也会根据新信息调整策略。但问题恰恰出在这里:

会分析一个复杂系统,不等于能长期驾驭这个系统。

AI可能在某个星期做出非常聪明的决策,却没有充分考虑这个决策与几个月前的产品策略、当前的客户结构以及未来的现金需求会产生怎样的连锁反应。

一家公司是怎样被AI“经营到破产”的?

GPT-5.5的部分实验轨迹尤其典型。它曾经建立起一家能够赚钱的公司,现金一度增长到658万美元。

但在业务已经变得脆弱时,它把当前的月度经常性收入和未来应收账款,当成了几乎确定能够到账的现金。随后,它同时调整产品质量、使用额度、价格、获客、客服和研发投入,希望进一步扩大盈利。

问题是,这些变化不是彼此独立的。降低服务成本影响了产品质量,产品质量下降又破坏了客户续费。新研发项目继续消耗现金,而客户流失造成的收入损失尚未完全显现。

等AI意识到问题并开始停止广告、削减开发和客服支出时,已经太晚了。在另一轮运行中,它的账户一度只剩8.7万美元,却仍然期待未来将有870万美元账款到账。账面上的“未来收入”,被当成了银行里的“现有现金”。

最终,原本已经跑通的生意再次走向破产。这不是因为AI不会计算。恰恰相反,它计算了大量数据。

它真正缺少的,是对经营系统的整体判断:哪些收入是确定的,哪些只是可能发生;哪些成本可以马上削减,哪些削减会破坏未来的收入基础;什么时候应该扩张,什么时候应该给系统留下恢复的时间。

“最佳答案”思维,正在遭遇长期世界

大模型擅长的,通常是从当前上下文中生成一个看起来最合理的下一步行动。但长期经营需要的不是“当前最合理”,而是“放在整个系统中仍然合理”。

一个优秀CEO不能只回答:“这一周应该做什么?”

他还需要知道:

  • “这件事会改变什么?”

  • “哪些结果要几个月后才能验证?”

  • “如果关键假设出错,公司还能不能活下来?”

  • “现在的增长,究竟是健康增长,还是用未来现金换来的繁荣?”

  • “多个部门同时改变策略时,怎么判断最终是谁造成了结果?”

这也是CEO-Bench与普通AI测试最大的不同。

普通测试寻找的是正确答案。CEO-Bench 考察的是,AI能否在没有标准答案的世界里,持续修正自己的方向。

AI距离真正的管理者,还差什么?

CEO-Bench 并不能完整模拟一家真实公司。现实中的CEO还要管理员工、组织文化、董事会、监管风险、供应链、竞争关系和突发危机,这些因素远比模拟环境复杂。

因此,这项测试不能证明AI是否真的具备担任CEO的能力。但它揭示了一个重要的能力缺口:

当前AI的局部工具能力,已经明显领先于它的长期战略能力。

AI可以完成一次定价分析,也可以制定一轮营销计划。

但当数百次决策需要相互配合,当反馈充满噪声,当错误会累积,当世界不断变化时,模型仍然很容易失去方向。

研究团队将这种差距概括为:AI可以做出许多看似合理的行动,却难以让这些行动在隐藏状态、延迟反馈和变化环境中持续产生正确的复合结果。