大多数人对 Elon Musk 的理解停在这里:他擅长设定符合第一性原理的技术目标,然后放出看起来接近完成、震惊四座的进度条,最后在不断跳票里继续稳步前进。
但我认为,他能做成这么多事,不在于说大话,也不只在于所谓第一性原理的思考方法,而在于他重新理解、甚至重新定义了失败。在他的系统里,失败数据不是需要掩盖的事故记录,而是企业独有的训练资产。这和 AI 公司用数据训练模型的逻辑一模一样。
■ 二十年,一路炸过来
先看 SpaceX 这二十年炸过多少次。
Falcon 1,公司的第一枚火箭。2006 年 3 月第一次发射,燃料管路被海水腐蚀,起飞 33 秒起火。2007 年 3 月第二次,液氧晃动引发振荡,二级发动机提前关机。2008 年 8 月第三次,一级残余推力让两级分离时撞在一起。三连败。Musk 后来说,那时候他的钱都投给了 Tesla 和 SolarCity,刚离婚,连房子都没有,公司只剩最后一次的钱。2008 年 9 月 28 日,第四次,入轨。
Falcon 9 的回收。2015 年 1 月和 4 月,两次砸在海上回收船上。2015 年 6 月,CRS-7 任务的火箭在上升段空中解体。2015 年 12 月 21 日,第一次陆上回收成功。2016 年 1 月和 3 月,又两次在船上摔坏。2016 年 4 月 8 日,第一次海上回收成功。2016 年 9 月,Amos-6 任务的火箭在静态点火时连同卫星在发射台上炸掉。
Starship 的原型机。2019 年 11 月 Mk1 在压力测试中炸裂,2020 年 SN1、SN3 在压力测试中垮掉,SN4 在第五次点火后爆炸。2020 年 12 月到 2021 年 3 月,SN8、SN9、SN10、SN11 四台原型机连续在十公里高空飞行后炸毁:SN8 落地太快,SN9 一台发动机没点着,SN10 落是落了,十分钟后炸了,SN11 在浓雾里下降途中炸了。2021 年 5 月 5 日,SN15 落下来了。
然后才是 2023 年开始的 Starship 整箭试飞。
把这张单子摊开,很少有公司愿意把这样一份记录公开挂在自己的历史上。但正是这份记录,是 SpaceX 今天能每隔两个月飞一次、把星链送进轨道的原因。每一次爆炸后面,都跟着一次设计变更。
■ 十八个月,五次飞行
2023 年 4 月 20 日,Starship 第一次试飞。多台发动机在飞行中失效,火箭在空中翻滚,自毁系统启动后又过了 40 秒才把它炸掉。发射台被严重损坏,碎片飞进了旁边的州立公园。
按照任何传统航天公司的标准,这是一次灾难。
美国联邦航空管理局的事故调查开出了 63 项纠正措施。七个月后,Flight 2 升空。这一次 33 台发动机全程工作,完成了热分级分离,这是 Flight 1 根本没做到的事。但助推器在翻转后丢失,飞船因起火自毁。
又过了四个月,Flight 3。首次全时长二级发动机燃烧,首次舱内推进剂转移测试。助推器着陆时只有 3 台发动机点火,丢了。飞船再入时失控。
再过三个月,Flight 4。助推器第一次受控溅落在墨西哥湾。飞船前翼严重烧损,但仍然完成了受控溅落。这是 Starship 历史上第一次两级都受控返回。
然后是 Flight 5。2024 年 10 月 13 日,助推器被发射塔的机械臂稳稳接住。人类航天史上从未发生过的事。
从炸毁发射台到塔臂接住助推器,中间只有 18 个月,5 次飞行。每一次飞行都失败了一些东西,每一次飞行都修好了上一次失败的东西,同时尝试了新的东西。
到 2026 年 7 月,Starship 已经飞了 13 次。前 3 次全部失败,此后每一次都完成了主要目标,中间 2025 年上半年连续三次丢了飞船。今年 5 月起飞的是全新的 V3:新一代 Raptor 3 发动机,更大的推进剂容量,7 月那次已经把星链卫星送进了轨道。这些改动不是在实验室里推演出来的,是从前面十几次飞行的失败数据里长出来的。
■ 爆炸是设计出来的
那些令人咋舌的爆炸,不是意外的失败,而是主动的失败。
SpaceX 在每次试飞前都会公布一份目标清单。Flight 1 的目标是"离开发射台",Musk 自己说,只要不炸毁发射台就算成功。Flight 3 的目标包括首次全时长二级燃烧和推进剂转移测试,但并不要求助推器成功着陆。Flight 6 故意拆掉了飞船侧面几个区域的隔热瓦,就是为了看飞船在缺少防护的位置会怎样。每一次飞行都被设计成"在某些环节会失败"的实验。它们不是在追求完美飞行时不幸出了事故,而是在有意识地把失败边界往外推,同时确保拿到足够的数据来理解这个边界在哪里。
传统航天的逻辑是:在地面上把所有问题解决完,再飞。SpaceX 的逻辑是:有些问题只有飞了才知道存在,所以尽早飞、尽早暴露、尽早修。原型火箭的造价被刻意压低,就是为了让"炸一枚"的成本可以承受。
这不是鲁莽。这是用经济手段把失败变成可重复的实验。
失败不是系统的例外,而是系统的燃料。
■ 失败是原材料
传统企业对失败的处理方式是:发生,追责,修复,尽量不再发生。失败是成本,是需要最小化的东西。组织的本能反应是把失败藏起来,或者至少让它看起来不那么严重。
Elon 的系统不是这样运转的。在他的系统里,失败是一种原材料,和钢材、代码、推进剂一样,是生产下一版产品必需的输入。
Flight 1 炸了发射台。这不是一个需要道歉的事故,而是一组关于"混凝土在 33 台猛禽发动机的尾焰下会发生什么"的数据。这组数据催生了水幕系统和钢板防护,这些东西在 Flight 1 之前,没有人知道需要。
Flight 7 的飞船因为推进系统的谐波响应远超地面测试,引发推进剂泄漏和持续起火而丢失。Musk 第一天就在 X 上写了:要给那个舱段加灭火系统,可能还要扩大通风面积。调查完成后,SpaceX 改了燃料管路、推进剂温度和推力目标。这不是公关声明,这是一条设计变更通知。
这种处理方式和 AI 公司训练模型的逻辑是同构的。模型在哪里犯错,那个错误样本就是下一轮训练最有价值的数据。SpaceX 从每次飞行的异常中提取设计改动。失败不是系统的例外,而是系统的燃料。
Tesla 的 FSD 把这个逻辑推到了更极致的地步。它不只是从失败中学习,它在主动制造失败。
FSD 的车队里有一个叫"影子模式"的机制:即使驾驶员在手动驾驶,系统也在后台同时运行自己的决策模型。如果系统的决策和驾驶员的实际操作出现分歧,比如系统认为应该直行但驾驶员踩了刹车,或者系统想变道但驾驶员没动,这个分歧就是一个"虚拟失败"。它没有真的发生在路上,但它被完整记录下来,回传到云端,成为下一轮训练的高价值样本。
特斯拉自动驾驶团队的 Phil Duan 今年在 CVPR 上给了这套机制的规模:约 700 万台车的车队,每天产生约 500 年的驾驶时长。但随机采样的视频 90% 没用,一段平稳的高速巡航模型早就会了。真正被捞出来训练的,是模型输出与人类司机操作不一致的片段。模型和人开得一样的地方没有信息增益,只有"模型想这么开,但人类实际那么开"的地方,才藏着模型还没掌握的知识。这些片段被自动标注、进入仿真和训练,再通过 OTA 推回车队。
所以 Tesla 的车队规模不只是一个销售数字,而是一个数据工程数字。每多一辆车上路,不是多了一个客户,而是多了一台 24 小时运转的失败探测器。
每多一辆车上路,不是多了一个客户,而是多了一台 24 小时运转的失败探测器。
这些失败数据的价值,在 FSD 的版本演进里看得很清楚。V12(2024 年初)第一次用端到端神经网络替代了手写规则的流水线,让模型直接从真实驾驶轨迹里学策略。这个变化的前提,正是车队积累的海量失败样本,没有它们,端到端模型没有原材料。V14(2025 年 10 月起)的强化学习阶段专门盯着更难的样本:小动物、复合信号灯路口、弯道黄灯、斜着伸进车道的异常物体。这些更难的样本从哪里来?从车队主动探测到的失败里来。
车队主动制造失败样本,自动标注和仿真,训练更强的模型,OTA 推送回车队,车队发现新的失败边界,再来一轮。这就是我在另一篇文章里说的智能复利。它的燃料不是正常驾驶的里程,而是失败。
■ 不是快速失败,是失败工业化
硅谷流行一句话叫 fail fast。但这句话被用滥了,经常变成对草率的美化。Elon 做的事情比 fail fast 精确得多。
他做的是把失败变成一条工业流水线:发生,测量,根因分析,设计改动,下一个原型,再次飞行。这条流水线的关键不是"快",而是"完整"。每一步都不能跳过。
Musk 自己公开讲过一个五步法:第一步,让需求变得不那么蠢,质疑需求本身,谁给的都一样;第二步,删除零件或流程;第三步,简化或优化剩下的;第四步,加速循环时间;第五步,自动化。他反复强调,前三步没做完之前不要加速,聪明工程师最常见的错误,是去优化一个本来就不该存在的东西。
最反直觉的是第二步。他说:如果你没有至少 10% 的时间在把东西加回去,说明你删得不够。这意味着他预期删除本身会产生失败:删多了,某个功能出问题,你才知道它其实是需要的。这种故意删过头再加回来的做法,本质上是在用可控的失败来逼近真实的需求边界。
Tesla Model 3 的"生产地狱"是另一个例子。2017 到 2018 年,Musk 睡在弗里蒙特工厂的地板上,产线一度几乎停摆。事后他承认,过度自动化是一个错误,"人类被低估了"。拆解专家 Sandy Munro 2018 年拆开 Model 3,一边批评车身工艺,一边说它的电子架构领先对手五到八年。两条评价放在一起,恰好说明了什么被撞出来了:Tesla 在极短时间内经历了别人十年才会遇到的制造问题,并且把每一个问题都变成了产线的改进。别的公司在设计阶段就把风险规避掉了,代价是永远不知道真实的制造边界在哪里。Tesla 选择了先撞上去,再从撞击中学习。
■ 四个前提
把失败当方法,听起来很酷。但它有几个不容易复制的前提。
失败必须发生在可控边界内。 Starship 的试飞在德克萨斯州的私人发射场进行,飞行路径经过联邦航空管理局审批,自毁系统随时可以启动。这不是在闹市区试验炸药。FSD 的新版本先在影子模式下运行,再灰度推送给一小部分用户,最后才全量 OTA。每一层都是一个可控的失败边界。
失败必须被完整测量。 没有遥测数据的爆炸只是爆炸。SpaceX 每次飞行收集海量传感器数据,失败后的调查报告精确到第几秒、哪台发动机、什么原因。Tesla 的车队数据系统能从几百万辆车的正常驾驶中自动筛出异常样本。不能测量失败,就不能从失败中学习。
组织必须能承受失败的成本。 SpaceX 的原型火箭造价远低于传统航天器,这是故意的。如果每次失败都要花 10 亿美元,你承受不了 13 次试飞里前三次全炸。Musk 五步法里的"删除"和"简化"不只是工程美学,它们直接降低了每次失败的财务成本,从而让更多次失败成为可能。
创始人必须有足够的权威来保护这种文化。 在一个需要向董事会解释每次爆炸的组织里,第三次失败之后就不会有第四次了。Elon 能做到这一点,部分原因是他同时是最大股东和 CEO,部分原因是他用早期的成功,Falcon 9 和 Model S,建立了足够的信用储备。
■ 学不会的是结构,不是态度
很多公司试图学习 Elon 的方法。它们在内部推行"快速迭代",鼓励"试错文化",甚至在墙上贴 embrace failure 的标语。
但大多数公司在一个关键的地方卡住了:它们没有把失败变成资产的基础设施。
一次异常发生后,它进入的是投诉流程、邮件链和责任谈判,而不是进入训练、回归和下一版产品。组织的免疫系统会自动把失败当作病毒来隔离,而不是当作营养来吸收。
这不是态度问题,是结构问题。当数据权、产品权、发布权和责任归属分散在不同的部门甚至不同的公司之间时,一次失败从发生到变成下一版能力的路径,就会被拉长到失去意义。等你终于搞清楚这次失败该谁负责、数据该谁处理、修复该谁验证、新版本该谁签发的时候,竞争对手已经飞了三次了。
Elon 的公司能把失败当方法,不是因为他比别人更勇敢,而是因为他把数据、设计、制造、测试和发布放在了同一个组织、同一条决策链、同一个时间表上。失败从发生到变成下一版产品的路径,被压缩到了组织能承受的最短距离。
这可能是 Elon 最不被讨论、却最难复制的能力。不是设定目标的能力,不是融资的能力,不是营销的能力,而是把失败工业化的能力:让每一次失败都以最短路径、最低成本、最完整的测量,变成下一版量产能力的一部分。
失败不是一件让人难堪的事。它是一种必然,也是一种主动的选择。
推荐阅读
点击标题阅读