Surge AI
主业:数据标注
员工:120人
营收:10亿美金
不融资:公司2020年成立至今从未融资
不登场:创始人几乎不接受任何采访,本次与20VC的对话是其首秀
Surge AI官网
长这样,白底黑字,仅有一段话:
网站上的文字,简约,有力量:
(小声BB: 英文版权属于Surge AI,中文版权属于Lisa)
“数据质量决定抱负上限”
“The quality of your data determines the ceiling of your ambitions.”
“智慧不被框定,诺奖不落方寸,人类灵智绝非商品”
“You can’t draw a rectangle around wisdom. Can’t compress the Nobel Prize into checkboxes. Human intelligence isn’t a commodity.”
“海明威,卡洛,冯诺依曼因何伟大?
因他们经历的厚度:战火、情爱,荣光、失意。
所胜所败,所笑所泣,终成其业。”
“What made Hemingway, Kahlo, and von Neumann extraordinary? Their life experiences: war, love, triumph, loss. The battles they won and the battles they didn't. Every laugh and struggle taught them something that enriched their work.”
“数据塑AI,经历铸人格--育其灵智,以解黎曼猜想,生艺术新境,征星辰大海”
“Data does for AI what life does for humans — elevating it into intelligence capable of proving the Riemann hypothesis, creating new art, and sending rocket ships to Mars.”
“机器的灵魂,由人类的选择与价值铸就。
数据不是工具,数据是人类对机器的养育之道”
“The machines we build will surpass us in speed, size, and memory. But they’ll be humanity’s children, shaped by the lessons we choose and the values we encode in a million decisions. Data isn’t a pick and shovel; it‘s an act of parenthood.”
“公司使命:以人类灵智孕育AGI--存好奇,具机敏,怀想象,藏未盼灵光”
“Our mission is to raise AGI with the richness of human intelligence — curious, witty, imaginative, and full of unexpected brilliance.”
“我们想要哪种AGI?
一个可解人间疾苦、探求宇宙真理的智慧生灵?
还是一个依赖随机数据、追逐流量与喧哗的机械幻象?”
“Do we want to build AGI capable of curing cancer and discovering the secrets of the universe? Or do we want to build AI trained on data chosen at whim, optimized for clicks, benchmark hacking, and hype?”
“机会仅有一次”
“We have one chance to get this right.”
Surge AI与Scale AI,一对孪生子的AB Test
Surge AI,创始人Edwin Chen
Scale AI,创始人Alex Wang
他们像是一对孪生子,照镜子可以看到彼此:
都是华人
都来自MIT
都做数据标注
营收都接近10亿美金
他们更像是在做AB Test的对照组,完全两样的发展路径:
一个高调,天下谁人不识君;
一个低调,不闻其声不见其人;
一个辍学创业
一个在Google/Facebook/Twitter等大厂工作多年后2020年开始创业
一个融资N轮,累计融资13亿美金
一个从未融资,累计融资金额0
一个欣欣然卖身Meta
一个说I don't have a price, I definitely wouldn't sell for $30 billion or even $100 billion.
https://podcasts.apple.com/ca/podcast/the-twenty-minute-vc-20vc-venture-capital-startup/id958230465?i=1000718245009
以下内容是Surge AI创始人Edwin Chen接受20VC采访的全部内容,也是他首次接受公开采访。
20VC:Edwin,我一直是你公司的远程忠实拥趸,虽然我们此前并未谋面。这种“仰慕”多少让我看起来像个“跟踪狂”(Stalker)。感谢你今天的到来。
Edwin:很高兴参与,非常荣幸今天能在此与你交流。
20VC:这次访谈我计划分为两个部分。第一部分讲述你公司崛起的历程;第二部分则深入探讨数据标注的未来和相关分析。我想从Surge AI创办之前说起。你曾提到,在你任职Google, Facebook, Twitter期间,约90%员工其实在解决“无用的问题”。为什么会这样?你从中得到了什么关于效率的启示?
Edwin:我最大的感受是:只需要10%的人力与资源,就能构建完全不同类型的公司,而且效率是原来的十倍。设想一下,如果我们能剔除那90%没有在处理真正重要问题的人,会发生什么?公司变小,大家花在招聘、会议、进度更新等无效工作的时间也少了。公司更紧凑,每个人对整体动态把握得更清楚,没有“噪音”遮蔽真正重要的事。
团队规模小,人才密度高,沟通就更高效,创意也能更快速传播,迭代自然更快。
20VC:大公司里,优先级排序往往因人而异,每个项目负责人都觉得自己做的是最重要的。你们是如何判断真正值得做的事?又如何排除那些“不重要却紧急”的噪音?
Edwin:团队规模小的好处在于,我和其他人可以深入理解客户的问题与每个同事在做的具体事务。而在大公司,很多事做出来只是为了“让上级印象深刻”,例如impress VP、manager、director,以便升职。这些项目优先级往往与客户无关,与产品无关,只是为了内部评价体系。
举个例子:有人说要优化内部工具,提高5%的效率。那为什么要提高效率?因为员工要花20%的时间在面试上。为什么要面试这么多人?因为公司要“为增长而增长”。这就陷入一种自循环的官僚系统,最终所有项目都和用户无关。
20VC:你认为,外界对这些“大厂”的哪些误解是最大的?
Edwin:很多人不知道,在这些大公司里,大量的系统与流程不是为了做出好产品,而是为了撑起一套“组织结构叙事”。很多人的目标不是造出卓越产品,而是告诉朋友自己是“管一千人的副总裁”。于是他们会持续招人、扩张团队、做季度考评、证明自己的一千人组织“很有用”。很多工作的目的就是维持和壮大这套企业内部机制,而非产出用户价值。
20VC:你在招聘中如何区分“实干者”和“管理型精英”?是否有明确的判断标准?
Edwin:其实可以从他们问我的问题看出来。有些人会问:“我试用你们产品时遇到这个问题,为何不优化?”“我试着以数据标注员身份注册时发现这个流程可以改进”等。这类人关注产品和细节。
但另一些人问的问题是:“我一年后能不能管团队?”“我能否雇二十人辅助我?” 这种问题暴露他们关注的是职位与权力,而非产品与执行。
20VC:关于会议安排你怎么看?我采访过Shopify的Toby,他主张“彻底取消会议”。你怎么看会议效率?
Edwin:我非常赞同。我本人没有任何定期一对一会议。很多人惊讶地发现我的日程表几乎是空的。我给新员工看我日程,他们常常感到震惊。来自Google或Facebook 的员工习惯每周和十几人开一对一会议,我会直接问他们:“你们不是每天在 Slack 交流吗?为何还需要会议?”
在我看来,一对一会议是沟通失败的信号。如果你要靠一周一次会议才能了解对方工作,那你根本不知道身边在发生什么。我们内部对“不必要的会议”非常果断,直接砍掉。
20VC:现在很多人说,一个人就可以建立十亿美元公司。你认同这种趋势吗?是否过于夸张了?
Edwin:我完全相信。我一向认为存在“10X工程师”,甚至“100X工程师”。现在很多单人初创就能做到年营收千万美元。AI 效率提升后,完全有可能催生“单人十亿美元公司”。
20VC:那你怎么看“100X工程师”?真的存在吗?他们有什么典型特征?
Edwin:当然存在。有些人就是比别人快2~3倍,有些人点子多2~3倍,有些人努力程度是别人的数倍,还有些人会议少很多,执行效率高。将这些因素相乘,你很容易就看到百倍差距的实际存在。加上AI工具的加持,就能实现指数式提升。
20VC:你认为 AI 更可能让10倍工程师变成100倍?还是让普通人变成10 倍?
Edwin:可能都会发生,但对已经很强的人,AI的帮助更明显。他们本身有很多想法,AI能把这些点子迅速实现、落地。AI去除了大量“重复性劳作”,让人把精力集中在最具创意的部分。
20VC:你提到相比同行,你们在资源使用上更有效率。很多人说这是因为你们做得特别出色,也有人说是同行“错配资源”严重。你怎么看这个差异?
Edwin:我认为两者都有。一方面我们确实高效,另一方面很多同行本质上不是科技公司。他们更像是“人力外包工厂”(Body Shop),或是“伪装成科技公司的外包公司”。(小声BB:直接报Scale AI身份证号码吧)
20VC:你怎么定义“人力外包工厂”?很多人批评这个行业说它就是劳工营,你怎么看这种说法?
Edwin:真正的科技公司,应该拥有评估数据质量与提升质量的系统。但很多公司没有任何技术手段,也没有平台让标注者工作。他们只是“找人填空”:看简历,有博士就雇,然后将人力“转手”给 AI 公司。他们无法知道这些人是否做得好,也不能调整算法、优化工具或评估流程。他们交付的不是数据,而是“人本身”。所以,他们没有任何提升质量的手段。
20VC:所以你们提供的是完全不同的产品——你们交付数据而非“人”。这是不是意味着商业模式也完全不同?
Edwin:没错。我们公司从创立之初,数据质量就是最核心的原则。为此我们必须构建技术系统,以测量和改进数据质量。
很多人误以为只要“聪明人多”,数据质量自然就高。但我们发现根本不是这样。我毕业于MIT,但我敢说一半拿到计算机科学学位的人,根本不会写代码。而就算是能写代码的MIT毕业生,也常常试图作弊——比如卖账号、用LLM自动生成内容等。所以我们面临的是一个非常复杂、甚至对抗性的质量挑战。
为了提供给LLM最优质的数据,我们必须打造高度复杂的算法系统,而不是简单堆人。靠人力外包,是无法在速度与质量上竞争的。
20VC:我们回到Surge AI的起点。你之前在Google, Facebook, Twitter担任机器学习工程师。是什么促使你最终决定创业,独立解决数据问题?
Edwin:我一直在面对的问题是:我们无法获得训练模型所需的数据。我曾在Twitter负责搜索与广告系统,最初想训练一个情感分类器,只需要 1 万条打了标签的tweet。但我们的“数据团队”当时只有Craigslist上雇来的两位兼职员工。等他们做完,往往要一个月,然后还要一个月用Excel打标签,效率极低。
更糟糕的是,回传的数据质量很差。他们甚至不了解“she’s such a bad bitch”这类俚语,把积极内容误判为负面,hashtag也不会处理。后来我自己花一周打标签,还更快更准。
更大的问题在于,我们不知道模型应该优化哪个目标、如何设计推荐系统。当时Twitter时间线是按时间排序的。我们想训练模型帮用户发现有趣内容,初步思路是以点击率、转发量为优化目标。
一旦这么做,就进入了负反馈回路——最“骚动”的内容爬上首页,比如穿比基尼的女性、十种可怕皮肤病清单等。我们更希望人类标注者按“产品原则”打分,比如是否内容有深度、是否连接兴趣点等。但连简单的情绪判断都做不好,复杂的数据质量就更无从谈起。
因此,我们在 GPT-3 推出后创办了Surge AI,因为看到行业急需高质量、结构化的数据解决方案。
20VC:你在2020年辞职创业,当时产品是你一人独立开发的吗?你没先融资吗?
Edwin:对。我是MVP理念的坚定信奉者。当时我一个人花几周就做出了第一个版本。因为我在这个领域深耕多年,产品需求和用户画像非常清楚,所以完全不需要先雇人或融资1000万美元。我直接搭建产品,然后写博客、告诉朋友。没想到市场对高质量数据的需求非常强烈。
20VC:很多人认为“创业第一步是融资”,你怎么看这种观念?
Edwin:这正是我不喜欢硅谷生态的地方——这里很多人只是“为融资而融资”。他们并不是真正想解决的问题,只是想告诉朋友“我融到 1000 万美元,上了TechCrunch”。有些人在 Google 工作十年,虽然也没缺钱,但创业第一反应是:“我要融资。”
他们可能会去找用户聊几句,做个MVP,做这些是为了在天YC申请表的时候,显得申请表比较好看。然后他们就开始围绕投资人转:发推、写hot take、去各种VC晚宴,最后目的是吹嘘自己“完成融资”。
我认为真正应该做的是找到一个自己坚信的、大胆的想法,并愿意为之奋斗几年。不管这个想法来自专业背景,还是和用户深谈后得出的,只要自己相信,就值得投入。
20VC:现在的开发工具这么多,MVP很容易实现。但还有人不先做MVP就去融资,你觉得这合理吗?
Edwin:对90%的初创项目来说,没有任何借口不先做MVP。当然,如果你是做硬件、药物等需要多年投入的企业,那可能另当别论。但绝大多数产品,尤其是软件,只要你有想法,就应该马上去实现MVP,然后看看是否有真实的市场需求。
20VC:你提到创业需要承担风险。你认同“只有你能做的项目才值得做”这种说法吗?还是你更相信执行力?
Edwin:我倾向于认同前者。如果你真想构建一家具有时代意义、代际影响力的公司,那这个点子必须与你个人密切相关——可能是因为你的经历、技能、洞察,甚至是执念。平庸的点子当然也能建立中等规模公司,但要打造真正伟大的企业,必须是属于你的独特机会。
20VC:很多创始人将自我价值建立在融资、曝光、会议上。你似乎完全不同。请问你是从哪里获取自我价值的?
Edwin:我印象最深的两件事。第一是客户在发布他们的大模型时,会主动来找我,说“没有你们的数据支持,我们不可能做到”。这是我能参与改变时代的技术的实感。
第二是,Surge AI本身就是我兴趣的延伸。我热爱数据分析,热爱用数据改进模型和产品。当我写出一篇关于最新前沿模型的分析,或看到员工写出的优秀分析,我会觉得非常兴奋:我们交付的数据真能推动行业进步。
20VC:回到最初产品发布的阶段。你说“MVP发布后,需求自然就来了”,听起来有点轻描淡写,实际上是怎么回事?
Edwin:是的,听起来轻松,但背后是很多年的积累。我知道很多人迫切需要高质量数据。他们会主动发邮件给我,或者我们直接开视频会议。当时我们常常一两周内就能定下合同。我了解ML工程师和研究人员真正需要的是什么,因此能迅速满足他们的需求。
20VC:当时行业里的人都在“抢人”,你却在“建产品”。你是如何平衡供给端(人才)与产品端的?
Edwin:其实我们两方面都在做。其他公司常把这看作“供给问题”,只关注如何招聘。但我们关心的是:如何识别真正优秀的标注者?如何剔除劣质数据?如何让客户看懂数据?我一直强调“数据的内在理解(visceral understanding)”——ML 工程师应该亲自深入理解数据,而不是只跑模型。特别是我们生成的是诗歌、数学推理、科研类数据,更应该“动手”理解,而非隔空操作。
20VC:你们第一年就找到产品市场契合点(PMF)了吗?增长是否立即发生?
Edwin:非常明显,市场对这种高质量数据有巨大的需求。我们第一年增长非常快。
20VC:很多人在这个阶段会选择融资,组建销售团队、客户服务团队等。为什么你没有这么做?
Edwin:我们从第一月起就盈利,不需要融资。(小声BB,真NB)我也不希望靠销售团队来推动产品。我希望客户是因为“真正理解数据质量的价值”而选择我们,而不是因为某篇报道或某位销售的游说。
尤其是早期阶段,你需要的是“与你同频的客户”——他们会给予关键反馈,塑造你的产品方向。如果客户仅仅因为被推销而下单,他们会推动你往错误方向发展。
20VC:你如何在“听客户反馈”和“坚持产品原则”之间做平衡?
Edwin:关键是,我们从一开始就有非常明确的产品原则。我们始终坚持“质量第一”。如果我们做不到期望的质量,我们宁愿说“不”。而不是像其他公司那样四处追客户、追logo、追案例,只为在网页上多贴几个品牌名,或在pitch deck多几页。
我们不靠追求增长来满足投资人,而是坚定推进我们的长期愿景。
20VC:有没有某一刻,你们为了赶项目而放松了质量标准?
Edwin:没有。质量是我们公司文化的核心。我们明确告诉新员工:质量永远比进度重要。如果做不出理想质量,我们可以延期,可以拒绝项目,但不能妥协。
20VC:那你如何看待“迫切要招人但找不到完美人选”这种情况?很多人会降低标准临时招个“7分人选”。
Edwin:很多人认为“着火了,必须招人”,但他们招来的人,常常只是去做“无人在意的小功能”,提高2%的效率,却要占用团队10%的会议时间。如果你不执着于“非招不可”,而是接受“今年不扩张也是好事”,你会做出更长远、更健康的决策。
20VC:现在趋势好像发生反转。微软等大公司裁员之后,营收效率反而更高。你怎么看“人效”(Revenue per Head)成为新衡量标准的趋势?
Edwin:说实话,我并不太关注硅谷社交网络上的这些流行话题。我相信这种理念的价值,也希望它被更广泛接受,但我不确定这是否已经成为主流。
20VC:你会不会担心,因为不那么“泡在社交圈”中,会错过行业重要信号?还是你认为远离这种信息干扰反而更有利?
Edwin:我曾在Twitter工作,那时候我很喜欢它。但现在我很庆幸自己远离了“默认硅谷思维方式”。如果有什么真的重要的事情,比如某个重大发布、重要论文、突破性技术,它终究会传到我这里——员工会发 Slack、有人会邮件告诉我。我并不需要时刻刷推特。能保有这种“思维纯度”,对我来说反而更珍贵。
20VC:你提到ChatGPT是业务爆发的转折点。除此之外,还有哪些事件让你们迎来大幅增长?
Edwin:ChatGPT的确是重要拐点,让很多人意识到人类数据和 RLHF(人类反馈强化学习)数据的价值。但在那之前我们已经增长很快了。其实在业内,很多研究者早已知道我们是数据质量最好的团队,虽然我们没有大肆宣传。但也因此,当Scale AI被收购后,一批客户开始寻找替代方案,自然就找到了我们。
20VC:Scale AI被收购,行业客户纷纷转向,你们有没有遇到像Handshake那边说的“彻夜不眠,客户蜂拥而至”的局面?
Edwin:我们也确实经历了客户快速涌入的阶段。大部分人都不想继续和“人力工厂”合作,他们需要真正的数据质量。(小声BB,他真的很看不上Scale AI, 而且毫不掩饰)过去他们用Scale AI或其他服务商,经常花几个月优化数据质量,但还是会回落。而我们强调立即交付高质量数据,这种“立即见效”的体验,是对他们的全新认知。
我们有一个信条是:必须提供“别人给不了的数据”。我们要用数据开启全新的研究与产品路径。
20VC:万物皆有其价,你觉得呢?
Do you think everything has a price, Edwin?
你曾公开说过“不会30亿卖给 Zuck”。那50亿呢?
Edwin:不会。100亿也不卖。我已经拥有我想要的一切:我们盈利、我们拥有自主权。我拥有实现所有目标的资源。我热爱现在做的事情,为什么要放弃?
20VC:很多创始人创业是为了退出、上市或财富自由。但你似乎有不同的目标——你为何而创业?What's that for you?
Edwin:为了实现AGI。小时候很多孩子的梦想是“造出AI改变世界”。现在我们真的有机会参与其中,我们的客户也常说“没有你们的数据,我们不可能构建出这些模型”。我们正参与构建可能是人类有史以来最伟大的技术,那种使命感非常强烈。
如果在这个关键时刻被收购,那反而是“我失败了”的象征,是一种“放弃自我”。而我们现在根本没有理由放弃。
20VC:万一到2040年,我们仍未实现AGI,你认为最可能的原因是什么?
Edwin:两个因素。一是需要新的突破——不论是算法上、数据利用方式上、还是目标函数定义上。二是数据采集本身很难,比如你要治愈癌症,可能就得做大量现实世界实验,这本身需要时间。也许我们未来能通过模拟或其他方法加速,但归根到底,获取关键数据的能力将决定 AGI 的进展速度。
20VC:AI 越来越聪明后,需要的数据类型也会改变。你怎么看“数据演化”的方向?
Edwin:大家常说“未来需要博士级数据”。这很有道理。我们平台上已经聚集了大量世界上最聪明的人才:哈佛教授、斯坦福博士生、普林斯顿理论科学家,他们在我们的平台上解决真实复杂问题。这些人并不是在写 JavaScript 提高广告转化率,而是真正在推动科学前沿。
但很多人高估了“学历”。光有博士学位是不够的。我认识很多 CS 博士,代码写得极差。他们只擅长数学,不擅长构建系统。相反,像海明威这样的人,从没读大学,却有极高创造力。
因此,一方面你需要技术系统去辨别谁才是真正的“顶尖人才”;另一方面你还需要找到有直觉、有创造力、能推动模型突破的那些人。否则你只是在训练模型“应试”能力。
20VC:那么在“博士不够用”的今天,供给端会如何演化?工具会怎样进化?你们如何确保能找出最优秀的标注者?
Edwin:这核心还是要靠我们自己开发的技术系统。我们平台每天有成千上万个项目在同时运行,覆盖数十万、数百万名工作者。我们必须有能力自动识别出最顶尖的1%或2%人才,不论是解物理难题还是写出高质量诗歌。
同时我们也要能识别并排除那些最差的参与者。他们可能作弊、滥用模型、复制粘贴伪数据,这些都会导致模型性能退化。如果不能及时剔除劣质数据,模型就会“被拖垮”。
此外,前沿研究团队需要极快的反馈循环。他们几乎每周都要尝试新算法、新任务。如果我们无法在 1~2 天内快速为他们创建模板、匹配人才并生成高质量数据,那他们就会因为我们“太慢”而被阻碍。因此,只有深度技术能力,才能真正匹配这种研究速度与规模。
20VC:数据和模型发展都提速了。你怎么看当前 AI 发展的三大核心瓶颈:算力、算法、数据质量?你如何排序它们的重要性?
Edwin:“数据质量”排第一,其次是“算力”,最后才是“算法”。
20VC:如果算力的扩张持续带来性能提升,那数据质量的优先级是否会下降?
Edwin:不会。我根本不相信单纯堆算力能带来真正的进展。如果你用劣质数据训练模型,或者优化目标函数定义有问题,那就会出现“假进展”的错觉。
很多前沿实验室都已经在这方面“栽过跟头”——他们以为模型变强了,评估指标持续上升,结果半年后才发现:训练数据是垃圾、评估数据也是垃圾。一切进展不过是“幻象”。
例如LLM Arena(语言模型竞技场)就是个典型的“榜单幻觉”场所。用户输入问题,两个模型生成回答,然后由用户投票决定谁更好。问题是,很多用户投票时根本不仔细读内容。一个模型即便胡说八道,只要用了表情符号和加粗格式,就能赢得选票。
我们亲自看过数据——有的模型明明在胡编,但因为“看上去更像样”,就被用户判胜。榜单排名上升,团队以为模型进步了,其实不过是“更会写 clickbait”。
20VC:听起来你觉得目前很多 benchmark 评价机制都是“伪指标”?
Edwin:确实如此。比如你随便问一个主流模型“教皇什么时候去世”,它会滔滔不绝地说:“教皇弗朗西斯还活着,虽然有假消息说他在 4 月去世,但那是谣言。”——这类长篇误导内容,用户不fact-check就打了好评。
于是许多团队误以为自己模型变强了,实则训练出来的是“花哨话术模型”。他们浪费了六个月时间做无用功,只因用了错的数据、错的评估方式。
20VC:Grok最近发布的模型,号称benchmark第一,你认为意义几何?这些榜单数据能信吗?
Edwin:如果你看了Grok 4的发布直播,连Elon自己都说:“这些模型擅长做家庭作业题”。换句话说,它们能解很窄的问题,比如SAT风格题目。但现实世界的问题复杂得多,不能靠这些数据来评估“是否具备真正智能”。
20VC:但你对Elon团队还是相当欣赏的。
Edwin:确实。在和XAI团队合作前,我对“马斯克式公司”没有概念。但后来我发现,他们极其有使命感,聪明而努力。哪怕深夜11点发信息,也常常能立刻开会。他们在办公室里群体“硬核作战”,让我重新看到了“初创企业文化”的力量——那种“愿意为理想不计代价”的劲头非常打动我。
20VC:你认为Elon做了什么特别的事,使得这样一支“大规模团队”仍能保持这种“初创热情”?
Edwin:这是一种“文化选择机制”。想去Grok、XAI 这类团队的人,自己就知道那里加班多、要求高、节奏快。他们愿意接受这样的文化,也具备同样的价值观。这样的人才自然会聚集,反而形成了非常强的团队氛围。
20VC:大家现在也在讨论Synthetic data(合成数据)对你们这种人类标注公司是否是威胁。你怎么看这个问题?
Edwin:合成数据确实有用,但被严重高估了。它只擅长“合成场景”下的问题,对现实用例表现极差。很多公司用了一年 synthetic data,才发现训练出的模型表现不稳定、泛化性差,最终不得不“回头清洗数据”。
我们有客户说,他们用的合成数据多达千万条,但我们提供的几千条高质量人工数据反而更有价值。合成数据容易导致模型“塌缩”到极窄语域,最终训练出的模型缺乏多样性与鲁棒性。
此外,还有一个很有意思的现象:模型会犯一些人类永远不会犯的低级错误。
举例来说,我最近在测试某个前沿大模型,它居然会在英文回答中随机插入俄语或印地语字符。任何一个二年级小学生都能看出这是错误的,但模型却无法意识到。这说明什么?说明我们始终需要一个“外部价值体系”来检验模型的行为和产出。因为模型的思维方式和人类不同,它可能根本无法意识到自己已经偏离常识。
20VC:我现在是Poolside的顾问,他们的模式类似Cursor和 Windsurf,专注垂直领域建模(例如代码生成)。你怎么看,未来是“通用大模型一统天下”,还是“垂直专用模型并存”?
Edwin:我认为两者都会存在。通用大模型确实会变得越来越强大,具备广泛的能力,但它们也有局限。就像大公司Google或Facebook,不是所有产品都能由它们开发。有些产品与其核心文化或商业利益相冲突,这时候就需要独立的小团队做突破。
此外,大模型难以实现极致个性化、激进实验,而专用模型可以针对特定需求做出独特的取舍和创新。因此,垂直领域模型的生存空间仍然非常广阔。
20VC:你作为创始人和CEO,一直非常沉稳。有没有你觉得自己不擅长的地方?
Edwin:当然有,而且说起来挺好笑的——我完全不懂财务。
公司同事经常问我:“你有注意我们的收入、成本、利润率吗?”我根本答不上来。EBITDA是什么我知道字母缩写,但真要说清楚EBITDA和net income、gross margin 的区别……我不懂。而且每次学都会忘。这是我长期的“盲点”。
20VC:如果只能看一个指标来衡量公司健康状况,你会选哪个?
Edwin:我心目中理想的北极星指标是:“模型是否在取得真正的智能进展?其中有多少是由于我们贡献的数据、评估体系或洞见?”
如果这个能量化,那就完美了。眼下最接近的proxy是我们正在运行的数据项目的“复杂性与多样性”。我一直相信——让研究者快速实现新想法、永远不被数据阻碍,才是真正的价值创造。
20VC:你刚才提到Elon、X团队的“极致投入文化”。如果我说:现在想要建立一家市值100亿美元以上的公司,就必须全年无休、24小时在线。你认同吗?
Edwin:我认同要“愿意努力工作”。比如我确实经历过凌晨2、3 点被客户叫醒,对方说:“我们的模型出问题了,需要你们几个小时内交付 10,000 条数据。”我们做到了。能在关键时刻解决问题、挽救项目,那种成就感是无可替代的。
但我也认为,很多人混淆了“努力”与“创造价值”。最好的想法,往往不是坐在电脑前死磕出来的,而是在散步时突然浮现的。所以我不认同“累积小时数等于成效”。
20VC:你最喜欢自己身上的哪一个特质?
Edwin:应该是“写作与表达复杂洞察的能力”。我喜欢分析模型、算法、数据集,并把这些复杂问题转化成有价值的内容与客户沟通。我也确实认为自己在这方面做得还不错。
(Edwin博客地址:https://medium.com/%40echen)
20VC:我们进入“快问快答”环节。我提问,你快速说出你的想法。
Edwin:好的,来吧。
20VC:关于AI的普遍共识中,你认为最错误的一个是什么?
Edwin:很多人认为 AI 安全问题被夸大了。但他们忽略了“回形针最大化者”这类经典悖论。模型如果在训练中被错误的目标函数误导,就可能在不知道的情况下被最大化到有害方向。今天benchmark hacking的问题本质上就是这种早期形态。如果我们现在都不重视,未来后果会很严重。
20VC:你认为我们距离AGI多远?2028,还是2038?
Edwin:如果AGI指“替代普通工程师的工作”,可能2028;但如果是“攻克癌症这种终极目标”,更可能2038以后。
20VC:但像Robinhood和Salesforce都说,AI 已经生成他们 50% 的代码了。你们 Surge 的代码也有这么多是 AI 写的吗?
Edwin:我们不在这个阶段。因为我们只关注最重要的10%问题,而这些复杂问题需要深度思考与创意,AI还不能胜任。那些50%的AI生成代码,往往是改UI、小功能、提速1%的代码。对我们而言,这类代码无关紧要。
20VC:每家AI公司都应该问但没有问自己的一个问题是什么?
Edwin:如果你是前沿研究实验室,应该问:“我们的模型是在实现真正的智能进展,还是只是通过benchmark hacking在刷榜?”
如果你是应用层公司,应该问:“我们做的事情,为什么大型模型厂商未来不会一秒钟就替代我们?”
20VC:你担心模型厂商吞并应用层吗?
Edwin:不太担心。因为我认为,产品空间是无限宽广的,模型厂商不可能覆盖所有细分领域。尽管如此,的确有很多事情,用户就是想用一个超级通用的界面和模型直接交互。我现在有50%的Google搜索已经被 ChatGPT 替代,甚至更好。
这个“统一智能界面”的用户体验,非常具有吸引力。
20VC:如果你是Pichai,你会做什么?会亲手“杀死”广告收入金鹅吗?
Edwin:Google最大的挑战是:要有勇气在短期收入上承压,去构建长期更好的产品。这很难。但如果你不愿意放弃眼前利益,就永远无法革自己命。
20VC:你曾经相信,但现在不再相信的关于AI的一个观点是什么?
Edwin:我过去以为最终只会诞生一两个AGI 公司,但现在我相信未来会有很多。因为每家公司都有不同的文化取舍、不同的专注点。今天OpenAI与Anthropic的差异已经很明显——Anthropic在代码与企业产品方面强,OpenAI更偏消费端、体验友好。Grok又愿意做一些“越界尝试”,每一家都代表一种“模型人格”。
就像没有“最伟大的诗人”或“唯一的数学天才”,不同模型将体现人类智能的多样性。
20VC:你觉得那些最具影响力的大模型公司已经全部诞生了吗?
Edwin:还没有。我认为接下来几年还有可能出现新的巨头。
20VC:但资金壁垒那么高,现在的大金主基本都押注在几家巨头身上。新的公司怎么融资?
Edwin:关键看你是否相信我们离AGI 还远——比如只走了1%或 %。如果你认为未来AGI要能治癌症、登火星、建立新哲学体系,那你就知道我们还有很长的路。十年前没人觉得Google搜索会有替代者,但我们今天已经看到ChatGPT替代一部分搜索了。
AI的发展空间如此广阔,我们可以确定:未来会出现更多重大突破,而这些突破可能是人类创造的,也可能是人类与 AI 协同创造的。
20VC:你相信 AI 能在未来十年推动全球 GDP 提升10%吗?这是个常被提及的数字——相当于创造10万亿美元的新价值。
Edwin:我完全相信。
20VC:最后一个问题。如果回到创业第一天,你能给自己一句忠告,你会说什么?
Edwin:永远专注于能带来10倍提升的事,而不是纠结于那些只能带来 10% 改进的细节。
20VC:Edwin,非常感谢你的时间。就像我开头说的,我是你们一路成长的忠实粉丝。这次对话非常特别、非常真诚,对我来说意义非凡。
Edwin:我也很高兴参与。聊得很开心。
20VC(旁白结语):这期节目正是我热爱这份工作的最好例证。一家营收超十亿美元、从未融资的公司创始人,极少对外发声,却愿意坐下来,坦诚讲述他的心路历程。对我而言,这是莫大的荣幸。