作为一名在数据库领域奋斗了10多年的工程师,同时也是在这个领域创业了4年的创业者,我想真心劝告数据领域的工程师们:去用AI,去学AI,去理解AI。在此基础上,再考虑是不是要转行去做AI!

跟我交流过的朋友应该都清楚,从2024年下半年开始,我就不停地鼓吹AI,不断地讲AI对未来的重要性,以及它对整个数据领域可能带来的颠覆性影响。

Image

我在公开场合发表的观点。

Image

我在公司内部发送的全员信。

我并不是一个盲目追捧前沿科技的人,相反,我一直认为自己比大多数人更保守。但当我看到了越来越多真实的案例后,我越来越确信,AI不仅可以回答问题、生成文字、图片、语音和视频,它还会在短时间内彻底改变数据领域。

这篇文章里,我会从我自己的经历出发,聊聊为什么我认为AI能对数据领域产生冲击,以及我所看到的一些潜在机会。

数据库凉了吗?

当我们谈到要“all in”一个新的领域时,总会有人产生疑问:是不是我们之前看好的领域“凉”了?我是很反感这样的问题的。对于数据领域这样拥有众多从业工程师的行业,我当然不能替大家发表任何结论,但我可以简单分享一下我们公司——RisingWave,在实时数据流计算系统方向上的一些进展。

2024年是RisingWave成立的第四年,而这一年,我们取得了以下成果:RisingWave开源社区的规模增长了3倍,付费客户数量增长超过10倍,年收入也实现了超过10倍的增长。此外,我们成功进入欧美证券、支付、加密货币、能源、制造业等多个行业的头部企业。在RisingWave进一步成熟的过程中,其简单、易用和可扩展的特性将更快吸引那些对实时计算有需求的用户。基于此,我们坚信,在未来12到24个月内,RisingWave将继续保持在流计算领域的高速增长。

尽管AI在这两年强势爆发,但这并不影响数据库行业稳健发展。不仅如此,数据库市场庞大的基本盘也可以养活大量公司。因此,称数据库领域“凉”了,一定是不恰当的。

我的自我说服的过程

既然数据库领域仍在持续发展,那为什么我们还要关注AI?好吧,让我们直面一个事实:在过去两年中,AI吸引了大量的关注,而这种热度在未来两年内也大概率不会消退。无论我们是否决定“all in” AI,都有必要去了解AI。而这,并不是我第一次接触AI。 大约八年前,我第一次接触AI在数据库领域的应用。当时,我与Andy Pavlo合著了Self-Driving Database Management Systems论文[1] 。之后,在IBM Research工作期间,我继续探索AI在数据库中的潜力,并于2019年的VLDB会议上发起了AIDB Workshop[2],这一活动至今已连续举办了六年。

回想那时,我并不相信AI能为数据库领域带来颠覆性的改变。AI对我而言,更像是一系列有趣的研究点子,而非一套实用的工具。即便是在Redshift任职期间,我们尝试推广AI在数据库中的应用时,我的感受是,这似乎更多是为了吸引眼球。尤其是,当时通过简单的逻辑回归预测查询执行时间,却被包装成“AI for database”,让我不禁感到排斥。

两年前,当ChatGPT横空出世时,我依然保持了怀疑。尽管每天都会用ChatGPT,但很长一段时间内,我都认为它更适合用于生成辅助性的营销内容,并不认为它能对数据领域产生颠覆性影响。

Image

我已经当了两年的ChatGPT付费用户了!

回想起2023年,我们应该还记得,当时,AI与数据库结合领域最突出的两个趋势是向量数据库和Text-to-SQL。这两个趋势分别代表了AI和数据库交叉的两种主要方式:database for AI,以及AI for database。

我能够理解向量数据库为何受到关注以及它的重要性。几乎每一个基于RAG(检索增强生成)的应用程序都依赖于向量数据库。然而,我并不认为向量数据库是一个可行的商业机会。在我的博客文章中对此进行了详细解释:《向量数据库?不要投资!不要投资!不要投资! 》[3]。

至于Text-to-SQL,我一直对这个话题没有太多好感。在IBM工作期间,“自然语言查询”(NLQ)团队就在我的隔壁,他们的唯一目标就是将人类语言翻译成SQL查询。如今,几乎每一家大型科技公司——AWS、GCP、微软和苹果——都有自己的text-to-SQL团队。Snowflake和Databricks也推出了各自的文本到SQL功能,而与我交谈过的每一家BI工具公司,要么已经具备了这一功能,要么正面临被视为过时的风险。

尽管大语言模型相比传统方法显著提升了文本到SQL的准确性,但我始终认为,文本到SQL不太可能发展成一个独立且有利可图的商业模式。

直到大概半年前,Cursor AI、Replit等工具的爆火让我开始意识到:尽管AI不会立刻取代工程师,但它已经足以深刻影响软件工程领域。当我进一步探索AI与数据库的结合,并与多位我们的付费客户深入交谈后,我深刻地感受到:AI一定会撼动数据行业,并且就在未来两年内!

为什么?为什么AI会如此深远地影响数据领域?对于数据行业来说,十年前的AI可能只是帮助用户更好地开发和使用数据库,而今天的AI,让我们不得不重新思考一个问题:我们是否还需要数据库?

AI与数据库的定位

正如上文所提到的,在过去的很长一段时间里,AI在数据库领域主要扮演着辅助角色:AI可以帮助数据库自动构建索引、自动生成物化视图、预测查询执行时间,甚至是让人们更自然地通过语言与数据库交互。无论是哪种方式,我们都在理所当然的假设:数据库是核心,AI是辅助。

当AI能力较弱时,引入AI的更多意义在于市场营销,帮助产品赢得关注。而随着AI能力的逐步提升,引入AI的确能够在某些场景中提供实际的产品价值。但作为数据库厂商,我们都清楚,绝大多数用户并不会因为某个AI功能而为数据库买单。他们选择数据库的关键仍然是效率、可靠性,以及数据库本身的性能与背后商业化团队的支持。

然而,当AI的能力达到甚至超越某个临界点时,我们可能需要重新思考:在数据库与AI的关系中,究竟谁是核心,谁是辅助?

AI将引发数据库交互方式的变革。谈到交互方式,就不得不又提到Text-to-SQL。虽然我在前文中提到我并不看好Text-to-SQL作为一个商业模式的前景,但需要注意的是,这一问题的本质在于:未来,Text-to-SQL会成为一种标配(commodity),而不再是一个能够带来产品差异化的功能。

尽管目前各类通用模型在SQL生成上的表现仍不尽如人意(准确率普遍低于50%),但一些特化模型的准确率已经达到了75%,甚至Snowflake号称能够提升到90%[4]。大模型在过去两年的飞速发展也让我们有理由相信,通用大模型在不久的将来可以大幅提升Text-to-SQL的能力。

在这种趋势下,我们需要重新审视数据库和AI的关系,以及它们将在未来交互方式中的角色分工。这种变革将不仅仅改变技术本身,还会对整个行业产生深远影响。

Image
Reference: https://cohere.com/blog/command-r7b
Image

Bird Benchmark:https://bird-bench.github.io/

关于Text-to-SQL能力将持续大幅提升的佐证,可以从Anthropic最新推出的 MCP(Model-Context Protocol)[5] 中找到支持。简单来说,MCP允许用户为大语言模型(LLM)提供外部数据源作为模型的上下文,而SQL数据库正是这些数据源中的重要组成部分。在这个协议中,LLM与数据库的交互方式依然是SQL。

为了让MCP有效工作,高准确度的Text-to-SQL能力成为不可或缺的一环。MCP展示了一种未来交互的雏形:用户通过自然语言向LLM提出问题,LLM通过生成SQL查询从数据库中提取所需的数据,然后将结果反馈给用户。这不仅优化了人与数据库的交互效率,也进一步提升了AI在实际场景中的实用性。

我认为,人与数据库交互方式正不可阻挡地向自然语言跃迁。自然语言更符合人类的直觉,也更容易让非技术用户与数据库进行互动。然而,这并不意味着SQL会被取代。正如汇编语言仍然作为中间层服务于机器与高级编程语言一样,SQL也将在未来扮演类似的角色。它将继续用于精确控制、性能优化以及调试等场景。

总的来说,MCP的推出进一步表明,Text-to-SQL不仅是技术的延伸,也是未来人机交互方式的核心变革方向之一。这种变革将为数据库领域带来更广泛的应用场景,同时也为数据库技术发展带来了新的机遇与挑战。

Image

SQL将在AI时代扮演中间语言的角色。

在以上讨论中,我们仍然在假设数据库是不可或缺的工具,而AI则扮演辅助角色,帮助人们更好地操作数据库。然而,如果我们深入思考,不禁会问:我们真的还需要数据库吗?

我的答案:数据库仍然必要,但AI能替代部分功能。

数据库的核心职责是两件事:存储数据和计算数据。在AI技术飞速发展的背景下,这两项职责确实可能在一定程度上被AI替代。

1. 存储数据:模型是一种有损压缩

当前,人类存储的大量明细数据实际上是无用的。AI模型则可以对这些数据进行有损压缩,从而替代部分存储功能。例如,网站访问日志是否需要长期存储每一个细节?显然不需要。对于大多数网站所有者,他们关心的是流量、页面访问统计等高层次的信息,而Google Analytics等工具正是提供了这些汇总结果。

通过引入模型,我们可以在不存储海量数据的情况下,依然获得比传统统计方法更加全面的信息。例如,一个经过训练的模型可以在用户提出查询时,直接基于模型中内嵌的知识进行回答,免除了存储和计算的开销。这种方法不仅节省存储资源,还能显著提升信息获取的灵活性。

2. 计算数据:模糊计算 vs. 精确计算

数据库擅长精确计算,而AI模型则以模糊计算见长。在过去十年中,不少创业公司尝试使用统计方法进行模糊计算,但并未取得显著成效,原因在于现代数据库已经足够快,模糊计算并未提供足够的效率提升。

然而,大模型的出现改变了这一局面。它们并不以查询效率为卖点,而是通过提升查询表达能力来重塑交互模式。例如:

  • 传统方法:分析Twitter数据需要先将数据导入数据库,再进行词频统计和分布分析,这种方法效率低且结果有限。
  • 大模型方法:通过调用OpenAI的API,直接对实时社交媒体数据进行情感分析,准确率极高且无需额外的数据处理。这一案例表明,在这样的场景中,数据库存储依然有用,但我们可以使用AI来进行计算。
3. AI正在侵蚀数据库在现代应用中的计算地位

大模型逐步蚕食了数据库计算在AI/ML应用中的领地。在传统机器学习应用中,特征工程是模型训练的重要步骤,这通常依赖于如Spark等计算平台(顺便提一下,RisingWave也常用于在线特征工程!)。然而,随着预训练模型的普及,许多场景下的特征工程已变得多余,因为预训练模型已经具备从原始数据中自动抽取特征的能力。

Image

AI的确替代了部分特征工程的需求。

回到最初的问题:“我们真的还需要数据库吗?”答案是肯定的——我们仍然需要数据库。不过,AI将逐步成为人类与数据库交互的媒介,同时也在替代数据库在存储和计算上的部分功能。

看到这里,你或许已经明白为什么我会自我说服,不断拥抱AI了。当一个新兴事物逐步渗透到我们的工作领域,甚至开始侵蚀这一领域的核心价值时,我们不可能对此无动于衷!

当然,数据库依然拥有强大的护城河和庞大的基本盘。当前的大模型主要擅长处理非结构化数据(如文本、图片、语音等),而对结构化数据的处理效率仍然较低。结构化数据通常是高度敏感的私有数据,其特性因场景而异,这使得传统数据库在存储和计算方面依然占据巨大的优势。

尽管如此,未雨绸缪总是明智的。与其等到某一天AI完全抢占数据库的领地,不如现在就主动拥抱AI,让它成为我们工具箱的一部分,助力我们适应这场不可避免的技术变革。

数据库增长靠AI

数据库发展至今,从技术层面来说,几乎已经没有太多秘密可言。目前,全球可能存在上百种数据库。而数据库领域在过去几十年的持续发展,主要依赖于两个核心驱动力:硬件的不断迭代和应用场景的持续丰富。然而,再多的硬件进步、再多的场景需求,其实并不需要上百种数据库。可以预见的是,随着时间推移,数据库领域将不可避免地趋于同质化。

以RisingWave所在的流计算领域为例。在过去四年里,RisingWave一直在发展,而与此同时,我们也看到越来越多的流计算引擎和流数据库涌现。这些产品的设计理念和技术实现大多相似:兼容Postgres协议、采用存算分离架构、优化复杂的运算算子(如Join)、实现流批一体等等。区分点往往集中在产品的成熟程度以及对细节的打磨(当然,细节决定成败!)。幸运的是,RisingWave在这一领域处于领先地位。

但如果把视角拉长到十年甚至更远的未来,在产品方向没有重大突破的情况下,各家的产品大概率会趋于同质化。这种同质化意味着竞争加剧,从而导致厂商利润率逐步下滑,直到稳定在一个较低的水平。这种趋势不仅适用于流计算领域,也同样适用于数据库的其他细分领域。除非有新的硬件或新的场景出现,否则数据库市场的创新步伐将逐渐放缓。事实上,如果你翻阅各大上市数据库公司的财报,或许能从中得出类似的结论。

在摩尔定律逐渐放缓的今天,CPU硬件进步的红利已难以持续,我们必须寻找新的增长点。而AI的崛起显然是一个关键变量。AI将带来更多的数据和更多的场景,这些新数据和新场景很可能会为数据库领域创造新的机会。

即便我们并不直接转向AI领域,也应认识到AI对行业的变革力量,研究它对各行业的颠覆性影响。这种颠覆将催生新的需求,而数据库的新机会、新场景很可能出现在这些被颠覆的行业中。

在我所熟悉的流计算领域,我认为实时推荐和实时搜索可能是未来的重要机会。当大模型能够为人类提供更优质的推荐结果和搜索结果时,势必会有新的创业公司试图颠覆这些领域,而现有玩家也会尝试引入新技术以巩固自己的市场地位。

这些变革正是数据库厂商的机会所在。数据库产品可以成为支持这些实时场景的底层基础设施,为创业公司和行业巨头提供关键技术支持。RisingWave这样的流计算系统,也将在这种新场景中扮演重要角色,助力行业的持续创新。

如何入局AI?

我在AI方面并没有什么天赋,对机器学习的理解也仅限于博士阶段在一些研究课题上的积累。相信对于许多数据工程师来说,平时工作已经相当繁忙,很难抽出时间去深入研究AI。不过,我自己的方法或许可以为大家提供一些参考:

  1. 使用各种AI工具

    我是个喜欢尝试新鲜产品的人,对于有意思的工具,总是愿意付费体验。比如,我不仅订阅了ChatGPT Pro,同时也是Anthropic的付费用户。除此之外,我还花时间研究和使用了Cursor、Replit、Bolt.new等平台。通过亲自体验这些工具,我可以更直观地理解AI目前的能力、局限性以及可能的发展方向。

  2. 多与人沟通交流

    我目前base在旧金山湾区,而旧金山堪称“AI之城”,每天都有许多与AI相关的meetup可以参与。通过参加这些活动,我不仅能结识一些有趣的人,还能听到许多新鲜的观点。此外,我非常感激那些与我线上或线下交流的创业者、投资人和AI从业者们,他们总能分享一些关于AI发展方向的最新资讯。

  3. 大量阅读

    我平时喜欢阅读各种博客和技术文章。对于那些专业性很强的文章或者论文,我通常会借助ChatGPT来帮我详细解读,这大大提高了我的阅读效率——感谢AI!

入局AI并不意味着我们需要从零学习AI算法。我们完全可以从使用AI工具开始,逐步探索它的能力与潜力。对于工程师来说,这不仅是一个更轻松的切入点,也是一种了解AI实际应用场景的高效方式。

总结

2025年已经到来。作为数据领域的从业者,如果你还没有开始接触AI,那么或许该感到一丝焦虑了——毕竟AI的发展速度实在太快,很可能很快就会影响到我们所深耕的领域。不过,你也不必过于担忧。在信息如此发达的时代,每天投入一些时间,就足以让我们在短期内对任何新兴事物建立一个大致的了解。

那么,什么时候才是开启AI之旅的最佳时机?答案是:现在!现在永远是学习和拥抱AI的最佳时机。不要再等待,从今天开始探索AI,未来的无限可能就在眼前。

Image广告时间Image

RisingWave 是一款基于 Apache 2.0 协议开源的分布式流数据库,致力于为用户提供极致简单、高效的流数据处理与管理能力。RisingWave 采用存算分离架构,实现了高效的复杂查询、瞬时动态扩缩容以及快速故障恢复,并助力用户极大地简化流计算架构,轻松搭建稳定且高效的流计算应用。
RisingWave社区:go.risingwave.com/slack

[1]

Self-Driving Database Management Systems: https://db.cs.cmu.edu/papers/2017/p42-pavlo-cidr17.pdf

[2]

AIDB Workshop: https://sites.google.com/view/aidb2023/

[3]

向量数据库?不要投资!不要投资!不要投资! : https://mp.weixin.qq.com/s/gGptu_zoT4lJbZ9-4fQzzg

[4]

Snowflake的博客: https://www.snowflake.com/engineering-blog/cortex-analyst-text-to-sql-accuracy-bi/

[5]

MCP博客: https://www.anthropic.com/news/model-context-protocol