先锋 趋势 方法 投研 作者
Vol.84 数据不再是“后台的沉默基石”:OceanBase 与 00 后开发者眼中的 AI 变局
返回节目精读

Vol.84 数据不再是“后台的沉默基石”:OceanBase 与 00 后开发者眼中的 AI 变局

摘要

  • 大模型竞争正从“吃尽公共语料”转向把企业私域数据接入业务流程,数据因而成为下一阶段落地的关键约束。 日照认为语言预训练数据“应该是基本上都用得差不多”,而企业最核心的数据不会被训进大模型;真正未解的是如何管理、检索这些数据,并把它们与模型能力融合进业务流程。庄明浩援引一份 MIT 报告称,去年第三、第四季度有“百分之九十五”的企业 AI 投入效果不理想,但双方更倾向于把它理解为实施仍早,而非产业已被证伪。
  • 预训练的边际优势没有消失,而是从数据规模转入数据质量、工程细节、复现与快速迭代。 日照以 Google Gemini 3 为例:大家可能用了相似数据,但它“可能是预训练”做得更好,胜负来自逐条处理数据和稳定 infra。语言之外,word model、embodied 等方向的数据仍“相当有限”,因此数据、算法、算力仍会“左脚踩右脚”交替抬升能力。
  • 企业 AI 的控制平面正由单一向量库升级为混合检索与上下文工程。 OceanBase 的赛题从上一年的向量数据库转向混合检索,并涉及向量、全文、图、标量及半结构化索引的组合,还尝试在数据库中直接调用 AI Function。背后的现实是:CEO 已经说“我要用大模型”,但 CTO、CIO 面对没有统一评估、语言和方案的市场,往往仍是“我不知道怎么用”。
  • 比赛中的性能跃迁说明,早期 AI 数据栈的收益可能更多来自执行流程重构,而非传统局部优化。 杨同学所在队伍从约 600 分起步,看到“不要有小情绪”队冲到约 1,300 或 1,600 分后改写执行流程,最终达到约 7,100 或 7,200 分;吴同学所在队伍靠索引层求交把性能提高十倍,再逐层优化全文扫描。参赛者的原话很传神:“他们叫‘不要有小情绪’,结果我们有小情绪了。”
  • 幻觉治理不能只看答案对不对,还必须把来源、文档和页码做成可验证的链路。 学生方案先重写用户问题、做混合检索,再重排序;当答案正确但引用“始终在飘”时,又按 chunk 先定位文档、再定位页码。日照借大脑和类似海马体的外部记忆作类比,认为数据库可以保存固定信息并按需读取,同时改善经济性、效率和可信度。
  • AI Coding 已经改变开发速度,但核心能力正从“谁敲出来”转向谁能定义需求、审查结果并持续创新。 杨同学原本坚持手写,后来看到队友吴敬华用 GPT 分析代码、用 Claude 实现功能,在自己尚未理清前因后果时已做出一版功能,遂转而拥抱 AI。日照仍强调严谨代码“里面是有坑的”,需要强工程师 review;OceanBase 的判断更直接:“最核心的资产其实是员工,而不是员工写的那些代码。”
  • Continual Learning 与 Agent 商业化都将沿两条速度不同的路线推进。 模型内部持续学习目前仍缺少可预测的突破,做几次 LoRA 后结果可能不可预测,仍需要人工查看;数据与模型通过持续上下文迭代,则被日照视作更实用且“正确的方向”。通用 Agent 可能“一年增长十倍”,企业 Agent 却更像 To B:假设原先增长 20%,AI 或把它提到 30%—40%,不会骤变为 200%,但可以“连续增长二十年”。
  • 开源正在从技术传播方式变成中国 AI 工程能力参与全球竞争的产品与分发战略。 OceanBase 2010 年始于蚂蚁内部,2020 年后公司化,次年开源;这并非直接把内部代码放出去,还要解除蚂蚁依赖、修改代码和补齐文档。日照把 2026 年亲自推动 OceanBase 开源生态走向全球作为目标,而金融、医疗及泛搜索、风控、客服被视为私域数据 ROI 会较早显现的行业与场景。

精读

1. AI 的下一阶段问题被重新归结为数据问题

  • 庄明浩回看自己对 2025 年的总结:这一轮模型主要在解决激励模型、记忆和 benchmark 三类问题,而它们大多可以继续追溯到数据层。
  • 2025 年被不少人称为“强化学习的一年”;进入 2026 年,行业又开始谈 continual learning、online learning 或自主学习。定义仍然混乱,但庄明浩认为,无论强化学习继续演化还是在线学习真正出现,数据的重要性都会进一步上升。
  • 这轮 AI 常被解释为工程能力的胜利。主持人的追问是:当“工程”具体落到模型公司每天处理的任务时,数据是否已从辅助性的后台角色走向模型进步的中心位置?

2. 公共数据支撑了通用应用,私域数据决定企业渗透

  • 日照把应用分成两个阶段:第一阶段使用公共数据,ChatGPT、Coding、纹身图和纹身视频等依赖公共数据的场景因此容易产品化,也较容易在不同企业之间泛化;第二阶段则要进入每家企业各不相同的私域数据。
  • 私域数据“一定不会被训到大模型里面去”,因为它往往是企业最核心的资产。难点由此变成:如何管理这些数据,并把它们同公有数据训练出的推理能力结合,真正嵌进业务流程。
  • 庄明浩援引 MIT 在去年第三、第四季度的一份报告:约“百分之九十五”的企业 AI 投入实施效果不理想。双方没有据此判定泡沫破裂——从 2022 年底 ChatGPT 出现,到 2024、2025 年才开始部署,组织和系统融合本来就需要时间。

3. 预训练竞争已从“有没有数据”转向“能不能把同一批数据用好”

  • 日照的判断带着边界:语言类预训练数据“应该是基本上都用得差不多”,但 word model、embodied 等方向的数据仍相当有限,需要新的方法。
  • 即使面对相似语言数据,质量工程仍可能拉开模型差距。他以 Google Gemini 3 为例,认为其效果强,“最核心的一个做得好的地方可能是预训练”——逐条处理数据问题、调好琐碎细节,并非简单扩大语料规模。
  • 这种工作还要求稳定 infra:结果要可复现,实验要快速迭代,算法工程师才能持续调数据。庄明浩把模型、数据、预训练与强化学习的互相推动形容成“左脚踩右脚,自己把自己踢上去”。

4. 大模型让过去较难利用的数据进入更广泛的处理体系

  • 日照并不认同数据今天才变重要:“对于真正一流的科技公司,它其实一直以来都是最核心的位置。”大模型带来的变化,是“把原来用不了的这些数据也能用了”,从结构化数据扩展到文本、视频、音频等数据。
  • 庄明浩把数据库和大模型概括为数据处理体系的两个核心组件,并提出数据库要处理更多多模态、非结构化数据,同时利用大模型的能力简化数据库和用户操作。
  • 庄明浩又把语言、多模态和 Coding 比作原本分开的德州扑克桌;随着图片等内容开始承载逻辑、搜索结果、故事和前因后果,它们在用户眼里逐渐变成“一张大桌子”。底层技术路线可以不同,但用户只等待真正泛化的方法出现。

5. 企业 AI 的首要瓶颈不是模型价格,而是没有标准化

  • DeepSeek 把使用成本明显降下来后,企业需求迅速升温。日照观察到,“用大模型的人其实都是 CEO”,CEO 说“我要用大模型”,下面的 CTO、CIO 却常回答“我不知道怎么用”。
  • 数据库曾通过标准化推动信息系统普及;企业大模型目前既没有统一评估体系,也没有标准语言、构建方式和标准解决方案,效果又高度 case by case。对一般企业而言,使用门槛依然很高。
  • OceanBase 选择从数据与模型融合入手,让更多企业逐步解决真实使用大模型时遇到的问题;行业解法积累到一定程度后,才可能自然形成行业方案和标准。

6. 数据库竞赛从向量检索转向了上下文工程

  • OceanBase 上一年的题目聚焦向量数据库:当时模型能力相对弱,常见方案是通过 embedding 和 RAG 补充信息。到了今年,赛题升级为混合检索,还增加了一道 React 题目。
  • 日照认为业界会从单一向量和 embedding 走向“上下文工程”:向量、全文、图、标量和半结构化索引共同参与搜索,再与模型能力组合;数据库还可能通过 AI Function 直接调用模型。
  • 比赛虽然加入了 AI 相关业务场景,但到第 5 年仍专注数据库内核。出题既要贴近当前应用,又必须保留足够区分度,目标是研究如何针对 AI 场景优化内核,并培养底层数据库内核和基础软件研发人才。

7. 查询重写、混合检索和重排序组成了学生版检索链

  • 杨同学所在队伍先把用户问题重写,让近义表达、缩写和全称更显性,再进入混合检索;拿到候选内容后继续重排序,以提高语义相关性并减少幻觉。
  • 用户问题对参赛者是“盲盒”,因此方案不能只针对已知问法调参。吴同学所在队伍参考了 OceanBase 的实现,但坦言做的是“比较粗糙”的版本,重点是先验证整条链有效。
  • 这套处理还必须兼顾效率:路径不能为了准确率无限膨胀。数据库内核面对的目标被概括得很朴素——性能要快,数据要准确,同时让用户尽量感觉不到底层复杂度。

8. 一次执行流程重构把成绩从约 600 推到 7100 以上

  • 杨同学所在队伍最初做到约 600 分,判断传统优化已接近 600—700 的上限;两个队员玩完游戏回来,却发现“不要有小情绪”队冲到了约 1,300 或 1,600 分。队内反应是:“他们叫‘不要有小情绪’,结果我们有小情绪了。”
  • 他们由此判断,对手用的不是通常的优化思路,遂从整个执行流程下手。杨同学先说最终达到约 7,700 分,随后又改口为约 7,100 或 7,200 分,保留了成绩表述的不确定性。
  • 吴同学所在队伍曾长期没有性能提升,后来用索引层求交把速度提高十倍以上,再向下优化全文扫描,最终形成三到四层方案,成绩接近 7,100。答辩时各队才发现,实现路径“大相径庭”,并不存在唯一模板。

9. AI 数据库把成熟的确定性系统重新打开了

  • 日照回顾,传统数据库主要处理交易和分析,理论与经验经过多年沉淀,方法变革周期很长;数据与 AI 结合后,很多问题转化成“怎样从上下文找到与大模型更匹配的东西”。
  • 搜索结果不是“一加一等于二”式的百分之百精确,领域又处于早期,方法尚未定型。评委有时也想不到学生采用的路径,这使比赛从单向评审变成互相学习,也让数据库变得更加开放。
  • 日照还认为,AI 数据库更多依靠年轻人,已经不是“老登”的天下。

10. 幻觉治理的底线是答案和出处必须同时正确

  • 日照把模型类比为具有推理能力的大脑,但仅有推理还不够,还需要类似“海马体”的外部记忆。数据库把固定信息保存下来,模型遇到问题再读取,既降低成本,也避免每次都重新计算。
  • 参赛者遇到的典型问题是:回答内容看似正确,关联文档和页码却“一直在飘”;即使出题方增加视觉模型,漂移仍未消失。学生直言,这在业界会是“非常严重的隐患”,因为无法区分检索所得与模型猜测。
  • 他们最终先依据 chunk 对文档排序,再在最可能的文档内定位页码,用多层位置确认补足生成模型。不过团队也承认,数据量放大后方案考虑不够周全,受时间限制,相关知识题表现并不理想。

11. AI Coding 让传统手写派在一次决赛中改变了立场

  • 杨同学有 ACM 背景,赛前更相信“自己写的东西会更牢靠”,担心 AI 生成代码会导致理解不清。他所在团队通过 PR 协作,每个人都要读懂彼此修改后才合并。
  • 转折来自队友吴敬华:他用 GPT 分析代码,再用 Claude 直接实现功能;杨同学还在梳理前因后果时,对方已经做出一版功能发给团队。这个速度差促使杨同学开始学习怎么向 AI 讲清问题和需求。
  • 吴同学则较早开始使用 AI。他认为近一年的最大变化是编程 IDE 能直接读取整个源码上下文,不再需要把代码逐段摘出、复制给模型,阅读和改造大型项目因此明显提速。
  • 但手艺并未完全失效:简单错误由人扫一眼修掉,比反复消耗 token 更便宜;团队坚持细读 AI 写出的代码,理解执行流程,而杨同学也把这视为后来能够反超的原因。
  • 庄明浩还把这种变化延伸到 PPT:AI 不只是排版,而是能听懂逻辑、把逻辑可视化。他原本坚持逐页手工制作 PPT,如今每两三个月做一次 PPT 时,已经大量使用 AI 生成配图,并感到“手抠 PPT”的空间也在被不断挤压。

12. 企业开发的约束从写代码转向审查、协作与责任归属

  • OceanBase 内部 AI Coding 使用率很高,前端开发、生成实验性代码和部分中间件效率尤其突出;但日照强调,特别严谨的代码目前仍有明显问题,“直接做出来的东西里面有坑”。
  • 因此既要学会用 AI,也要由能力较强的人 review,并建立适配 AI Coding 的开发、测试和产品协同方式。日照把它称为传统手艺之上的“新的手艺”。
  • 庄明浩担心公开 coding 工具可能带来安全和隐私问题。日照没有展开工具安全,而是强调 OceanBase 的核心代码完全开源,因此“最核心的资产其实是员工,而不是员工写的那些代码”;真正的壁垒是组织持续创新、解决客户问题并在故障时兜底的能力。

13. Continual Learning 有两条路线,模型内化仍不可预测

  • 日照把前述持续学习分成两层:一是让模型自身持续内化新知识,二是让模型与可实时读写、持续演进的数据库结合,通过外部上下文更新能力。
  • 第一条路线“到目前为止还是没有一个很大的突破”。模型做几轮 LoRA 后,最终结果基本不可预测,仍需要人查看,难以形成稳定的自动化闭环;日照提到一些新实验室,比如 Thinking Machines Lab,也在尝试,但理论突破是否必然出现,他没有给出确定答案。
  • OceanBase 选择先做更实用的第二条路线:以混合搜索和持续迭代的上下文连接数据与模型。日照承认这件事也“没有把整个事情完全做明白”,但判断它“一定是一个正确的方向”,对大小企业都有效。

14. 开源与产业应用在 2025 年真正汇流

  • 庄明浩观察到,早期开源研究、GitHub 热点和产业应用曾各做一套;到 2025 年,Agent 框架、infra 与数据层项目的增长、研究热点已经和产业趋势高度匹配,“开源并不等于公益”,也不等于没有商业化。
  • 日照解释,AI 早期更偏创新,与传统技术栈存在 gap;当企业开始要求既有应用智能化,两套体系必须结合,原有数据库和基础软件也就不得不拥抱 AI。
  • 主持人把“开源”视为 2025 年中国 AI 的候选关键词,甚至认为它既是中美 AI 竞争的结果,也可能反过来成为原因。日照的解释是:中国未必首先发明算法,但擅长把工程优化做到极致,开源是这类产品面向全球市场、借生态继续迭代的有效方式。

15. OceanBase 的开源不是代码发布,而是从内部系统变成通用产品

  • OceanBase 2010 年开始建设,前十年主要是蚂蚁内部项目,2020 年后公司化,次年开源。开源并非把仓库直接公开,还要去掉对蚂蚁内部代码的依赖、修改质量不足的部分并补齐外部文档。
  • 从内部支撑转向开放产品、销售和客户交付,角色与目标都会改变。日照认为决定成败的是“这个产品的初心是什么”:OceanBase 创立第一天就以“做世界级的数据库”为目标,因此设计从一开始便朝通用化推进。
  • 日照称 OceanBase、seekdb 以及上层探索工具 Power Lag、Power Memory 都采用开源路线,并使用 Apache 2.0 许可证。团队希望外部开发者在此基础上把数据—模型融合做得更好。

16. 年轻开发者的机会扩大,安全边界也同步扩张

  • 杨同学感受到,传统安全较偏固定规则和封闭结构;模型、多模态以及企业业务连接后,大模型安全、多模态安全等问题把安全边界拉得很大,目前仍处于快速发展、尚未收敛的阶段。
  • 庄明浩提醒,一旦幻觉进入交易和权限链,错误可能直接转化为操作风险。杨同学希望继续研究大模型安全;他接触到的密码学方向是全同态加密,即在加密数据上计算,解密后得到正确结果。
  • 吴同学在银行工作,原本是后端工程师,借助 AI 已同时接触 Java、C++ 和 React,逐渐变成全栈。他承认对未来方向仍“非常模糊”,但也考虑成为独立开发者,做一些小而新奇的产品。
  • 日照认为数据库人才的画像有变也有不变:数据库基本理论和基础 coding 能力仍然重要,先学会老手艺,才能学好把 AI 用好的新手艺。

17. Agent 会按两种速度增长,2026 年的胜负手是把路径沉淀成产品

  • 日照相信 2026 年 AI Agent 会进一步爆发,并真正进入企业业务流程。通用 Agent 依靠通用能力会发展很快;与企业流程深度结合的 Agent,则需要处理数据、权限、模型和既有系统,周期会更长。
  • 他引用业界常说的通用 Agent “一年增长十倍”,并用 To B 与 To C 的差别解释增速:假设传统 To B 年增 20%,AI 可能把它推到 30%—40%,但不会骤然变成 200%;优势是这种增长可以“连续增长二十年”,而消费级爆发可能两年便结束。
  • 场景上,泛搜索、风控、客服已处在大规模采用前期,企业即使尚未用好,也已有迫切需求;行业上,金融、医疗拥有高价值私域数据,更容易与业务结合并产生明确 ROI,日照判断这些行业会先爆发。
  • OceanBase 的 2026 年目标有两层:把数据与模型结合的路径沉淀为产品和系统,帮助企业真正走通并在未来几年复制;同时把目前主要立足中国的开源生态推向全球。
  • 杨同学期待找到有意思的正式工作,也考虑成为独立开发者;吴同学期待 AI for Science 更严谨地协助论文研究,并希望成为开源社区 committer。吴同学还说:“代码始终是人写的”,只要用心去看,迟早都能看懂。