共计 1155 个字符,预计需要花费 3 分钟才能阅读完成。
万亿市场背后,AI 数据基础设施的竞赛已经开始
大模型能力快速逼近应用需求的同时, 一个反直觉的现象正在出现: 企业买好了模型、租好了算力 ,AI 项目却卡在了从试点到生产的那一步。真正拖住 AI 规模化落地的, 可能不再是模型本身, 而是数据。
📌 从拼模型到拼数据: 瓶颈正在换位置
但到了 2026 年, 情况变了 。邓白氏覆盖 32 个国家 1 万家企业的调查显示,97% 的企业正在推进 AI 项目, 却只有 5% 认为自身数据做好了充分准备。Forrester 的研究也指出, 大部分 RAG 实施失败可以追溯到数据质量问题, 而非检索算法或语言模型本身。
🔍 数据的使用方式变了, 传统架构跟不上了
- 过去数据主要服务业务系统和人, 现在 Agent 也成了数据的使用者;
- 过去数据库主要处理结构化数据, 现在文档、图片、音视频、向量等非结构化数据不断涌入生产系统;
- 过去数据能存能查就够了, 现在 AI 需要的是实时、统一、可理解、可调用的数据。
💡 AI 数据基础设施: 一个万亿市场正在打开
IDC 将这一新市场定义为 AI 数据基础设施, 划分为三大领域:AI 数据平台负责多模态数据统一管理 ;AI 数据智能利用 AI 提升数据治理和分析效率,2025 至 2030 年复合增长率达 48.2%;AI 数据服务从传统标注走向知识库运营、评测数据、合成数据等持续性服务, 复合增长率 30.7%。
市场规模方面,2025 年中国 AI 数据基础设施市场约 149 亿美元 , 预计 2030 年达到 738 亿美元, 到 2035 年有望达到 1548 亿美元, 约合 1 万亿人民币, 较 2025 年增长超过 10 倍。作为对比, 中国分布式事务型数据库市场 2030 年预计约 129.3 亿元人民币。
两个数字的差距, 反映的不只是规模 , 而是市场边界正在扩展: 数据库厂商面对的已不只是原来的数据库市场, 而是一个向更大范围数据基础设施延伸的新市场。
📊 玩家从不同方向涌入, 终点都是企业 AI 数据底座
IDC 将市场玩家分为三类: 云厂商从模型和算力向数据底座延伸; 数据库和湖仓厂商从企业核心数据底座向语义、知识和 Agent 扩展 ; 独立 AI 数据软件商从向量、治理、特征工程切入。三类厂商从不同控制点进入同一赛道, 最终都要回答同一个问题——谁能先形成从数据管理到 Agent 消费的完整闭环?
以 OceanBase 为例, 其在分布式数据库基本盘上已位居中国市场第一 , 同时正在向湖库一体、多模态数据和 AI 应用延伸。据彭博报道,OceanBase 正在进行外部融资,2026 年年化收入已超过 14 亿元, 同比增长约 70%。
🚀 小结
AI 项目里大部分工作其实和模型无关, 都在处理数据 。当所有人都在抢 GPU 的时候, 那些沉下心把企业数据底座做扎实的公司, 会在下一个阶段拥有不一样的位置。毕竟, 模型可以调用很多家, 但企业自己的数据, 只有一份。