卡点从模型到数据 AI产业如何破局?

卡点从模型到数据 AI产业如何破局?

  随着模型能力持续提升,AI落地的卡点 ,正在从“模型够不够强”转向“数据能不能用 ” 。

  《中国经营报》记者在近期举行的2026 Inclusion·外滩大会期间的多场论坛上了解到,上述问题正在存量端与增量端同时发生:在存量端,企业手里的数据没有被连接起来;在增量端 ,真正能让模型进步的数据还没有被生产出来。

  IDC中国企业软件市场研究经理王楠在“数智进化:让多模态数据成为AI核心燃料”见解论坛上给出一组预测,到2035年,中国AI数据基础设施市场规模将达到1548.3亿美元 ,相比2025年增长超过10倍;IIDC数据显示 ,2025年企业新生成的数据资产约90%属于非结构化数据,大量数据散落在NAS(网络附加存储)、对象存储等不同系统中。

  在王楠看来,AI正在进入下半场 ,数据能力已成为企业AI落地的核心瓶颈 。

  存量之困:九成非结构化数据难在连接与利用

  “谁掌控了数据,谁就在AI竞争中获得了先机。”华东师范大学原副校长 、教授周傲英在上述论坛上表示,数据已经成为重要的生产要素 ,高质量的AI决策离不开高质量的数据基础,“如果没有高质量的底层数据,任何‘本体建模’都是沙滩上的城堡 ”。

  如今的企业并不缺数据 ,缺的是让数据被AI理解和使用的能力 。王楠判断,未来的竞争在于谁能最先形成覆盖“数据管理—数据智能—数据服务—Agent消费”的完整闭环 。路线上则是构建多模态数据底座,结合行业知识与场景数据 ,通过小模型微调实现可控的生产级AI落地。

  OceanBase高级副总裁翁睿在论坛上表示,AI时代的数据底座需要向一体化、多模态方向演进,让结构化、半结构化 、非结构化以及多模态数据能够被统一治理和关联使用。据翁睿介绍 ,客户诉求已经发生变化:“过去 ,客户要的是‘能存数据的库’,现在,客户要的是‘懂数据、用数据、驱动智能的引擎’ 。”

  数据能否被有效关联和调用 ,也开始体现在准确率 、运营成本等具体指标上。

  据OceanBase在论坛上披露的案例,一家国有大型银行通过引入语义层让系统理解业务意图,智能问数准确率从70%提升至98%;一家超大型财险公司 ,统一关联责任认定 、理赔、投保、路网 、气象、交通流量等数据后,用于分析车辆事故高发路口及成因,推动事故发生频率、理赔成本与车险综合成本率同步下降。

  随着AI进一步进入具体业务流程 ,数据还开始影响模型调用成本 。蚂蚁阿福技术负责人魏鹏在现场介绍,OceanBase已贯穿阿福从评测 、记忆构建到在线服务的核心数据链路,其中记忆与上下文共享可节省30%以上的Token ,降低60%—80%的对话成本。这意味着数据的组织方式不仅影响效果,也开始直接影响其运行成本。

  OceanBase CEO杨冰对这一变化的概括是:进入AI时代,企业关注的重点正从数据库本身的性能、成本和可靠性 ,转向数据背后不同业务对象之间的关联 ,以及它们与真实世界之间的关系,“真正的商业价值,往往就藏在那些尚未建立连接的数据之间 ” 。

  当智能体开始替用户执行任务 ,需要被校验的数据又多了一类——用户意图。

卡点从模型到数据 AI产业如何破局?

  蚂蚁集团风控安全负责人陈锣斌表示,相较传统支付风控,Agent场景增加了对智能体身份、运行环境 、委托链路和用户意图的校验 ,系统复杂度会有所提高;与此同时,AI也可以提升风险识别和策略攻防对抗的效率和能力,“我们会在保障安全的前提下 ,通过模型、工程和分层管控持续优化整体成本与用户体验 ”。

  蚂蚁大安全CTO陈亮则表示,其中的关键是让身份、意图 、授权和交易结果能够相互校验,金额明显异常相对容易识别 ,品类、口味或偏好出现偏差,“则更考验Agent对用户意图的理解” 。

  数据链路本身是否打通,同样构成约束。Naughty Labs CEO杨天润对记者表示 ,当前很多任务Agent执行不通 ,原因在于“整个数字世界是给人类建设的”,界面与数据链路并非为Agent设计,Agent既难以获得一个人完整的上下文 ,也难以跨生态调用本应可用的数据。

  增量之难:具身智能的数据飞轮尚未转起

  如果说企业面对的是存量数据缺乏连接,那么具身智能面对的是能让模型进步的增量数据如何被生产出来 。

  一家投资具身智能领域的创投公司相关负责人表示,相比大模型领域 ,行业对于“什么是优质的具身智能数据 ”尚未形成同等程度的共识 。在其看来,大模型领域对于何种数据能够有效提升模型能力已有较多实践积累,而具身领域仍需头部公司自行烧算力、堆科研人员去探索。

  产业端给出的诊断更具体。蚂蚁灵波首席数据科学家黄用韬在具身智能论坛上表示 ,数据飞轮尚未真正转起来的一个关键原因,是进入真实生产和服务场景的机器人还太少,大量机器人仍用于科研 、数采或展示 ,真实工作中的失败与反馈没有充分回流 。

卡点从模型到数据 AI产业如何破局?

  黄用韬将数据质量分为两层,他表示,掉帧 、画面异常、时钟不同步等属于工程底线;越过这条线之后 ,什么是“好数据”必须由训练目标决定。关键在于把模型当前的问题转化为可量化的数据筛选条件 ,快速组合出相应数据集,再通过训练结果验证判断是否正确,“这种能力 ,无法靠买一批数据直接获得”。在他看来,数据飞轮真正转起来的标志,是行业开始“做减法 ”——能够判断不需要哪些数据 。

  围绕如何让数据产生反馈 ,同场论坛的其他参与者给出了各自的路径。光轮智能(北京)科技有限公司副总裁张建伟将评测放在闭环的关键位置:先用仿真评测规模化发现问题,针对问题定向补采与优化,再通过真实部署与反馈检验模型效果 ,并把新的失败案例带回训练。

  觅蜂科技副总裁李茂青则主张对数据分级使用,精确标注的数据服务模仿学习,场景和语义丰富的数据帮助模型理解世界 ,判断一种数据是否有价值,最终要回到“它究竟能帮助模型学到什么” 。

(文章来源:中国经营报)

©版权声明
THE END