媒体报道 | 从“让人看懂”到“给机器执行”——拓尔思的数据精炼之道
01 被卡住的数据:AI止步于最后一公里
某国有大型银行科技部门的会议室里,一场复盘会让在场的人沉默了很久。
会上讨论的不是某个大模型的评测分数有多高,而是近一年内上线的智能风控助手、信贷审批辅助、客户画像生成三个AI试点项目,为什么一个都没有进入正式生产流程?
模型的能力无可指摘,评测报告显示,三个项目的模型指标都“达标”甚至“优秀”;数据资源更是得天独厚,该行有十几年的交易数据、客户数据、风控数据,体量庞大。
真正卡壳的,是一个基础且隐蔽的环节:数据,真的准备好了吗?
这家银行的遭遇并非孤例,而是当前AI产业落地困境的一个缩影。
模型能力每年跃升一个台阶,算力成本持续走低,但AI真正进入生产系统的速度,却远比所有人预想的要慢。
问题症结不在模型,也不在算力,而在数据层。
高质量、可授权、可执行的行业数据极度稀缺;数据散落在不同系统里“老死不相往来”;传统数据基础设施根本扛不住AI的多模态检索与高并发推理。
三道关卡,每一道都足以让AI止步于演示环境。
沿着一家家企业AI落地的真实路径追下去,一条清晰的产业链逻辑逐渐浮现:数据要支撑AI跑起来,必须依次打通三个关键环节——从“精炼”到“流通”再到“承载”。
数据只有产得出、流得通、扛得住,AI的价值才能被真正释放,而不是只停留在汇报PPT中。
02 从“让人看懂”到“给机器执行” 大模型对数据的需求,与传统BI时代已发生根本变化。 BI场景下,数据治理的核心任务是字段对齐、维度一致、指标口径统一。而大模型要求机器理解字段背后的业务语义、决策逻辑与行动规则。 拓尔思数字经济研究院副院长文雅对此概括道:“过去的数据治理,是让人能查得到、看得懂;现在AI的终点是‘给机器执行’——治理的内涵从字段级对齐,走向语义级的理解和表达。” 03 十六年“笨功夫”攒出的语料资产 拓尔思的解法,是用十六年的时间攒了一套“笨功夫”。 2010年起,自建大数据中心,通过自研“海蜘”采集平台7×24小时抓取互联网多模态数据。 原始数据经清洗、去重、分类、打标、融合、质量打分、敏感过滤、格式统一,最终形成超1亿条数据资源,通过高质量数据治理,已形成涵盖全球内容与知识数据、社会行为与态势数据、产业经济与商业数据、全球实体与关系数据、空间与物理世界数据、认知加工与标注数据六大类别的全域数据资产体系,覆盖200+国家与地区、130+语种。数据日均更新超8亿条,日均API调用超20万次。 这套资产的壁垒有多高?文雅举了一个例子:曾有客户查10年前国家新能源产业政策,主流搜索引擎几乎搜不到,而拓尔思的数据包中非常丰富。 这些十多年前采集的权威信源,至今已无法被任何工具重新获取。 让后来者难以复制的是三重壁垒叠加——时间深度、治理宽度、数据厚度。 多家头部科技企业已采购拓尔思语料用于大模型训练——市场已用采购做了验证。 04 AI眼中的高质量≠业务眼中的高质量 但数据量大不等于AI能用。 文雅对此辨析道:“AI眼中的高质量是统计意义上的——Token多样性、分布均衡性、数据低噪声与高信息密度;企业CIO眼中的高质量则是业务意义上的——准确性、时效性、合规性,以及与具体业务场景的匹配度。 一个追求泛化,一个要求不出错、可解释、可审计。” 05 预训练打底, 后训练进阶,动态本体执行业务 如何弥合这道鸿沟,实现数据从“能用”到“好用”? 拓尔思的策略分两步走。 预训练阶段,通过对语料在政策、标准、产业链、技术等维度的定向配比,确保模型在目标领域获得充分的数据代表性,为行业语义理解奠定基础。 后训练(SFT、RLHF等)让模型从“通用语义理解”进化到“行业语义理解”。 但懂业务不等于能执行业务——业务决策涉及跨系统的数据关联、动态规则、权限流程,这些都无法靠模型自身记忆来完成。 这时候就需要动态本体作为“业务语义的中间层”,把分散的数据字段、业务规则、决策逻辑统一组织起来。 而实现从“懂业务”到“执行业务”的核心工具,正是拓尔思的“动态本体”。 它不是传统知识图谱,而是一套“活的业务语义框架”——将不同数据源中的原始字段、表结构、业务规则,统一映射为机器可理解、可推理的概念、属性与关系,同时接入业务状态变化,推演并触发执行。 正如文雅所说:“动态本体就是将不同部门对同一业务实体的不同表述统一为可被机器理解和推理的语义框架。在动态本体没有真正成熟之前,很多智能体落地还不能直接用于决策。” 06 多智能体协同,把人工介入压缩到20% 方向明确了,但数据清洗和标注占AI项目绝大部分的时间成本,这笔账怎么算? 拓尔思基于多智能体协同治理数据。不同智能体各司其职,承担数据采集、清洗、标注等规则明确的任务,仅在遇到标签不清、阈值模糊等情况时,人才介入。 这套机制将人工介入比例压缩到约20%,清洗效率提升10倍量级。同时,模型推理产生的反馈数据自动回流,驱动下一轮策略优化,形成“数据飞轮”闭环。 07 合成数据:真实为主,合成为辅 至于合成数据,文雅判断克制:“合成数据是真实数据的衍生品,不是万能的。拓尔思始终以真实数据为主、合成数据为辅。” 她补充道,合成数据需警惕“模型崩塌”风险——研究表明,合成数据占比过高时,用其反复训练模型会导致输出质量逐代退化;业界普遍建议合成数据在训练集中占比不超过20%-30%。因此合成数据仅适合定向补充,而非规模替代。


