欢迎大家关注“凯哥讲故事系列”公众号

凯哥讲 AI智胜系列政策解读 × 方法论升级 × 产业落地
出品:凯哥讲 AI · 智胜系列 | 主题:国家数据局《关于推进行业高质量数据集建设行动的实施方案》专业解读

核心判断:这份文件真正重要的地方,不是提出“强基扩容、标注攻坚、提质增效、应用赋能、管理服务、价值释放”六大行动,而是国家层面把行业高质量数据集建设从“数据资源建设”提升为支撑“人工智能+”落地的系统工程。
未来竞争的重点,不再是谁的数据更多,而是谁能把数据变成模型可用、场景可验、价值可释放、运营可持续的高质量数据集。
国家数据局印发的《关于推进行业高质量数据集建设行动的实施方案》明确提出,行业高质量数据集是经过采集、加工等数据处理,可直接用于开发和训练人工智能模型,并能有效提升模型性能的行业数据集合,包含行业通识和行业专识数据集。
这一定义非常关键。过去很多单位谈“数据建设”,讲的是数据资源目录、数据库、数据治理、数据资产台账。现在政策讲“高质量数据集”,评价标准已经发生变化:
不是有没有数据,而是数据能不能直接用于模型;不是数据规不规范,而是能不能提升模型性能;不是建没建平台,而是有没有形成应用价值闭环。
文件还提出,到 2028 年底,要建成一批覆盖重点领域、经过应用验证的行业高质量数据集,打造一批数据驱动人工智能创新发展的典型应用场景,培育一批创新型数据企业和专业人才,形成一批行业高质量数据集建设工具和标准。
这意味着,高质量数据集建设不是短期试点,不是局部项目,而是未来三年数据要素与人工智能融合发展的主线任务。
更值得注意的是,文件在总体要求中提出要形成:
“场景牵引数据、数据驱动模型、模型赋能应用、应用创造价值”的“数据飞轮”。
这句话是全文的灵魂。它说明高质量数据集不再是数据部门自己做数据,而是要围绕场景、模型、应用、价值形成闭环。
凯哥讲 AI 的“六定方法论”,本质上是一套把高质量数据集从政策要求转成工程实施的操作系统。
六定方法论 | 要回答的问题 | 对应的建设动作 |
|---|---|---|
价值定场景 | 为什么建?服务什么业务价值? | 场景识别、价值评估、急用先行、应用牵引 |
场景定模型 | 场景需要什么模型能力? | 模型任务卡、能力目标、输入输出、评测指标 |
模型定数据 | 模型需要什么数据才能变强? | 数据需求单 DRS、覆盖率矩阵、数据源和授权 |
数据定算子 | 数据如何加工成模型可用样本? | 清洗、增强、对齐、标注、质检、合成、配比 |
算子定平台 | 如何规模化生产和治理? | 血缘、版本、权限、审计、协同、可信流通 |
评测定运营 | 如何证明有效并持续释放价值? | 质量测评、应用验证、交易流通、资产化、持续迭代 |
这次国家数据局文件虽然没有直接使用“六定”这个词,但政策逻辑与六定高度同构。
文件讲“需求牵引、急用先行、应用验证、安全保障”,对应的是价值定场景;文件讲面向预训练、指令微调、强化学习、测评等阶段建设多模态数据集,对应的是场景定模型和模型定数据;文件讲清洗、增强、标注、对齐、质检、合成数据,对应的是数据定算子;文件讲依托国家数据基础设施、可信数据空间、隐私保护计算、国家数据集管理服务系统,对应的是算子定平台;文件讲“数据质量验证+模型应用反馈”“一次测评、全国互认”“数据集商业化、资产化、词元交易”,对应的是评测定运营和价值释放。
因此,六定不是另起炉灶,而是对国家文件落地路径的工程化翻译。
很多人读政策,会把“六大行动”理解成六个并列任务:强基扩容、标注攻坚、提质增效、应用赋能、管理服务、价值释放。
但如果用六定方法论来看,六大行动不是分散任务,而是一套完整的数据飞轮。

图 1|政策六大行动与六定体系映射:从文件要求到建设方法的系统转换
文件提出,要聚焦科学研究、工业制造、农业农村、智慧能源、交通运输、金融服务、医疗卫生、教育教学、电子商务、人力资源、文化旅游、应急管理、气象服务、绿色低碳、公共安全、城市治理、住房建设、自然资源、社会信用等重点领域,以及低空经济、具身智能、智能驾驶、智慧海洋、生物制造等创新领域,加快推进行业高质量数据集建设。
这不是简单地让大家“多建数据集”。真正的问题是:哪些行业最急?哪些场景最痛?哪些模型最缺数据?哪些数据最能带来模型性能提升?
所以,强基扩容首先对应的是 价值定场景 和 模型定数据。过去很多数据项目习惯“先盘数据,再找应用”,结果往往是数据很多、价值不清。新政策的逻辑是反过来的:
先找场景,再定义模型;先定义模型,再反推数据。
文件对数据标注的定位非常高,提出数据标注是“将知识和经验注入到训练数据的过程”,并强调从“以人为主”向“人机协同、专家深度参与”的多层次标注模式转变。
过去一提标注,很多人想到的是框框、画线、打标签,是劳动密集型工作。但在大模型和行业模型时代,真正有价值的标注已经变成专家经验结构化、行业知识显性化、业务规则可训练化、复杂推理过程样本化、评价标准可计算化。
也就是说,标注不再只是“给数据贴标签”,而是在给模型注入行业知识。这对应六定中的 数据定算子。
文件提出,要构建符合结构完整性、内容多样性、标注准确性、模型适配性等质量标准、满足 AI-Ready 的高质量数据集,并通过数据智能过滤、配比、合成等技术,构建更精、更强的高知识密度数据集,降低训练推理成本。
这里最重要的关键词是:模型适配性。传统数据治理关心完整性、准确性、一致性、及时性、唯一性。这些当然重要,但已经不够。面向 AI 的高质量数据集,还必须回答是否覆盖模型任务边界、是否覆盖长尾场景、是否能提升模型泛化能力、是否能支撑推理规划决策、是否能降低幻觉偏见和错误输出、是否能支撑评测和持续迭代。
数据质量的终点,不在数据表里,而在模型效果和业务结果里。
文件提出,要坚持行业高质量数据集建设与实际应用深度融合,以模引数、用数赋模,推动形成“场景—数据—模型”协同发展的良性循环。
过去常见逻辑是:建平台 → 汇数据 → 做治理 → 等应用。高质量数据集的新逻辑应该是:找场景 → 定模型 → 反推数据 → 加工数据 → 验证模型 → 运营迭代。
应用赋能对应六定中的三个关键环节:价值定场景、场景定模型、评测定运营。高质量数据集不是一次性交付物,而是要在应用中不断生长。
文件提出,要加强覆盖数据采集、清洗、加工、标注、质检、测评、迭代、审计等全生命周期的数据集管理服务能力建设,并建设“物理分散、逻辑集中”的国家数据集管理服务系统,实现数据集目录、供需等信息互联互通。
真正可运营的高质量数据集,至少要管住七件事:来源可追溯、授权可证明、过程可审计、版本可管理、质量可评价、效果可验证、价值可计量。
这对应六定中的 算子定平台。平台不是为了“看起来先进”,而是要承载数据集全生命周期的工程流程、质量门禁、版本血缘、权限审计和价值运营。
文件第七部分专门提出“价值释放行动”,包括数据集商业化、资产化、交易流通、订阅模式、商场模式、定制模式、API 调用、模型化解决方案、全栈服务、词元交易、数据集质押融资、作价入股、资产证券化、数据信托、数据保险等内容。
这意味着国家已经不满足于“把数据建起来”,而是要推动形成:
数据集可评价、可交易、可定价、可入表、可融资、可持续运营的价值体系。
这对应六定中的 评测定运营。没有评测,就没有可信质量;没有可信质量,就没有市场定价;没有市场定价,就没有交易流通;没有交易流通,就谈不上资产化和价值释放。
国家政策行动 | 文件中的核心要求 | 六定对应关系 | 项目落地抓手 |
|---|---|---|---|
强基扩容 | 拓宽数据供给渠道,丰富数据类型,建设行业高质量数据集 | 价值定场景、模型定数据 | 场景清单、数据资源清单、数据集需求清单 |
标注攻坚 | 人机协同、专家参与、智能化标注、专业知识标注 | 数据定算子 | 标注规范、专家机制、模型预标注、质检算子 |
提质增效 | AI-Ready、质量标准、清洗增强、合成数据、测评互认 | 模型定数据、数据定算子、评测定运营 | 质量门禁、覆盖率矩阵、合成数据方案、测评报告 |
应用赋能 | 以模引数、用数赋模,形成场景—数据—模型闭环 | 价值定场景、场景定模型、评测定运营 | 应用验证、模型任务卡、数据飞轮运营机制 |
管理服务 | 全生命周期管理,国家数据集管理服务系统,目录互联互通 | 算子定平台 | 数据血缘、版本管理、权限审计、平台接口 |
价值释放 | 交易、订阅、API、资产化、词元交易、数据采买预算 | 评测定运营 | 数据集卡片、定价机制、交易挂牌、资产登记 |
这张表说明一个问题:
政策给出方向,六定提供抓手,场景验证决定成败。
行业单位推进高质量数据集建设,不能把它做成普通数据治理项目,也不能把它做成一次性验收项目。更合理的打法,是按照六定体系形成一套可执行路线图。

图 2|从政策到落地:六定体系下的实施路径与数据飞轮闭环
01
建立高价值场景池,优先选择政策导向强、业务价值高、数据基础较好、模型应用明确、可验证可复制的场景。
02
形成模型任务卡,明确模型类型、输入输出、任务边界、性能指标、推理约束、安全要求和业务验收指标。
03
编制数据需求单 DRS,反推模态、样本、标签、长尾覆盖、授权范围和质量门槛。
04
构建数据加工流水线,包括接入、清洗、脱敏、标注、质检、增强、合成、配比和数据集划分。
05
建设轻量化、可扩展平台,支撑数据目录、血缘、版本、权限、质量门禁、标注协同、API 服务和审计追溯。
06
建立质量测评、模型效果测评、应用验证、成本收益评估、数据集卡片、交易和资产化材料。
交通行业天然适合高质量数据集建设。它有丰富场景:公交、地铁、高速、港口、物流、停车、信号、枢纽、低空、自动驾驶;它有多模态数据:视频、图像、轨迹、路网、票务、卡口、感知、点云、时序、气象;它有强模型需求:预测、识别、调度、问答、仿真、决策、智能体;它还有明显公共价值:安全、效率、低碳、韧性、服务民生。
因此,交通行业不能只把高质量数据集理解为“数据治理专项”,而应将其作为:
交通行业人工智能基础设施、可信数据空间、行业模型能力、数据要素价值释放的共同底座。
尤其是在自动驾驶、低空经济、城市交通治理、跨境物流、综合交通运行监测、交通大模型、交通智能体等方向,高质量数据集会成为决定行业 AI 能不能真正落地的关键资源。
需求不只是数据清洗,而是场景策划、数据盘点、模型任务设计、数据加工、标注质检、合规治理、平台建设、评测封装、运营服务的全链条能力。
简单人工标注会被压缩,专家型、人机协同、模型辅助标注会增长。核心竞争力将转向行业专家资源、智能标注平台和质量控制体系。
清洗、增强、对齐、质检、过滤、配比、合成等技术会沉淀为行业算子,项目经验将进一步产品化。
“一次测评、全国互认”会推动数据集测评成为连接建设、交易、采购、资产化的关键环节。
数据集将从“卖一次数据包”向持续服务、模型服务、场景服务和资产运营升级。
文件在保障措施中明确提出,要避免一哄而上,防止同质化、低水平重复建设,并要求强化安全保障,防范数据投毒与污染、数据泄露等安全风险。
这提醒我们,高质量数据集建设不能变成新一轮项目运动。最容易出现三类误区:
过去两年,行业里很多人关注大模型。真正进入产业落地阶段后,大家会发现:
通用大模型解决的是“通用智能底座”问题;行业高质量数据集解决的是“行业智能落地”问题。
没有高质量行业数据集,大模型很难深入千行百业;没有场景验证,数据集很难证明价值;没有持续运营,数据集很难变成资产;没有标准和评测,数据集很难交易流通。
所以,这份政策真正开启的是一个新阶段:
从模型竞争,进入数据集竞争;从数据资源竞争,进入高质量数据集能力竞争;从一次性项目竞争,进入数据飞轮运营竞争。
而六定体系,就是把这个新阶段落到项目、平台、组织和商业模式里的方法论。
这份文件已经把国家方向讲得非常清楚:高质量数据集是“人工智能+”落地的关键资源;建设逻辑必须从数据供给走向场景牵引;质量评价必须从数据指标走向模型应用反馈;管理方式必须从静态数据包走向全生命周期治理;价值释放必须从项目验收走向交易、服务、资产化和持续运营。
对行业单位来说,下一步不是简单跟风“建数据集”,而是要用六定体系把这件事做实:
价值定场景,解决为什么建;
场景定模型,解决建给谁用;
模型定数据,解决需要什么数据;
数据定算子,解决如何加工成高质量;
算子定平台,解决如何规模化生产和治理;
评测定运营,解决如何证明价值并持续释放。
最终,高质量数据集建设的目标,不是多交付几个数据包,也不是多建几个平台,而是形成真正可持续的数据飞轮:场景牵引数据,数据驱动模型,模型赋能应用,应用创造价值。
1. 政策事实依据:国家数据局公开发布文本及公开媒体转载报道,包括《国家数据局关于印发〈关于推进行业高质量数据集建设行动的实施方案〉的通知》(国数科基〔2026〕25号)。
2. 本文方法论解读为“凯哥讲 AI · 智胜系列”基于六定体系形成的分析判断,供行业研究、项目策划、方案编制与内部培训参考。