AI Native 数据平台 · 系统智能系列
在前三篇里,我们分别讲了腾讯云大数据 AI Native 数据底座的三个方向:计算智能让 Agent "跑得快"、存储智能让 Agent "存得下、取得到"、数据智能让 Agent "替你分析"。它们解决的都是同一件事——让平台更好地服务 Agent。
但当平台的能力越来越强、承载的负载越来越复杂,一个被长期忽略的问题浮上水面:这套平台本身,应该由谁来运维、谁来调优?这正是四象里最后一块拼图——系统智能。本篇聚焦 AI Native 平台在系统智能下,如何让平台实现"自己管理自己",从"人工救火"走向"自动驾驶"。
背景:Agent时代运维复杂度不降反升
一个反直觉的事实是:平台越智能,运维越难。
过去的大数据平台负载相对单,以离线 ETL 和 SQL 分析为主,运维对象是可预期的批处理作业。而当平台同时承载多模态数据处理、模型训练、在线推理、RAG 检索和 Agent 编排,负载类型、资源画像和故障模式都变得高度异构:一个 GPU 训练任务的故障特征,和一个 Spark 批处理作业完全不同;Agent 7×24 小时高频并发调用,又让任务量从"几十人发起"跃升到"几百个 Agent 持续运行"。
需要指出的是,复杂度上升的根因并非负载异构本身,而是智能能力引入后的副作用:可观测维度变多、配置粒度变细、策略更新频率变高——这些才是运维对象膨胀的真正来源。传统运维模式在这种复杂度下逐渐失效。购买选型靠客户经理加解决方案专家人工评估;迁移上云靠人工经验加手工改写任务和代码;日常使用要找菜单、填表单、写 SQL、看仪表盘;运维调优则靠告警加经验排障、人工调参反复试错。每一个环节都重度依赖人,而企业内的资深运维和调优专家本就稀缺——海量任务的优化难度和工作量,远远超出有限的人力。更棘手的是,过去业务的波动和异常大多只能"事后感知":等告警响了、任务挂了,才开始排查。
系统智能要解决的,正是这个矛盾:让平台自身具备 Agent 能力,把选型、迁移、使用、运维、调优的全链路交给 Agent,让数据平台实现"自动驾驶"时刻。
系统智能定义:数据平台自身成为Agent,实现"自我管理"
在 AI Native 数据底座的两条主线中,系统智能对应的是 As Agent——让平台自身具备 Agent 能力,能自主感知、自主诊断、自主处置、自我演进。它不是在原有运维工具上加一个对话框,而是把 Agent 嵌入用户与平台交互的全生命周期,让平台从被动响应指令变成主动理解意图、自主完成任务。

腾讯云大数据系统智能的核心载体,是自研大数据智能管家 TCInsight。TCInsight 覆盖数据平台从购买选型到日常运维的全链路,每个阶段都有专门的 Agent 在协助用户,并对外通过 MCP、Skill、CLI 等接口开放,可被 DataBuddy 及第三方 Agent 平台直接调用。
全链路系统智能:每个阶段都有Agent在协助
TCInsight 把数据平台的全生命周期拆成四个阶段,每个阶段用一个专门的 Agent 替代原本的人工环节。

选型阶段——资源规划 Agent
传统方式下,企业上云选型需要客户经理和解决方案专家共同评估,客户既要理解底层产品的复杂参数,又要在成本和性能之间反复权衡。资源规划 Agent 则把这件事变成一次对话:用户只需提供数据量、任务规模和时效性要求,Agent 就能智能推荐集群规格、数量与成本组合,让选型从"依赖专家经验"变成"按需求自动推算"。
上云阶段——智能迁移 Agent
传统迁移依赖人工经验,手工改写任务和代码逻辑,周期长、风险高。智能迁移 Agent 配合自动迁移工具与校验机制,自动完成评估、SQL 翻译、数据搬迁与回归验证,迁移周期缩短 50%。这一阶段 Agent 给出方案、由人确认执行,属于"建议式"自治。
日常使用阶段——智能管控 Agent
自然语言取代菜单和表单,用户用一句话即可完成查询、配置和数据平台管理,不必在层层控制台里寻找入口,控制台的使用与管理全面实现 Agent 化。
运维调优阶段——智能自治 Agent
这是最消耗人力的环节,也是系统智能价值最集中的地方,平台在这里进入"自动驾驶",由自主调优、自主运维、预测治理三个 Agent 协同完成。这一阶段的 Agent 已从"协助"升级为"主导",但对高危操作仍保留人工审批与回滚路径。
核心能力:三大Agent实现平台的"自动驾驶"
运维调优是系统智能的核心战场。TCInsight 用三个 Agent 把这个过去最依赖资深专家的环节自动化,并且把处置的时间轴从事后一路前移到事前。
自主调优 Agent 持续优化任务执行。海量任务的调优过去难度极高、工作量巨大,往往需要五年、十年经验的专家才能完成的 Spark 参数调优,现在变成对话式交互,任务自动调优、减少资源浪费,资源浪费降低 15%。
自主运维 Agent 提供 7×24 小时值守。它每天自动巡检集群健康度,自动诊断问题并给出修复建议,对低危操作甚至可以直接执行。过去业务波动和异常大多只能事后感知,靠告警加人工经验排障,如今故障根因定位时间从 4.5 小时缩短至 30 分钟。
预测治理 Agent 把处置从"事后"提前到"事前"。它实时监测资源增长趋势,提前预警容量风险,避免因资源规划疏忽导致的生产事故,实现从"事后感知"到"事前处置"的转变。

需要强调的是,"自动驾驶"并非无人值守。我们遵循 ARRC 原则(“automate the repeatable, review the consequential”,可重复的自动化,后果重大的需人工复核):对已验证 playbook 范围内的低危操作,Agent 可自动执行并留痕;对中高危操作(如重启核心节点、修改资源配额、删除数据),必须采用"建议-人工审批-执行"的三段式路径,所有自动操作可回滚,并设立"死手开关"用于紧急接管,把信任建立在可回滚、可审计的基础上,才是自治走向生产的前提。
这三个 Agent 之所以能自治,靠的是 TCInsight 背后一套持续沉淀的 Agent 知识库——由模型库、场景知识库、策略算法库、数据特征库和多维多层数据库共同构成。数据特征库和多维多层数据库为 Agent 提供对集群与任务状态的实时感知,策略算法库和场景知识库沉淀了历次调优与排障的经验,模型库则支撑预测与决策。换句话说,平台每处理一次事件,这套知识库就厚一分,Agent 的判断也随之更准——这正是系统智能"自我演进"的底座。
但这一飞轮的前提,是事件根因被正确标注。为避免错误经验在飞轮中被放大,TCInsight 设立了标签置信度分级、人工抽检与定期回炉校验机制,以应对标签噪声累积、模型衰退与灾难性遗忘三类隐患——历史经验若不持续校验,会从"资产"变为"负债"。相关技术成果已入选数据库领域顶级会议 VLDB 2025。2025 年 TCInsight 已累计处置超过 10 万次系统事件,覆盖 EMR、DLC、ES、TCHouse 等核心产品以及第三方平台。
系统智能典型应用场景
TCInsight 的三个 Agent 并非概念,而是已在生产环境跑通的能力,可对应三个典型场景。
Spark 任务智能调优——面向 OOM、本地盘空间异常增长等常见问题,自主调优 Agent 自动定位参数瓶颈并给出调优方案,把过去依赖专家反复试错的过程压缩为对话式交互。该场景风险低、可灰度、回滚成本低,适合监督式自治。
集群健康度智能诊断——自主运维 Agent 7×24 小时巡检集群,自动识别健康度异常并定位根因,把根因定位时间从数小时压缩到分钟级。该场景属中等风险,根因定位后仍需人工确认修复方案。

集群存储容量预测——预测治理 Agent 基于历史趋势预测存储容量增长,提前预警扩容需求,避免容量打满导致的生产事故。该场景为事前预测,可容忍误报,但误报会消耗扩容成本,需配置告警阈值与人工复核窗口。

结语
从选型、迁移、使用到运维调优,系统智能让数据平台的每一个环节都有 Agent 在协助,最终指向一个目标:让平台在监督下管理自己。这既降低了企业对稀缺运维专家的依赖,也让平台在 Agent 时代急剧上升的复杂度面前,依然保持可控。
系统智能与计算智能、数据智能、存储智能一起,构成了腾讯云大数据 AI Native 数据底座的完整拼图。四象之中,计算智能让 Agent "跑得快"、存储智能让 Agent "存得下、取得到"、数据智能让 Agent "替你分析",而系统智能让平台"自己管理自己"、自身成为 Agent——一个能自主感知、自主诊断、自主处置、自我演进,但始终保留人工接管与审计能力的数据平台。
系统智能的目标不是消除人,而是把人从重复劳动中解放出来,让人聚焦于后果重大的判断。这是我们对"自动驾驶"的校准承诺,也是可信自治的边界。
END