首页
学习
活动
专区
圈层
工具
发布
社区首页 >专栏 >别先堆 Agent:LLM、RAG、Agent 的调用边界才是真问题

别先堆 Agent:LLM、RAG、Agent 的调用边界才是真问题

作者头像
李福春
发布2026-07-23 21:39:15
发布2026-07-23 21:39:15
420
举报

老李 · AI 架构师视角 · 架构探讨稿

用户问题
用户问题

一、痛点:模型很会说,系统不会管

不识庐山真面目,只缘身在此山中。

业务侧常问:「你们怎么把大模型接到业务里?」答「接了 API、做了知识库、挂了几个 Tool」。听起来热闹,一上线就露馅。

老李踩过三坑:

  1. 无边界调用:聊天、查库、改单全塞一个 Prompt,成本失控,出错难追责。
  2. 假 RAG:PDF 切一刀丢进向量库,命中率看着还行,业务口径一对就穿帮。
  3. Agent 当万能胶:规划链越长,幻觉和工具误调用叠乘,延迟滑到不可用。

DigitalHuman 早期 ASR→LLM→TTS 卡在约 2s;HeroDash 客服上量后,并发和口径一起爆。问题不在模型不够聪明,在调用边界没画清。先定「什么时候不该调模型」。


二、是什么:三条链路,不是三个时髦词

名不正,则言不顺。

是什么:三条链路,不是三个时髦词 · 能力
是什么:三条链路,不是三个时髦词 · 能力

横向对比:LangChain / LangGraph 给编排与状态机抽象;AgentX 用 DAG 编排 + MCP 工具调用 + 多模型 LLM API对齐能力,但不绑死框架。讲清「节点是什么、失败怎么回滚」,比背框架名管用。

是什么:三条链路,不是三个时髦词
是什么:三条链路,不是三个时髦词

LLM 负责说;RAG 负责有据;Agent 负责做事。Prompt 钉成可测契约。


三、为什么用:业务压出来的,不是技术橱窗

纸上得来终觉浅,绝知此事要躬行。

为什么用:业务压出来的,不是技术橱窗 · 场景
为什么用:业务压出来的,不是技术橱窗 · 场景

为什么不全上 Agent?因为客服主路径往往是「查得到就答、查不到就转人工」——RAG + 拒答更稳、更便宜。为什么不全靠 RAG?因为改配置、拉监控、跑流水线带工具副作用,这时才上 Agent。

反直觉一句:Agent 越多,越要先砍 Agent。先证明直调或 RAG 不够,再加规划器。


四、架构:一条可讲清的调用边界

善战者,求之于势。

架构:一条可讲清的调用边界
架构:一条可讲清的调用边界

边界规则老李常压成三句:

  1. LLM:无外部事实、无副作用 → 直调;有事实 → 强制走 RAG。
  2. RAG:检索→重排→置信阈值;不够就拒答或澄清,禁止「编一个好听的」。
  3. Agent:仅允许白名单工具;每步写审计;超时与最大步数硬顶。

DigitalHuman 把 ASR/TTS 与 LLM 解耦,LiveKit 扛实时,延迟 2s→500ms。HeroDash 知识库与客服策略拆开,600+ 并发下可换模型供应商而不改业务协议。


五、接入步骤:先契约,后模型

工欲善其事,必先利其器。

用 Claude Code / Cursor 搭骨架时,固定顺序:

  1. 定路由表:意图 → llm/ rag/ agent,写进配置,不写死在 Prompt。
  2. 接多模型 API:同一接口适配 Azure / Google / Llama3;超时、重试、降级写清。
  3. RAG 最小闭环:切分 → Embedding → TopK → 重排 → 引用模板 → 拒答文案。
  4. Agent 白名单:MCP schema、参数校验、最大步数、高危人工确认。
  5. Prompt 入库:分层、版本号、黄金集回归。
  6. 观测:token、延迟、命中、工具失败率、拒答率同一看板。
接入步骤:先契约,后模型
接入步骤:先契约,后模型

六、实战:三条可复述的链路

操千曲而后晓声。

6.1 RAG:切分 / 向量 / 重排 / 拒答

HeroDash 客服口径要求「有出处」。最小可测链路:

代码语言:javascript
复制
文档 → 按标题+语义块切分 → 向量召回 TopK
     → 交叉重排 → score < τ 则拒答
     → 否则:答案 + 引用片段 ID

Prompt 只许引用检索片段,禁止「根据常识补充」。评测不靠自建垂直评测平台——用黄金问答集 + 人工抽检 + 线上拒答率/转人工率。诚实讲:没有「幻觉评测中台」,有的是可回归用例与指标。

6.2 Agent:规划 - 工具 - 记忆

AgentX:规划器出 DAG;节点绑 MCP;短期记忆只存本轮状态与工具回执。对齐 LangGraph 状态机:失败可重试或转人工,禁止无限 ReAct。

6.3 Prompt:可测试化

同一意图至少两套 Prompt 并行;黄金集断言引用/拒答/禁字段。DigitalHuman 私有化时 Prompt 与路由进配置包,KA 可换模型不改契约。

实战分数看:能否复现一次拒答、一次工具失败恢复。


七、洞见 ×3

博观而约取,厚积而薄发。

洞见 1:边界比模型贵

换更强模型,不如先把「事实/行动/闲聊」分流做对。HeroDash 多模型(Llama3/Azure/Google)能扛 500 万+ 用户,靠的是协议稳定,不是单模型神话。

洞见 1:边界比模型贵
洞见 1:边界比模型贵

洞见 2:RAG 的胜负在拒答

召回率好看没用,业务要的是「答错不如不答」。重排阈值与拒答文案,是客服可信度的一半。

洞见 3:Prompt 是契约,不是灵感

可版本、可 diff、可黄金集回归。AgentX 把 Prompt 与 DAG/MCP 同库管理;别只聊「我调了温度参数」。

洞见 3:Prompt 是契约,不是灵感
洞见 3:Prompt 是契约,不是灵感

八、总结与实践清单

凡是过往,皆为序章。

一句话:LLM 生成,RAG 供据,Agent 行事;Prompt 写成可测契约,拒答与审计守住幻觉。

证据链:DigitalHuman 2s→500ms、99.9%、兴业/国泰/瑞众私有化;HeroDash 600+ 并发、500 万+ 用户;AgentX 用 DAG + MCP + 多模型,而不是无限聊天。

方法论速查表

方法论速查表 · 问题
方法论速查表 · 问题

行动号召

下次设计先画一张「意图路由图」,再钉一个拒答案例、一个工具失败恢复。能把这两刀讲清楚,比堆十个框架名更像架构师。

本文参与 腾讯云自媒体同步曝光计划,分享自微信公众号。
原始发表:2026-07-22,如有侵权请联系 cloudcommunity@tencent.com 删除

本文分享自 李福春持续输出 微信公众号,前往查看

如有侵权,请联系 cloudcommunity@tencent.com 删除。

本文参与 腾讯云自媒体同步曝光计划  ,欢迎热爱写作的你一起参与!

评论
登录后参与评论
0 条评论
热度
最新
推荐阅读
目录
  • 一、痛点:模型很会说,系统不会管
  • 二、是什么:三条链路,不是三个时髦词
  • 三、为什么用:业务压出来的,不是技术橱窗
  • 四、架构:一条可讲清的调用边界
  • 五、接入步骤:先契约,后模型
  • 六、实战:三条可复述的链路
    • 6.1 RAG:切分 / 向量 / 重排 / 拒答
    • 6.2 Agent:规划 - 工具 - 记忆
    • 6.3 Prompt:可测试化
  • 七、洞见 ×3
    • 洞见 1:边界比模型贵
    • 洞见 2:RAG 的胜负在拒答
    • 洞见 3:Prompt 是契约,不是灵感
  • 八、总结与实践清单
    • 方法论速查表
    • 行动号召
领券
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档