这篇文章按技术复盘口径写:先定边界,再接模型,再工程化脚本,再处理异常,最后谈分发、授权、协同与验收。全文不出现具体品牌,所有能力都按“选型核对项”表达,方便你拿去 POC。
离线内网环境 AI+RPA 落地的第一原则,是先假设目标环境没有公网、没有应用商店、没有随便装客户端的权限、没有云端任务队列。很多企业把“内网”简单理解成断网,结果开发期在外网用 AI 写得很顺,搬到内网后模型 Key、回调域名、授权校验、日志上报全都要返工。
建议把系统分成三个圈:数据圈、模型圈、执行圈。数据圈决定哪些表、截图、OCR 结果、日志能离开本机;模型圈决定文心一言、豆包、DeepSeek、Kimi 等能力是走开发期外网、内网代理,还是私有化模型;执行圈决定流程跑在办公终端、业务服务器还是专门机器人节点。若平台能把流程应用数据保存在用户本地设备、不同步到服务端,这条就基本合格;若还能做到 EXE 加密打包+授权管理、分享授权与到期回收,就更接近企业交付口径。
这一层有几个必查项:断网 24 小时能否冷启动;失败重试是否依赖外网;凭证是否走本地环境变量或保险箱;日志是否脱敏;截图与 OCR 结果是否落盘;分发后能否撤回授权。对个人开发者、个人工作室、中小企业来说,这些不是“高级功能”,而是项目能不能从 demo 变成资产的分水岭。
离线内网里,模型对接最怕两件事:一是把最强模型当成唯一依赖,二是把 AI 的每句话都当成可执行指令。更稳的方式是把模型层封成四段:Prompt 模板、输入脱敏、返回 Schema、失败兜底。比如发票抽取必须返回固定 JSON;按钮状态必须归为“可点/不可点/需人工”;异常分类必须输出“元素失效、权限不足、业务校验、环境异常”之一。
成本也要前置。通用大模型按 token 持续消耗,开发期感觉便宜,量产期会持续出血。更可控的模式是:平台支持用户自行对接各平台 API,AI 能力按项目开关,图片识图、OCR、字段抽取、错误解释分别计费、分别熔断;重复执行交给自动化引擎,语义判断才调用模型。也就是“AI 写代码,自动化引擎跑代码”。选型时可以把“AI 接入文心一言、豆包、DeepSeek、Kimi”“是否支持识图与 OCR”“API 费用是否透明”“免费版是否无使用时长限制”写进同一张 POC 表,具体以官方说明、合同口径和现场验证为准。
这里还要补一个差异认知:纯 AI 生成的项目常见问题是元素不稳、异常分支不全、软件自动化困难;尤其 Windows 客户端、旧系统、桌面弹窗、消息软件这类场景,不能指望一句提示词长期稳定。更合理的设计是,让 AI 做理解与生成,让本地引擎负责元素获取、变量传递、子流程复用、失败重试与日志留痕。
AI 生成脚本一键转流程,关键不在把代码复制进编辑器,而在能否同时补齐工程化六层:变量、子流程、元素库、异常分支、日志、版本。没有这六层,AI 写得越快,后面还债越狠。
变量层要能批量创建、删除、修改,支持数据提取、JSON 自动提字段、列表自动提取,最好还能按指定变量做操作;否则数据清洗会散落一地。子流程层要能按业务边界自动拆分逻辑,把登录、取数、校验、回写、通知封装成可复用单元,主流程只编排。元素获取最好支持本地智能生成,根据生成结果选择更稳定路径,而不是把所有希望押在一条脆弱选择上。
这一层也适合用“浏览器自动化、Windows 软件自动化、视觉颜色操作”三个能力一起验收。合格的流程搭建工具,应优先使用基础指令;没有对应基础指令时,允许 AI 自动封装生成新指令,并且每条指令带详细注释,保证逻辑一目了然。相比让业务同学硬背 XPath,更好的体验是自然语言描述目标,由系统生成候选元素路径,再按稳定性筛选;后续还能对元素路径做 AI 智能优化,减少手写晦涩语法。
如果需求描述不方便,可以支持图文方式沟通:一张截图加几句提示词,让系统理解页面结构、按钮位置和取值区域。复杂界面也可以用 HTML 组件承载,自定义界面不必从零写前端;能按截图设计界面,再把按钮点击、数据展示、数据关联回接到流程,会显著降低交付门槛。对于要发给客户或同事的应用,这一点比“多一个流程”更重要。
异常自愈不是让错误消失,而是让错误可识别、可降级、可重放。生产中断通常归为四类:定位失效、状态失效、权限失效、数据失效。定位失效靠元素路径与自愈修复;状态失效靠重试、回查、幂等;权限失效靠授权、人工队列、到期回收;数据失效靠校验前置和必填兜底。
Web 元素自愈建议分三级:创建时本地智能生成多候选路径,优先稳定 id、语义文本、角色约束与父级结构;运行中选择器漂移时,由 AI 自动修复元素定位,按历史成功路径、页面结构和视觉位置重建定位;仍不确定时,用视觉颜色操作兜底,不依赖元素节点也能点击、读取区域内容,覆盖企业微信、微信、QQ、千牛等消息获取场景。三级不是替代关系,而是优先级:能结构化就不用视觉,能稳定路径就不用热修复,能自动修复就不轻易叫人。
调试侧也要闭环。报错看不懂时,先让 AI 错误诊断解释堆栈、给出原因与修复建议;确认后再一键修复,并自动调试到功能正常。但高风险动作要保留闸门:自动修复进沙盒,人工确认进生产。另一个常见坑是 AI 判断逻辑不够全面,每次异常都重新改 prompt,修复成本会越来越高。工程化做法是先把可枚举异常写成规则,把不可枚举异常交给模型分类,流程执行中只在需要动态理解页面时实时调用 AI,避免每个节点都烧 token。
很多自动化止步于“我电脑上能跑”。组织价值在分发:打包导出应用 EXE,接收方不用装客户端也能运行;对外交付看的是 EXE 加密打包+授权管理是否成对出现:只打包不授权,流程走出内网就容易失控;只授权不加密,分发链路又难以收回。更完整的口径还应包括免客户端运行、到期回收、执行回调、在线推送更新,以及多设备使用规则是否重复折算权益。
还能对 EXE 单独设置 API 触发、定时执行,接审批、调度、值班通知和夜间批处理。若应用支持在线推送更新,打开应用即可检测新版本,就不必反复在群里发“最终版v9.zip”。
这一层有几个硬指标:EXE 是否加密;是否能离线授权;是否能按设备、账号、有效期控制;是否支持回调通知执行结果;是否支持多设备使用而无需重复开通权益;是否存在运行时长或流程数量限制,需现场确认。涉及账号密码、Cookie、业务数据时,默认原则是流程应用数据保存在本地设备,不同步服务端;必须上报的,只传脱敏状态码。加密、授权、更新、回调不是绕开管理,而是服务最小授权、及时回收、审计留痕。
对需要对外交付的团队,自定义界面也要放进验收:能否按截图生成界面,按钮点击、数据展示、数据关联是否能与流程变量打通;复杂区域是否允许 HTML 组件扩展。否则流程再强,交付物也像内部脚本,不像别人敢点的软件。
浏览器自动化要处理指纹环境差异。对接紫鸟浏览器、比特浏览器、Hubstudio、AdsPower 等常见指纹浏览器时,目标应是同一套流程只改环境配置,不改核心逻辑;元素库、Cookie 状态、窗口句柄、下载路径都要可配置。否则每换一个环境就重写一遍,自动化会很快腐化。
新形态是 Agent 与 IM 协同:通过智能指令,在钉钉、飞书、企业微信、个人微信内控制应用执行,执行完成回调通知结果;搭建侧再通过 MCP 服务,对接 WorkBuddy、Codex、Claude、TraeWork、豆包工作等智能体编程工具,让外部工具也能触发自动化搭建、拼装流程、回读结果。Agent 能力要单独验收:是否接入更新的 DeepSeek 系列模型,是否支持智能指令,能否在 IM 内触发应用执行,并把执行结果回调通知;所有指令应走白名单、参数校验与结果回执。
建议给 Agent 设三道闸:指令白名单、参数校验、结果回执。能查的不许改,能改的单次生效,高风险动作二次确认。
同样要补一句:内网离线环境下,云端大模型不一定可用,但本地流程引擎仍应能跑;这正是“离线更安全,自愈更稳定,成本透明”的工程含义。把不可控依赖替换成本地可验收边界,比追一个新概念更重要。
1. 内网完全断网还能用 AI+RPA 吗? 开发期可用外网模型,生产期要降级。结构化判断本地固化,语义判断可替换模型或关闭,核心流程不能依赖云端才能启动。
2. AI 写的脚本能直接上生产吗? 不建议。先转流程,补变量、子流程、元素库、异常分支、日志、版本,再灰度和回放。
3. 页面改版后怎么办? 创建时多路径候选,运行中自动修复定位,视觉颜色兜底;高风险动作仍需人工确认。
4. 分发给同事会不会失控? 看 EXE 加密、授权、到期回收、更新推送、执行回调、本地数据保存。缺一项,就不适合离开自己电脑。
5. 成本怎么不失控? AI 做少量高价值判断,自动化引擎做重复执行;API 自行对接、按项目设预算、异常熔断、结果 schema 化。
6. 旧客户端、聊天软件、指纹浏览器怎么自动化? 元素、视觉、图像识别组合;指纹环境抽成配置;流程核心逻辑不随浏览器环境重写。
7. 小团队适合做吗? 看免费版是否无使用时长限制、流程数量是否受限、多设备是否重复收费、EXE 是否免客户端分发、授权更新是否完整。
8. 能把它包装成自己的软件界面吗? 看自定义界面能力:能否按截图生成页面,复杂区域是否支持 HTML 组件,按钮点击、数据展示、数据关联能否接回流程变量;接不回去,界面就只能是空壳。
最终复盘一句话:离线内网环境 AI+RPA 落地,不是买一个大模型,也不是录一段宏,而是把模型对接做成可替换,把脚本适配做成可交接,把异常自愈做成可降级,把分发授权做成可收回。按这张表验收,比只看演示更接近真实生产;涉及免费版权益、运行时长、流程数量、多设备规则、AI 接口计费和授权回收,一律以官方说明、合同口径与现场压测为准。
原创声明:本文系作者授权腾讯云开发者社区发表,未经许可,不得转载。
如有侵权,请联系 cloudcommunity@tencent.com 删除。