
先给一个总判断:算法备案的技术难度不高,但流程复杂度远超多数团队预期。 它由"判定、材料、填报、审核、持续合规"五个环节构成,其中真正耗费时间的不是写代码,而是把算法机制"讲成人话"、把安全措施"做出量化证据"、把三份材料"对上同一个口径"。
我们团队做了两个典型的文本生成功能——基于大语言模型的营销文案生成,以及基于大语言模型 + RAG 的园区智能客服。功能很常规,但从合规判定到拿到备案编号,中间经历多次驳回、多次补正。这篇文章把整套流程按技术实施顺序拆开,每一步对应做什么、容易在哪里翻车,一并写清楚。
全文结构如下:先做备案前判定,再理清"双备案"体系,然后按流程拆解六个阶段,最后给出时间规划与避坑清单。
很多团队拿到产品第一件事是写材料,这是顺序错误。第一步应该是判定。
依据现行监管框架,需要履行算法备案义务的核心条件是"三有":在中国境内,面向公众提供信息服务,且服务具有舆论属性或社会动员能力。实践中,这一条大致看三点,命中其一通常就应当启动备案:
用第三方大模型 API 做上层应用的团队特别注意:调用已备案的模型,并不豁免你作为应用层服务提供者的备案义务,只是决定了你走"大模型备案"还是"大模型登记"通道(下文详述)。
备案系统覆盖五类算法:生成合成类、个性化推送类、排序精选类、检索过滤类、调度决策类。系统选项里,深度合成已并入"生成合成类",统一显示为"生成合成类(深度合成)"。
判定只看算法的技术本质,不看业务话术。 这是最容易错的一步。比如"智能客服会推荐答案",业务上叫"推荐",但技术本质是根据用户问题生成新文本,属于生成合成类;把客服归到"个性化推送类",是典型的高频错判。我们的经验是:凡是"产出新内容"的都是生成合成,凡是"从既有内容里挑"的才谈得上推送、排序、检索。
同一套算法,两种角色对应不同的填报口径:
角色混填会导致备案范围与实际不符。自用 + 对外提供产品服务的团队,通常按服务提供者申报。注意:即使你作为技术支持者已经备案,你的下游客户只要直接面向公众,仍然需要以自己的主体做服务提供者备案——两边的义务不互相替代。
在做任何动作之前,把下面这三件事分清楚,否则材料会互相"借用"、交叉出错:
关键结论:对文本生成类 SaaS 服务,"算法备案"是必做项;"大模型备案还是登记"取决于你的底座是自研/微调,还是纯调 API。 两者不是二选一,是并行义务。算法备案和大模型备案的区别可以一句话概括:算法备案是给"这条算法服务"做注册,大模型备案是给"面向公众的生成能力"做准入审查,含金量和周期都更高。
正式填报前,先确认四件事,否则会在主体审核阶段被卡住:
登录互联网信息服务算法备案系统(beian.cac.gov.cn),注册账号并完成主体实名认证(法人扫码或电子营业执照),然后填报主体信息:企业基本信息、证件信息、法定代表人信息、算法安全责任人信息,并上传《算法备案承诺书》(官方模板,法定代表人签字盖章)和《落实算法安全主体责任基本情况》。
省级网信办完成主体审核通常需要数个工作日。注意:必须先通过主体审核,才能进入算法信息填报,所以阶段 0 的资质问题越早解决越好。
一条算法一条记录,多个算法必须分别填报,不能"一把梭"。每个算法需填写两大部分:
基础属性:算法类型(本例为"生成合成类(深度合成)")、角色(服务提供者/技术支持者)、算法名称、应用领域、上线时间。
算法名称是重要的合规标识,建议采用"品牌名 + 功能/场景 + 算法"的格式,例如"XX 营销文案生成算法""XX 园区智能客服对话算法"。名称一旦确定,此后所有材料必须沿用同一个,绝不能在中途更换表述。
详细属性:算法数据、算法模型、算法策略、算法风险与防范机制。这一部分建议配合安全自评估报告一起准备,填报内容与报告内容保持完全一致。系统支持随时"保存至草稿箱",建议边整理材料边填,避免信息丢失。
技术向团队最容易在这部分出问题——不是写不出来,是用技术语言写合规材料和用合规语言讲技术逻辑之间的转换出了问题。四份材料的技术要点如下。
审核方要看懂算法逻辑,而不是欣赏名词库。推荐四层框架:输入层、模型层、逻辑层、输出层,每一步都把安全节点写进去。以我们的营销文案生成算法为例,这段表述后来直接用于公示材料:
算法作用对象为文本数据。根据用户输入的文案主题、风格要求和园区资料信息,利用大语言模型技术对输入内容进行语义理解,结合园区资料库中的楼宇参数、招商政策等结构化信息,生成符合用户需求的园区营销文案,包括招商介绍、活动宣传、政策通知等多类型文本。 运行机制:
加分项有三个:每步体现安全节点(输入审、输出审、事实核查);写明可干预、可熔断机制(审核不通过即终止);写明输出内容的 AI 标识方案。RAG 场景(如我们的智能客服)还要突出"答复与知识库一致性校验",防止模型编造知识库之外的政策信息。
自评估报告是整套材料中审核最严、驳回率最高的部分。两个写作纪律:
一是风险研判必须结合自身业务,不能抄通用风险清单。要写"我们这个场景可能产生什么风险、影响谁、怎么防"。例如智能客服场景的真实风险是"把知识库之外的信息编造成园区政策",对应措施就是"答复与知识库一致性校验 + 兜底话术"。
二是防控措施必须有数字。把"内容审核机制健全"改成"输入与输出双环节内容安全审核,高风险内容 100% 人工复核,敏感词库定期更新并留存版本记录,操作日志留存不少于 6 个月"。审核只认能量化的、能追溯的东西。
公示内容是给社会公众看的,200 字以内要讲清"这是什么算法、干什么用、怎么保证安全"。要点:避免堆砌技术术语,避免涉密细节,同时必须与线上产品真实展示的内容一致——监管巡查会做比对。可以参考的写法是:一句话讲用途、一句话讲技术路线、一句话讲安全措施、一句话讲边界(如"仅用于园区营销文案场景,不涉及人脸等生物特征信息处理")。
依据《人工智能生成合成内容标识办法》及配套强制性国家标准(GB 45438-2025),文本生成类服务属于需要显式标识的典型场景。材料层面要写清楚你的标识实现方式,例如:生成内容在文首/文末附加含"人工智能生成"要素的文字提示,不可关闭;文件元数据中写入符合规范的隐式标识(含 AIGC 扩展字段);下载、导出链路中的标识随文件保留。注意:材料里写标识方案,是给备案审核看的;真正让标识每天生效的,是生成管线里的工程实现。 两者要一致,缺一不可。
服务提供者需要勾选应用该算法的产品及功能,注意三种粒度:勾选产品 = 该产品下所有功能;勾选功能访问路径 = 该路径下所有功能;勾选特定功能 = 仅该功能。粒度选错会导致备案范围与实际不符。例如算法只用于某个小程序的特定入口,就不要一路勾到整个产品。
提交前,务必做一遍"一致性对账"——这是退件的头号原因。系统填报、安全自评估报告、拟公示内容三份材料的算法名称、功能模态、应用场景、数据来源、量化指标、企业信息必须完全一致,统一社会信用代码连字符格式都不能错。
审核大致经历四步:
拿到编号后,必须将备案编号和公示链接展示在产品显著位置(如网站底部、用户协议中),与线上实际产品保持一致。
如果你的服务触发了大模型备案义务,它与算法备案是两条并行的线,时间上要提前规划,因为大模型备案通常需要更长周期(材料审核 + 技术测试)。
技术团队最容易忽略的是评估测试题库建设。安全评估报告需要测试题库支撑,实践中对生成测试题量、拒答专项题量、风险关键词库规模、敏感问题拒答率等都有量化口径要求,且需要附模型的实际输出记录。题库建设是最耗时的环节,建议在开发阶段就同步积累,而不是等材料阶段临时凑。
几个并行推进的实务要点:
拿到编号不是终点。以下几项是拿到备案编号后仍然持续的硬性义务:
综合上述流程,给计划启动备案的团队一个可执行的时间盒:
两个时间管理上的血泪教训:一是内测即上线,只要面向真实用户提供服务就视为上线,不要赌"先上了再说";二是材料撰写放在关键路径上,别等所有前置资质齐了才动笔。
最后,把我们在实操中遇到及同行高频踩中的退件点汇总如下,提交前逐条对照:
原创声明:本文系作者授权腾讯云开发者社区发表,未经许可,不得转载。
如有侵权,请联系 cloudcommunity@tencent.com 删除。