2026 年,大模型备案不再是"备了就过"的流程性动作。"清朗·整治 AI 应用乱象"专项行动把"未按规定履行备案登记义务"和"AI 平台安全与审核过滤能力不足"列为第一阶段整治重点,安全审核能力是否真实、可量化,成为备案能不能一次通过的关键。而在整套备案材料里,拦截关键词库(即备案材料中的"风险拦截关键词列表")正是审核过滤能力最直接的证明文件——它同时也是被退回、被补正次数最多的材料之一。
很多企业拿到这份材料的第一反应是:"不就是一份敏感词表吗?网上找几千个词填进去不就行了?"实际情况远没有这么简单:总规模不足、风险类别覆盖不全、没有更新机制、拿不出拦截效果数据……任何一个缺口,都可能让这份材料被质疑"形同虚设"。
这篇文章把拦截关键词库从法规依据、硬性指标、搭建方法、技术落地、避坑要点五个层面讲透,帮助企业一次把这份材料做扎实。
要理解关键词库的地位,先要看清楚监管的三层框架:
• 《生成式人工智能服务管理暂行办法》(2023 年 8 月 15 日施行)。这是大模型备案的直接法律依据。第四条要求服务提供者"坚持社会主义核心价值观",不得生成煽动颠覆国家政权、宣扬恐怖主义极端主义、宣扬民族仇恨、暴力淫秽色情以及虚假有害信息等法律禁止的内容;第十四条要求发现违法内容后"及时采取停止生成、停止传输、消除等处置措施,采取模型优化训练等措施进行整改"。
• 《生成式人工智能服务安全基本要求》(原为全国信安标委 TC260 技术文件,后升级为国家标准 GB/T 45654-2025《网络安全技术 生成式人工智能服务安全基本要求》)。这份文件把"不得生成违法内容"拆解成了可量化、可评估、可验收的具体指标,关键词库的总规模、覆盖范围、分档要求都出自这里。
• 《互联网信息服务深度合成管理规定》(2023 年 1 月 10 日施行)。第七条要求深度合成服务提供者落实信息安全主体责任,建立健全信息发布审核等管理制度;同时要求"建立健全用于识别违法和不良信息的特征库"——这里说的"特征库",在落地层面就是关键词库、分类模型等机制。
一句话概括:管理办法划红线,安全基本要求定指标,深度合成规定补细节。关键词库就是这三份文件交汇后落到企业身上的具体义务。
2026 年 4 月 30 日,中央网信办部署开展为期 4 个月的"清朗·整治 AI 应用乱象"专项行动,分两个阶段推进。第一阶段重点整治 7 类突出问题,排在前面、也最值得注意的两项就是:
1. 未按规定履行大模型备案登记义务,即"应备未备";
2. AI 平台安全和审核过滤能力不足,明确点名"缺乏安全围栏机制、审核过滤能力不足,生成违法不良信息风险高"。
专项行动第一阶段成效也已公布:累计处置违规网站、应用程序、智能体等 AI 产品 1.4 万余款,清理违法违规信息 600 余万条,处置账号 2.6 万余个。
这释放的信号很明确:监管已经从"查你有没有备"进入"查你的安全能力到底行不行"的阶段。而审核过滤能力最直观的物证,就是拦截关键词库以及基于它的拦截效果数据。它不再是一份"可有可无的附表",而是备案审核中"安全能力真实性"的试金石。
完整的大模型上线备案,企业需要准备六类核心材料:
序号 | 核心材料 | 作用 |
|---|---|---|
1 | 生成式人工智能服务上线备案表 | 主体信息、模型信息、算力与语料概况 |
2 | 安全自评估报告 | 对标《安全基本要求》逐条自评,含实测数据 |
3 | 用户服务协议与隐私政策 | 对外公示数据采集范围、用户权责等 |
4 | 语料标注规则文档 | 证明训练语料处理流程合规可控 |
5 | 风险拦截关键词库(附件4) | 证明生成端内容过滤能力 |
6 | 评估测试题集 | 含业务题与高风险题,留存输出与拒答记录 |
其中,语料标注规则管的是"输入端"——确保喂给模型的数据本身干净合规;拦截关键词库管的是"输出端"——确保模型"吐出来"的内容安全可控。一进一出,构成完整的内容安全闭环:
【内容安全闭环流程图】A 训练语料 |输入端防线| B 语料安全评估<br/>分类模型+人工抽检 → B C (大模型) → D 用户输入 E 输入安全检测 → E C → C |输出端防线| F 拦截关键词库<br/>+分类模型+人工复核 → F G 命中风险? → G |是| H 阻断/替换/提示 → G |否| I 正常返回 → H J 拦截日志留存 → I J
根据《生成式人工智能服务安全基本要求》第 9 章"关键词库",以及备案评估的通行要求,关键词库有五个硬性指标:
指标项 | 硬性要求 | 说明 |
|---|---|---|
关键词库总规模 | 不应少于 10000 个 | 官方口径"不宜少于 10000"或"不应少于 10000" |
覆盖风险范围 | 至少覆盖附录 A.1 + A.2 共 17 种安全风险 | 不是任意 17 类,而是标准附录指定的高风险+中风险 |
A.1 每类关键词 | 不应少于 200 个 | 高风险类别逐类达标 |
A.2 每类关键词 | 不应少于 100 个 | 中风险类别逐类达标 |
单个关键词长度 | 不超过 10 个汉字或 5 个其他语言单词 | 过长词条匹配效率低且易误伤 |
更新频率 | 每周至少更新一次 | 结合网络安全实际需要及时更新 |
这里必须强调一点:只堆总数不达标。10000 个词如果集中堆在某几类风险上,其他风险类别是空白,一样会被退回。审核方会逐类核对每一类风险的关键词数量是否达到分档要求。
这是备案企业最常混淆的一对数字,直接说清楚:
• 附录 A 一共定义了 5 大类 31 种安全风险,覆盖违反社会主义核心价值观、歧视性内容、商业违法违规、侵犯他人合法权益、特定服务类型安全需求等维度。
• 拦截关键词库必须覆盖其中的 17 种(即附录 A.1 高风险 + A.2 中风险),这是关键词库的硬性范围。
• 分类模型、生成内容测试题库、语料过滤分类目标则要完整覆盖全部 31 种安全风险。
为什么关键词库只要求 17 种而分类模型要 31 种?逻辑在于:关键词是"点对点"的精准拦截,优先覆盖最高发、最核心的风险;而分类模型是"语义级"的判断,需要完整覆盖所有风险类型才能兜底。两者配合,才是完整的过滤体系。企业在做材料时,不要只盯着关键词库的 17 种,语料过滤和分类模型的 31 种覆盖同样要一并规划。
关键词库还存在明显的地方差异,企业必须按属地监管要求适配:
• 北京等监管强度较高的地区,实务中常要求关键词拦截库扩充到 20 万–50 万词量级;
• 广州、深圳等地要求词库规模 不低于 3 万词;
• 部分省份(如浙江)按覆盖 31 类风险类别、总量不低于 1 万词的口径要求。
差异源于各属地网信办对风险的研判口径不同。建议企业在筹备期就先与属地网信办或专业服务机构确认当地的具体标准,而不是直接套用通用模板,否则容易反复补正、拉长周期(完整备案周期通常为 4–10 个月)。
第一步:按风险分类建目录。 不要按"热点话题"或"临时想到哪算哪"来建库,而是严格按附录 A 的风险分类建目录,为 17 种风险(A.1 + A.2)各建一个独立分类,分类下再分子类。一个规范的三级结构是"风险大类 → 风险小类 → 关键词词条"。
第二步:按配额填充。 先满足分档底线:A.1 每类不少于 200 个、A.2 每类不少于 100 个,然后再扩充总量至 10000 以上。扩充时按"每类风险的实际表达空间"分配词量,而不是哪类好凑就多堆哪类。
第三步:建更新机制。 关键词库是"活"的。要在组织层面明确:谁负责维护、多久更新一次(每周至少一次)、更新依据是什么(舆情热点、监管通报、攻击样本)、更新记录如何留痕。更新日志是备案审核时的重点核查项。
只收录原始词条远远不够,同一风险点的表达方式有成百上千种变体。词条设计要重点考虑:
• 谐音变体:如用谐音字替代敏感字;
• 拼音缩写:如"VX"类缩写在金融诈骗、违禁品交易场景中很常见;
• 形近字替换:用形近字绕过滤规则;
• 符号插入:如在字符间插入特殊符号(如"薇❤"式写法)。
建议在词库中为每个核心风险点维护"原始词条 + 常见变体"的词组,并在技术上支持正则匹配、模糊匹配等能力,而非简单的完全字符串匹配。同时控制单条长度不超过 10 个汉字,避免词条过长导致匹配失效。
如果模型支持图片、音频、视频等多模态生成,关键词库不能只覆盖文本维度。对于图片中的文字、音频中的语音内容,需要结合 OCR、语音转写后的文本再走关键词过滤;同时配合内容标识(显式标识 + 隐式水印)要求,形成多模态的完整防线。
关键词库不是一份提交后就束之高阁的表格,它要落到线上服务里真正生效。建议构建三层分级拦截体系:
层级 | 拦截对象 | 处置方式 |
|---|---|---|
一级 · 高危阻断 | 涉政敏感、涉恐、违禁品交易等明确违规内容 | 立即阻断生成,记录完整交互日志 |
二级 · 替换复核 | 低俗、歧视等中风险内容 | 屏蔽处理(如打码)并进入人工复核队列 |
三级 · 风险提示 | 边缘性、潜在风险内容 | 弹出风险提示,要求用户确认知晓 |
同时,关键词过滤只是第一道防线,要和以下机制联动,构成多层防护:
1. 语义理解与上下文分析:融合分类模型,识别语境中隐含的风险意图(如借隐喻、指代传播有害信息),弥补关键词"只看表面、不看语境"的不足;
2. Prompt 工程约束:在系统提示语中明确回答边界,从源头引导模型不进入高风险话题;
3. 人机协同复核:对拦截结果抽样人工审核,持续用拦截样本反哺词库和模型优化;
4. 拦截效果数据沉淀:统计拦截率、误杀率、处置量,这些数据既是安全评估报告里"有实测数据支撑"的证据,也是备案审核时最有力的佐证。
安全评估环节的硬性指标也应同步对齐:语料安全评估中人工抽检合格率不低于 96%、技术抽检合格率不低于 98%;生成内容安全评估(人工、关键词、分类模型三种抽检)合格率均不低于 90%;应拒答测试题拒答率不低于 95%,非拒答测试题拒答率不高于 5%。关键词库的质量,直接影响这些抽检合格率能否达标。
结合大量备案项目实操,与关键词库相关的高频驳回原因及对策如下:
常见问题 | 表现 | 优化建议 |
|---|---|---|
词库规模不足 | 总量不到 10000,或总量达标但某一类风险空白 | 按附录 A 分类逐类核查,补齐到分档要求再扩总量 |
只堆总量、不满足分档 | A.1 某类不足 200、A.2 某类不足 100 | 建立"分类-子类-词条"三级台账,逐类核对 |
无更新机制 | 无法说明更新频率,拿不出更新日志 | 建立每周更新机制,留存版本记录与更新日志 |
缺拦截效果数据 | 只有词表,没有拦截率、误杀率等数据 | 上线后沉淀拦截统计,附人工审核流程 SOP 与处置案例 |
与题库、语料过滤脱节 | 关键词库、测试题库、语料过滤各做各的 | 共用附录 A 风险分类这一张"安全地图",统一规划 |
风控方案"形同虚设" | 材料里写了拦截机制,但测试仍能生成违规内容 | 补变体词库、语义模型、人工复核,验证拦截真实生效 |
此外,还有一类与关键词库直接相关的整体性驳回点:安全评估报告空洞,只有框架没有实测数据和案例。关键词库的拦截效果数据,正是把"空洞报告"变成"实证报告"的关键素材。
拿到备案编号只代表"准予上线",动态合规义务才刚刚开始:
• 变更报备:当模型版本发生重大迭代、训练语料大规模变更、核心风控机制调整时,需重新组织安全评估并按规定履行变更报备;
• 词库持续迭代:每周更新关键词库,紧跟舆情热点、监管通报和新型攻击手法;
• 日志留存:保留近期 3–6 个月的拦截日志,供合规审计与效果回溯;
• 应急处置:发现违法内容及时停止生成、停止传输并消除,向主管部门报告,配合整改;
• 监看人员:按服务规模配置监看人员,及时根据国家政策和投诉情况调整内容安全策略。
拦截关键词库的体量只有 1 万词、几十行表格,却是大模型备案里"最能证明安全能力真实与否"的一份材料。它背后是三层防线:指标达标(建得够)→ 技术生效(拦得住)→ 持续运营(管得住)。
对正在筹备备案的企业,建议把三件事放进同一条时间线一起做:按附录 A 风险分类搭建关键词库、用同一张风险地图建设语料过滤分类模型、把拦截效果数据沉淀进安全评估报告。这三件事用的是一套风险分类逻辑,一起规划才能一次搭好、双双过关,避免反复补正拉长 4–10 个月的备案周期。
本文基于现行公开法规与监管文件整理,具体备案要求请以属地网信部门最新口径为准。
参考依据(现行有效):
1. 《生成式人工智能服务管理暂行办法》(国家网信办等七部门令第 15 号,2023 年 8 月 15 日施行)
2. 《生成式人工智能服务安全基本要求》(原 TC260 技术文件,现升级为国家标准 GB/T 45654-2025)
3. 《互联网信息服务深度合成管理规定》(国家网信办等三部门令第 12 号,2023 年 1 月 10 日施行)
4. 中央网信办《关于开展"清朗·整治 AI 应用乱象"专项行动的通知》(2026 年 4 月)及阶段成效通报(2026 年 7 月)
原创声明:本文系作者授权腾讯云开发者社区发表,未经许可,不得转载。
如有侵权,请联系 cloudcommunity@tencent.com 删除。