首页
学习
活动
专区
圈层
工具
发布
社区首页 >专栏 >《大模型安全评估实务:GB/T 45654 要求与测试题集建设》

《大模型安全评估实务:GB/T 45654 要求与测试题集建设》

原创
作者头像
AI算法大模型备案科普
发布2026-09-02 17:18:08
发布2026-09-02 17:18:08
50
举报
文章被收录于专栏:大模型备案大模型备案

背景

生成式人工智能服务备案材料里,评估测试题集是技术含量最高的一份。它要证明模型"该答的答得好,不该答的拒得掉"。而题集设计的依据,核心就是 TC260 组织编制、已于2025年正式发布实施的国家标准 GB/T 45654《网络安全技术 生成式人工智能服务安全基本要求》。这篇文章从工程视角拆解标准的关键要求和题集建设的实操方法。

题集的三大类结构

按通行实践,评估测试题集分为三类,各有不同的设计目标和判定标准:

第一类是应拒答题,即安全问题。这类题测试模型对违法、不良信息的拒绝能力,覆盖《标准》附件里列明的安全类目。判定标准非常严格:不仅拒绝,还要拒答理由得当。常见的工程误区是题面写得直白,模型靠关键词匹配就能拒答,评估通过率虚高,但监管抽测时用变体问法就失效了。所以应拒答题要设计"改写变体":同一风险点用不同话术、不同语境、隐晦表达反复测试。

第二类是边界题,即伦理与价值边界。这类题没有非黑即白的答案,测试的是模型在敏感话题、专业领域(医疗、法律、金融)上的回答分寸。判定标准是"不主动引导错误行为、不给确定性结论、提示风险并建议咨询专业人士"。

第三类是普通题,即能力与一致性。表面看是常规问答,实际测试两件事:模型回答的事实准确性,以及回答中不会夹带违法有害内容。这类题往往从业务真实场景抽取,覆盖产品的主要功能面。

题量与比例

题集规模上,建议每一类都不低于数百题量级,且安全类题目的占比要能够真实暴露模型短板——安全的比例不是越高越好,而是要贴近监管抽测的分布。题集要保留原始问答记录作为评估证据。

语料与关键词的配套

题集不是孤立的。备案材料里的语料标注规则要与题集的安全维度对齐:标注规则怎么定义违法不良信息、怎么分级、质检抽检比例是多少,要能前后印证。关键词拦截列表同样如此——它兜底的是模型拒答之外的内容安全防线,列表要覆盖题集中暴露的高危类目,并保持动态更新。

收益总结

一次通过备案的团队,共性不是模型能力强,而是评估材料形成了逻辑闭环:语料标注规则→ 关键词拦截 → 测试题集 → 安全评估报告,四份材料讲的是同一个故事。建议在启动备案前先做一轮内部对齐评审,把这四份材料的口径统一,再进入正式申报。

参考资料

l 《生成式人工智能服务管理暂行办法》

l GB/T 45654《网络安全技术 生成式人工智能服务安全基本要求》

l 《互联网信息服务深度合成管理规定》

原创声明:本文系作者授权腾讯云开发者社区发表,未经许可,不得转载。

如有侵权,请联系 cloudcommunity@tencent.com 删除。

问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档