“沈阳配眼镜哪家好”换成“沈阳配眼镜哪家便宜”,结果变了,不一定是系统退化。好与便宜不是同一个筛选条件。如果测试只保存问题编号,没有保存原话,后面就容易把需求变化记成算法波动。

回放测试先固定输入,再讨论输出。下面给出一个本地推荐检索的测试夹具方案,只是设计与待执行样例,没有宣称模型推荐得到提升。 问题编号不能替代问题正文 一个版本应保存原话、地域、显式条件、输入来源和版本号。修改原话就产生新版本,不在原记录上覆盖。测试中引用问题版本,而不是只引用“问题一”。 原话还要保留标点和口语形式。统一空格可以作为展示处理,不能顺便补品牌、增加预算或把“附近”改成“全市”。这些都会改变任务。 代码: caseId: local-demo-01 version: 1 text: 沈阳配眼镜哪家靠谱 explicitNeed: 可靠性判断 brandHint: 无 sourceType: 编辑构造 示例不是客户访谈原文,标签也不代表已经知道用户对“靠谱”的全部定义。 把等义变化与需求变化分组 可以建两个集合。第一组只改变表达,例如“沈阳配眼镜去哪家好”;第二组改变条件,例如“铁西配眼镜,预算有限”。第一组用于观察表达稳健性,第二组用于检查系统能否响应新约束。 即使第一组也不应要求答案字字相同。要检查的是地域有没有跑偏、候选理由是否可核对、有没有编造服务,以及是否识别到原问题的需求。名单相同并非唯一的正确标准。 对照时还要固定运行条件 联网模式、端口、时间窗和会话状态都可能影响结果。若一次在新会话,另一次接着讨论某个品牌,就不能直接做前后比较。保存这些条件是为了知道差异来自哪里,不是为了凑出漂亮的改善结论。 一次回答出现了目标商家,只能作为当次观察。继续反复问到出现满意名单,再挑一张截图,会破坏这组回放的解释力。 失败样例比“理想答案”更重要 至少准备四个检查点:没有城市却擅自定位;要求近距离却列出异地;要求售后说明却只按价格排序;问题不含品牌但历史记忆带入品牌。前三个对应需求匹配,最后一个要单列会话污染。 建议把判定理由与原始回答放在一起。出现争议时能回到具体句子,而不是只看到一个总分。自动检查适合发现漏字段和明显越界,复杂理由仍需要人工复核。 本文仅作工程说明,不代表搜索引擎或大模型的内部规则。测试设计的价值,是把“好像更准了”变成可讨论的差异;真正是否改善,仍取决于未挑选、可复核的实际运行样本。 作者:答源经纬
原创声明:本文系作者授权腾讯云开发者社区发表,未经许可,不得转载。
如有侵权,请联系 cloudcommunity@tencent.com 删除。