TAPD AI 测试基于DeepSeek和混元大模型重构测试范式,支持AI一键生成测试用例、智能评审需求。
摘要:以阿里云公开的E-Commerce Bench为事实起点,用电商定价、补货与投放场景拆解长周期Agent的时间预算、状态变化、延迟后果、轨迹评测和CI回归...
摘要:以Meta公开的WhatsApp端侧Scam Alert架构为事实起点,拆解端侧AI既要识别诈骗又不能扩张消息用途的测试难题,给出数据出境、模型完整性、实...
摘要:基于OpenAI公开的第三方网络安全评测事件,拆解Agent为何会在完成靶场目标时使用范围外凭据和公共服务,并给出授权清单、网络隔离、凭据蜜罐、行为断言、...
摘要: 如果你刚开始接触大模型测评,AI 生成代码其实是一个很适合入门的场景。过去我们习惯看“代码能不能跑、测试能不能过”,但到了 Coding Agent ...
摘要: 做大模型测评时,我们习惯检查回答正确性、相关性、幻觉率,再用 LLM-as-a-Judge 打个分。但进入 Agent 阶段以后,只看最终回答已经越来...
上个月,团队里一个测试新人问我:“哥,你总说 Agent Skills 是乐高积木,到底什么意思?”
“哥,我在项目里放了一个 SKILL.md,为什么 Claude Code 还是不会干活?”
晚上六点,研发把“升级依赖、修复兼容问题、补齐测试并生成迁移说明”交给Agent。第二天早上,PR能编译、单测也通过,可工作区多了几个缓存文件,数据库迁移脚本被...
摘要:周一上午,产品把AI客服模型从A切到B,理由很直接:回答更自然,价格也更低。三个人的测试团队却一点都高兴不起来。上次换模型,他们花了四天重新抽查;这次知识...
功能测试想自己把自动化跑起来,脚本会一点、页面一改就全红,覆盖率数字有了却说不清有没有拦住问题——三件事常常同时存在。再往下,用例在禅道里,脚本在另一套仓库里,...
摘要:模型可以替换,但IDE提供的编译诊断、预览和模拟器工具并不天然等价。测试应把任务结果、工具使用和失败恢复一起纳入兼容矩阵。
OpenAI用GPT-Live-1和Codex改造LED屏,语音测试最该盯哪条链?
周一上午十点,产品把改好的提示词整段贴进测试群,末尾跟一句:就换了两个词,晚上能上吧。你盯着那两处改动看了半分钟——退款话术里加了「运费一并退还」,「转人工」改...
周报里那行「平均 6.2 步完成」看着很体面,直到你把某条会话的调用日志按时间铺开:同一个订单查询接口,它连着叫了十九次,参数一字未改。最后它交出一段格式完整、...
评审会开到第三遍,产品经理把同一句话又念了一次:「这个『基本可用』,具体要看到什么才算过了?」桌上六个人——算法、产品、运维、测试都在——没人接话。不是不想答,...
过去测广告,重点是展示、点击、跳转和归因。广告变成可对话的商家Agent后,用户会追问价格、库存、退款和效果,系统不再只是展示素材,而是在实时生成承诺。
接口字段改动不会平均影响全部用例。真正危险的是:字段看似只多了一个枚举值,AI却按照旧规则批量维护断言,把“部分退款”仍当成“退款完成”。这篇把接口维护从“改脚...
选型材料还剩最后一页。你上周从厂商发布页截下来的那张图,被贴进了三份评审文档,其中一个数字撑起了整个『为什么选这版模型』的论证。今天临下班你想把同一块区域再截一...
上线评审会开到第二十分钟,卡在同一个问题上:这个智能体到底能不能上线。产品说演示很顺;算法说场景集通过率不错;安全说没报漏洞;运维说回滚预案写好了;业务负责人最...