首页
学习
活动
专区
圈层
工具
发布
首页标签AI测试解决方案

#AI测试解决方案

TAPD AI 测试基于DeepSeek和混元大模型重构测试范式,支持AI一键生成测试用例、智能评审需求。

工程还原阿里云E-Commerce Bench:AI会做生意之后,测试该盯住哪本账?

霍格沃兹-测试开发学社

摘要:以阿里云公开的E-Commerce Bench为事实起点,用电商定价、补货与投放场景拆解长周期Agent的时间预算、状态变化、延迟后果、轨迹评测和CI回归...

3500

第一次接手AI反诈项目:传统功能测试为什么很快就不够用了?

霍格沃兹-测试开发学社

摘要:以Meta公开的WhatsApp端侧Scam Alert架构为事实起点,拆解端侧AI既要识别诈骗又不能扩张消息用途的测试难题,给出数据出境、模型完整性、实...

5200

普通测试团队如何验收高权限Agent:先把授权、网络、凭据和停止条件拆开

霍格沃兹-测试开发学社

摘要:基于OpenAI公开的第三方网络安全评测事件,拆解Agent为何会在完成靶场目标时使用范围外凭据和公共服务,并给出授权清单、网络隔离、凭据蜜罐、行为断言、...

5400

大模型写代码以后,测试到底要测什么?

霍格沃兹-测试开发学社

摘要: 如果你刚开始接触大模型测评,AI 生成代码其实是一个很适合入门的场景。过去我们习惯看“代码能不能跑、测试能不能过”,但到了 Coding Agent ...

3400

Agent到底该怎么测?这4个评测方法可以直接用

霍格沃兹-测试开发学社

摘要: 做大模型测评时,我们习惯检查回答正确性、相关性、幻觉率,再用 LLM-as-a-Judge 打个分。但进入 Agent 阶段以后,只看最终回答已经越来...

4200

为什么说 Agent Skills 是 AI 测试的“乐高积木”?

霍格沃兹-测试开发学社

上个月,团队里一个测试新人问我:“哥,你总说 Agent Skills 是乐高积木,到底什么意思?”

6400

Agent Skills 入门:技能包如何让测试 Agent 真正落地?

霍格沃兹-测试开发学社

“哥,我在项目里放了一个 SKILL.md,为什么 Claude Code 还是不会干活?”

4700

一个 SKILL.md 就能让 Agent 干活?测试人入门必看

霍格沃兹-测试开发学社

“哥,我在项目里放了一个 SKILL.md,为什么 Claude Code 还是不会干活?”

5300

深度拆解OpenAI Agents API:任务跑得越久,测试为什么越不能只看最终答案?

霍格沃兹-测试开发学社

晚上六点,研发把“升级依赖、修复兼容问题、补齐测试并生成迁移说明”交给Agent。第二天早上,PR能编译、单测也通过,可工作区多了几个缓存文件,数据库迁移脚本被...

2800

3个人维护上千条AI客服用例,模型一换,为什么整个团队又从头测一遍?

霍格沃兹-测试开发学社

摘要:周一上午,产品把AI客服模型从A切到B,理由很直接:回答更自然,价格也更低。三个人的测试团队却一点都高兴不起来。上次换模型,他们花了四天重新抽查;这次知识...

3300

智能测试从哪学起:一条斜杠链路的课程表

用户12800608

功能测试想自己把自动化跑起来,脚本会一点、页面一改就全红,覆盖率数字有了却说不清有没有拦住问题——三件事常常同时存在。再往下,用例在禅道里,脚本在另一套仓库里,...

2800

同一份Android工程换了一个AI Agent,最先坏的可能不是代码

霍格沃兹-测试开发学社

摘要:模型可以替换,但IDE提供的编译诊断、预览和模拟器工具并不天然等价。测试应把任务结果、工具使用和失败恢复一起纳入兼容矩阵。

12600

OpenAI用GPT-Live-1和Codex改造LED屏,语音测试最该盯哪条链?

霍格沃兹-测试开发学社

OpenAI用GPT-Live-1和Codex改造LED屏,语音测试最该盯哪条链?

11400

改一句提示词就敢上线?先把这三类场景挑出来陪你跑

霍格沃兹-测试开发学社

周一上午十点,产品把改好的提示词整段贴进测试群,末尾跟一句:就换了两个词,晚上能上吧。你盯着那两处改动看了半分钟——退款话术里加了「运费一并退还」,「转人工」改...

11900

智能体不是不会做,是卡住了也不告诉你:给会话装一台停滞检测器

霍格沃兹-测试开发学社

周报里那行「平均 6.2 步完成」看着很体面,直到你把某条会话的调用日志按时间铺开:同一个订单查询接口,它连着叫了十九次,参数一字未改。最后它交出一段格式完整、...

10100

pytest 断言管得了代码,管不了「基本可用」:质量人手里的第三张表,为什么决定你在不在决策桌上

霍格沃兹-测试开发学社

评审会开到第三遍,产品经理把同一句话又念了一次:「这个『基本可用』,具体要看到什么才算过了?」桌上六个人——算法、产品、运维、测试都在——没人接话。不是不想答,...

9600

用户点开一条广告,却和商家Agent聊了十分钟:谁保证它没有乱承诺?

霍格沃兹-测试开发学社

过去测广告,重点是展示、点击、跳转和归因。广告变成可对话的商家Agent后,用户会追问价格、库存、退款和效果,系统不再只是展示素材,而是在实时生成承诺。

7910

接口用例越多越难维护?先让AI学会看懂一次业务变更

霍格沃兹-测试开发学社

接口字段改动不会平均影响全部用例。真正危险的是:字段看似只多了一个枚举值,AI却按照旧规则批量维护断言,把“部分退款”仍当成“退款完成”。这篇把接口维护从“改脚...

12700

厂商会悄悄改发布页上的数字:测试团队该把结论锚在自己能重跑的那一份上

霍格沃兹-测试开发学社

选型材料还剩最后一页。你上周从厂商发布页截下来的那张图,被贴进了三份评审文档,其中一个数字撑起了整个『为什么选这版模型』的论证。今天临下班你想把同一块区域再截一...

12100

国家评测机构首次给智能体分五级:这套五维框架,测试团队明天就能抄成上线验收清单

霍格沃兹-测试开发学社

上线评审会开到第二十分钟,卡在同一个问题上:这个智能体到底能不能上线。产品说演示很顺;算法说场景集通过率不错;安全说没报漏洞;运维说回滚预案写好了;业务负责人最...

18200

相关产品

  • AI测试解决方案

    TAPD AI 测试基于DeepSeek和混元大模型重构测试范式,支持AI一键生成测试用例、智能评审需求。

领券