(转载)我做了个Skill,专门用来自动生成测试用例:一个测试Agent的诞生

目录
一、现象:测试设计正在成为瓶颈
二、本质变化:从“人工设计”到“智能体生成”
三、核心机制拆解:一个测试用例生成Skill的五个关键设计
四、典型案例对比:人工 vs Skill,差距在哪
五、工程落地启示:你的团队也能复制
六、趋势判断:测试工程师的角色会怎么变


一、现象:测试设计正在成为瓶颈

先说说那个让我崩溃的下午。

说实话,这个工具是被逼出来的。那天手里压着两个版本的需求,截止时间是下午五点。一份文字需求,一份原型图,加起来三四十页,从头写测试用例。我当时的感受是:这玩意儿凭什么要人手工做?

做过测试的应该都懂那种感觉——业务逻辑要反复看,边界值要一个个算,场景流要慢慢梳理,然后还得在XMind里一个节点一个节点地敲进去。一份中等复杂的需求,快的一两小时,慢的大半天就没了。

更烦的不是耗时,是那些“重复的愚蠢”:上周刚问过产品某个模糊需求怎么理解,这周换了个文档,同样的问题又得问一遍。优先级怎么定?每次都靠感觉,P0和P1混在一起,分布飘忽不定。某些场景几乎每次都忘——弱网重试、空列表状态、文件上传边界值——不是不知道,就是在赶时间的时候会漏。

很多人已经开始感觉到:测试设计的瓶颈不在执行,不在工具,在设计本身。而设计这件事,目前大部分还是靠人工堆时间。

我当时就想,AI整天说能替代人了,怎么就没人做一个真的能接手这件事的工具?不是那种给你列几个测试点的半成品,而是真正端到端——进来需求,出来一份可以直接导入XMind的完整用例文件。

于是自己动手做了。


二、本质变化:从“人工设计”到“智能体生成”

传统的测试用例生成,本质上是一个翻译加枚举的过程:人读需求,人脑调用测试设计方法,人手工录入。瓶颈在于人脑的工作记忆有限,而且容易疲劳、遗漏。

现在AI Agent介入之后,变化的核心不是“生成速度快了”,而是设计过程被结构化、可重复、可自检

这个Skill做的事情,不是把需求丢给GPT让它随便写几句,而是把一个有经验的测试工程师的思维过程——方法选择、边界计算、场景梳理、风险推测——编码成了一个可执行的智能体工作流。

本质是:把测试设计这个“隐性知识”变成了“显性流程”。

维度传统人工该Skill
方法调用靠经验,不固定四种方法有序叠加
覆盖率判断凭感觉量化指标自动检查
遗漏场景下次可能还漏记忆机制,越用越全
输出格式手动整理直接生成XMind文件

这个变化带来的直接结果:测试设计从“手艺活”变成了“配置活”。


三、核心机制拆解:一个测试用例生成Skill的五个关键设计

这个Skill不是简单的“需求→LLM→用例”。它内部有五个核心模块,按顺序执行。

1|四种测试设计方法,有序叠加

很多AI工具给出的测试用例,就是把需求复述一遍,加个“验证一下是否正确”。这不叫测试设计,这叫翻译。

这个Skill内置了测试领域真正在用的四种方法,按顺序叠加执行:

  • 等价类划分:把所有输入划分成有效区间和无效区间,不遗漏,不重叠。
  • 边界值分析:上限、下限、临界点,一个个算出来,而不是靠感觉“试试边界”。
  • 场景法:完整梳理基本流、备选流、异常流,业务主线和每一条分支都要覆盖到。
  • 错误推测:高风险模块补充特殊字符、极端值、并发场景,把最容易出BUG的地方重点照顾。

四种方法不是随机调用,而是有顺序地叠加,最终生成的用例集是一个有结构、有层次的整体。

观点句:测试设计不是翻译需求,而是构造有效验证。

2|多模态:从图片里读场景

很多时候需求根本没有文字,来的就是一张Figma截图、一张原型图、或者一张画满箭头的业务流程图。以前遇到这种情况,我得自己先把图“翻译”成文字,再去写用例,相当于多做了一遍工。

现在把图片直接丢进去就行了。工具会用多模态能力读取图片内容:

  • UI设计稿 → 识别页面元素、输入框、按钮、状态文案 → 生成表单验证和交互用例
  • 流程图 → 识别分支条件、步骤顺序、异常路径 → 生成完整的场景流用例
  • 规则表格截图 → 识别枚举值和条件组合 → 生成等价类和边界值用例

图片和文字可以同时放进去,工具会交叉对照,补全单独依赖任何一方都可能漏掉的场景。

3|质量预审:不合格不放行

AI生成测试用例最让人不放心的地方不是慢,而是你不知道它漏了什么。生出来一堆用例,覆盖率其实只有60%,优先级全堆在P2,P0寥寥无几——这种结果比没有还烦人,因为你还得去检查。

工具在正式生成之前会跑一轮质量预审,逐项核查:

  • 需求覆盖率是否达到95%以上
  • P0占比是否在合理区间(10–15%)
  • P1占比是否达标(30–40%)
  • 每条需求是否至少关联了一种测试设计方法
  • 有没有凭空编造需求文档里不存在的场景
  • 有没有语义重复的用例

六项全过,才进入生成阶段。任何一项不达标,先自动修正,改完再输出。整个过程你只需要在两个检查点确认一下,其余全自动。

观点句:AI生成用例最大的问题不是慢,而是你不知道它漏了什么。

4|记忆机制:越用越懂你

这部分是我花时间最多的地方,也是让它从“能用”变成“好用”的关键。

第一次用完之后,Skill会在项目里创建一个.memory/文件夹,把这些东西记下来:

  • 你做过的歧义判断:某个模糊需求你怎么理解的,下次遇到类似描述直接复用
  • 你的标签选择:这个项目是PC端还是APP端,记住了,下次不用重选
  • 你的步骤粒度偏好:你觉得步骤太细让它合并了,它记住,后续风格保持一致
  • 历史漏掉的场景:哪类场景之前经常遗漏,这次自动补进去

用了几次之后,生成质量会明显比第一次好。不是因为模型升级了,而是因为它记住了你的项目和你的习惯。

5|输出直接可用:XMind免二次整理

生成的文件是.xmind格式,结构严格按照XMind导入规范组织:

  • 项目名作为根节点,下面按功能模块分层
  • 每条用例包含:前置条件、操作步骤、预期结果、优先级标签
  • 同一模块下的用例按功能区域归类,不会出现“每个功能点单独建一个目录”导致目录爆炸的问题

打开XMind,全选导入,一份结构清晰的测试用例树就在眼前了。

Copyright © 2018-2026 莫妮卡的小屋. All Right Reserved.

关于本站

欢迎来到莫妮卡的小屋。我是一名有多年测试经验的女娃子,正在探索人工智能的边界。这里记录工作中的测试技巧、实践经验与质量观念,以及成长心得。以诚恳的笔触分享经验、学习进阶,愿成为同路人提升技能、发现热情的温馨小窝。

找到我

  • 星系板块永恒昼半球 · 极光潮汐区 (Aurora Tide Sector, Eternal Day Hemisphere)
  • 座标思念波长 520 赫兹 · 萤火深空大道 13 单元 (520Hz Resonance, Firefly Deep-space Blvd, Unit 13)
  • 建筑倒悬的莫比乌斯书店 · 梦境采样塔 (The Inverted Mobius Bookstore, Dream-sampling Tower)
  • 房间第 9.75 维度 · 玫瑰色星云套间 1314 室 (Dimension 9.75, Rosy Nebula Suite, Room 1314)