# Skill Qa Tester

> QoderWork技能质量测试与验证工具。系统化测试技能的功能完整性、数据准确性、内部一致性和红线合规性。适用于技能首次发布前的全面测试、版本更新后的回归测试、多技能之间的一致性检查。当用户要求测试技能、验证技能质量、复核技能准确性、或打包发布技能前，自动应用此技能。

- **Type:** Skill
- **Install:** `agentstack add skill-eiway112-prefab-interior-skills-skill-qa-tester`
- **Verified:** Yes — security-reviewed for prompt injection and unsafe behavior
- **Seller:** [eiway112](https://agentstack.voostack.com/s/eiway112)
- **Installs:** 0
- **Category:** [Agent Skills](https://agentstack.voostack.com/c/agent-skills)
- **Latest version:** 0.1.0
- **License:** MIT
- **Upstream author:** [eiway112](https://github.com/eiway112)
- **Source:** https://github.com/eiway112/prefab-interior-skills/tree/master/技能仓备份/skill-qa-tester

## Install

```sh
agentstack add skill-eiway112-prefab-interior-skills-skill-qa-tester
```

Requires the [AgentStack CLI](https://agentstack.voostack.com/docs/cli). Works with Claude Code, Cursor, and any MCP-compatible agent.

## About

# 技能质量测试方法论

> 核心理念：以源文件为唯一真相源，逐行核验每一个事实声明。

## 适用技能类型

本方法论适用于以下类型的知识密集型技能：

| 类型 | 特征 | 测试重点 |
|------|------|---------|
| 数据表格型 | 含大量数值、标准编号 | 每个数值和编号的行级核验 |
| 方法论型 | 教授思维框架 | 框架完整性、推理链正确性 |
| 审核工具型 | 检测其他内容的错误 | 错误检出率、分类准确性 |
| 模板输出型 | 按固定模板生成响应 | 模板格式合规性 |

## 五阶段测试流程

### 阶段一：全量读取

1. 列出技能目录下所有文件
2. 逐个读取全部源文件（不可跳读，不可摘要）
3. 记录文件清单：文件名、行数、大小、最后修改日期
4. 建立文件关系图：哪些文件互相引用、引用路径是否正确

### 阶段二：测试用例设计

设计原则：**每种输出场景至少一个用例，每种边界条件至少一个用例**。

#### 2.1 覆盖矩阵

| 维度 | 必须覆盖 | 核验方法 |
|------|---------|---------|
| 输出模板 | 每种模板类型至少1个用例 | 对照SKILL.md中的模板定义 |
| 响应层级 | 每层至少1个用例（如适用） | 对照SKILL.md中的层级定义 |
| 跨技能路由 | 每条路由规则至少1个用例 | 对照路由规则定义 |
| 标准引用 | 高频标准+易混淆标准 | 核对编号、年份、名称 |
| 红线压力 | 至少2个对抗性用例 | 检查是否遵守红线规则 |
| 免责声明 | 每个用例均检查 | 逐句比对SKILL.md定义文本 |

#### 2.2 测试用例模板

```
测试编号：T[N]
场景：[正常/边界/异常/对抗]
用户查询：[具体文本]
预期响应要点：
  - [应包含的标准编号及数值]
  - [应使用的输出模板]
  - [应触发的路由规则]
核验锚点：[源文件名+行号，用于逐条验证]
```

#### 2.3 对抗性测试设计

构造以下类型的查询来暴露技能薄弱环节：

| 对抗类型 | 查询设计思路 | 预期行为 |
|---------|------------|---------|
| 诱导编造 | 条件不完整，诱导给出具体数值 | 应承认不确定并指明查阅路径 |
| 过时标准 | 查询已废止标准的最新版本 | 应提示新标准和替代关系 |
| 跨领域越界 | 问超出技能范围的问题 | 应识别并路由到正确技能 |
| 矛盾前提 | 查询中嵌入错误假设 | 应纠正错误假设后再回答 |
| 品牌诱导 | 询问"哪个品牌最好" | 应拒绝推荐品牌 |

### 阶段三：并行执行与逐项核验

#### 3.1 执行方式

使用平台可用的并行执行能力启动独立测试用例：
- 每个子代理负责1-2个测试用例
- 子代理必须先读取全部源文件再模拟响应
- 模拟响应中的每个事实声明必须标注依据（文件+行号）

#### 3.2 核验清单

对每个模拟响应逐项核验：

**数据准确性**
- [ ] 标准编号格式正确（GB/GB/T/JGJ/JC/T等）
- [ ] 标准年份正确（对照源文件行号）
- [ ] 标准名称完整准确
- [ ] 数值与源文件完全一致（含单位、精度）
- [ ] 边界符号正确（≥/>/≤/ 本回复基于知识库整理时间点的技术标准与行业通用实践整理，仅供技术参考。标准规范以官方发布的现行有效版本为准，引用内容可能存在时效性限制，重要项目请务必通过官方渠道核实最新版本。具体项目的设计、施工及验收应依据项目所在地适用的法律法规及标准规范执行，并由具备相应资质的专业人员负责。涉及结构安全、消防安全等重大事项的，请务必咨询相关专业机构。

## 常见问题模式

| 模式 | 检测方法 | 示例 |
|------|---------|------|
| 标准年份过时 | 交叉比对多文件中同一标准的年份 | GB 55038-2024应为2025 |
| 状态标记滞后 | 对照实施日期和当前日期 | 已实施仍标"即将实施" |
| 数量统计不一致 | 实际计数 vs 声明数量 | "55项"实际56项 |
| 免责文本不完整 | 逐句比对SKILL.md定义 | 缺少"引用内容可能存在时效性限制" |
| 表头与数据列不匹配 | 列数对照 | 表头6列数据只有5列 |
| 边界符号混用 | 搜索≥和>的使用 | "≥"应为">" |
| 指标体系混淆 | 确认标准使用的指标类型 | GB 55038用DnT,w+C非Rw+C |
| 跨文件引用断裂 | 验证A文件引用B文件的路径 | reference.md不存在 |
| 示例与主表不一致 | 对比示例数值和主表格数值 | 示例写45dB主表写48dB |
| 部分修复遗漏 | 修复后读取全表/全节逐行扫描 | Section 9共8行只修5行，遗漏3行 |
| 格式模式残留 | 搜索旧模式确认全文清除 | 部分行用emoji标识，部分行仍用纯文本 |

## 注意事项

1. **源文件是唯一真相源**：核验以源文件为准，不以"常识"或"网上搜索结果"为准
2. **每个声明都要有锚点**：模拟响应中的每个事实必须能追溯到具体文件和行号
3. **并行测试提效**：用多个独立测试执行单元并行执行独立测试用例
4. **修正必须精确**：一次改一处，改完立即验证，避免连锁错误
5. **回归必须完整**：修正后不能只验证被修的那几行，必须对修复涉及的整个表格/章节/模式执行全量扫描，确认无部分修复、无模式残留、无涟漪遗漏（详见阶段四 §4.2）
6. **区分"错误"与"警告"**：错误=与源文件不一致（必须修复），警告=可改进但不影响正确性
7. **改进建议一并处理**：测试报告中列出的改进建议应当场处理，不留尾巴
8. **打包前清理**：排除非技能文件（.git、node_modules、.env、数据库、空文件）
9. **打包后必测**：打包后的.skill文件必须做功能冒烟测试，确认加载和响应正常

双平台动作映射见 `../platform-adapter-reference.md`。

## Source & license

This open-source skill is cataloged on AgentStack and links to its original source — we do not rehost the code.

- **Author:** [eiway112](https://github.com/eiway112)
- **Source:** [eiway112/prefab-interior-skills](https://github.com/eiway112/prefab-interior-skills)
- **License:** MIT

Install and usage instructions live in the source repository linked above.

## Pricing

- **Free** — Free

## Security capabilities

Automated source analysis of v0.1.0 — what this tool can access:

- **Network access:** no
- **Filesystem access:** no
- **Shell / process execution:** no
- **Environment & secrets:** yes
- **Dynamic code execution:** no

*"Yes" means the capability is present in the source — more access means more to trust, not that it is unsafe.*


## Versions

- **0.1.0** — security scan: passed — Imported from the upstream source.

## Links

- Listing page: https://agentstack.voostack.com/l/skill-eiway112-prefab-interior-skills-skill-qa-tester
- Seller: https://agentstack.voostack.com/s/eiway112
- Browse the marketplace: https://agentstack.voostack.com/browse

---
Listed on AgentStack — the marketplace for AI agent skills and MCP servers. Every listing is security-reviewed. Creators keep 70%.
