AgentStack
Browse Sign in
Browse Why AgentStack Sell Docs
Sign in
SKILL verified MIT Self-run

Skill Qa Tester

skill-eiway112-prefab-interior-skills-skill-qa-tester · by eiway112

QoderWork技能质量测试与验证工具。系统化测试技能的功能完整性、数据准确性、内部一致性和红线合规性。适用于技能首次发布前的全面测试、版本更新后的回归测试、多技能之间的一致性检查。当用户要求测试技能、验证技能质量、复核技能准确性、或打包发布技能前,自动应用此技能。

No reviews yet
0 installs
16 views
0.0% view→install

Install

$ agentstack add skill-eiway112-prefab-interior-skills-skill-qa-tester

✓ scanned · ✓ verified, works with Claude Code, Cursor, and more.

Security review

✓ Passed

No issues found. Passed automated security review. · v0.1.0 How review works →

  • Prompt-injection patterns
  • Secret / credential exfiltration
  • Dangerous shell & filesystem operations
  • Untrusted network calls
  • Known-malicious package signatures

What it can access

  • Network access No
  • Filesystem access No
  • Shell / process execution No
  • Environment & secrets Used
  • Dynamic code execution No

From automated source analysis of v0.1.0. “Used” means the capability is present in the source — more access means more to trust, not that it’s unsafe.

View the full security report →

Verified badge

Passed review? Show it. Paste this badge into your README, it links to the public security report.

AgentStack Verified badge Links to your public security report.
[![AgentStack Verified](https://agentstack.voostack.com/badges/verified.svg)](https://agentstack.voostack.com/security/report/skill-eiway112-prefab-interior-skills-skill-qa-tester)

Reliability & compatibility

Security review passed
0 installs to date
no reviews yet
17d ago

Declared compatibility

Claude CodeClaude Desktop

Compatibility is declared by the source manifest. End-to-end runtime verification is coming, see below.

Preview Execution monitoring

We're building live execution health for every listing: tool-call success rate, median latency, uptime, and last-checked timestamps, measured, not self-reported. It isn't live yet, so we don't show numbers we can't stand behind.

How agent discovery & health will work →
Are you the author of Skill Qa Tester? Claim this listing to set pricing, connect Stripe payouts, and keep 70% of every sale.
Sign up to claim

About

技能质量测试方法论

> 核心理念:以源文件为唯一真相源,逐行核验每一个事实声明。

适用技能类型

本方法论适用于以下类型的知识密集型技能:

| 类型 | 特征 | 测试重点 | |------|------|---------| | 数据表格型 | 含大量数值、标准编号 | 每个数值和编号的行级核验 | | 方法论型 | 教授思维框架 | 框架完整性、推理链正确性 | | 审核工具型 | 检测其他内容的错误 | 错误检出率、分类准确性 | | 模板输出型 | 按固定模板生成响应 | 模板格式合规性 |

五阶段测试流程

阶段一:全量读取

  1. 列出技能目录下所有文件
  2. 逐个读取全部源文件(不可跳读,不可摘要)
  3. 记录文件清单:文件名、行数、大小、最后修改日期
  4. 建立文件关系图:哪些文件互相引用、引用路径是否正确

阶段二:测试用例设计

设计原则:每种输出场景至少一个用例,每种边界条件至少一个用例

2.1 覆盖矩阵

| 维度 | 必须覆盖 | 核验方法 | |------|---------|---------| | 输出模板 | 每种模板类型至少1个用例 | 对照SKILL.md中的模板定义 | | 响应层级 | 每层至少1个用例(如适用) | 对照SKILL.md中的层级定义 | | 跨技能路由 | 每条路由规则至少1个用例 | 对照路由规则定义 | | 标准引用 | 高频标准+易混淆标准 | 核对编号、年份、名称 | | 红线压力 | 至少2个对抗性用例 | 检查是否遵守红线规则 | | 免责声明 | 每个用例均检查 | 逐句比对SKILL.md定义文本 |

2.2 测试用例模板
测试编号:T[N]
场景:[正常/边界/异常/对抗]
用户查询:[具体文本]
预期响应要点:
  - [应包含的标准编号及数值]
  - [应使用的输出模板]
  - [应触发的路由规则]
核验锚点:[源文件名+行号,用于逐条验证]
2.3 对抗性测试设计

构造以下类型的查询来暴露技能薄弱环节:

| 对抗类型 | 查询设计思路 | 预期行为 | |---------|------------|---------| | 诱导编造 | 条件不完整,诱导给出具体数值 | 应承认不确定并指明查阅路径 | | 过时标准 | 查询已废止标准的最新版本 | 应提示新标准和替代关系 | | 跨领域越界 | 问超出技能范围的问题 | 应识别并路由到正确技能 | | 矛盾前提 | 查询中嵌入错误假设 | 应纠正错误假设后再回答 | | 品牌诱导 | 询问"哪个品牌最好" | 应拒绝推荐品牌 |

阶段三:并行执行与逐项核验

3.1 执行方式

使用平台可用的并行执行能力启动独立测试用例:

  • 每个子代理负责1-2个测试用例
  • 子代理必须先读取全部源文件再模拟响应
  • 模拟响应中的每个事实声明必须标注依据(文件+行号)
3.2 核验清单

对每个模拟响应逐项核验:

数据准确性

  • [ ] 标准编号格式正确(GB/GB/T/JGJ/JC/T等)
  • [ ] 标准年份正确(对照源文件行号)
  • [ ] 标准名称完整准确
  • [ ] 数值与源文件完全一致(含单位、精度)
  • [ ] 边界符号正确(≥/>/≤/ 本回复基于知识库整理时间点的技术标准与行业通用实践整理,仅供技术参考。标准规范以官方发布的现行有效版本为准,引用内容可能存在时效性限制,重要项目请务必通过官方渠道核实最新版本。具体项目的设计、施工及验收应依据项目所在地适用的法律法规及标准规范执行,并由具备相应资质的专业人员负责。涉及结构安全、消防安全等重大事项的,请务必咨询相关专业机构。

常见问题模式

| 模式 | 检测方法 | 示例 | |------|---------|------| | 标准年份过时 | 交叉比对多文件中同一标准的年份 | GB 55038-2024应为2025 | | 状态标记滞后 | 对照实施日期和当前日期 | 已实施仍标"即将实施" | | 数量统计不一致 | 实际计数 vs 声明数量 | "55项"实际56项 | | 免责文本不完整 | 逐句比对SKILL.md定义 | 缺少"引用内容可能存在时效性限制" | | 表头与数据列不匹配 | 列数对照 | 表头6列数据只有5列 | | 边界符号混用 | 搜索≥和>的使用 | "≥"应为">" | | 指标体系混淆 | 确认标准使用的指标类型 | GB 55038用DnT,w+C非Rw+C | | 跨文件引用断裂 | 验证A文件引用B文件的路径 | reference.md不存在 | | 示例与主表不一致 | 对比示例数值和主表格数值 | 示例写45dB主表写48dB | | 部分修复遗漏 | 修复后读取全表/全节逐行扫描 | Section 9共8行只修5行,遗漏3行 | | 格式模式残留 | 搜索旧模式确认全文清除 | 部分行用emoji标识,部分行仍用纯文本 |

注意事项

  1. 源文件是唯一真相源:核验以源文件为准,不以"常识"或"网上搜索结果"为准
  2. 每个声明都要有锚点:模拟响应中的每个事实必须能追溯到具体文件和行号
  3. 并行测试提效:用多个独立测试执行单元并行执行独立测试用例
  4. 修正必须精确:一次改一处,改完立即验证,避免连锁错误
  5. 回归必须完整:修正后不能只验证被修的那几行,必须对修复涉及的整个表格/章节/模式执行全量扫描,确认无部分修复、无模式残留、无涟漪遗漏(详见阶段四 §4.2)
  6. 区分"错误"与"警告":错误=与源文件不一致(必须修复),警告=可改进但不影响正确性
  7. 改进建议一并处理:测试报告中列出的改进建议应当场处理,不留尾巴
  8. 打包前清理:排除非技能文件(.git、node_modules、.env、数据库、空文件)
  9. 打包后必测:打包后的.skill文件必须做功能冒烟测试,确认加载和响应正常

双平台动作映射见 ../platform-adapter-reference.md

Source & license

This open-source skill is cataloged on AgentStack and links to its original source — we do not rehost the code.

Install and usage instructions live in the source repository linked above.

Reviews

No reviews yet, be the first.

Versions

  • v0.1.0 Imported from the upstream source.