Install
$ agentstack add skill-eiway112-prefab-interior-skills-skill-qa-tester ✓ scanned · ✓ verified, works with Claude Code, Cursor, and more.
Security review
✓ PassedNo issues found. Passed automated security review. · v0.1.0 How review works →
- ✓ Prompt-injection patterns
- ✓ Secret / credential exfiltration
- ✓ Dangerous shell & filesystem operations
- ✓ Untrusted network calls
- ✓ Known-malicious package signatures
What it can access
- ✓ Network access No
- ✓ Filesystem access No
- ✓ Shell / process execution No
- ● Environment & secrets Used
- ✓ Dynamic code execution No
From automated source analysis of v0.1.0. “Used” means the capability is present in the source — more access means more to trust, not that it’s unsafe.
Verified badge
Passed review? Show it. Paste this badge into your README, it links to the public security report.
Reliability & compatibility
Declared compatibility
Compatibility is declared by the source manifest. End-to-end runtime verification is coming, see below.
We're building live execution health for every listing: tool-call success rate, median latency, uptime, and last-checked timestamps, measured, not self-reported. It isn't live yet, so we don't show numbers we can't stand behind.
How agent discovery & health will work →About
技能质量测试方法论
> 核心理念:以源文件为唯一真相源,逐行核验每一个事实声明。
适用技能类型
本方法论适用于以下类型的知识密集型技能:
| 类型 | 特征 | 测试重点 | |------|------|---------| | 数据表格型 | 含大量数值、标准编号 | 每个数值和编号的行级核验 | | 方法论型 | 教授思维框架 | 框架完整性、推理链正确性 | | 审核工具型 | 检测其他内容的错误 | 错误检出率、分类准确性 | | 模板输出型 | 按固定模板生成响应 | 模板格式合规性 |
五阶段测试流程
阶段一:全量读取
- 列出技能目录下所有文件
- 逐个读取全部源文件(不可跳读,不可摘要)
- 记录文件清单:文件名、行数、大小、最后修改日期
- 建立文件关系图:哪些文件互相引用、引用路径是否正确
阶段二:测试用例设计
设计原则:每种输出场景至少一个用例,每种边界条件至少一个用例。
2.1 覆盖矩阵
| 维度 | 必须覆盖 | 核验方法 | |------|---------|---------| | 输出模板 | 每种模板类型至少1个用例 | 对照SKILL.md中的模板定义 | | 响应层级 | 每层至少1个用例(如适用) | 对照SKILL.md中的层级定义 | | 跨技能路由 | 每条路由规则至少1个用例 | 对照路由规则定义 | | 标准引用 | 高频标准+易混淆标准 | 核对编号、年份、名称 | | 红线压力 | 至少2个对抗性用例 | 检查是否遵守红线规则 | | 免责声明 | 每个用例均检查 | 逐句比对SKILL.md定义文本 |
2.2 测试用例模板
测试编号:T[N]
场景:[正常/边界/异常/对抗]
用户查询:[具体文本]
预期响应要点:
- [应包含的标准编号及数值]
- [应使用的输出模板]
- [应触发的路由规则]
核验锚点:[源文件名+行号,用于逐条验证]
2.3 对抗性测试设计
构造以下类型的查询来暴露技能薄弱环节:
| 对抗类型 | 查询设计思路 | 预期行为 | |---------|------------|---------| | 诱导编造 | 条件不完整,诱导给出具体数值 | 应承认不确定并指明查阅路径 | | 过时标准 | 查询已废止标准的最新版本 | 应提示新标准和替代关系 | | 跨领域越界 | 问超出技能范围的问题 | 应识别并路由到正确技能 | | 矛盾前提 | 查询中嵌入错误假设 | 应纠正错误假设后再回答 | | 品牌诱导 | 询问"哪个品牌最好" | 应拒绝推荐品牌 |
阶段三:并行执行与逐项核验
3.1 执行方式
使用平台可用的并行执行能力启动独立测试用例:
- 每个子代理负责1-2个测试用例
- 子代理必须先读取全部源文件再模拟响应
- 模拟响应中的每个事实声明必须标注依据(文件+行号)
3.2 核验清单
对每个模拟响应逐项核验:
数据准确性
- [ ] 标准编号格式正确(GB/GB/T/JGJ/JC/T等)
- [ ] 标准年份正确(对照源文件行号)
- [ ] 标准名称完整准确
- [ ] 数值与源文件完全一致(含单位、精度)
- [ ] 边界符号正确(≥/>/≤/ 本回复基于知识库整理时间点的技术标准与行业通用实践整理,仅供技术参考。标准规范以官方发布的现行有效版本为准,引用内容可能存在时效性限制,重要项目请务必通过官方渠道核实最新版本。具体项目的设计、施工及验收应依据项目所在地适用的法律法规及标准规范执行,并由具备相应资质的专业人员负责。涉及结构安全、消防安全等重大事项的,请务必咨询相关专业机构。
常见问题模式
| 模式 | 检测方法 | 示例 | |------|---------|------| | 标准年份过时 | 交叉比对多文件中同一标准的年份 | GB 55038-2024应为2025 | | 状态标记滞后 | 对照实施日期和当前日期 | 已实施仍标"即将实施" | | 数量统计不一致 | 实际计数 vs 声明数量 | "55项"实际56项 | | 免责文本不完整 | 逐句比对SKILL.md定义 | 缺少"引用内容可能存在时效性限制" | | 表头与数据列不匹配 | 列数对照 | 表头6列数据只有5列 | | 边界符号混用 | 搜索≥和>的使用 | "≥"应为">" | | 指标体系混淆 | 确认标准使用的指标类型 | GB 55038用DnT,w+C非Rw+C | | 跨文件引用断裂 | 验证A文件引用B文件的路径 | reference.md不存在 | | 示例与主表不一致 | 对比示例数值和主表格数值 | 示例写45dB主表写48dB | | 部分修复遗漏 | 修复后读取全表/全节逐行扫描 | Section 9共8行只修5行,遗漏3行 | | 格式模式残留 | 搜索旧模式确认全文清除 | 部分行用emoji标识,部分行仍用纯文本 |
注意事项
- 源文件是唯一真相源:核验以源文件为准,不以"常识"或"网上搜索结果"为准
- 每个声明都要有锚点:模拟响应中的每个事实必须能追溯到具体文件和行号
- 并行测试提效:用多个独立测试执行单元并行执行独立测试用例
- 修正必须精确:一次改一处,改完立即验证,避免连锁错误
- 回归必须完整:修正后不能只验证被修的那几行,必须对修复涉及的整个表格/章节/模式执行全量扫描,确认无部分修复、无模式残留、无涟漪遗漏(详见阶段四 §4.2)
- 区分"错误"与"警告":错误=与源文件不一致(必须修复),警告=可改进但不影响正确性
- 改进建议一并处理:测试报告中列出的改进建议应当场处理,不留尾巴
- 打包前清理:排除非技能文件(.git、node_modules、.env、数据库、空文件)
- 打包后必测:打包后的.skill文件必须做功能冒烟测试,确认加载和响应正常
双平台动作映射见 ../platform-adapter-reference.md。
Source & license
This open-source skill is cataloged on AgentStack and links to its original source — we do not rehost the code.
- Author: eiway112
- Source: eiway112/prefab-interior-skills
- License: MIT
Install and usage instructions live in the source repository linked above.
Reviews
No reviews yet, be the first.
Write a review
Versions
- v0.1.0 Imported from the upstream source.