AgentStack
Browse Sign in
Browse Why AgentStack Sell Docs
Sign in
SKILL verified MIT Self-run

Exp Usability Testing

skill-guofu-shiqu-ux-expert-skills-exp-usability-testing · by guofu-shiqu

可用性测试。当需要设计可用性测试方案、编写测试任务脚本、执行测试或分析测试结果时调用。

No reviews yet
0 installs
29 views
0.0% view→install

Install

$ agentstack add skill-guofu-shiqu-ux-expert-skills-exp-usability-testing

✓ scanned · ✓ verified, works with Claude Code, Cursor, and more.

Security review

✓ Passed

No issues found. Passed automated security review. · v0.1.0 How review works →

  • Prompt-injection patterns
  • Secret / credential exfiltration
  • Dangerous shell & filesystem operations
  • Untrusted network calls
  • Known-malicious package signatures

What it can access

  • Network access No
  • Filesystem access No
  • Shell / process execution No
  • Environment & secrets No
  • Dynamic code execution No

From automated source analysis of v0.1.0. “Used” means the capability is present in the source — more access means more to trust, not that it’s unsafe.

View the full security report →

Verified badge

Passed review? Show it. Paste this badge into your README, it links to the public security report.

AgentStack Verified badge Links to your public security report.
[![AgentStack Verified](https://agentstack.voostack.com/badges/verified.svg)](https://agentstack.voostack.com/security/report/skill-guofu-shiqu-ux-expert-skills-exp-usability-testing)

Reliability & compatibility

Security review passed
0 installs to date
no reviews yet
3mo ago

Declared compatibility

Claude CodeClaude Desktop

Compatibility is declared by the source manifest. End-to-end runtime verification is coming, see below.

Preview Execution monitoring

We're building live execution health for every listing: tool-call success rate, median latency, uptime, and last-checked timestamps, measured, not self-reported. It isn't live yet, so we don't show numbers we can't stand behind.

How agent discovery & health will work →
Are you the author of Exp Usability Testing? Claim this listing to set pricing, connect Stripe payouts, and keep 70% of every sale.
Sign up to claim

About

可用性测试

设计可用性测试方案,包括测试类型选择、任务设计、测试脚本编写、执行方法和结果分析,发现用户实际使用中的体验问题。

触发条件

  • 需要发现用户实际使用中的体验问题
  • 需要验证设计改版是否真正改善体验
  • 需要评估特定任务流程的可用性
  • 需要在上线前进行可用性验证
  • 需要对比新旧方案的体验差异

核心能力

1. 测试类型选择

| 测试类型 | 方法 | 适用阶段 | 目的 | |---------|------|---------|------| | 形成性可用性测试 | 小样本(5-8人),定性为主 | 设计迭代阶段 | 发现问题、指导改进 | | 总结性可用性测试 | 大样本(20+),定量为主 | 上线后/版本对比 | 评估质量、基线对比 | | 远程可用性测试 | 线上工具,异步或同步 | 地理分散用户 | 降低成本、扩大样本 | | 眼动追踪测试 | 眼动仪记录注视点 | 视觉密集页面 | 了解视觉注意力分布 | | A/B 测试 | 线上分流对比 | 上线后验证 | 验证方案效果 | | 专家评审 | 专家走查 | 快速评估 | 快速发现明显问题 |

2. 测试任务设计

任务设计原则:

  • 任务应基于真实用户目标,而非功能点
  • 任务描述避免引导性语言
  • 任务应有明确的完成标准
  • 任务难度应覆盖核心场景

任务设计模板:

任务名称:[...]
场景描述:[给用户一个真实的生活化场景]
任务目标:[用户需要完成什么]
成功标准:[怎样算完成]
预计时长:[X 分钟]
关注点:[测试者要重点观察什么]

任务类型:

  • 成功路径任务 — 测试用户能否顺利完成核心任务
  • 探索任务 — 测试用户能否自主发现功能
  • 错误恢复任务 — 测试用户能否从错误中恢复
  • 边界任务 — 测试极端场景下的表现

3. 测试脚本结构

完整的测试脚本包含以下部分:

  1. 开场说明 — 研究目的、时长、隐私、鼓励发声思考
  2. 暖场问题 — 了解用户背景、使用习惯
  3. 前测问卷 — 收集用户属性和预期
  4. 测试任务 — 按顺序执行各任务
  5. 任务后评分 — 每个任务后让用户评分(SEQ 单题易用性量表)
  6. 整体评估 — SUS 量表或整体满意度
  7. 回顾访谈 — 询问困惑点、改进建议
  8. 结束语 — 感谢、后续跟进

4. 关键指标

过程指标:

  • 任务完成率(Task Completion Rate)
  • 任务时长(Time on Task)
  • 错误次数(Number of Errors)
  • 求助次数(Help Requests)
  • 迷路次数(Lostness)

主观指标:

  • SEQ(Single Ease Question)— "完成这个任务的难度是?" 1-7 分
  • SUS(System Usability Scale)— 10 题标准量表
  • ASQ(After-Scenario Questionnaire)— 场景后满意度
  • NPS — 净推荐值

行为指标:

  • 首次点击正确率
  • 回退次数
  • 停滞时间(犹豫)
  • 非预期路径

5. 结果分析方法

问题分类: | 严重程度 | 定义 | 处理优先级 | |---------|------|-----------| | 致命(P0) | 用户完全无法完成任务 | 立即修复 | | 严重(P1) | 用户花费大量时间或多次出错 | 本版本修复 | | 一般(P2) | 用户有困惑但最终完成 | 下版本优化 | | 轻微(P3) | 小的体验摩擦 | 放入优化池 |

输出格式:可用性测试方案 + 结果报告

测试方案

【可用性测试方案】

▸ 测试目标:[...]
▸ 测试类型:[形成性/总结性/远程/眼动/A-B/专家评审]
▸ 测试对象:[用户描述],样本量:[X人]
▸ 测试环境:[实验室/远程/线上]

▸ 任务清单:
  任务1:[名称],场景:[...],成功标准:[...],预计:[X分钟]
  任务2:[...]
  ...

▸ 测试脚本:[完整脚本]
▸ 评分量表:[SEQ / SUS / ASQ / NPS]
▸ 预计总时长:[X分钟/人]

结果报告

【可用性测试结果报告】

▸ 测试概况:
  参与人数:[X]
  测试时间:[...]
  测试版本:[...]

━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━

▸ 一、关键指标

  任务     │ 完成率 │ 平均时长 │ 错误次数 │ SEQ均值 │ 严重程度
  ─────────┼────────┼──────────┼──────────┼─────────┼─────────
  任务1    │  XX%   │  X分XX秒 │   X.X    │  X.X    │  [...]
  任务2    │  XX%   │  X分XX秒 │   X.X    │  X.X    │  [...]
  ...
  整体     │  XX%   │  X分XX秒 │   X.X    │  X.X    │

  SUS 得分:[XX.X]/100([优秀/良好/一般/差])

━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━

▸ 二、问题清单

  P0 致命问题:
    1. [问题描述],出现频次:[X/X],发生环节:[...]
       原因分析:[...]
       修复建议:[...]

  P1 严重问题:
    1. [...]

  P2 一般问题:
    1. [...]

  P3 轻微问题:
    1. [...]

━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━

▸ 三、用户行为洞察

  典型路径:[...]
  迷路热点:[...]
  犹豫时刻:[...]
  意外发现:[...]

━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━

▸ 四、用户原声

  正面:"[用户原话]"
  负面:"[用户原话]"
  建议:"[用户原话]"

━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━

▸ 五、改版建议

  必须修复:
    1. [...]
  建议优化:
    1. [...]
  验证建议:
    [修复后应再次测试哪些任务]

使用方法

当需要验证和发现可用性问题时调用本 skill。测试结果可与认知心理学分析、旅程分析等 skill 衔接,将发现的问题转化为深层的体验洞察和优化策略。

Source & license

This open-source skill is cataloged on AgentStack and links to its original source — we do not rehost the code.

Install and usage instructions live in the source repository linked above.

Reviews

No reviews yet, be the first.

Versions

  • v0.1.0 Imported from the upstream source.