AgentStack
SKILL verified MIT Self-run

Stimuli Dataset Evaluation

skill-cuteweather-agent-stimuli-dataset-evaluation · by cuteweather

心理学刺激数据集的量化测评与微调价值分析。利用 `multimodal-looker` 子 agent 对比图像与 exp_design.md 的参数一致性,并产出 dataset_evaluation_report.md。

No reviews yet
0 installs
2 views
0.0% view→install

Install

$ agentstack add skill-cuteweather-agent-stimuli-dataset-evaluation

✓ scanned · ✓ verified — works with Claude Code, Cursor, and more.

Security review

✓ Passed

No issues found. Passed automated security review. · v0.1.0 How review works →

  • Prompt-injection patterns
  • Secret / credential exfiltration
  • Dangerous shell & filesystem operations
  • Untrusted network calls
  • Known-malicious package signatures

What it can access

  • Network access No
  • Filesystem access No
  • Shell / process execution No
  • Environment & secrets No
  • Dynamic code execution No

From automated source analysis of v0.1.0. “Used” means the capability is present in the source — more access means more to trust, not that it’s unsafe.

Are you the author of Stimuli Dataset Evaluation? Claim this listing to set pricing, connect Stripe payouts, and keep 70% of every sale.
Sign up to claim

About

心理学刺激复现:数据集量化测评与微调价值分析

最高原则

  • LLM 必须扮演极端严谨的实验检测员。心理学实验对误差零容忍,任何与 exp_design.md 描述不符的细微偏差(颜色、位置、形状、大小)都必须判定为 Fail
  • 严禁对相似度进行模糊分析,必须根据exp_design.md文档中的参数(特别是参数注册表和5.x.3 Phase-by-Phase Stimulus Spec中的参数定义—),结合data文件夹下的原始数据,逐项对图像进行物理参数审计。
  • 所有图片审计必须通过 multimodal-looker 子 agent 完成。涉及图片判断的任务,必须显式创建该子 agent,并向其传递图片绝对路径与本次审计目标。
  • 注意:multimodal-looker 当前可能不会出现在 agent 列表界面中,但运行环境可能已显式注册该 agent;执行时必须按名称创建,不得回退到旧名称或其他图像工具替代。
  • 你的读图 MCP 不能完全替代 multimodal-looker 的图像理解能力,请优先使用 multimodal-looker 进行图像审计。
  • 禁止直接调用 look_at / look-at 做图片审计;必须使用 task(subagent_type="multimodal-looker", load_skills=[], run_in_background=false, ...)
  • 防 OOM 强制红线:严禁全量加载数据集。必须采用“按实验条件分层抽样”,每种独立条件随机抽取 10 张典型图片进行 审计。

特别注意

  • 必须确保正确完成全部五个指标的评测,若出现失败情况必须重新评测直至按照评测要求正确获得评测结果。若在评估过程中发现评估方法或理解有误,则必须立即停止评测,重新审视评测方法并修正后再继续执行评测。

务必确保对实验设计和实验参数的理解完全正确

  • 评测结果必须以 dataset_evaluation_report.md 的形式输出,且必须包含每张被抽样图片的名字、对应的参数表述、审计结果和整体统计数据,以便后续快速定位复现代码中的 Bug。
  • 抽样的图片请以json文件的形式输出在 /evaluation_samples.json 中,包含图片名字、对应的参数表述和审计结果。
  • 为了避免运行超时,五个评测指标需要分别创建sub-agent进行评测,每个子任务单独执行并输出结果,最后再将结果汇总到最终的 dataset_evaluation_report.md 中。
  • 其中所有涉及图片审计、盲分类、跨阶段连续性判断的子任务,必须由 multimodal-looker 执行。
  • 盲测阶段复制得到的图片以及需要调用 multimodal-looker 进行图片识别的任务,必须使用绝对路径传递 sub-agent,禁止使用相对路径或仅使用图片名字,以免导致路径解析错误。
  • 评测基准:请以目录下的论文原始图片作为最高评测基准,与原文图片存在偏差的抽样图片必须单独列出并分析偏差原因。

输入

1) /output/(Review 通过的层级结构图片数据集) 2) /exp_design.md(用于提取语义描述、Phase 流程与理论条件数,作为审计的唯一标准答案) 3) /data/(原始数据文件,作为审计的唯一标准答案)

工作流(按顺序执行)

1.标准获取

  • 打开 exp_design.md,确认各trail的关键参数、条件与映射规则以及具体的Trail流程,作为后续图像准确性判断的唯一标准。
  • 识别每个实验条件下的关键视觉特征(如:Target 必须是 #FF0000 红色、位于左上象限、45度倾斜)。

注意:后续实验中涉及到具体图片的参数细节的,请结合exp_design.md文件和data文件夹下原始数据进行抽取,特别关注参数注册表和5.x.3 Phase-by-Phase Stimulus Spec中的描述,严禁模糊或凭空捏造。

  • 若样本包含背景图片,先核验来源追溯链是否完整:是否遵守“先 image-search,不合适再 image-generate”策略,且回退原因、来源类型、文件路径可核验。

2. 指标计算细则 (强制遵守)

  • 仔细阅读 /exp_design.md,利用你的代码执行能力和多模态视觉能力,严格按照要求逐步完成以下 5 个指标的评测:
2.1 视觉与文本语义对齐度
  • 物理意义:验证每张抽样检测的图片形状、颜色、位置、大小等物理属性以及与数量、遮挡、截断等空间结构是否达到“像素级执行”准确度。
  • 强制实现方法
  • 1.双阶段策略性采样
  • 第一阶段(哨兵检测):每个实验随机抽取 6 张“哨兵图片”交给 multimodal-looker 做图像审计。若 6 张图片均 100% 通过(Pass),则判定该 Condition 具备系统性稳定性,结束审计。注意,必须确保完成了所有实验条件的审计,对每个实验条件,尽可能抽取到不同 trail 中不同阶段的图片进行审计,以确保全面覆盖。
  • 2.图片准确度分析:对每张图片,基于 exp_design.mddata文件夹下原始数据中的参数细节,重点参考exp_design.md5.x.3 Phase-by-Phase Stimulus Spec中的描述,逐项审计以下六个维度:形状一致性、颜色准确度、空间位置精确度、元素尺寸比例、刺激物总数、是否存在边缘截断/非预期遮挡(即刺激物未能完整的展现在画布中),分别输出 PassFail,以及不符合项的具体描述(例如:“Fail: Target color is #FE0000, expected #FF0000”)。注意:审计指令必须明确要求模型进行像素级分析,禁止模糊判断;并最终输出每张图片的审计结果(Pass/Fail)。

特别注意:是否存在边缘截断/非预期遮挡判断准则:

  • subagent需要识别所有刺激元素,确定每个元素的几何边界,若出现以下任一情况,则该维度判定为 Fail:
  1. 任意刺激元素的像素位于画布范围之外
  2. 任意刺激元素的几何顶点与画布边界发生相交或位于画布之外

一张图片的判定标准:六个维度必须全部为 Pass,则该图片判定为 Pass;任一维度 Fail,则整张图片判定为 Fail。

  • 3.结果聚合:统计每个 Condition 的 PassFail 数量,计算整体的准确率(Accuracy)并输出。
  • 4.输出:你给出的输出里必须包含每张被抽取图片的名字、对应的详细参数、审计结果和整体统计数据,所有结果必须来源于实际审计,禁止推测或捏造。
  • 背景图附加审计(如适用):检查背景图语义与实验条件一致性,以及来源合规性。若出现“未先检索即文生图”或来源不可追溯,单张图片直接判定为 Fail
2.2 参数注册表参数保真度
  • 物理意义:严格验证参数注册表中的每一个参数是否在生成代码中被精确定义,且其数值/范围(Value/Range)、单位(Unit)和属性是否在最终生成的图片或者复现代码中得到了像素级/结构级的完美还原。
  • 强制实现方法
  1. exp_design.md中的参数注册表部分提取出所有的参数,包括每个参数的Param KeyTypeUnitValue/RangeNotes
  2. 为每个参数生成独立审计指令,根据 exp_design.md 中的定义,检查生成的图片和复现代码中是否存在或实现了该参数,并且数值/范围、单位、属性完全匹配。
  3. 对每一个参数,只有完全匹配(Pass)才算通过,否则判定为 Fail,并且必须给出具体的失败原因。
  • 输出
  1. 参数保真度得分(%):通过的参数数量占总参数数量的比例。
  2. 逐项审计追溯表:必须在最终的 Markdown 报告中输出一个表格,列出所有的 Param Key、Type、Unit、Value/Range、Notes,以及对应的审计结果(Pass/Fail)和失败原因。
  • 注意:严禁仅根据参数名是否出现在代码文件中判断是否实现,必须准确分析代码中是否有对该参数的定义和体现。
2.3 条件视觉区分度
  • 物理意义:评估不同实验条件在视觉特征空间上是否具有可区分性,避免生成的刺激图片在视觉上过于相似,导致模型学习困难。
  • 强制实现方法
  1. exp_design.md文件中提取出所有条件定义,同时从./output目录中跨条件随机抽取20张图片,隐去标签(例如将其复制到一个 temp 文件夹,命名为 1.png10.png),并将真实标签保存在一个字典中。
  2. 具体实现逻辑:对每张隐去标签的目标图片,agent需要根据 exp_design.md 中的条件定义,判断该图片最可能属于哪个条件,需给出理由并直接回答类别名称。
  3. 量化得分:推理结束后,与真实标签对比,计算正确分类的图片数量占总测试图片数量的比例,输出条件视觉区分度得分(%)。如果得分低于 90%,必须记录将哪些条件弄混了(例如:高对比度和中对比度难以区分),并反馈在报告中。
  • 输出
  1. 条件视觉区分度得分(%)
  2. 所有抽样的图片信息、盲分类结果和混淆条件的具体分析。
  • 注意:请清晰地区分"设计规范参数"与"视觉显示元素"。
2.4 交互时序复杂度指数
  • 物理意义:量化单次 Trial 中时间维度的记忆与推理难度,决定微调模型输入需采用单图还是多图序列。
  • 强制实现:编写 Python 函数解析 exp_design.md 文本(或使用正则表达式匹配 Phase 结构):
  1. 基础得分:总 Phase 数量 $\times 1.0$。
  2. 掩蔽加分:文本中是否包含 Mask / Masking Phase?若是,得分 $+2.0$。
  3. 动态分支加分:文本是否表明存在依据上一动作决定的反馈/分支(Feedback/Branch)?若是,得分 $+3.0$。
  • 输出:最终 SIC 得分。若 SIC $> 2.0$,明确提示该数据集在微调时必须采用“多图交替序列输入(Multi-image Sequence)”格式。
2.5 Trial跨阶段参数连续性
  • 物理意义:评估同一 Trial 内不同 Phase 之间的刺激参数是否保持连续一致,并确保同一 stimulus 的多个特征(如颜色、方向、位置等)在整个 Trial 中保持正确绑定关系, 避免出现前后矛盾的参数设置。
  • 强制实现:审计单位为完整 Trial,而非单张图片。每个被抽样的 Trial 必须同时读取:Stimulus Phase/Probe /Response / Feedback Phase(如果存在),注意确保这些图片或数据属于同一 Trial。严禁根据exp_.design.md文件中的trail参数定义进行判断,审计结果必须来源于对抽样的图片的真实审计。
  1. 每个实验均需要进行抽样审计,每个实验条件下抽取3个trail进行连续性审计,若全部 Pass,则判定该 Condition 参数继承稳定。
  2. 对每个trail,agent需要首先从exp_design.md文件的5.x.3 Phase-by-Phase Stimulus Spec部分提取出该 Trial 的完整 Phase 流程和每个 Phase 的参数定义,基于这些定义,审计该 Trial 内所有 Phase 的刺激图片,确保它们在目标可追溯性、颜色连续性、方向连续性、身份绑定一致性(Probe 或 Response 所使用的多个参数必须来自同一个 stimulus)四个维度上符合实验设计,并且在整个 Trial 内保持正确的绑定关系。
  3. 若四个维度的审计全部 Pass,则该 Trial 判定为 Pass;任一项Fail,则该 Trial 判定为 Fail,并需要给出具体原因,
  • 输出
  1. Trial参数连续性得分:Trial Continuity Accuracy (%) = Passtrials / Totaltrials
  2. 每个被抽样 Trial 的详细审计结果,包括涉及的图片名字、四个维度的审计结果和不符合项的具体描述。(注意,所有被抽样的trail均需要在报告中列出)

4. 产出测评与微调分析报告

  • 结合测评得分和 exp_design.md,输出 /dataset_evaluation_report.md,注意这里的workspace是基于具体论文的相对workspace
  • 报告中必须包含:刺激类型定义、Trial 内涉及的交互时序(Phases),以上 5 个指标的详细得分与结论分析。

特别注意:请将抽取的图片样本名字及其对应的文本参数表述全部依次输出在测评结果报告中,并包含详细的测评结果,以便后续快速定位复现代码中的 Bug。

  • 强制要求:必须在报告末尾,专门为后续图文/多字段样本微调设计具体的数据输入格式示例,提供单图或多图序列的 JSON/Dict 样例。

必读参考

测评结果报告示例:references/dataset_evaluation_report.md

Source & license

This open-source skill is cataloged on AgentStack and links to its original source — we do not rehost the code.

Install and usage instructions live in the source repository linked above.

Reviews

No reviews yet — be the first.

Versions

  • v0.1.0 Imported from the upstream source.