AgentStack
Browse Sign in
Browse Why AgentStack Sell Docs
Sign in
SKILL verified MIT Self-run

Paper Redteam

skill-xf686-meet-reviewer-2-paper-redteam · by xf686

Simulate rigorous, fair peer review on a paper — in two modes. (A) Red-team YOUR OWN draft before submission to predict the reviews you'll get and get a fix list. (B) Review SOMEONE ELSE'S paper when you're an assigned reviewer or helping your advisor — produce a fair, venue-formatted, submission-ready review. Use whenever the user gives a paper (PDF, .tex, .md, arXiv link, or pasted text) and wa…

No reviews yet
0 installs
51 views
0.0% view→install

Install

$ agentstack add skill-xf686-meet-reviewer-2-paper-redteam

✓ scanned · ✓ verified, works with Claude Code, Cursor, and more.

Security review

✓ Passed

No issues found. Passed automated security review. · v0.1.0 How review works →

  • Prompt-injection patterns
  • Secret / credential exfiltration
  • Dangerous shell & filesystem operations
  • Untrusted network calls
  • Known-malicious package signatures

What it can access

  • Network access No
  • Filesystem access No
  • Shell / process execution No
  • Environment & secrets No
  • Dynamic code execution No

From automated source analysis of v0.1.0. “Used” means the capability is present in the source — more access means more to trust, not that it’s unsafe.

View the full security report →

Verified badge

Passed review? Show it. Paste this badge into your README, it links to the public security report.

AgentStack Verified badge Links to your public security report.
[![AgentStack Verified](https://agentstack.voostack.com/badges/verified.svg)](https://agentstack.voostack.com/security/report/skill-xf686-meet-reviewer-2-paper-redteam)

Reliability & compatibility

Security review passed
0 installs to date
no reviews yet
3mo ago

Declared compatibility

Claude CodeClaude Desktop

Compatibility is declared by the source manifest. End-to-end runtime verification is coming, see below.

Preview Execution monitoring

We're building live execution health for every listing: tool-call success rate, median latency, uptime, and last-checked timestamps, measured, not self-reported. It isn't live yet, so we don't show numbers we can't stand behind.

How agent discovery & health will work →
Are you the author of Paper Redteam? Claim this listing to set pricing, connect Stripe payouts, and keep 70% of every sale.
Sign up to claim

About

Paper Red-team & Review — rigorous, fair, evidence-bound

模拟严谨且公正的同行评审,两种模式:

  • Mode A — 审自己的稿(红队): 投稿前把草稿丢进来,审稿小组把它挑一遍 → 预测评审与结局 → 给修补清单。终点是 redteam/.md
  • Mode B — 审别人的稿: 你被指派当审稿人、或帮导师审稿时,产出一份按会议官方表格式、公正、可直接提交的评审。终点是 reviews/.md

核心信条(两种模式都别违反):

  • 凡批评必有出处。 每条 weakness 钉到具体位置([§x / 图y / 表z / 第n段 / "原文短引"]),定位不到、但本该有的标 ⚠ MISSING,绝不脑补。
  • 绝不编造毛病。 真没问题就说没问题,绝不为凑数硬挑。
  • 🔥 过公正性防火墙。 任何 weakness 提出前,先对照 reviewing-rubric.mdH1–H17 黑名单:命中(如"不够新颖却不给引用""没超 SOTA""方法太简单""你该多做实验 X""有局限=有缺陷")就删除或降级为温和建议,绝不当硬伤。这条是"严谨"与"键盘喷子"的分水岭。
  • 按客观标准评。 维度、评分量表、判据一律以 reviewing-rubric.md 为准(蒸馏自 NeurIPS/ICLR/ACL 官方指南),不是凭个人喜好。

开工前必读(三份,顺序读)

  1. references/reviewing-rubric.md —— 审稿的客观标尺:四大维度、各会议评分量表、Reviewer 2 必查清单、H1–H17 公正性防火墙、好/烂评审标准。两种模式的判据都在这。
  2. references/review-schema.md —— 产物的字段定义:单份 review 字段、weakness 三色分级、Mode A 的 meta-review + fix-list、Mode B 的正式评审模板、质量门。
  3. references/reviewer-personas.md —— 审稿人格(R1/R2/R3·AC)盯什么、什么口吻;以及人格如何受防火墙约束。

第 0 步:判模式(先做这个)

看用户的话判 Mode A 还是 Mode B:

  • Mode A(审自己)信号:"我的草稿 / 投稿前 / 帮我挑 / 会被怎么拒 / red-team my draft / before I submit"。
  • Mode B(审别人)信号:"帮我审这篇 / 我要审稿 / 导师让我审 / 给个评审意见 / review this paper / I'm a reviewer"。
  • 拿不准就问一句:"这是你自己要投的稿(我帮你提前挑),还是别人的论文(你要写正式评审)?"——两者口吻和产物不同,别搞反。

Mode A:审自己的稿(红队)

A1. 拿到草稿,定位骨架

用户给 PDF/.tex/.md(直接读;.tex 行号好引用)、arXiv/链接(WebFetch 取正文)、或粘贴文本。通读后定位:Claim/卖点、Contribution、Method、Evidence(实验/baseline/ablation/统计)、Positioning、Limitations——后面每条批评往这上面挂。 > 只拿到摘要/链接打不开/PDF 抠不出 → 先说清卡在哪,别用半篇硬凑。

A2. 跑审稿小组(逐人格出 review)

reviewer-personas.md 逐个出结构化 review(字段见 review-schema.md):R1 拥护者校准"什么是真强";R2 方法怀疑论者专攻 soundness(对照 rubric 第三节必查清单);R3·AC 卡 novelty。 每条 weakness 都要:出处 + 三色分级 + 过 H 列防火墙。 人格之间别互相抄,保留分歧。

A3. AC 综合

共识 weakness(几人都点=最危险)、分歧点、决定性 2–3 条、预测结局(Reject/Borderline/Accept),显式标"模拟,非真实评审"。

A4. 出修补清单(Mode A 的真正价值)

所有 weakness 去重,按影响 × 成本排序。每条:出处 + 谁提的 + 分级 + 怎么改 + 赶得上吗(✅ deadline 内 / ⏳ 需新实验 / 🛟 只能写进 limitations 缓冲),诚实标注。

A5. 过质量门

对照 review-schema.md 质量门逐条打勾(含:每条 weakness 有出处+分级?有没有假 weakness?有没有漏过 H 列防火墙的不正当批评?预测结局标了"模拟"?fix-list 按影响×成本排序?)。


Mode B:审别人的稿(当审稿人 / 帮导师)

> 你现在是公正的裁判,不是对手。口吻专业、中性、善意,守 rubric 第五节铁律:"写一份你自己也愿意收到的评审。" 防火墙在这是强制的——绝不对作者发出 H 列不正当批评。

B1. 确认 venue 与拿到论文

问清(或让用户说)投的是哪个会议/期刊——决定用哪套评分量表(NeurIPS / ARR / ICLR,见 rubric 第二节)。没说就按 NeurIPS 通用量表,并提示"换 venue 量表会变"。然后取得论文正文(同 A1)。

B2. 通读 + 按四维度评

照 rubric 第一节四维度(Soundness / Clarity / Significance / Originality)逐项过,对 soundness 用第三节必查清单。每一条优点和缺点都钉到出处。

B3. 每条 weakness 过公正性防火墙(强制)

逐条对照 H1–H17:命中就删掉或改成"给作者的温和建议(非拒稿点)",并在评审里体现你是公正的。这一步让你的评审经得起 AC 和作者的检验

B4. 按官方表写出正式评审

review-schema.mdMode B 模板产出(reviews/.md):Paper Summary(证明读懂了)→ Strengths(带出处)→ Weaknesses(带出处+分级,均已过防火墙)→ Questions for Authors → Suggestions(可执行、非拒稿点)→ 按 venue 的评分(soundness/presentation/contribution/overall/confidence 等)+ 一句话推荐理由。 用具体化写法(rubric 第五节):别写"X 不清楚",写"X 的描述里缺了 Y 和 Z"。

B5. 过质量门

对照 review-schema.md 质量门 + 额外两条 Mode B 专项:① 口吻是否专业中性、无挖苦?② 是否有任何 H 列不正当批评漏网?任一不过,回去改。


边界(两种模式都守)

  • 不替用户改/写论文。 Mode A 产诊断,Mode B 产评审;真去动草稿是另一回事。
  • Mode B 不替用户冒充。 产出的是草稿评审供用户审阅定稿,提醒用户对照论文核对每个 [出处]、为打分负责后再提交;评分是建议值。
  • 不编实验数据。 建议"补实验"时只说补什么、为什么,绝不编结果。
  • 不保证录用 / 不替 AC 做决定。 Mode A 降低被毙风险≠保录;Mode B 给的是一份审稿意见,最终决定在 AC。

Source & license

This open-source skill is cataloged on AgentStack and links to its original source — we do not rehost the code.

Install and usage instructions live in the source repository linked above.

Reviews

No reviews yet, be the first.

Versions

  • v0.1.0 Imported from the upstream source.