# Bi Cohort Analysis

> 把用户按同一批/同一类分组，比较各群体后续表现。触发条件：对话涉及同期群分析、分群后表现对比、用户生命周期分群跟踪等任务时触发，如出现「同期群」「cohort」「按起始特征分群后表现如何」「不同客群后续转化/留存对比」「注册周/获客渠道分群跟踪」等相似问题时触发。

- **Type:** Skill
- **Install:** `agentstack add skill-agentscope-ai-qwenpaw-data-bi-cohort-analysis`
- **Verified:** Yes — security-reviewed for prompt injection and unsafe behavior
- **Seller:** [agentscope-ai](https://agentstack.voostack.com/s/agentscope-ai)
- **Installs:** 0
- **Category:** [Databases](https://agentstack.voostack.com/c/databases)
- **Latest version:** 0.1.0
- **License:** Apache-2.0
- **Upstream author:** [agentscope-ai](https://github.com/agentscope-ai)
- **Source:** https://github.com/agentscope-ai/QwenPaw-Data/tree/main/packages/datapaw-skills/skills/workflows/bi-cohort-analysis

## Install

```sh
agentstack add skill-agentscope-ai-qwenpaw-data-bi-cohort-analysis
```

Requires the [AgentStack CLI](https://agentstack.voostack.com/docs/cli). Works with Claude Code, Cursor, and any MCP-compatible agent.

## About

# bi-cohort-analysis

把用户**按同一批/同一类分组，比较各群体后续表现**：定义 cohort 规则 → 取数 → 划分 cohort → 按 cohort 汇总后续表现 → 跨 cohort 对比 → 解读与输出。

## 前置条件

开始执行前，确认以下信息已就绪：

- **分析对象**明确，通常为「用户」，且能唯一标识（如 `user_id`）
- **cohort 规则**已确定，即按什么分群（如注册周、获客渠道、首单金额档、首日行为等）
- **跟踪指标**已确定，即 cohort 形成后要比较的后续指标（如留存、转化、LTV、复购等）及其时间窗口
- **数据获取能力**可用，能取到对象级起始特征数据及对应后续行为/指标数据

若 cohort 规则或跟踪指标不明确，需先回到规划阶段补充，或向用户确认后再开始执行。

## 分析原则

### 同期群定义

同期群（cohort）指在相同时点或具备相同起始特征的用户集合。本 workflow 通过 **cohort 规则分群** 定义 cohort，再比较各 cohort 在 **后续时间窗口** 内的指标表现。

### 主要步骤

| 步骤 | 用途 | 是否必选 |
|------|------|----------|
| 定义 cohort 规则 | 确定分群依据与跟踪指标 | **必选**，见步骤 1 |
| 取数 | 取用户 ID、起始特征、后续行为/指标 | **必选**，见步骤 2 |
| 划分 cohort | 将每个用户分到对应群体 | **必选**，见步骤 3 |
| 汇总后续表现 | 按 cohort 聚合跟踪指标 | **必选**，见步骤 4 |
| 跨 cohort 对比 | 对比各群差异、幅度与显著性 | **必选**，见步骤 5 |
| 解读 & 输出 | cohort 画像、表现对比、业务建议 | **必选**，见步骤 6 |

**典型产出**：cohort 矩阵、群间对比表、cohort 留存曲线（多条线对比）等。

**最短路径**：定义分群规则 → 划 cohort → 跟踪各群指标 → 跨群对比（即步骤 1 → 3 → 4 → 5，取数随分群展开）。

本 workflow 主要提供 cohort 场景下的编排与数据衔接逻辑，各步骤的具体执行按相应分析方法的标准流程进行。

---

## 1. 定义 cohort 规则

明确「按什么分群」与「跟踪什么指标」，这是后续取数与划分的基础：

| 要素 | 含义 | 常见取值 |
|------|------|----------|
| **分群依据** | 划分 cohort 所依据的起始特征 | 注册周/注册月、获客渠道、首单金额档、首日关键行为、获客活动等 |
| **跟踪指标** | cohort 形成后要比较的后续指标 | 留存率、转化率、LTV、复购次数等 |
| **时间窗口** | 在哪些 dayn 观测跟踪指标 | D1/D7/D30 留存、30 日内 LTV、首周转化率等 |

要点：

- 分群依据可为**单一维度**（如注册周）或**多维特征组合**（如消费 + 活跃 + 渠道，优先走聚类，见步骤 3）
- 对象粒度须为「一行一用户」；若原始数据为事件级，先聚合到用户级
- 规则一旦确定，后续取数、划分、汇总须保持一致

---

## 2. 取数

按步骤 1 的规则取数，准备划分 cohort 与汇总后续表现所需的数据。

### 数据准备

整理 CSV，包含：

- **对象标识列**（如 `user_id`）
- **起始特征列**：用于划分 cohort（如注册周、获客渠道、首单金额；多维聚类可有多列数值特征）
- **后续行为/指标列**：用于汇总跟踪指标（如各 dayn 是否留存、是否转化、累计付费金额等）

示例：

```csv
user_id,注册周,获客渠道,D7是否留存,30日LTV
u001,2025-W01,自然量,1,128.0
u002,2025-W01,广告,0,0.0
```

后续指标若来自另一张表，可仅取用户 ID + 起始特征，待步骤 3 划分后再按 `user_id` 关联后续指标表。

---

## 3. 划分 cohort

以步骤 1 的规则为输入，将每个用户分到对应群体。

### 划分方式

- **按已有特征分群**：以起始特征列（如注册周、获客渠道、首单金额档）为分组键，直接将用户归入对应 cohort
- **两维策略型分群**（如「增长 × 份额」）：优先波士顿矩阵法
- **多维综合分群**：优先 K-means / 分层聚类 / DBSCAN

分群结果保存为 JSON，键为 cohort 标识（如 `"2025-W01"`、`"cluster 1"`），值为该 cohort 内的用户 ID 列表（供步骤 4 按 `user_id` 关联）。

### 产出检查

- [ ] 各 cohort 样本量可解释，无异常空簇（DBSCAN 噪声点单独标注）
- [ ] 分群依据与方法在结论中可复现

---

## 4. 按 cohort 汇总后续表现

基于步骤 3 的划分结果，为每个 cohort 汇总跟踪指标：

1. 将 cohort 划分结果与用户级后续指标按 `user_id` 关联
2. 按 cohort 聚合跟踪指标（如 cohort 均值、中位数、率值指标的分子/分母汇总等）
3. 整理为 **对比分析用 CSV**：每列对应一个 cohort（或参照 cohort），每行对应一个时间点或汇总口径

示例（三群 D7 留存率对比）：

```csv
指标,cohort_1,cohort_2,cohort_3
D7留存率,0.42,0.38,0.51
```

若需绘制 **cohort 留存曲线**，按 dayn 逐行整理多群留存率（每列一群、每行一个 dayn），供步骤 6 多线对比。若需与总体或某一基准 cohort 对比，在 CSV 中一并纳入参照列。

---

## 5. 跨 cohort 对比

对步骤 4 整理的数据执行对比分析，判断哪个群体最好/最差、差异幅度与显著性。

### 分析要点

- **比较维度**：通常为 **空间对比**（横向比较不同 cohort 之间差异）
- **基准设定**：明确参照 cohort（如总体、最大群、或业务指定的对照群）
- **计算方式**：按指标类型选择绝对差值或相对差值；多 cohort 间不遗漏任一对比对
- **显著性**（可选）：样本为多个用户或多次观测时，按显著性检验规则执行 t / z / 卡方检验

保存对比分析结果。

---

## 6. 解读 & 输出

完成以上步骤后，围绕**各群体后续表现差异**汇总并输出。

| 字段 | 说明 |
|------|------|
| 执行内容 | 本步骤做了什么 |
| 取数文件 | 起始特征数据、后续表现数据路径 |
| 中间产物 | 分群 JSON、对比用 CSV 路径 |
| 计算结果 | 对比分析结果路径 |
| 结论 | 各 cohort 的起始画像、后续表现差异及显著性 |

汇总结构建议：

1. **Cohort 划分**：分群规则、起始特征、各群规模与占比（含 **cohort 矩阵**）
2. **起始画像**：各 cohort 在起始特征上的差异（辅助解读分群合理性）
3. **后续表现对比**：各 cohort 在跟踪指标上的水平、差异幅度与显著性（含 **群间对比表** 与 **cohort 留存曲线**）
4. **业务解读**：表现最优/最劣 cohort 的可能原因与可执行建议
5. **局限与不确定性**：样本量、时间窗口、特征选择、分群稳定性等

## Source & license

This open-source skill is cataloged on AgentStack and links to its original source — we do not rehost the code.

- **Author:** [agentscope-ai](https://github.com/agentscope-ai)
- **Source:** [agentscope-ai/QwenPaw-Data](https://github.com/agentscope-ai/QwenPaw-Data)
- **License:** Apache-2.0

Install and usage instructions live in the source repository linked above.

## Pricing

- **Free** — Free

## Security capabilities

Automated source analysis of v0.1.0 — what this tool can access:

- **Network access:** no
- **Filesystem access:** no
- **Shell / process execution:** no
- **Environment & secrets:** no
- **Dynamic code execution:** no

*"Yes" means the capability is present in the source — more access means more to trust, not that it is unsafe.*


## Versions

- **0.1.0** — security scan: passed — Imported from the upstream source.

## Links

- Listing page: https://agentstack.voostack.com/l/skill-agentscope-ai-qwenpaw-data-bi-cohort-analysis
- Seller: https://agentstack.voostack.com/s/agentscope-ai
- Browse the marketplace: https://agentstack.voostack.com/browse

---
Listed on AgentStack — the marketplace for AI agent skills and MCP servers. Every listing is security-reviewed. Creators keep 70%.
