# Xhs Blogger Analyzer

> >

- **Type:** Skill
- **Install:** `agentstack add skill-arraycto-xhs-blogger-analyzer-xhs-blogger-analyzer`
- **Verified:** Yes — security-reviewed for prompt injection and unsafe behavior
- **Seller:** [arraycto](https://agentstack.voostack.com/s/arraycto)
- **Installs:** 0
- **Category:** [Agent Skills](https://agentstack.voostack.com/c/agent-skills)
- **Latest version:** 0.1.0
- **License:** MIT
- **Upstream author:** [arraycto](https://github.com/arraycto)
- **Source:** https://github.com/arraycto/xhs-blogger-analyzer

## Install

```sh
agentstack add skill-arraycto-xhs-blogger-analyzer-xhs-blogger-analyzer
```

Requires the [AgentStack CLI](https://agentstack.voostack.com/docs/cli). Works with Claude Code, Cursor, and any MCP-compatible agent.

## About

# 小红书博主拆解 Skill

## 你是什么

自动化的小红书博主深度分析工具。输入一个博主名字，输出全套拆解文档。适用于任何领域。

## 能力范围

爬取目标博主笔记数据（支持 30/50/80/全量四档），产出 4 份深度分析文档：

1. **博主深度拆解** — 账号画像、人设拆解、高赞排行、TOP10逐条拆解、内容模式（含垂直/交叉策略判断）、评论洞察（含下一步内容机会）
2. **内容公式总结** — 11种标题公式/开头公式/结构模板/CTA/视觉公式，附用户账号的改编示例
3. **选题素材库** — 可借鉴选题、差异化赛道、优先级×创作难度矩阵、系列IP建议
4. **全量笔记结构化分析** — 领域分布、藏赞比分析、发展趋势（条件性转型分析）、爆款公式、竞争格局

脚本负责数据采集和统计分析（保下限），AI 负责深度洞察和个性化建议（冲上限）。
支持与自己账号数据做对比分析。

---

## 前置要求

- 需要本地桌面环境（支持显示图片或打开文件）
- 云端/无头服务器暂不支持（无法完成扫码登录）
- Python 3.8+ （Skill会自动检测，如未安装会提示）
- 网络连接（用于下载MCP二进制和爬取小红书数据）

### 代理设置

如需通过代理访问GitHub或小红书，设置环境变量：

```bash
# Windows
$env:HTTP_PROXY="http://127.0.0.1:7890"
$env:HTTPS_PROXY="http://127.0.0.1:7890"

# macOS/Linux
export HTTP_PROXY="http://127.0.0.1:7890"
export HTTPS_PROXY="http://127.0.0.1:7890"
```

---

## 执行流程

### Phase 0: 环境自动准备

运行 `python scripts/check_env.py`

自动检查并修复以下依赖：

1. **python-docx** — 检测到未安装时自动 `pip install`（使用清华镜像源）
2. **xiaohongshu-mcp 二进制** — 检测到未安装时自动从GitHub Releases下载最新版到 `~/.xiaohongshu/bin/`
3. **MCP 服务** — 检测到未运行时自动后台启动
4. **小红书登录状态** — 检测到未登录时提示扫码登录

**扫码登录详细流程**：

1. 调用 `check_login_status` 检查登录状态
2. 若已登录 → 跳到Phase 1
3. 若未登录：
   a. 调用 `get_login_qrcode` 获取二维码（URL或base64格式）
   b. 展示策略（分级降级）：
      - 尝试直接渲染二维码图片给用户
      - 若失败，保存到桌面 `~/Desktop/xiaohongshu_qrcode.png` 并提示用户打开
      - 若失败，输出二维码URL让用户在手机浏览器打开
   c. 提示用户用手机小红书扫码
   d. 每3秒轮询 `check_login_status`，超时120秒
   e. 登录成功 → 继续；超时 → 报错退出

### Phase 1: 数据采集

运行 `python scripts/crawl_blogger.py  -o ./data`

自动完成：

1. **搜索定位博主**（优先小红书号，否则按昵称精确匹配 → 昵称包含 → 出现频次）
2. **获取主页信息** — 粉丝数、获赞数、笔记数、简介
3. **获取主页笔记列表** — 从user_profile返回的feeds中提取
4. **多关键词搜索补充** — 默认使用通用后缀（教程/推荐/分享/测评/攻略/合集），用户可通过 `--keywords` 指定领域词
5. **逐条获取笔记详情** — 每条间隔3秒防风控
6. **checkpoint断点恢复** — 每10条自动存盘

输出文件（JSON）：

- `{博主名}_profile.json` — 主页信息
- `{博主名}_notes_list.json` — 笔记列表（按赞数排序）
- `{博主名}_notes_details.json` — 全量笔记详情（含评论）

### Phase 2: 数据分析

运行 `python scripts/analyze.py ./data/_notes_details.json -o ./data`

自动完成：

1. **数据清洗** — 解析JSON，提取标题/正文/互动数据/评论/标签
2. **内容分类** — 基于笔记标签和高频关键词动态聚类，不预设任何领域
3. **标签统计** — 提取所有#话题标签，按频次排序TOP20
4. **TOP10 + 评论洞察** — 高赞前10条的详情 + 热评精选
5. **[可选] 对比分析** — 自己 vs 目标博主的数据差异

输出文件：

- `{博主名}_analysis.json` — 结构化分析数据（含完整笔记列表及category）

### Phase 3: 文档生成（骨架版）

运行 `python scripts/generate_docs.py ./data/_analysis.json "" -o ./output --details ./data/_notes_details.json`

自动完成：

1. 基于分析数据生成 4 份 Markdown 文档骨架（数据表格 + 占位符）
2. 调用 `utils/md_to_docx.py` 转为 Word（微软雅黑字体、表格交替行着色、标题分级配色）
3. 文件整理：`.docx` → 输出根目录，`.md` → `_过程文件/原始素材/`

输出 4 份骨架版文档（含数据表格，深度分析部分为占位符）：

- `{博主名}_博主深度拆解.docx`
- `{博主名}_内容公式总结.docx`
- `{博主名}_选题素材库.docx`
- `{博主名}_全量笔记结构化分析.docx`

> **注意**：骨架版仅包含数据统计，缺乏深度洞察和个性化建议。如需高质量产出，必须继续执行 Phase 3.5。

### Phase 3.5: AI 深度分析 ★ 产出物质量的关键

**分两步执行：脚本准备数据底稿（保下限），AI 产出深度报告（冲上限）。**

#### 步骤 A：生成数据底稿（脚本自动执行）

运行 `python scripts/deep_analyze.py ./data/_analysis.json "" -o ./output --details ./data/_notes_details.json`

脚本自动完成以下确定性分析，产出数据底稿供 AI 使用：

1. **基础统计面板** — 篇均赞/藏/评、爆款率(均赞×3)、超级爆款率(均赞×10)、视频vs图文对比、整体藏赞比
2. **标题模式识别** — 11种标题策略（数字型/疑问型/感叹型/教程型/列表型/对比型/故事型/悬念型/降门槛型/对比降维型/亲测型）的使用比例和示例
3. **内容结构分析** — 正文长度分布、列表格式使用率、数字小标题使用率
4. **CTA 提取** — 6种引导方式（关注/收藏/点赞/评论/转发/私信）的使用频率
5. **Emoji 视觉分析** — 使用率、高频 TOP10、视觉风格判定
6. **发布频率** — 平均间隔天数、更新模式判定
7. **藏赞比逐条计算** — 每条笔记的收藏÷赞数，三档分类（>0.8实用型 / 0.3-0.8均衡型 / 70%同一领域）还是多元交叉型（3+领域）
9. **发展趋势数据** — 按时间切半对比各领域占比变化 + 标注时间跨度是否适合做转型分析（≥30条且>6个月）
10. **爆款规律** — 爆款阈值、集中领域、形式分布、低赞内容共性
11. **TOP10 完整数据包** — 每条笔记的标题、赞/藏/评、正文前300字、热评 TOP5（含赞数）
12. **对比数据**（如有 --self）— 用户 vs 对标博主的维度对比表

输出文件：

- `{博主名}_数据底稿.md` — 结构化数据（供 AI 使用，非最终交付物）
- `{博主名}_AI分析任务.md` — AI 深度分析的结构化任务指令

#### 步骤 B：AI 深度分析（宿主 AI 在对话中执行）

**AI 读取「数据底稿」和「AI分析任务」，按以下框架逐份产出最终报告。**

产出物为 4 份文档，每份的结构、内容要求和写作标准定义在「AI分析任务.md」中。
详细的质量标杆参见 `references/产出物质量标杆.md`。

**4 份文档的定位**：

1. **博主深度拆解** — 理解对标博主全貌（谁、做了什么、为什么好、你能学什么）
   - 含博主人设拆解（人设三板斧 + 粉丝跟TA的本质原因）
   - 含评论区"下一步内容机会"提取
2. **内容公式总结** — 提炼可直接套用的创作模板
   - 11种标题公式（含对比降维型、亲测型）
   - 开头/结构/CTA/视觉/标签/排版/发布时间公式
3. **选题素材库** — 给出可执行的选题清单
   - 优先级 × 创作难度双维排序
   - 已做选题对照表（有 --self 时）
4. **结构化分析** — 数据驱动的底层规律
   - 藏赞比三档分析（实用型/均衡型/情绪型）
   - 极度垂直 vs 多元交叉策略判断
   - 条件性转型路径分析（数据充足时才做）

**AI 分析的 8 条写作准则**（从质量标杆文档提炼）：

| # | 准则 | 说明 |
|---|------|------|
| 1 | **有观点不骑墙** | 每个数据章节后必须有"核心发现"，用加粗标出判断 |
| 2 | **有对比有洞察** | 做5类对比：产量vs效果、藏赞比含义、早期vs近期、爆款vs低赞、垂直vs交叉 |
| 3 | **有针对性建议** | 如有用户账号数据，每章末尾写"对你的启示"+ 具体可执行建议 |
| 4 | **有因果解释** | 爆款原因用因果链，引用评论附"→ 这说明..."，转型分析附原因推测 |
| 5 | **有层次感** | TOP5深度拆解（~20行/条），TOP6-10快速拆解（~3行/条） |
| 6 | **有金句记忆点** | 结尾产出"博主底层公式"（用×连接），章节结论加粗总结 |
| 7 | **有数据锚点** | 禁止"表现较好"等模糊用语，必须跟具体数字 |
| 8 | **格式有节奏** | 数据=表格、分析=段落加粗、结论=引用块或代码块 |

**脚本 vs AI 分工**：
- **脚本做 30%**：基础数据、统计分析、模式识别、条件判断 → 体现在「数据底稿」
- **AI 做 70%**：人设拆解、因果分析、公式提炼、针对性建议、评论洞察、底层公式、金句 → 体现在最终报告

**完成后**，AI 将 4 份报告保存为 Markdown，并调用 `utils/md_to_docx.py` 转为 Word，覆盖 Phase 3 的骨架版。

### Phase 4: 质量检查

验证：

1. 所有 .docx 文件存在且大小 > 0
2. 笔记数量一致（采集数 = 分析数）
3. 输出执行摘要

---

## MCP调用协议

使用HTTP + JSON-RPC协议，每次调用需要三步：

```python
from scripts.utils.mcp_client import MCPClient

client = MCPClient(port=18060)
data = client.call("search_feeds", {"keyword": ""})
```

### 可用工具

| 工具名 | 作用 | 关键参数 |
|--------|------|---------|
| `check_login_status` | 检查登录状态 | 无 |
| `get_login_qrcode` | 获取登录二维码 | 无 |
| `search_feeds` | 搜索笔记 | `keyword` |
| `user_profile` | 获取用户主页 | `user_id`, `xsec_token` |
| `get_feed_detail` | 获取笔记详情 | `feed_id`（注意不是note_id） |

### 踩坑记录

- `get_feed_detail` 的参数名是 `feed_id`，不是 `note_id`
- `user_profile` 需要 `xsec_token` 参数，从搜索结果中获取
- 每次新的调用链都需要重新 init → notify → call（session不持久）
- 请求间隔建议2-3秒，否则可能触发临时风控

---

## 文件结构

```
小红书博主拆解Skill/
├── SKILL.md                  # 你现在看的这个文件
├── run.py                    # 一键运行入口（串联 Phase 0→3）
├── install.py                # 自动安装脚本（检测平台，复制到正确路径）
├── scripts/
│   ├── check_env.py          # Phase 0: 环境自动准备
│   ├── crawl_blogger.py      # Phase 1: 数据采集
│   ├── analyze.py            # Phase 2: 数据分析
│   ├── generate_docs.py      # Phase 3: 文档生成（骨架版）
│   ├── deep_analyze.py       # Phase 3.5: AI深度分析（数据底稿+任务指令）
│   └── utils/
│       ├── __init__.py
│       ├── common.py         # 共用工具函数（parse_count, safe_filename）
│       ├── mcp_client.py     # MCP HTTP调用封装
│       └── md_to_docx.py     # Markdown → Word转换
└── references/               # 参考文档
    ├── README.md             # 项目说明
    ├── CHANGELOG.md          # 版本迭代日志
    ├── 产出物质量标杆.md      # ★ AI分析的质量标准和文档结构参考
    └── 平台兼容性测试记录.md  # 各AI工具测试结果
```

---

## 使用方式

### 自然语言触发（推荐）

直接对AI说：

```
拆解博主 
```

AI自动执行完整流程：环境准备 → 扫码登录 → 爬取数据 → 分析 → 生成文档

**变体**：

```
拆解博主 XX，对比我的账号 YY
拆解美食博主 XX，关键词：烘焙、食谱、探店
依次拆解以下博主：XX、YY、ZZ
分析小红书博主 XX 的内容策略
```

### 一键运行（推荐）

```bash
cd 小红书博主拆解Skill/

# 基本用法
python run.py ""

# 带对比分析
python run.py "" --self ""

# 指定领域关键词
python run.py "" --keywords "烘焙,食谱,探店"

# 跳过环境检查（已确认环境OK时）
python run.py "" --skip-env
```

### 手动分步执行

```bash
cd 小红书博主拆解Skill/

# Phase 0: 环境自动准备
python scripts/check_env.py

# Phase 1: 采集博主数据
python scripts/crawl_blogger.py "" -o ./data

# Phase 1 (可选): 采集自己的数据
python scripts/crawl_blogger.py "" --self -o ./data

# Phase 2: 数据分析（带对比）
python scripts/analyze.py ./data/_notes_details.json --self ./data/_notes_details.json -o ./data

# Phase 3: 生成文档（骨架版）
python scripts/generate_docs.py ./data/_analysis.json "" -o ./output --details ./data/_notes_details.json

# Phase 3.5a: 生成数据底稿和AI分析任务（脚本自动执行）
python scripts/deep_analyze.py ./data/_analysis.json "" -o ./output --details ./data/_notes_details.json

# Phase 3.5b: AI深度分析（宿主AI读取底稿和任务指令，在对话中逐份产出最终报告）
```

---

## 多平台兼容性

### 测试矩阵

| 平台 | 本机运行 | HTTP localhost | Python | 文件读写 | 测试状态 |
|------|---------|---------------|--------|---------|---------|
| CodeBuddy (WorkBuddy) | ✅ | ✅ | ✅ | ✅ | ✅ 已验证 |
| Claude Code |✅  | ✅ | ✅ | ✅ | ✅已验证 |
| OpenClaw (本地) | ✅ | ✅ | ✅ | 待测试 | 待测试 |
| OpenClaw (云端) | ❌ | ❌ | ✅ | ⚠️ 受限 | ❌ 不支持 |

### 核心原则

1. 一份SKILL.md兼容WorkBuddy / Claude Code / OpenClaw（Claude Code独有字段WorkBuddy安全忽略）
2. 工具函数提取到`utils/common.py`共用
3. 使用标准库（urllib）避免外部依赖
4. 登录扫码做好降级策略（渲染图片 → 保存PNG → 输出URL）

---

## 参考文档

- `references/产出物质量标杆.md` — ★ AI 分析时必读：4 份文档的结构模板 + 8 条写作准则 + 脚本vs AI 分工
- `references/README.md` — 项目说明和快速开始
- `references/CHANGELOG.md` — 版本迭代日志（v0.1 → v0.4）
- `references/平台兼容性测试记录.md` — 各AI工具测试结果和方法

## Source & license

This open-source skill is cataloged on AgentStack and links to its original source — we do not rehost the code.

- **Author:** [arraycto](https://github.com/arraycto)
- **Source:** [arraycto/xhs-blogger-analyzer](https://github.com/arraycto/xhs-blogger-analyzer)
- **License:** MIT

Install and usage instructions live in the source repository linked above.

## Pricing

- **Free** — Free

## Security capabilities

Automated source analysis of v0.1.0 — what this tool can access:

- **Network access:** yes
- **Filesystem access:** no
- **Shell / process execution:** no
- **Environment & secrets:** no
- **Dynamic code execution:** no

*"Yes" means the capability is present in the source — more access means more to trust, not that it is unsafe.*


## Versions

- **0.1.0** — security scan: passed — Imported from the upstream source.

## Links

- Listing page: https://agentstack.voostack.com/l/skill-arraycto-xhs-blogger-analyzer-xhs-blogger-analyzer
- Seller: https://agentstack.voostack.com/s/arraycto
- Browse the marketplace: https://agentstack.voostack.com/browse

---
Listed on AgentStack — the marketplace for AI agent skills and MCP servers. Every listing is security-reviewed. Creators keep 70%.
