# Mc Vocal Direction

> Vocal direction and harmony design (演唱指导与和声设计) - specifying how a vocal should be delivered, not just what notes it sings. The two musical criteria, the vocabulary that actually changes a performance (brighter rather than louder, harder consonants rather than louder), consonant/vowel separation and why the beat lives in the vowel, the anti-perfection pitch philosophy that keeps a vocal from sound…

- **Type:** Skill
- **Install:** `agentstack add skill-jtydhr88-music-composition-skills-mc-vocal-direction`
- **Verified:** Yes — security-reviewed for prompt injection and unsafe behavior
- **Seller:** [jtydhr88](https://agentstack.voostack.com/s/jtydhr88)
- **Installs:** 0
- **Category:** [Agent Skills](https://agentstack.voostack.com/c/agent-skills)
- **Latest version:** 0.1.0
- **License:** MIT
- **Upstream author:** [jtydhr88](https://github.com/jtydhr88)
- **Source:** https://github.com/jtydhr88/music-composition-skills/tree/main/plugins/music-composition/skills/mc-vocal-direction

## Install

```sh
agentstack add skill-jtydhr88-music-composition-skills-mc-vocal-direction
```

Requires the [AgentStack CLI](https://agentstack.voostack.com/docs/cli). Works with Claude Code, Cursor, and any MCP-compatible agent.

## About

# 演唱指导与和声设计（Vocal Direction）

**这个 skill 管的是：人声该**怎么唱**，不只是唱什么音。**

对本库尤其重要，因为——

> **AI 人声最稳定的破绽是"完美"**：音准全中、力度平直、每遍副歌唱得一模一样。
> 真人做不到这些，也不想做到。

所以本 skill 有一半内容是在教**怎么要求"不完美"**，以及**怎么把这种要求写成后端能吃的话**。

## 按任务读哪几节

| 症状／任务 | 读 |
|---|---|
| 人声听着平、没表情 | §2 演唱指导的语汇 |
| 想让人声更有冲击力 | §2.3 辅音 |
| 人声"太准了"、像机器 | §4 音准哲学 |
| 人声推不出来、埋在伴奏里 | §4.1（多半不是音量问题） |
| 要加和声，不知道加哪种 | §5 四型 |
| 和声盖过主唱 / 太抢 | §5 对应型号的 delivery ＋ EQ 思路 |
| 要不要做 double | §6 |
| 写 Suno/YuE2 的人声提示词 | §7 |
| 填 ARR-SPEC 的 vocal 块 | §8 ＋ §9 |

## 边界：什么不归这个 skill 管

| 不归这里 | 归哪 |
|---|---|
| 词怎么写、押韵、倒字/协音 | **作词库**（`lyric-writing`，LYR-SPEC） |
| 旋律的音高走向、音域设计 | `mc-melody`（L1） |
| 字怎么安到音上（符割り/字余り） | **作词库**——它是词曲接口，归词库 |
| 人声 EQ 的具体频点、压缩参数 | `mc-mix-intent`（意图）／出库混音库（实操） |
| 人声和哪件乐器抢频段 | `mc-texture-layering` |
| 合成人声音源（Vocaloid、Synthesizer V 的引擎参数） | 不做。本库只写演唱意图（§7 映射到各后端），不写引擎参数 |

---

## 1. 动笔前必填

| 必填 | 问法 |
|---|---|
| **① 这是谁在唱** | 声音人设：性别、音区、质感、年代感。**不是"女声"这种程度** |
| **② 每段的 delivery** | 至少分主歌/副歌/桥。用 §2 的语汇写，不是"有感情" |
| **③ 力度起伏** | 逐段的相对强弱——**lint #15 查这个，全曲一个力度直接判不合格** |
| **④ 副歌逐遍差异** | 第二遍、第三遍分别改了什么（lint #16） |
| **⑤ 和声方案** | 用哪型（§5）、在哪几段、上还是下 |

---

## 2. 演唱指导的语汇

### 2.1 只有两条音乐上的判据

> 1. **是否适合这首歌**
> 2. **是否适合这个歌手（似合っているか）**

就这两条。**技术好不好不是判据**——技术是手段。
用在本库上，第 2 条变成"**是否适合这个声音人设**"。

### 2.2 ★ 不要说"大声点"

这是整节最实用的一条：

> 宏大的编曲配上含混的人声时，**不要说"唱大声点"**——音量推子能解决音量。
> 你真正想要的多半是"**更亮的声音**"，所以说"**请唱得亮一点**"更有效。

**形象化指令**同样有效：
- "带着笑唱"
- "嘴角上扬"
- "往很远的地方唱"

**为什么这条对本库特别重要**：这些正好是**文本后端能吃的词**。
`sing brighter` / `smiling delivery` / `sung toward a far distance` 是有效提示词，
而 `louder` 在生成模型那里几乎没有意义——它不控制音量。

### 2.3 ★ 辅音与元音分开想

这是演唱指导和后期编辑共同的基础知识：

- 一个音节 = **辅音 + 元音**（「か」= K + A，写成罗马字最清楚）
- **要冲击力时，说"辅音用力"比说"大声"有效**
- 编辑时要分清：这是**辅音的时机问题**还是**元音的长度问题**
- 混音里**光是控制辅音的电平**就能改变人声的表情

### 2.4 "S" 这个魔法辅音

> **S ≈ 用嗓子发出的白噪声——它本质上就是噪声。**

推论（都很实用）：
- **可以在 S 的中间剪接，听不出接缝**
- **它的长度可以自由伸缩而不违和**
- 从别的 take 移植一个 S 过来基本上无缝

> **★ 拍点活在元音上，不在辅音上。**
> 「さ」(= S + A) 唱在第 2 拍时，S 实际发生在第 1 拍的尾巴上——
> **和拍子对齐的是元音 A。**

**这条有两个用处**：
1. 编辑 AI 生成的人声时，**"这里有个 S"= "这里是好剪接点"**
2. 判断人声"抢拍/拖拍"时，**要看元音的位置**，不是音节的起点——
   否则你会把所有以 S、SH、TS 开头的字都误判成抢拍

---

## 3. 制作链条的类比

一个有用的对照（电影 → 流行音乐）：

| 电影 | 音乐 |
|---|---|
| 剧本 | 词曲 |
| 布景与服装 | **编曲** |
| 演员 | **歌手** |
| 发型化妆 | **现场演唱指导** |
| 摄影 | 录音 |
| 剪辑 | treatment（人声修整） |
| MA | 混音 |

"现场指导 + 录音 + treatment"三者合起来才是**广义的 vocal direction**。

**对本库的意义**：用生成模型时，"录音"这一环消失了，
但**"发型化妆"（指导）和"剪辑"（修整）两环都还在，而且更重要**——
因为你唯一能控制模型的地方就是指导，唯一能补救的地方就是修整。

---

## 4. ★ 音准哲学：本 skill 最反直觉的一节

### 4.1 两条实测经验

> - **唱低（flat）的人声，推子推到天上也"出不来"**
> - **稍微偏高（sharp）的人声"抜け"（穿透力）更好**——好歌手会无意识地唱得略高

第一条解释了一个常见误判：**人声埋在伴奏里，先查音准，再查音量**。

### 4.2 不要全修

> "音准对了所以唱得好"是不完整的；反过来说才对：**唱得好的人大体上是准的。**

所以：
- 伴奏稀疏的地方，偏低或偏高的瞬间**本身就是"韵味"**
- 想强调的地方**偏高是可以的**——不是事后拉上去，而是**刻意保留**
  那些歌手"在情绪里忍不住唱高了"的地方
- > **不是全部对齐，而是刻意留下一部分不动——那才是自然的修音。**

**这条是本库对抗 AI 味的核心人声规则。**
生成模型输出的人声天然全准，你要做的不是"修得更准"，而是**指定哪里允许不准**。

**写法**：在 ARR-SPEC 的 `vocal.pitch_policy` 里写"哪些位置保留偏移"，
而不是写"修准"。

**失效条件**：编曲极密、和声堆叠很厚的段落，音准偏差会变成浑浊而不是韵味——
那些地方该修。**判据是伴奏密度，不是段落名称。**

### 4.3 treatment 的三步顺序

1. **清理多个 take 之间的接点**
2. **对齐节奏**
3. **修音准**

> **为什么是这个顺序**：先动节奏（挪时间）再接的话，接点得重做一遍。

---

## 5. 和声四型

**每一型都由三件事定义：目的 / delivery / 怎么让它不抢主唱。**
注意 delivery 是本 skill 的部分，EQ 是 `mc-mix-intent` 的部分——这里只给思路。

### 型 1：歌い上げ上ハモ（全声上方和声，通常三度）

- **目的**：保持主旋律不变，让整体**更亮、更辉煌**
- **内在矛盾**：它比主唱高，天然突出，却不能压过主唱
- **★ 解法**：**不要靠"唱轻一点"解决**——唱轻就失去辉煌感。
  **保持全声的唱法，用 EQ 解决**（思路：让和声从主唱的频段里"逃开"——
  大幅削低频，并挖掉中频的"芯"，必要时反而强调高频）

### 型 2：贴着主唱的上方和声

- **目的**：不是辉煌，而是**制造空气感、把和弦感演出来**
- **★ 关键在改变唱法**：不是张开的声音，而是**轻的、带气声的干净唱法**
- **注意**：音量会下降，但**不要靠靠近话筒来补**（近讲效应会抬低频），用增益控制

### 型 3：内敛的平行下方和声

- **形象**：**"主唱投下的影子"**。原书配的插画就是歌手和自己的影子：唱法、咬字都尽量贴合主唱，影子本身没有独立的表情 (p0186)
- **降低存在感**：削低频。原书给的参考 EQ（6 段均衡）：低切约 110 Hz，再叠加 123 Hz 削 −10 dB、247 Hz 削 −4.9 dB、621 Hz 削 −4.2 dB，是低频到中低频的整体削减，不是单点陷波 (p0186)

### 型 4：合いの手（句间的应答短句，2–3 声齐唱）

- **定位**：和主唱是**"不同的物件"**
- **做法**：**先伸手去拿 EQ** 来改变质感（收音机音色也行，光削低频就能换气氛）
- **提高多声部的统一度**：推子＋压缩对齐电平 → **给这一组挂同一个空间效果** →
  甚至整组共用一个调制效果（链：EQ → 压缩 → 合唱 → 延迟）

### 混响也是型号的一部分

- 型 1、型 2 可以用**高频成分丰富的混响/延迟**来补辉煌感或空气感，这是把"逃开主唱频段"的思路从 EQ 延伸到空间效果 (p0186)
- 型 3 **减少直达声、增加混响成分**可以降低存在感，干湿比往湿走，"这个人真的在这里唱"的实体感会跟着变淡 (p0186)
- 型 4 的空间处理目标是齐整度：给整组配同一个空间效果统一质感，见本节型 4。混响的声像怎么和主唱声像一起摆，见 §6.2

---

## 6. Double 与声像

### 6.1 Double 主唱：一个明确的权衡

> - **给咬字极好的主唱做 double 会稀释字的感觉**
> - 但 double 特有的立体声扎实感带来**机器复制做不出的温暖与厚度**

★ 注意"机器复制做不出"这句——它同时说明了为什么
**生成模型直接输出的"双轨"听起来是假的**：那是复制，不是第二次演唱。
要真 double 就得让后端**二次生成**，而不是复制一轨再微调。

**操作要点**：
- **主唱 take 必须先选定**，double 是听着主唱贴着唱的
- 但选得慢会让歌手干等——**趁歌手还记得咬字立刻录 double 更好**（时间 vs 质量的权衡）
- 咬字复杂的歌：**几句几句分段认真录**
- **检查手法**：把两轨硬左右，或**把主唱静音**，严格检查 double 有没有贴住
- **指导原则**：**别让主唱的咬字被抹掉**——让歌手用**强调咬字的唱法**录 double，正好

### 6.2 声像策略

| 形态 | 做法 |
|---|---|
| **Single** | 没有特别理由就放**正中**；用音量、混响、延迟制造与主唱的距离和纵深；极高/极低音区的和声考虑**换一支和主唱不同的话筒** |
| **Double** | 可左右分开；**甩得越极端越突出，小音量下也被强调**——想强调的甩远。上下和声都有 double 时，**只甩其中一对**，两对都甩元素太多。若编曲里只有和声是宽的会显怪（故意利用可以），**混响的声像要一起考虑** |
| **Triple** | 理解成"**single + double**"：single 负责纵深，double 负责宽度；**把 single 的音量拉下来**更干净 |

### 6.3 和声录音的指导

主唱唱主旋律很好、唱和声却意外地难——**因为和声和主旋律微妙地相似，很难记住**。

**导唱轨（ガイド）是最常用的解法**：
- 新建一轨，用**起音弱的柔和音色**弹出和声线
- 技巧：**故意高八度弹**更好听清；1 小节的线做成 **2 小节的循环**；可以**只甩到耳机一侧**
- 歌手熟了之后**逐渐降低导唱音量**，再录正式的
- **最有效的其实是唱给他听**——乐器音色和人声是完全不同的东西，
  要一个不弹乐器的主唱"在脑子里把乐器音换成人声"极其困难，
  尤其在歌词音节安排复杂的时候

> **对本库的映射**：用生成后端时，"导唱轨"对应的是**给模型一条参考旋律或参考音频**。
> 同一个道理：**给模型听人声比给它看乐器 MIDI 更有效**。

---

## 7. 映射到各后端

| 后端 | 能吃什么 | 写法 |
|---|---|---|
| **Suno / MiniMax** | 自然语言的 delivery 描述 | 用 §2.2 的词汇：`brighter`、`breathy`、`harder consonants`、`smiling`。**不要写 `louder`** |
| **YuE2** | 同上，且可逐段不同 | 逐段写 delivery，正好对上 §1 的必填② |
| **MIDI / DAW（真人录）** | 完整的 §2–§6 | 直接当 direction sheet 用 |

**所有后端共通的两条**：
1. **力度必须逐段不同**（lint #15）
2. **副歌每一遍必须有变化**（lint #16）——加和声、改 delivery、加 double，三选一以上

**后端能力差异的处理**：若某后端根本不接受 delivery 描述（`honors: none`），
算照做率时应**排除**这些项，而不是给 0 分——详见 L4 的 backend profile 规则。

---

## 8. 与 ARR-SPEC 的字段对应

| 字段 | 本 skill 的哪一节 |
|---|---|
| `vocal.persona` | §1① |
| `vocal.delivery`（可逐段） | §2 |
| `vocal.dynamics_by_section` | §1③，**lint #15** |
| `vocal.chorus_variation` | §1④，**lint #16** |
| `vocal.pitch_policy` | §4.2（写**哪里保留偏移**，不是"修准"） |
| `vocal.stacking` | §5 四型 ＋ §6 double（含 type / 段落 / delivery / 声像） |

---

## 9. 写完后必过

- [ ] 声音人设具体到**能想象出是谁**，不是"女声"
- [ ] 每段有自己的 **delivery**，用的是"亮/气声/辅音用力"这类可执行的词
- [ ] **没有写"大声点"**
- [ ] 力度**逐段不同**（lint #15）
- [ ] 副歌**每一遍都改了东西**，且说得出改的是什么（lint #16）
- [ ] `pitch_policy` 写的是**哪里允许不准**，不是"修准"
- [ ] 和声选了型号，且该型号的 **delivery 和"怎么不抢主唱"都写了**
- [ ] 型 1 的和声**没有靠"唱轻"来避让**
- [ ] 做 double 的话，要求的是**二次演唱**，不是复制一轨
- [ ] 上下和声都有 double 时，**只甩了一对**到极端声像
- [ ] 判断人声抢拍/拖拍时，看的是**元音**的位置

---

## 附：来源

- **日式包 `jp-vocal-lyrics-production`**——§2、§4、§5、§6 全部主干。
  原书为日本流行音乐制作实务系列。
- §5 型 3 的 EQ 参考例、"混响也是型号的一部分"三条，出自《プロの曲作りが分かる本》(p0186)。
- **词曲对齐部分（符割り／字余り／イントネーション）不在本 skill**，
  归**作词库 `lyric-writing`**，因为它是词的工序。
- 人声混音链的具体参数（压缩比、EQ 频点、pop noise 消除的 309.6 Hz 实例等）
  整理在 [reference.md](reference.md)，实操出库到混音库。
- 自查 #15／#16 的判法见 `mc-workflow` §3.0。

## Source & license

This open-source skill is cataloged on AgentStack and links to its original source — we do not rehost the code.

- **Author:** [jtydhr88](https://github.com/jtydhr88)
- **Source:** [jtydhr88/music-composition-skills](https://github.com/jtydhr88/music-composition-skills)
- **License:** MIT

Install and usage instructions live in the source repository linked above.

## Pricing

- **Free** — Free

## Security capabilities

Automated source analysis of v0.1.0 — what this tool can access:

- **Network access:** no
- **Filesystem access:** no
- **Shell / process execution:** no
- **Environment & secrets:** no
- **Dynamic code execution:** no

*"Yes" means the capability is present in the source — more access means more to trust, not that it is unsafe.*


## Versions

- **0.1.0** — security scan: passed — Imported from the upstream source.

## Links

- Listing page: https://agentstack.voostack.com/l/skill-jtydhr88-music-composition-skills-mc-vocal-direction
- Seller: https://agentstack.voostack.com/s/jtydhr88
- Browse the marketplace: https://agentstack.voostack.com/browse

---
Listed on AgentStack — the marketplace for AI agent skills and MCP servers. Every listing is security-reviewed. Creators keep 70%.
