AgentStack
Browse Sign in
Browse Why AgentStack Sell Docs
Sign in
SKILL verified MIT Self-run

Mc Vocal Direction

skill-jtydhr88-music-composition-skills-mc-vocal-direction · by jtydhr88

Vocal direction and harmony design (演唱指导与和声设计) - specifying how a vocal should be delivered, not just what notes it sings. The two musical criteria, the vocabulary that actually changes a performance (brighter rather than louder, harder consonants rather than louder), consonant/vowel separation and why the beat lives in the vowel, the anti-perfection pitch philosophy that keeps a vocal from sound…

— No reviews yet
0 installs
0 views
— view→install

Install

$ agentstack add skill-jtydhr88-music-composition-skills-mc-vocal-direction

✓ scanned · ✓ verified, works with Claude Code, Cursor, and more.

Security review

✓ Passed

No issues found. Passed automated security review. · v0.1.0 How review works →

  • ✓ Prompt-injection patterns
  • ✓ Secret / credential exfiltration
  • ✓ Dangerous shell & filesystem operations
  • ✓ Untrusted network calls
  • ✓ Known-malicious package signatures

What it can access

  • ✓ Network access No
  • ✓ Filesystem access No
  • ✓ Shell / process execution No
  • ✓ Environment & secrets No
  • ✓ Dynamic code execution No

From automated source analysis of v0.1.0. “Used” means the capability is present in the source — more access means more to trust, not that it’s unsafe.

View the full security report →

Verified badge

Passed review? Show it. Paste this badge into your README, it links to the public security report.

AgentStack Verified badge Links to your public security report.
[![AgentStack Verified](https://agentstack.voostack.com/badges/verified.svg)](https://agentstack.voostack.com/security/report/skill-jtydhr88-music-composition-skills-mc-vocal-direction)

Reliability & compatibility

✓ Security review passed
0 installs to date
— no reviews yet
● 5d ago

Declared compatibility

Claude CodeClaude Desktop

Compatibility is declared by the source manifest. End-to-end runtime verification is coming, see below.

Preview Execution monitoring

We're building live execution health for every listing: tool-call success rate, median latency, uptime, and last-checked timestamps, measured, not self-reported. It isn't live yet, so we don't show numbers we can't stand behind.

How agent discovery & health will work →
Are you the author of Mc Vocal Direction? Claim this listing to set pricing, connect Stripe payouts, and keep 70% of every sale.
Sign up to claim

About

演唱指导与和声设计(Vocal Direction)

这个 skill 管的是:人声该怎么唱,不只是唱什么音。

对本库尤其重要,因为——

> AI 人声最稳定的破绽是"完美":音准全中、力度平直、每遍副歌唱得一模一样。 > 真人做不到这些,也不想做到。

所以本 skill 有一半内容是在教怎么要求"不完美",以及怎么把这种要求写成后端能吃的话。

按任务读哪几节

| 症状/任务 | 读 | |---|---| | 人声听着平、没表情 | §2 演唱指导的语汇 | | 想让人声更有冲击力 | §2.3 辅音 | | 人声"太准了"、像机器 | §4 音准哲学 | | 人声推不出来、埋在伴奏里 | §4.1(多半不是音量问题) | | 要加和声,不知道加哪种 | §5 四型 | | 和声盖过主唱 / 太抢 | §5 对应型号的 delivery + EQ 思路 | | 要不要做 double | §6 | | 写 Suno/YuE2 的人声提示词 | §7 | | 填 ARR-SPEC 的 vocal 块 | §8 + §9 |

边界:什么不归这个 skill 管

| 不归这里 | 归哪 | |---|---| | 词怎么写、押韵、倒字/协音 | 作词库(lyric-writing,LYR-SPEC) | | 旋律的音高走向、音域设计 | mc-melody(L1) | | 字怎么安到音上(符割り/字余り) | 作词库——它是词曲接口,归词库 | | 人声 EQ 的具体频点、压缩参数 | mc-mix-intent(意图)/出库混音库(实操) | | 人声和哪件乐器抢频段 | mc-texture-layering | | 合成人声音源(Vocaloid、Synthesizer V 的引擎参数) | 不做。本库只写演唱意图(§7 映射到各后端),不写引擎参数 |


1. 动笔前必填

| 必填 | 问法 | |---|---| | ① 这是谁在唱 | 声音人设:性别、音区、质感、年代感。不是"女声"这种程度 | | ② 每段的 delivery | 至少分主歌/副歌/桥。用 §2 的语汇写,不是"有感情" | | ③ 力度起伏 | 逐段的相对强弱——lint #15 查这个,全曲一个力度直接判不合格 | | ④ 副歌逐遍差异 | 第二遍、第三遍分别改了什么(lint #16) | | ⑤ 和声方案 | 用哪型(§5)、在哪几段、上还是下 |


2. 演唱指导的语汇

2.1 只有两条音乐上的判据

> 1. 是否适合这首歌 > 2. 是否适合这个歌手(似合っているか)

就这两条。技术好不好不是判据——技术是手段。 用在本库上,第 2 条变成"是否适合这个声音人设"。

2.2 ★ 不要说"大声点"

这是整节最实用的一条:

> 宏大的编曲配上含混的人声时,不要说"唱大声点"——音量推子能解决音量。 > 你真正想要的多半是"更亮的声音",所以说"请唱得亮一点"更有效。

形象化指令同样有效:

  • "带着笑唱"
  • "嘴角上扬"
  • "往很远的地方唱"

为什么这条对本库特别重要:这些正好是文本后端能吃的词。 sing brighter / smiling delivery / sung toward a far distance 是有效提示词, 而 louder 在生成模型那里几乎没有意义——它不控制音量。

2.3 ★ 辅音与元音分开想

这是演唱指导和后期编辑共同的基础知识:

  • 一个音节 = 辅音 + 元音(「か」= K + A,写成罗马字最清楚)
  • 要冲击力时,说"辅音用力"比说"大声"有效
  • 编辑时要分清:这是辅音的时机问题还是元音的长度问题
  • 混音里光是控制辅音的电平就能改变人声的表情

2.4 "S" 这个魔法辅音

> S ≈ 用嗓子发出的白噪声——它本质上就是噪声。

推论(都很实用):

  • 可以在 S 的中间剪接,听不出接缝
  • 它的长度可以自由伸缩而不违和
  • 从别的 take 移植一个 S 过来基本上无缝

> ★ 拍点活在元音上,不在辅音上。 > 「さ」(= S + A) 唱在第 2 拍时,S 实际发生在第 1 拍的尾巴上—— > 和拍子对齐的是元音 A。

这条有两个用处:

  1. 编辑 AI 生成的人声时,"这里有个 S"= "这里是好剪接点"
  2. 判断人声"抢拍/拖拍"时,要看元音的位置,不是音节的起点——

否则你会把所有以 S、SH、TS 开头的字都误判成抢拍


3. 制作链条的类比

一个有用的对照(电影 → 流行音乐):

| 电影 | 音乐 | |---|---| | 剧本 | 词曲 | | 布景与服装 | 编曲 | | 演员 | 歌手 | | 发型化妆 | 现场演唱指导 | | 摄影 | 录音 | | 剪辑 | treatment(人声修整) | | MA | 混音 |

"现场指导 + 录音 + treatment"三者合起来才是广义的 vocal direction。

对本库的意义:用生成模型时,"录音"这一环消失了, 但"发型化妆"(指导)和"剪辑"(修整)两环都还在,而且更重要—— 因为你唯一能控制模型的地方就是指导,唯一能补救的地方就是修整。


4. ★ 音准哲学:本 skill 最反直觉的一节

4.1 两条实测经验

> - 唱低(flat)的人声,推子推到天上也"出不来" > - 稍微偏高(sharp)的人声"抜け"(穿透力)更好——好歌手会无意识地唱得略高

第一条解释了一个常见误判:人声埋在伴奏里,先查音准,再查音量。

4.2 不要全修

> "音准对了所以唱得好"是不完整的;反过来说才对:唱得好的人大体上是准的。

所以:

  • 伴奏稀疏的地方,偏低或偏高的瞬间本身就是"韵味"
  • 想强调的地方偏高是可以的——不是事后拉上去,而是刻意保留

那些歌手"在情绪里忍不住唱高了"的地方

  • > 不是全部对齐,而是刻意留下一部分不动——那才是自然的修音。

这条是本库对抗 AI 味的核心人声规则。 生成模型输出的人声天然全准,你要做的不是"修得更准",而是指定哪里允许不准。

写法:在 ARR-SPEC 的 vocal.pitch_policy 里写"哪些位置保留偏移", 而不是写"修准"。

失效条件:编曲极密、和声堆叠很厚的段落,音准偏差会变成浑浊而不是韵味—— 那些地方该修。判据是伴奏密度,不是段落名称。

4.3 treatment 的三步顺序

  1. 清理多个 take 之间的接点
  2. 对齐节奏
  3. 修音准

> 为什么是这个顺序:先动节奏(挪时间)再接的话,接点得重做一遍。


5. 和声四型

每一型都由三件事定义:目的 / delivery / 怎么让它不抢主唱。 注意 delivery 是本 skill 的部分,EQ 是 mc-mix-intent 的部分——这里只给思路。

型 1:歌い上げ上ハモ(全声上方和声,通常三度)

  • 目的:保持主旋律不变,让整体更亮、更辉煌
  • 内在矛盾:它比主唱高,天然突出,却不能压过主唱
  • ★ 解法:不要靠"唱轻一点"解决——唱轻就失去辉煌感。

保持全声的唱法,用 EQ 解决(思路:让和声从主唱的频段里"逃开"—— 大幅削低频,并挖掉中频的"芯",必要时反而强调高频)

型 2:贴着主唱的上方和声

  • 目的:不是辉煌,而是制造空气感、把和弦感演出来
  • ★ 关键在改变唱法:不是张开的声音,而是轻的、带气声的干净唱法
  • 注意:音量会下降,但不要靠靠近话筒来补(近讲效应会抬低频),用增益控制

型 3:内敛的平行下方和声

  • 形象:"主唱投下的影子"。原书配的插画就是歌手和自己的影子:唱法、咬字都尽量贴合主唱,影子本身没有独立的表情 (p0186)
  • 降低存在感:削低频。原书给的参考 EQ(6 段均衡):低切约 110 Hz,再叠加 123 Hz 削 −10 dB、247 Hz 削 −4.9 dB、621 Hz 削 −4.2 dB,是低频到中低频的整体削减,不是单点陷波 (p0186)

型 4:合いの手(句间的应答短句,2–3 声齐唱)

  • 定位:和主唱是"不同的物件"
  • 做法:先伸手去拿 EQ 来改变质感(收音机音色也行,光削低频就能换气氛)
  • 提高多声部的统一度:推子+压缩对齐电平 → 给这一组挂同一个空间效果 →

甚至整组共用一个调制效果(链:EQ → 压缩 → 合唱 → 延迟)

混响也是型号的一部分

  • 型 1、型 2 可以用高频成分丰富的混响/延迟来补辉煌感或空气感,这是把"逃开主唱频段"的思路从 EQ 延伸到空间效果 (p0186)
  • 型 3 减少直达声、增加混响成分可以降低存在感,干湿比往湿走,"这个人真的在这里唱"的实体感会跟着变淡 (p0186)
  • 型 4 的空间处理目标是齐整度:给整组配同一个空间效果统一质感,见本节型 4。混响的声像怎么和主唱声像一起摆,见 §6.2

6. Double 与声像

6.1 Double 主唱:一个明确的权衡

> - 给咬字极好的主唱做 double 会稀释字的感觉 > - 但 double 特有的立体声扎实感带来机器复制做不出的温暖与厚度

★ 注意"机器复制做不出"这句——它同时说明了为什么 生成模型直接输出的"双轨"听起来是假的:那是复制,不是第二次演唱。 要真 double 就得让后端二次生成,而不是复制一轨再微调。

操作要点:

  • 主唱 take 必须先选定,double 是听着主唱贴着唱的
  • 但选得慢会让歌手干等——趁歌手还记得咬字立刻录 double 更好(时间 vs 质量的权衡)
  • 咬字复杂的歌:几句几句分段认真录
  • 检查手法:把两轨硬左右,或把主唱静音,严格检查 double 有没有贴住
  • 指导原则:别让主唱的咬字被抹掉——让歌手用强调咬字的唱法录 double,正好

6.2 声像策略

| 形态 | 做法 | |---|---| | Single | 没有特别理由就放正中;用音量、混响、延迟制造与主唱的距离和纵深;极高/极低音区的和声考虑换一支和主唱不同的话筒 | | Double | 可左右分开;甩得越极端越突出,小音量下也被强调——想强调的甩远。上下和声都有 double 时,只甩其中一对,两对都甩元素太多。若编曲里只有和声是宽的会显怪(故意利用可以),混响的声像要一起考虑 | | Triple | 理解成"single + double":single 负责纵深,double 负责宽度;把 single 的音量拉下来更干净 |

6.3 和声录音的指导

主唱唱主旋律很好、唱和声却意外地难——因为和声和主旋律微妙地相似,很难记住。

导唱轨(ガイド)是最常用的解法:

  • 新建一轨,用起音弱的柔和音色弹出和声线
  • 技巧:故意高八度弹更好听清;1 小节的线做成 2 小节的循环;可以只甩到耳机一侧
  • 歌手熟了之后逐渐降低导唱音量,再录正式的
  • 最有效的其实是唱给他听——乐器音色和人声是完全不同的东西,

要一个不弹乐器的主唱"在脑子里把乐器音换成人声"极其困难, 尤其在歌词音节安排复杂的时候

> 对本库的映射:用生成后端时,"导唱轨"对应的是给模型一条参考旋律或参考音频。 > 同一个道理:给模型听人声比给它看乐器 MIDI 更有效。


7. 映射到各后端

| 后端 | 能吃什么 | 写法 | |---|---|---| | Suno / MiniMax | 自然语言的 delivery 描述 | 用 §2.2 的词汇:brighter、breathy、harder consonants、smiling。不要写 louder | | YuE2 | 同上,且可逐段不同 | 逐段写 delivery,正好对上 §1 的必填② | | MIDI / DAW(真人录) | 完整的 §2–§6 | 直接当 direction sheet 用 |

所有后端共通的两条:

  1. 力度必须逐段不同(lint #15)
  2. 副歌每一遍必须有变化(lint #16)——加和声、改 delivery、加 double,三选一以上

后端能力差异的处理:若某后端根本不接受 delivery 描述(honors: none), 算照做率时应排除这些项,而不是给 0 分——详见 L4 的 backend profile 规则。


8. 与 ARR-SPEC 的字段对应

| 字段 | 本 skill 的哪一节 | |---|---| | vocal.persona | §1① | | vocal.delivery(可逐段) | §2 | | vocal.dynamics_by_section | §1③,lint #15 | | vocal.chorus_variation | §1④,lint #16 | | vocal.pitch_policy | §4.2(写哪里保留偏移,不是"修准") | | vocal.stacking | §5 四型 + §6 double(含 type / 段落 / delivery / 声像) |


9. 写完后必过

  • [ ] 声音人设具体到能想象出是谁,不是"女声"
  • [ ] 每段有自己的 delivery,用的是"亮/气声/辅音用力"这类可执行的词
  • [ ] 没有写"大声点"
  • [ ] 力度逐段不同(lint #15)
  • [ ] 副歌每一遍都改了东西,且说得出改的是什么(lint #16)
  • [ ] pitch_policy 写的是哪里允许不准,不是"修准"
  • [ ] 和声选了型号,且该型号的 delivery 和"怎么不抢主唱"都写了
  • [ ] 型 1 的和声没有靠"唱轻"来避让
  • [ ] 做 double 的话,要求的是二次演唱,不是复制一轨
  • [ ] 上下和声都有 double 时,只甩了一对到极端声像
  • [ ] 判断人声抢拍/拖拍时,看的是元音的位置

附:来源

  • 日式包 jp-vocal-lyrics-production——§2、§4、§5、§6 全部主干。

原书为日本流行音乐制作实务系列。

  • §5 型 3 的 EQ 参考例、"混响也是型号的一部分"三条,出自《プロの曲作りが分かる本》(p0186)。
  • 词曲对齐部分(符割り/字余り/イントネーション)不在本 skill,

归作词库 lyric-writing,因为它是词的工序。

  • 人声混音链的具体参数(压缩比、EQ 频点、pop noise 消除的 309.6 Hz 实例等)

整理在 [reference.md](reference.md),实操出库到混音库。

  • 自查 #15/#16 的判法见 mc-workflow §3.0。

Source & license

This open-source skill is cataloged on AgentStack and links to its original source — we do not rehost the code.

Install and usage instructions live in the source repository linked above.

Reviews

No reviews yet, be the first.

Versions

  • v0.1.0 Imported from the upstream source.