Install
$ agentstack add skill-jtydhr88-music-composition-skills-mc-mix-intent ✓ scanned · ✓ verified, works with Claude Code, Cursor, and more.
Security review
✓ PassedNo issues found. Passed automated security review. · v0.1.0 How review works →
- ✓ Prompt-injection patterns
- ✓ Secret / credential exfiltration
- ✓ Dangerous shell & filesystem operations
- ✓ Untrusted network calls
- ✓ Known-malicious package signatures
What it can access
- ✓ Network access No
- ✓ Filesystem access No
- ✓ Shell / process execution No
- ✓ Environment & secrets No
- ✓ Dynamic code execution No
From automated source analysis of v0.1.0. “Used” means the capability is present in the source — more access means more to trust, not that it’s unsafe.
Verified badge
Passed review? Show it. Paste this badge into your README, it links to the public security report.
Reliability & compatibility
Declared compatibility
Compatibility is declared by the source manifest. End-to-end runtime verification is coming, see below.
We're building live execution health for every listing: tool-call success rate, median latency, uptime, and last-checked timestamps, measured, not self-reported. It isn't live yet, so we don't show numbers we can't stand behind.
How agent discovery & health will work →About
混音意图(Mix Intent)
这个 skill 产出的是意图,不是参数。
区别很要紧:
- "人声 3 kHz +2 dB" 是参数——只有 DAW 能执行,换个后端就废了
- "人声必须在最密的副歌里仍然是最清楚的元素,让路的是 pad 不是吉他" 是意图——
人类工程师能执行、DAW 能执行、文本后端能部分执行、验收时能逐项核对
本库只到意图为止。 EQ 频点、压缩比、母带链出库到混音库。
按任务读哪几节
| 症状/任务 | 读 | |---|---| | 填 ARR-SPEC 的 mix_intent | §2–§4,然后 §8 | | 混音技术上干净但"不对" | §3.1 情绪 | | 不知道该不该追求平衡 | §4(深度是要一致,不是平衡) | | 声部互相盖 | §5 掩蔽(多半是 pad 的问题,不是鼓的) | | 要交给混音师 | §2 五领域 + §8 的交接格式 | | 判断某个后端能吃多少 | §7 | | 想找参考曲目 | §6 |
边界:什么不归这个 skill 管
| 不归这里 | 归哪 | |---|---| | EQ 频点、压缩比、混响参数、总线链、母带 | 出库 → 声音设计与混音库 | | 频段冲突的改写型解法(换音区、减音符、交替) | mc-texture-layering(先在那儿解,解不掉才来这儿) | | 前景/中景/背景的结构规划 | mc-texture-layering §2 | | 人声该怎么唱 | mc-vocal-direction | | 和声/double 的声像具体方案 | mc-vocal-direction §6.2 | | 音色本身怎么设计 | mc-sound-design | | 鼓组内部各件的左右与高低布局 | mc-rhythm-section §6(本 skill 的声场图只定鼓组整体坐在哪) |
> ★ 与 mc-texture-layering 的分界(重复一遍,因为最容易混): > texture-layering 的解法是"改写",mix-intent 的解法是"改混"。 > 能改写解决的不要留给混音。
1. 动笔前必填
| 必填 | 问法 | |---|---| | ① 情绪 | 一句话说这首混音要传达什么。先写这条,它否决后面所有决定 | | ② 声场图 | 每件乐器的左右位置和前后位置(§2) | | ③ 主角序列 | 逐段写:这一段谁是最清楚的元素 | | ④ 让路关系 | 谁给谁让、在什么时候(ducking_map) | | ⑤ 参考曲目 | 至少一首,且说得出参考它的哪一个具体方面 |
2. 五个领域与声场
混音过程必须涉及 5 个主要领域 (p0089):
| # | 领域 | |---|---| | 1 | 时间(Time) | | 2 | 频率(Frequency) | | 3 | 电平(Level) | | 4 | 立体声(Stereo) | | 5 | 深度(Depth) |
> 立体声和深度共同构成"空间(Space)" (p0089)。
声场(Sound stage): > 混音应该呈现在一个想象出来的声场当中,各个乐器具有一定的左右(立体声)和 > 前后(深度)位置 (p0089)。
这就是交接格式的骨架——一张声场图 + 五个领域各写一句,混音师就能开工。
左右与前后各靠什么线索(Howard & Angus):
- 声像电位器给的是声级差(p0112);声级差主要对高频定位起作用,时间差主要对低频起作用,
700 Hz–2.8 kHz 是两种线索的过渡区,定位能力最弱(p0108)。 → 低频元素的 pan 基本无效,居中即可;要一件乐器"位置明确",它得有 3 kHz 以上的成分。 失效条件:耳机监听(头中定位,p0109)。
- 前后靠直达声与混响声的比例和时间间隔(p0261、p0264);30 ms 内到达的延迟声不被单独听出,
定位仍在先导声(优先效应,p0110);初始延时 10–20 ms 是自然的前后间隔,50 ms 就是回声(p0346)。 → 写深度只给"近/中/远"三档,不写毫秒。
宏观 vs 微观 (p0089):
| | 针对 | 例 | |---|---|---| | 宏观混音 | 影响整个混音的元素 | 混音的频率平衡 | | 微观混音 | 每一个乐器声部单独处理 | 人声听上去是否自然 |
本 skill 主要写宏观——微观是混音师的手艺,不该由编曲规格单规定死。
3. 四个目标
混音有 4 个基本目标 (p0089):
| # | 目标 | |---|---| | 1 | 情绪(Mood) | | 2 | 平衡(Balance) | | 3 | 清晰(Definition) | | 4 | 趣味(Interest) |
> 评价混音时,先看它在各主要领域表现出的连贯性和吸引力,然后再分析对每个目标的完成度 (p0089)。
3.1 ★ 情绪:它有否决权
> 情绪指混音能否表达出音乐中含有的情感因素 (p0090)。
两个反例,都很说明问题 (p0090):
- 深度压缩、极端均衡、吵闹的失真、军鼓过于强烈的打击感 → 毁掉一首柔美的爵士
- 甜美的人声混响、过于和谐的鼓组、轻柔的吉他 → 毁掉一首充满愤怒的重金属
注意第二个例子:每一项单独看都是"好混音"的标志,合起来却是错的。 技术上正确不等于情绪上正确。
> 只擅长处理某种音乐风格的混音师,遇到其他风格时效果往往不佳 (p0090)。
对本库的意义:生成模型也是"只擅长某种风格的混音师"—— 它会把任何输入往它见得最多的那种平衡上拉。 所以 mix_intent.mood 必须写死,且在 prompt 里靠前。
3.2 清晰
> 清晰度代表着声音听上去是否清楚、可辨认 (p0090)。
落到规格单上就是 §1③ 的主角序列:逐段说清楚谁必须是可辨认的。
清晰度本质上包含在分离度里:一件乐器清不清晰,看它能不能被听辨出来(可懂度),也看它听着自不自然,跟响不响关系不大 (p0260)。判据可以用两个反例检验:钢琴录得像从海底传出来,或者踩镲缺了基本的高频成分,这两种情况电平都可能正常,清晰度却塌了 (p0260)。
电平和清晰度常被当成简单正比:"乐器电平越大,清晰度越高" (p0100)。但这条只在乐器本身频率健康时成立;一件频率本身有缺陷的乐器,提升电平只会让它变大,不会让它变清晰 (p0100)。诊断"这个声部不够清晰"时,先判断是响度不够还是频率有洞,再决定该不该推电平。
3.3 趣味
趣味往往来自违反平衡(见 §4.3),但违反平衡只是趣味的一种极端形式,趣味的机制更底层:耳朵会适应,声音长时间不变,注意力就会掉,只有变化才能把耳朵重新抓回来 (p0091)。主歌副歌反复、音轨加倍、配器改变,本质上都是靠制造变化撑住这份注意力 (p0091)。
混音能在编曲结构之上再叠一层变化,判据是"哪个段落有、哪个段落没有",不涉及具体参数 (p0092):
- 某个声部只在特定乐段自动化推起来
- 某件乐器只在特定乐段出现(例:小号只在主歌反复时进)
- 同一件乐器换乐段换处理,让明暗随段落变化
- 副歌把整体压得更狠,允许贝司失真
- 军鼓在不同乐段配不同混响
风格决定该做到什么程度:氛围音乐要让人有兴趣但不能太抓耳朵;trance 靠同一主题反复,变化反而要做得更精细才不腻 (p0092)。
写法:这些变化点按段落写进 focus_by_section[],不平衡类的写进 deliberate_imbalance[](§4.3),都不要写成全曲统一的状态。
4. 平衡:在哪三处求平衡,在哪一处不求
4.1 三个求平衡的领域 (p0090)
- 频率平衡:缺少中高频会让混音听上去浑浊、模糊,声像也显得更远 (p0090)。判据不是补到某个具体数值,是听感一旦落到"浑浊、模糊、变远"这三个词,就说明中高频欠了。
- 立体声声像平衡:靠电平平衡与频率平衡两条撑起来,尽量让乐器整体上左右对称(例如吉他、沙锤、伴唱人声)(p0252)。这里说的"平衡"针对整体声像分布,不要求单件乐器必须居中,居中反而是清晰度最差的位置(见 §2 定位线索)。
- 电平平衡:这里指相对电平,不是绝对电平。混音评估问的是"相对于其他乐器,这件乐器有多响",不是"这件乐器本身有多响";把监听音量整体开大解决不了相对电平的问题 (p0097)。相对电平通常由乐器在这一刻的重要性决定,随歌曲进展要跟着调,例如主音吉他独奏段的电平就该比伴奏段更高 (p0098)。
代价:如果为了让相对电平整齐,把所有敲击都压到同一电平,鼓组会听起来像"鼓机",丢掉原始力度带来的音色变化,电平平衡不等于电平统一 (p0388)。
4.2 ★ 深度要"一致",不要"平衡"
> 深度问题要做到一致,而非平衡 (p0090)。
> 例:如果底鼓声像近到贴脸,而军鼓远到邻居家,会使整个鼓组产生 > 在深度上极其扭曲的声像布局 (p0090)。
这条容易被误读成"深度也要居中"。不是—— 深度可以整体很近或整体很远,但同一个声源组内部必须一致。
自检动作:把乐器按组(鼓组、键盘组、弦乐组)分别列出深度值, 组内差异大于组间差异 → 错了。
物理上"同一组"就是共享同一套早期反射与混响拖尾:各声像位置的早期反射可以不同, 但拖尾的衰减率必须相同(Howard & Angus p0348–0350)。
4.3 两种可以不平衡的情况 (p0090)
- 做出创造性的音响效果
- 让歌曲产生趣味
> 例:Delgados《The Past That Suits You Best》里,混音师 Dave Fridmann > 把鼓组和人声的声像完全设置到一个声道当中,创造出立体声上不平衡但很有魅力的效果 (p0090)。
> 富于趣味的不平衡通常是瞬间上的处理——例如舞曲的华彩段落里把一些低频信号加倍 (p0090)。
"通常是瞬间上的"这句是关键:不平衡是事件,不是状态。 全曲不平衡是错误,某一处不平衡是手法。
写法:不平衡要写进 mix_intent.deliberate_imbalance[], 带起止小节和理由。没写小节范围的不平衡,一律当成失误。
5. 掩蔽:为什么问题多半出在 pad 而不是鼓
> 掩蔽的核心原则:响度高的声音会掩蔽响度低的声音; > 一件乐器的频率范围会掩蔽另一件乐器的频率范围 (p0038)。
但真正有用的是下面这条时间维度的推论:
> - 打击乐器(如底鼓)发声时间短,掩蔽作用较小 > - 持续发声的乐器(如锯齿波 pad)会占满频谱和立体声空间,掩蔽作用大 (p0038) > - ★ 提升密集 pad 声部的电平,比提升底鼓电平带来更多的掩蔽; > pad 掩蔽底鼓是持续发生的大问题 (p0038)
Howard & Angus 把这几条讲成了机制:
- 掩蔽向上延展:低频容易掩蔽高频,反过来弱得多(p0239)→ pad 的低频不只盖底鼓,它往上盖住一切,
所以"pad 低频留空"是第一刀。
- 掩蔽声所在的临界频带内,掩蔽阈只比掩蔽声低约 20 dB(p0240)→ 让路要让到位:
同频段轻 20 dB 以上才算"让",轻 3 dB 只是变糊。
- 时间掩蔽:响声停止后 100–200 ms 内,轻的起音仍听不见;反向(后掩蔽)只有约 10 ms,几乎不存在(p0241)。
短打击音本身的响度也按时长打折——200 ms 以内的声音越短听着越轻(p0095)。 → 人声或 hook 紧跟 crash/fill 进入时,要么留出 ≥ 200 ms,要么让它的第一个音自己够响。 自检:找每个主角的进入点,前 200 ms 内有没有更响的东西刚结束。
推论(本库的用法): 诊断"糊"的时候,先查持续音,不要先查打击乐。 直觉总是指向"鼓太大了",但按这条,元凶更可能是那个一直在响的 pad 或垫底吉他。
首选解法仍然在上游:让 pad 在低频区留空(改写,mc-texture-layering), 而不是靠侧链把它压下去(改混)。侧链是解决不掉时才用的。
6. 参考曲目:本库的校准手段
6.1 六种用法 (p0051–0052)
| 用法 | 说明 | |---|---| | 作为模板仿效 | 极佳的训练方法,但"模仿是创新最大的敌人";且作品类型差异会让模仿失效 | | 作为灵感来源 | 混音开始前播放,启迪方向 | | 陷入困境时的突破口 | 研究自己的混音与参考的差别 | | 作为成品参考 | 完成后对照频响和电平 | | 校准耳朵 | 到不熟悉的环境先放熟悉的参考曲,摸清扬声器/房间/座位 | | 评估扬声器 | 放自己真正熟悉的作品,比商家放的流行乐管用 |
6.2 选择与陷阱
- 参考曲目要匹配混音类型(做弦乐混音就找含弦乐的,做 chill-out 就找同类)(p0051)
- 存成无损格式,不要 MP3 (p0051)
- 最好包含事先选好的片段以便快速比较;可以加入未经混音的音轨 (p0051)
- ★ 注意母带处理的影响 (p0052):经过母带的参考曲通常动态更质密
(一致的相对电平 + 更大的压缩),且频率特性可能是按专辑里最不理想的那首改过的
- ★ 对比前先对齐响度:等响曲线随声压级变形,音量一降,低频和高频相对中频就被抑制,
声音变薄变暗(Howard & Angus p0091);声压级 +10 dB 响度约加倍(p0094)。 响一点的那个几乎总"听起来更好"——不对齐响度,比的是音量不是混音。
最后这条对本库特别重要:仓库的度量工具从成品音频反推指标, 测到的动态范围是母带之后的。所以拿参考曲的动态值当目标会系统性偏紧—— 这也是 probe_quality 要先报 bitrate 和高频截止的原因。
7. 各后端能吃多少
| 后端 | 能吃 | 不能吃 | |---|---|---| | Suno / MiniMax | 情绪、整体质感的形容(warm、dry、wide chorus) | 声场图、ducking_map、逐段深度 | | YuE2 | 同上,段落粒度更细 | 精确声像与深度 | | MIDI / DAW | 全部——直接当 direction sheet | — |
★ 规则:后端 profile 里标 honors: none 的项, 算照做率时必须排除,不能给 0 分。 否则一个诚实声明"我做不到声像"的后端,会比一个假装做得到的后端得分更低—— 那会把评分体系带向错误的方向。
8. 与 ARR-SPEC 的字段对应
| 字段 | 本 skill 的哪一节 | |---|---| | mix_intent.mood | §3.1(一句话,且放在生成提示词的靠前位置) | | mix_intent.sound_stage[] | §2(每件乐器的 pan + depth) | | mix_intent.focus_by_section[] | §3.2 主角序列 | | mix_intent.ducking_map[] | §5(谁给谁让、什么时候) | | mix_intent.deliberate_imbalance[] | §4.3(必须带起止小节 + 理由) | | mix_intent.reference_tracks[] | §6(必须写参考它的哪个方面) |
9. 写完后必过
- [ ]
mood写了,一句话,且不和后面的决定打架 - [ ] 五个领域各写了一句,不是只写了频率
- [ ] 声场图里每件乐器都有左右和前后两个值
- [ ] 同组乐器的深度一致(鼓组内部、弦乐组内部)
- [ ] 逐段写了谁是最清楚的元素
- [ ] 每处不平衡都带起止小节和理由,不是全曲状态
- [ ] 诊断"糊"时先查了持续音,不是先怪鼓
- [ ] 每个主角的进入点前 200 ms 内,没有更响的事件刚结束(§5)
- [ ] 低频元素的声像居中;参考曲对比时响度已对齐(§2、§6.2)
- [ ] 能在作曲层解决的冲突,已经在
mc-texture-layering解掉了,没堆到这儿 - [ ] 参考曲目至少一首,写明参考它的哪个方面
- [ ] 没有在本文件里写 EQ 频点或压缩比(那些属于混音库)
附:来源
- Roey Izhaki《Mixing Audio》(混音指南)——§2、§3、§4、§5、§6 的主干
(6 混音涉及的领域与目标、6.1 混音的目标、2.x 掩蔽、3.4 使用参考曲目)。页码为该书页。 本库只取"领域与目标"和"参考曲目"两部分;EQ/压缩/混响/母带的实操章节 全部出库到声音设计与混音库。
- Howard & Angus《音乐声学与心理声学》(Acoustics and Psychoacoustics)——
§2 的定位线索与优先效应、§4.2 的混响拖尾、§5 的掩蔽机制与时间掩蔽、§6.2 的等响曲线。页码为中译本页。
- 竹内一弘《EDM 制作》的频率平衡与 Lo-Mid 管理、各声部音量平衡——同样只取意图层,
参数整理在 [reference.md](reference.md)。
- 后端 profile 与
honors的定义见 本库架构文档 §2.3。
Source & license
This open-source skill is cataloged on AgentStack and links to its original source — we do not rehost the code.
- Author: jtydhr88
- Source: jtydhr88/music-composition-skills
- License: MIT
Install and usage instructions live in the source repository linked above.
Reviews
No reviews yet, be the first.
Write a review
Versions
- v0.1.0 Imported from the upstream source.