
1. 为什么AI音乐总是“一股机器味儿”1.1 从“能出声”到“像人写的”之间差了什么先抛一个我自己的真实经历。去年帮一个独立游戏团队做配乐需求是“一段带点忧郁感的钢琴曲节奏舒缓适合主菜单循环”。我打开AI音乐生成工具输入了“melancholic piano, slow, loopable”生成出来的东西乍一听没毛病钢琴音色对、速度对、调性也对但循环听了三遍之后团队主策直接说了一句“这玩意儿像电梯背景音乐没有灵魂。”问题出在哪不是模型不行是提示词太“说明书”了。你告诉AI“忧郁钢琴慢速”它给你的就是这三个标签的“平均值”——所有忧郁钢琴曲的公共特征集合。而真正打动人的音乐恰恰藏在那些“非平均值”的细节里左手低音区的半音下行、右手旋律故意延迟半拍进入、某个小节突然收弱再渐强。这些细节AI不会主动给你除非你在提示词里“暗示”它。这就是“机械AI味儿”的根源提示词停留在标签层面没有进入音乐语言层面。标签是给分类器看的音乐语言是给创作者看的。你要做的是把后者翻译成AI能理解的前者。1.2 六大曲风为什么是拆解提示词的最佳切口有人可能会问为什么不按“情绪”拆、不按“乐器”拆偏偏按曲风拆我的理解是曲风是音乐创作中约束条件最密集、最可操作的维度。你说“悲伤”一百个人有一百种悲伤但你说“City Pop”它天然绑定了特定的和声进行比如大七和弦、九和弦的频繁使用、特定的节奏型带切分的十六分音符贝斯线、特定的音色取向 chorus 效果的电吉他、FM电钢琴。这些具体特征才是提示词可以“下钩子”的地方。我选了六种在AI音乐生成中出现频率最高、也最容易出效果的曲风Lo-Fi Hip Hop、City Pop、Cinematic Orchestral、Synthwave、Acoustic Folk、Electronic Dance。它们覆盖了从“氛围铺底”到“主歌驱动”的主要使用场景也各自代表了不同的提示词策略。下面逐个拆。2. 六大曲风提示词拆解与实操模板2.1 Lo-Fi Hip Hop用“不完美”制造氛围感Lo-Fi Hip Hop 是AI音乐生成里最容易出“能听”结果、也最难出“好听”结果的曲风。原因很简单它的核心美学就是“不完美”——黑胶底噪、磁带抖动、鼓组略微偏离网格、钢琴音色带点模糊。但如果你直接在提示词里写“vinyl noise, tape wobble”很多模型会把这些当成独立音效层叠上去结果就是“干净的曲子上面浮着一层噪声”假得不行。我的做法是把“不完美”写成演奏指令而不是音效标签。比如提示词片段lazy swing drum pattern with slight humanization, dusty piano chords played with soft velocity, warm tape saturation on the master bus, vinyl crackle integrated into the mix rather than layered on top这里的关键词是humanization人性化处理、soft velocity轻力度、integrated into the mix融入混音而非叠加。这些词告诉AI不完美是演奏的一部分不是后期贴上去的。具体到参数层面如果你用的工具支持BPM和调性指定Lo-Fi Hip Hop 的甜区大概在70-85 BPM调性优先选小调或Dorian调式。Dorian的好处是既有小调的忧郁又有大六度带来的那一点“暖”不会太丧。鼓组方面底鼓和军鼓的力度差异要拉开底鼓可以设到100-110军鼓设到70-80这样才有“懒”的感觉。注意很多AI音乐工具对“swing”的理解是全局的但Lo-Fi的swing往往是局部的——比如只有hi-hat带swing底鼓还是直的。如果工具支持分轨提示一定要把swing限定在hi-hat或shaker上。2.2 City Pop和声密度决定“都市感”City Pop 这两年在国内突然火起来连带AI音乐生成里也多了很多“City Pop”标签的尝试。但大部分人生成出来的东西要么像80年代日本广告配乐要么像蒸汽波就是不像真正的City Pop。差别在哪和声密度。真正的City Pop和弦变化极其频繁经常一小节两个和弦而且大量使用大七、九、十一、十三和弦以及副属和弦比如在C大调里突然出现A7指向Dm7。这种和声密度带来的“信息量”才是都市感、繁华感、甚至一点点“塑料感”的来源。如果你只写“City Pop, 80s Japanese, funky”AI大概率给你一个四和弦循环的简单进行听起来就“空”。我的提示词策略是直接描述和声行为提示词片段rich jazz-fusion chord progressions with major 7th, 9th, and 13th extensions, frequent secondary dominants, smooth voice leading, chorus-drenched electric guitar playing single-note lines, FM electric piano comping with syncopated rhythms注意secondary dominants副属和弦和voice leading声部连接这两个词它们会显著提升生成结果的和声复杂度。另外FM electric piano是City Pop的标志性音色比普通的“electric piano”更精准。BPM方面City Pop 通常在95-115 BPM太快会失去那种“悠闲的都市感”。贝斯线要特别强调syncopated切分和slap technique勾弦这是City Pop律动的灵魂。2.3 Cinematic Orchestral用“空间叙事”替代“情绪形容词”Cinematic Orchestral 是AI音乐生成里翻车率最高的曲风之一。你写“epic, emotional, orchestral”它给你的是“所有史诗配乐的均值”——弦乐铺底、铜管齐奏、定音鼓滚奏听起来像预告片模板但没有任何具体场景感。我的经验是不要描述情绪描述空间和动作。情绪是结果空间和动作是原因。比如你要一段“英雄登场”的配乐不要写“heroic”写提示词片段low string ostinato in D minor, building from pp to ff over 16 bars, french horns entering on the downbeat with a rising perfect fifth motif, timpani rolls on the dominant, sudden tutti hit on the tonic, then silence for two beats before the main theme这里pp to ff over 16 bars是力度渐变的时间线rising perfect fifth motif是具体的音程动机sudden tutti hit是配器动作silence for two beats是留白。这些描述让AI知道“在什么时间、什么乐器、做什么动作”而不是“要什么感觉”。弦乐方面ostinato固定音型比melody更容易出效果因为AI对“重复中的微小变化”处理得比“长线条旋律”更好。铜管方面french horns比brass更精准前者天然带有“庄严但不刺耳”的质感。2.4 Synthwave音色设计比旋律更重要Synthwave 的核心不是旋律是音色。你去听The Midnight或者FM-84旋律其实很简单但那些detuned saw lead、gated reverb snare、analog bass一出来氛围就对了。所以Synthwave的提示词重点应该放在音色描述上而不是“写一段好听的旋律”。我的提示词模板提示词片段analog-modeled sawtooth lead with slight detune and slow LFO on filter cutoff, gated reverb on snare with 80s-style long decay, punchy analog bass with short envelope, sidechain compression between bass and kick, arpeggiated pad in the backgrounddetune失谐是Synthwave音色的关键通常两个振荡器相差5-15 cents效果最好。gated reverb是80年代鼓声的标志但注意long decay要配合gate使用否则会变成“浴室混响”。sidechain compression是Synthwave律动的核心它让贝斯在底鼓出现时“让路”产生那种“泵感”。BPM通常在80-100调性优先选小调但旋律可以偶尔用大调借用和弦制造“怀旧中的希望感”。2.5 Acoustic Folk用“演奏细节”替代“乐器列表”Acoustic Folk 看起来简单——吉他、人声、可能加点口琴或小提琴——但AI生成的结果往往“太干净”像录音棚里对着谱子弹的没有“民谣”那种粗粝感。问题在于提示词只写了乐器没写演奏方式。我的做法是加入大量演奏动作和录音场景的描述提示词片段fingerpicked acoustic guitar with slight string noise and fret buzz, capo on 3rd fret, alternating bass pattern with thumb, vocal recorded with a single condenser mic at 30cm distance, room ambience with slight natural reverb, harmonica entering on the second versestring noise琴弦噪音和fret buzz品丝杂音是民谣吉他的“人味”来源。capo on 3rd fret不仅指定了变调夹位置还暗示了音色会更明亮。single condenser mic at 30cm是录音场景描述会让AI生成的结果带有“近场录音”的质感而不是“混音成品”的质感。人声方面slight raspiness轻微沙哑和breathy delivery气声唱法比male vocal或female vocal更有效因为它们描述的是发声方式不是性别。2.6 Electronic Dance用“能量曲线”替代“风格标签”EDM 的提示词最容易写成“风格标签大杂烩”house, techno, trance, EDM, festival。结果AI给你一个“什么都像一点、什么都不像”的东西。EDM的核心是能量曲线——什么时候build up、什么时候drop、drop之后怎么breakdown。这些才是提示词应该描述的东西。我的模板提示词片段intro with filtered kick and hi-hat, 16-bar build-up with rising white noise sweep and snare roll accelerating from 1/8 to 1/16 to 1/32, drop at bar 32 with full kick and off-beat bass, main synth hook in F minor, breakdown at bar 64 with pad and vocal chop, second drop with added lead layerfiltered kick滤波底鼓是intro的经典手法white noise sweep和snare roll accelerating是build up的标准配置off-beat bass是house/techno的律动核心。vocal chop是EDM里人声的主要用法比完整人声更容易出效果。BPM方面House 在120-128Techno 在130-140Trance 在135-145。调性优先选小调但drop部分的hook可以用大调制造“释放感”。3. 提示词工程的核心方法论3.1 从“标签堆叠”到“分层描述”上面六个曲风的拆解其实指向同一个方法论提示词要分层不要堆叠。我习惯把提示词分成四层层级内容作用示例第一层骨架曲风、BPM、调性、段落结构定框架Lo-Fi Hip Hop, 78 BPM, D minor, 16-bar loop第二层和声和弦类型、进行方式、调式定色彩Dorian mode, maj7 and min9 chords, ii-V-I with secondary dominant第三层配器乐器、音色、演奏法定质感dusty piano, soft velocity, humanized swing drums第四层空间混音、效果、录音场景定氛围tape saturation, vinyl crackle integrated, room ambience大部分人的提示词只写了第一层和第三层缺了第二层和第四层。而恰恰是第二层和声和第四层空间决定了“机械味儿”还是“人味儿”。3.2 用“否定提示词”去掉AI的默认习惯除了正向描述否定提示词negative prompt同样重要。AI音乐工具有一些“默认习惯”比如默认把鼓组对齐到网格去掉quantized加上humanized默认使用简单和弦进行否定simple chord progression默认把混音做得很“亮”否定bright mix, harsh highs默认在结尾做渐弱否定fade out加上cold ending我常用的否定词列表quantized drums, simple chords, bright mix, fade out, generic melody, over-compressed。这些词能显著减少“AI味儿”。3.3 迭代策略每次只改一个变量很多人写提示词是一次性写一大段生成结果不满意就全部重写。我的做法是每次只改一个变量。比如第一版生成后如果觉得鼓太“直”就在提示词里加humanized swing如果觉得和声太简单就加secondary dominants如果觉得混音太亮就加warm tape saturation。这样你才能知道哪个词起了作用哪个词没起作用。我通常会生成5-8版每版只改一个变量最后把有效的词组合起来。这个过程听起来麻烦但比“随机重写”效率高得多。4. 实操流程与参数配置4.1 完整工作流从需求到成品假设你要为一段“城市夜晚开车”的短视频配乐目标曲风是Synthwave。我的完整流程是这样的第一步确定骨架。BPM 90调性F# minor结构是 intro(8) - verse(16) - chorus(16) - outro(8)。总时长约1分20秒。第二步写和声层。F# minorverse用F#m - D - A - Echorus用D - A - E - F#m在过渡处加Bm - C#7制造副属和弦张力。第三步写配器层。analog saw lead with detune、gated reverb snare、punchy analog bass、arpeggiated pad。第四步写空间层。sidechain compression、tape saturation on master、wide stereo image。第五步生成并迭代。第一版生成后如果lead太刺耳加low-pass filter on lead如果鼓太弱加punchy kick with transient shaping。4.2 参数速查表曲风BPM范围推荐调式核心音色关键提示词Lo-Fi Hip Hop70-85Dorian/小调dusty piano, vinyl cracklehumanized, soft velocity, integratedCity Pop95-115大调/混合利底亚FM electric piano, chorus guitarsecondary dominants, syncopated bassCinematic Orchestral60-120小调/大调string ostinato, french hornspp to ff, rising motif, tutti hitSynthwave80-100小调detuned saw, gated reverbsidechain, analog-modeled, wide stereoAcoustic Folk80-110大调/小调fingerpicked guitar, harmonicastring noise, fret buzz, room ambienceElectronic Dance120-145小调filtered kick, off-beat bassbuild-up, drop, vocal chop4.3 工具选择与适配不同AI音乐工具对提示词的理解能力差异很大。我的经验是Suno对自然语言描述理解好适合写“场景动作”型提示词但和声控制较弱。Udio对音乐术语理解好适合写“和声配器”型提示词但需要更精确的术语。Stable Audio对音色和空间描述敏感适合写“音色设计”型提示词。AIVA对古典和配乐结构支持好适合写“段落动机”型提示词。如果你用的工具支持分轨生成比如分别生成鼓、贝斯、和声那提示词可以写得更细每个轨道单独描述。如果不支持就把所有描述合并成一段但保持分层逻辑。5. 常见问题与排查技巧5.1 生成结果“太满”或“太空”怎么办“太满”通常是因为提示词里乐器太多、频段太挤。解决方法是加sparse arrangement稀疏编配或leave space for vocals为人声留空间并否定dense mix。“太空”则相反加layered pads、doubled lead、wide stereo并否定thin arrangement。5.2 鼓组总是“电子味”太重这是AI音乐生成的通病。解决方法是加humanized、swing、velocity variation否定quantized、electronic drums。如果工具支持把鼓组单独生成用acoustic drum kit替代drum machine。5.3 和声进行太“套路”加secondary dominants、modal interchange、chromatic passing chords否定four-chord loop、simple progression。如果工具支持和声指定直接写F#m - D - A - E这样的进行。5.4 混音“太亮”或“太闷”“太亮”加warm tape saturation、low-pass filter on highs否定bright mix。“太闷”加air band boost、crisp highs否定muddy mix。5.5 结尾总是“渐弱”加cold ending、final hit、sudden stop否定fade out。如果工具支持指定end on tonic或end on unresolved chord。提示以上所有否定词和正向词建议先小规模测试确认工具能正确理解后再大规模使用。不同工具对同一词的理解可能完全不同。6. 我踩过的坑与私藏技巧6.1 不要迷信“一键生成”我试过很多次“一句话生成完整曲子”结果没有一次能直接用。AI音乐生成目前最适合的定位是“灵感草稿机”——它给你一个起点你在这个起点上修改、迭代、重新生成。把AI当成一个“不会累的实习生”而不是“替代你的作曲家”。6.2 提示词要“具体到动作”“悲伤钢琴”不如“左手低音区半音下行、右手旋律延迟半拍进入的钢琴”。“欢快吉他”不如“开放和弦扫弦、每小节第二拍加重音的吉他”。动作描述比情绪描述有效10倍。6.3 保存你的“有效词库”我建了一个Excel表左边是曲风右边是“有效词”和“无效词”。每次生成后把起作用的词记下来下次直接复用。半年下来这个表比任何教程都有用。6.4 用“参考曲目”替代“风格标签”如果工具支持参考曲目reference track直接上传一首你想要的风格的曲子比写一百个标签都有效。如果不支持就在提示词里写in the style of [具体特征]比如in the style of 80s Japanese city pop with FM electric piano and chorus guitar而不是City Pop。6.5 最后再分享一个小技巧生成人声时在提示词里加入breath sounds、slight pitch drift、conversational delivery能显著减少“机器人唱歌”的感觉。如果工具支持把vibrato设到subtle而不是none完全无颤音反而假。这个内容后续还可以这样扩展把六大曲风扩展到十种加入Jazz、Ambient、Hip Hop、RB或者针对特定工具Suno、Udio写专门的提示词适配指南。我目前正在整理一份“AI音乐提示词速查手册”把每个曲风的有效词、否定词、参数范围做成一张大表到时候再分享。