最近给自己一个小页面做 demo 视频,想快速弄一段不侵权、能放在背景里的音乐。之前总觉得 AI 音乐就是输入一句“cinematic / emotional / inspiring”然后碰运气,实际折腾下来发现,真正有用的不是这些形容词,而是更具体的音乐参数。
我测试的页面是这个: https://flowmusic.co/
不是来吹效果多神,主要是拿它当一个 text-to-song 的测试对象。
比较稳定的 prompt 写法大概是:
lo-fi hip hop, dusty piano, vinyl crackle, mellow, 70 bpm, no vocals
比下面这种靠谱很多:
emotional, cinematic, inspiring
原因挺直观的:后者只给了情绪,没有告诉模型到底是什么曲风、什么乐器、有没有人声、速度大概多少。结果通常就是一段很泛的广告/预告片味背景音乐。
目前感觉比较有用的顺序是:
- 先写 genre ,比如 lo-fi hip hop / ambient electronic / acoustic ballad
- 再写 instrumentation ,比如 dusty piano / soft synth pads / light percussion
- 明确 vocals / no vocals
- 写 bpm 或 slow / mid-tempo
- 最后再补 mood ,比如 calm / nostalgic / darker tone
如果只是产品 demo 、加载页、短视频背景这种用途,no vocals 很重要。带人声以后变量太多,歌词、发音、声线都会抢注意力,反而不好当背景。
另一个小经验是,不要一直改 prompt 。同一个 prompt 多生成几次,往往比反复改词更有效。模型每次出来的旋律和编曲差异挺大,先 roll 几次,方向一直不对时再改 prompt 。
还有就是,哪怕只要 20 秒,也别太执着让它生成 20 秒。生成完整一首,然后在剪辑里截一段好听的,通常更自然。
限制也很明显:
- 很多工具不给 stems ,细修基本没法做
- vocal 还容易有 AI 味
- 想做同一个“歌手/乐队”风格的多首曲子,很难稳定
- 商用授权一定要单独看条款,不能只看首页写 royalty-free
所以我现在的判断是:AI 音乐比较适合做 demo / placeholder / mood test ,不太适合直接当最终音乐作品。对产品开发来说,能在 10 分钟内确认“这个页面配 jazz 还是 synthwave 更合适”,已经挺有用了。
有佬实际把 AI 生成音乐放到正式项目里的吗?尤其是授权这块,你们是怎么处理的?