一个让文本模型生成音乐的想法

佬们,我想到一个想法,能不能让文本模型生成一段类似于乐谱的东西,然后让软件演奏出来,这样生成音乐可不可行 :thinking:

5 个赞

可行,生成简谱五线谱,你需要设计一个数据交换标准喂给它

否则它生成出来的文本你没法有效转成音乐

甚至可以 computer use 让它操作 xstudio 直接写歌写曲

网易的,直接能生成歌声乐器声

3 个赞

其实已经有了,甚至有生成乐谱,然后用音乐模型演奏出来的,参考 yue2

2 个赞

生成 midi 格式,直接 web audio 或找一个 SF2 音色包来快速演奏调试。

并且文本模型甚至可以直接合成人的发声,opus 对声谱图的造化很高,手搓 .wav。前天脑洞大开,让他不准用扩散模型,给我说"伊苏尔德"、“痛,太痛了!”

2 个赞

不用那么麻烦,直接让agent搓midi就行了

1 个赞

可以,compute use能直接操作宿主进行编曲,或者让agent直接生成midi
不过让llm通过mcp直接连接宿主或者干脆是编曲harness这类形态还没怎么见过(不好用:face_holding_back_tears:)

1 个赞

我之前让Opus5.5用mcp连接宿主,它自己写midi,尝试了几遍,效果还不错(加上computer use也许就可以自己调vst插件了?效果应该会更好)
Opus 5.5编曲效果超过我这个初学者了… - 搞七捻三 - LINUX DO

1 个赞