感谢你们的工作,在Audio Generation中使用CoT很有启发性!
在论文4.4节 Stage3 Instruction-based Audio Editing 中,提到:
"The foundation model, conditioned on both this reasoning and the existing audio context, applies targeted modifications while maintaining overall coherence."
-
请问 audio context 指的是已经生成的audio,还是正处于生成过程中的audio latent ?
-
具体使用时,如何将 Audio 和 Edit Instruction 编码为condition,可以开源这部分的代码吗?
感谢你们的工作,在Audio Generation中使用CoT很有启发性!
在论文4.4节 Stage3 Instruction-based Audio Editing 中,提到:
"The foundation model, conditioned on both this reasoning and the existing audio context, applies targeted modifications while maintaining overall coherence."
请问 audio context 指的是已经生成的audio,还是正处于生成过程中的audio latent ?
具体使用时,如何将 Audio 和 Edit Instruction 编码为condition,可以开源这部分的代码吗?