长文案口播视频生成
人物图 + 口播文案 + 音频(可选)= 口播视频
人物图(同时作为每一小段的首帧与尾帧)
长文案
音色参考音频(可选;不选则保留原音色,不调用变声工作流)
高级设置
画面比例
9:16 竖屏
16:9 横屏
1:1 方形
3:4
4:3
自适应
语速(字/秒)
每段最长(秒)
合并目标(秒)
解析文案并分段
开始生成
待开始
下载视频