很多人手里只有一段录音:课程讲解、播客片段、小说推文旁白、手机采访音频,想把它做成能发到抖音、B 站、小红书或 YouTube Shorts 的字幕视频。这里最容易误解的一点是:录音本身没有画面,也没有字幕时间轴,不能只靠“上传音频”这一步直接变成完整成片。
更稳的流程是分开处理:先把录音通过专业的 录音转文字 工具生成文字和 SRT 字幕,再把录音做成带封面或波形的 MP4,最后把字幕放到视频里复查。VoiceIndex AI 可以处理前两段:语音转文字导出字幕,音频转视频生成封面/波形 MP4。最终是否烧录字幕,要看你用的平台或剪辑软件。
实操记录:同一段源音频要同时用于生成 SRT 和 MP4。如果先剪过音频再生成视频,字幕文件却来自旧音频,后面很容易出现几秒级漂移,靠手动拖字幕会很耗时间。
先判断你要的是哪种“字幕视频”
同样叫字幕视频,实际有两种交付物。第一种是“视频文件 + 单独 SRT 字幕”,适合上传到支持字幕文件的平台;第二种是“字幕已经压进画面的 MP4”,适合发短视频平台,观众不需要再打开字幕开关。
| 目标 | 你需要的文件 | 适合场景 |
|---|---|---|
| 视频 + SRT | MP4 视频、SRT 字幕文件 | YouTube、课程平台、资料归档,后续还能改字幕。 |
| 压字 MP4 | 一个已经带字幕画面的 MP4 | 抖音、快手、小红书、朋友圈,打开就能看字幕。 |
| 文字稿视频 | 音频、全文稿、封面图 | 不追求逐字同步,只想让观众看重点内容。 |
第一步:录音先转成文字,不要急着做视频
如果录音里有人名、数字、产品名、地名,先转文字再校对,比先生成视频再改字幕省很多时间。我的做法是先用 VoiceIndex AI 语音转文字上传录音,拿到初稿后重点改三类内容:人名和地名、金额和日期、英文缩写和专业词。
这一步不要只导出 TXT。如果后面要做字幕视频,最好导出 SRT 或 VTT,因为它们带时间轴。TXT 适合做文稿,SRT 才适合贴到视频上。
第二步:把录音做成有画面的视频
录音没有画面,最简单的做法是配一张封面图,再加一个波形动画。VoiceIndex AI 的音频转视频工具就是做这件事:上传 MP3、WAV 或 M4A,选择封面或背景,设置竖屏/横屏比例,生成 MP4。
如果你要发短视频平台,优先选竖屏 9:16;如果要放到课程、网站或 YouTube 横屏视频里,选 16:9。封面不要堆太多字,因为字幕还要放在画面下方,标题、人物头像、Logo 和字幕最好不要互相挡住。
实际顺序:先用录音生成 SRT,再用同一段录音生成 MP4。两个文件来自同一个音频,后面导入剪辑软件时更容易对齐。
实际发布时要提前留出字幕安全区:竖屏视频底部会被平台按钮、标题和评论入口占用,封面主体最好放在中上部。长音频导出 MP4 的耗时取决于浏览器和设备性能,如果录音超过几十分钟,建议先切成章节或短片段,确认比例、封面和波形样式后再批量处理。
第三步:把字幕放进视频里
如果你要的是“视频 + SRT”,这一步很简单:上传 MP4 时同时上传 SRT 字幕文件即可。如果你要的是“压字 MP4”,就把 MP4 和 SRT 导入剪映、CapCut、Premiere 或其他剪辑软件,让软件把字幕贴到画面上,再导出最终视频。
这里有一个细节:不要把整段文字一次性贴成大段字幕。录音字幕应该跟着说话节奏走,一条字幕控制在一到两行。短视频竖屏尤其要注意,字幕太低会被平台按钮挡住,太高又会挡封面主体。
第四步:发布前检查这几个位置
- 开头 10 秒:确认字幕没有太早出现,也没有盖住标题。
- 中间随机 3 处:检查字幕和声音是否同步,尤其是停顿后的第一句。
- 数字和人名:不要相信一次识别结果,发布前手动看一遍。
- 字幕安全区:竖屏视频底部要避开平台按钮和说明文字。
- 结尾:很多录音结尾音量变小,容易漏字或字幕提前结束。
什么时候不适合自动生成?
如果录音里有多人抢话、环境噪声很重、音乐盖过人声,自动字幕只能当初稿。还有一种情况是录音经过多次转发压缩,齿音和尾音都丢了,这时再好的工具也需要人工回听校对。
如果你要做商业发布,建议至少完整看一遍最终视频。字幕错一个数字、价格或人名,比普通错别字更影响观感。自动生成能省第一稿时间,但不能替代最后的发布检查。
我的推荐流程
只有一段录音时,我会这样做:先上传录音转文字,校对后下载 SRT;再用同一段录音生成封面/波形 MP4;最后把 MP4 和 SRT 放到剪辑软件或发布平台里检查同步。如果只是归档课程或播客,保留“MP4 + SRT”就够;如果要发短视频,再导出压字 MP4。
这个流程看起来比“一键生成”多一步,但可控性更好。字幕错了可以改 SRT,画面不满意可以换封面,比例不对可以重新导出视频,不需要每次从头开始。