很多人手里只有一段录音:课程讲解、播客片段、小说推文旁白、手机采访音频,想把它做成能发到抖音、B 站、小红书或 YouTube Shorts 的字幕视频。这里最容易误解的一点是:录音本身没有画面,也没有字幕时间轴,不能只靠“上传音频”这一步直接变成完整成片。

更稳的流程是分开处理:先把录音通过专业的 录音转文字 工具生成文字和 SRT 字幕,再把录音做成带封面或波形的 MP4,最后把字幕放到视频里复查。VoiceIndex AI 可以处理前两段:语音转文字导出字幕,音频转视频生成封面/波形 MP4。最终是否烧录字幕,要看你用的平台或剪辑软件。

实操记录:同一段源音频要同时用于生成 SRT 和 MP4。如果先剪过音频再生成视频,字幕文件却来自旧音频,后面很容易出现几秒级漂移,靠手动拖字幕会很耗时间。

只有一段录音生成字幕视频教程封面图
一段录音要变成字幕视频,至少需要三个东西:音频、字幕时间轴、视频画面。

先把录音转成 SRT。字幕视频最怕后期对不齐,建议先用同一段音频生成字幕,再生成封面波形 MP4。

录音转 SRT 字幕 音频生成视频

先判断你要的是哪种“字幕视频”

同样叫字幕视频,实际有两种交付物。第一种是“视频文件 + 单独 SRT 字幕”,适合上传到支持字幕文件的平台;第二种是“字幕已经压进画面的 MP4”,适合发短视频平台,观众不需要再打开字幕开关。

目标 你需要的文件 适合场景
视频 + SRT MP4 视频、SRT 字幕文件 YouTube、课程平台、资料归档,后续还能改字幕。
压字 MP4 一个已经带字幕画面的 MP4 抖音、快手、小红书、朋友圈,打开就能看字幕。
文字稿视频 音频、全文稿、封面图 不追求逐字同步,只想让观众看重点内容。

第一步:录音先转成文字,不要急着做视频

如果录音里有人名、数字、产品名、地名,先转文字再校对,比先生成视频再改字幕省很多时间。我的做法是先用 VoiceIndex AI 语音转文字上传录音,拿到初稿后重点改三类内容:人名和地名、金额和日期、英文缩写和专业词。

这一步不要只导出 TXT。如果后面要做字幕视频,最好导出 SRT 或 VTT,因为它们带时间轴。TXT 适合做文稿,SRT 才适合贴到视频上。

VoiceIndex AI 字幕文件导出面板截图
先拿到带时间轴的字幕文件。只有全文稿,没有时间码,后面还要重新对齐。

第二步:把录音做成有画面的视频

录音没有画面,最简单的做法是配一张封面图,再加一个波形动画。VoiceIndex AI 的音频转视频工具就是做这件事:上传 MP3、WAV 或 M4A,选择封面或背景,设置竖屏/横屏比例,生成 MP4。

如果你要发短视频平台,优先选竖屏 9:16;如果要放到课程、网站或 YouTube 横屏视频里,选 16:9。封面不要堆太多字,因为字幕还要放在画面下方,标题、人物头像、Logo 和字幕最好不要互相挡住。

VoiceIndex AI 音频转视频工具界面截图,展示音频上传、画面比例、波形预览和 MP4 导出
生成 MP4 时尽量使用和 SRT 完全相同的源音频,后面导入剪辑软件时更不容易出现字幕漂移。

实际顺序:先用录音生成 SRT,再用同一段录音生成 MP4。两个文件来自同一个音频,后面导入剪辑软件时更容易对齐。

实际发布时要提前留出字幕安全区:竖屏视频底部会被平台按钮、标题和评论入口占用,封面主体最好放在中上部。长音频导出 MP4 的耗时取决于浏览器和设备性能,如果录音超过几十分钟,建议先切成章节或短片段,确认比例、封面和波形样式后再批量处理。

录音生成字幕视频的完整工作流
如果工具没有一键烧录字幕,先把 SRT 和 MP4 分别生成出来,再合成,反而更可控。

第三步:把字幕放进视频里

如果你要的是“视频 + SRT”,这一步很简单:上传 MP4 时同时上传 SRT 字幕文件即可。如果你要的是“压字 MP4”,就把 MP4 和 SRT 导入剪映、CapCut、Premiere 或其他剪辑软件,让软件把字幕贴到画面上,再导出最终视频。

这里有一个细节:不要把整段文字一次性贴成大段字幕。录音字幕应该跟着说话节奏走,一条字幕控制在一到两行。短视频竖屏尤其要注意,字幕太低会被平台按钮挡住,太高又会挡封面主体。

第四步:发布前检查这几个位置

  • 开头 10 秒:确认字幕没有太早出现,也没有盖住标题。
  • 中间随机 3 处:检查字幕和声音是否同步,尤其是停顿后的第一句。
  • 数字和人名:不要相信一次识别结果,发布前手动看一遍。
  • 字幕安全区:竖屏视频底部要避开平台按钮和说明文字。
  • 结尾:很多录音结尾音量变小,容易漏字或字幕提前结束。
录音字幕视频画面布局和字幕安全区建议
只有录音时,画面越简单越好。封面、波形和字幕要各有位置,不要挤在一起。

什么时候不适合自动生成?

如果录音里有多人抢话、环境噪声很重、音乐盖过人声,自动字幕只能当初稿。还有一种情况是录音经过多次转发压缩,齿音和尾音都丢了,这时再好的工具也需要人工回听校对。

如果你要做商业发布,建议至少完整看一遍最终视频。字幕错一个数字、价格或人名,比普通错别字更影响观感。自动生成能省第一稿时间,但不能替代最后的发布检查。

我的推荐流程

只有一段录音时,我会这样做:先上传录音转文字,校对后下载 SRT;再用同一段录音生成封面/波形 MP4;最后把 MP4 和 SRT 放到剪辑软件或发布平台里检查同步。如果只是归档课程或播客,保留“MP4 + SRT”就够;如果要发短视频,再导出压字 MP4。

这个流程看起来比“一键生成”多一步,但可控性更好。字幕错了可以改 SRT,画面不满意可以换封面,比例不对可以重新导出视频,不需要每次从头开始。