读懂AI时代 Read AI Time读懂AI时代 Read AI Time繁體

订阅《读懂AI时代》

每早 8 点一封,昨天 AI 圈大事一次读完。免费。

用 AI 语音转文字:从录音到可用文稿与字幕

语音转文字用什么工具?本文按大陆直连与否整理讯飞听见、通义听悟、剪映、飞书妙记、Whisper、Descript 六款,先分清要文稿还是要 SRT 字幕文件,并给出从处理音源到导出字幕的五步流程,以及方言、多人区分说话人、长音频分段和录音授权要注意的地方。

结论先行:一小时的普通话录音,现在几分钟就能转成带时间戳的文字,视频也能自动生成对齐时间轴的字幕、导出 SRT 文件;音源清晰时初稿基本可用。仍要人做的是三件:核对人名、专有名词和数字;把逐字稿的断句、标点和口头禅理顺,变成能读的文字;字幕还要按屏幕宽度拆行、微调时间轴。录音糊了,换哪家工具都救不回来。

选工具看三条:一是输出形态——要一篇文稿、要带时间轴的字幕文件(SRT/VTT),还是要直接在剪辑里成片的字幕,对应的工具不同;二是难点场景:方言、中英混说、多人对话区分说话人,这几项各家差异最大,拿自己的真实录音试一段再定;三是数据去向,在线工具会把音频上传到服务商,隐私或涉密录音可以考虑在本机运行的开源模型。如果目标是开会出纪要和待办,直接看「AI 会议纪要」那一页。

能做这件事的工具

工具选它的理由免费额度大陆直连
讯飞听见 ↗科大讯飞讯飞的专业转写平台,录音、视频都能转,支持区分说话人,并可导出 SRT 字幕文件。以官网为准✓ 直连
通义听悟阿里巴巴阿里出品,文件转写与实时记录都能做,支持区分发言人、方言识别和多语种翻译。以官网为准✓ 直连
剪映字节跳动给视频加字幕最顺手:自动识别的字幕直接落在时间轴上,改完就能在剪辑里成片。以官网为准✓ 直连
飞书智能伙伴字节跳动妙记可导入本地音视频文件转写,文字稿存成飞书文档,团队内分享和检索方便。以官网为准✓ 直连
Whisper ↗OpenAIOpenAI 开源的语音识别模型,可在自己电脑上离线跑、直接输出 SRT/VTT,适合隐私录音和批量转写。开源免费(MIT 许可),本地运行不按时长计费,需自备电脑算力。需海外网络
DescriptDescript英文播客和口播视频后期常用:转写后改文字就能剪音视频,去口癖也在同一界面。免费档每月 60 分钟媒体时长,导出为 720p 且带水印。需海外网络

工具名链到本站入口页(官网地址、免费额度、登录方式随时复核);「需海外网络」只是客观说明其官方服务不面向中国大陆,本站不介绍任何绕过方式。

怎么做

  1. 先处理音源再转——视频先抽出音轨,多段录音按主题分开;背景音乐过响、多人同时说话的段落,能重录就重录。转写错误多半在这一步就定了,后期工具补不回来。
  2. 上传前设好语种和词表——选对普通话、粤语或中英混合等识别模式,把人名、品牌、术语、英文缩写加进热词或自定义词表(工具支持的话);多人对话记得打开区分说话人。
  3. 转完先核高风险位置:数字、金额、日期、人名和专有名词,逐一对照原音回听。其余部分快速通读,只改影响意思的错字,不必逐字抠。
  4. 按用途整理——要文稿的,删口头禅和重复、补标点分段,可以让大模型改成书面语,但要对照原文防止它添内容;要字幕的,按每行字数拆句,检查时间轴有没有提前或拖后。
  5. 导出对应格式:字幕导出 SRT 或 VTT 再导入剪辑软件或视频平台,文稿导出 DOCX 或 TXT。几小时的长音频按章节切段处理、分段校对,出问题只重跑那一段。

常见坑

  • 录别人说话要先告知并取得同意;把他人的课程、讲座、付费节目转成文字或字幕再公开发布,涉及著作权,需要授权,自用整理和公开发布是两回事。转写稿再经 AI 翻译、配音后发布的,按《人工智能生成合成内容标识办法》(2025 年 9 月 1 日起施行)在平台声明入口如实标注。
  • 在线工具会把音频上传到服务商。涉及未公开商业信息、客户隐私、医疗或法律咨询的录音,先确认服务商的数据留存期限与是否用于模型训练,或改用在本机运行的开源模型。
  • 方言、口音重、中英混说、多人抢话是准确率的塌陷区;一支麦收全场时,声线相近的人容易被合并成同一个说话人。这类段落里的数字和结论一律回听原音。
  • 大模型「润色」转写稿时可能替听不清的地方补出原音里没有的话;本地模型在长静音、纯音乐段也偶尔会输出凭空的句子。发布或引用原话前,以原音为准。

常见问题

语音转文字有免费的工具吗?
有。多数在线工具给新用户或免费档一定转写时长,但额度按分钟计且经常调整,以官网当期规则为准。长期大量转写又不想按时长付费,可以在自己电脑上跑开源的 Whisper,代价是要一台性能够用的电脑和一点安装门槛。
视频怎么自动生成字幕并导出 SRT?
两条路:在剪辑软件里用自动识别字幕,改好后直接成片或单独导出字幕文件;或者把视频传到转写工具,导出带时间轴的 SRT。SRT 是通用的纯文本字幕格式,主流剪辑软件和视频平台都能导入,导入后再统一调字体和样式。
方言和多人对话能转准吗?
部分工具支持粤语等方言和说话人区分,但准确率明显低于安静环境下的单人普通话。多人场景每人一支麦最稳,一支麦录全场时容易认错人。先拿自己的真实录音试 5 分钟,比看宣传的准确率数字可靠。
几个小时的长音频怎么处理?
先看工具的单文件时长和大小上限,超了就按章节或每 30~60 分钟切段上传,分段也方便分段校对。转完可以让大模型做分段摘要快速定位重点,但引用原话时要回到转写原文和原音核对。

相关新闻