用 AI 語音轉文字:從錄音到可用文稿與字幕
語音轉文字用什麼工具?本文按大陸直連與否整理訊飛聽見、通義聽悟、剪映、飛書妙記、Whisper、Descript 六款,先分清要文稿還是要 SRT 字幕檔案,並給出從處理音源到匯出字幕的五步流程,以及方言、多人區分說話人、長音訊分段和錄音授權要注意的地方。
結論先行:一小時的普通話錄音,現在幾分鐘就能轉成帶時間戳的文字,影片也能自動生成對齊時間軸的字幕、匯出 SRT 檔案;音源清晰時初稿基本可用。仍要人做的是三件:核對人名、專有名詞和數字;把逐字稿的斷句、標點和口頭禪理順,變成能讀的文字;字幕還要按螢幕寬度拆行、微調時間軸。錄音糊了,換哪家工具都救不回來。
選工具看三條:一是輸出形態——要一篇文稿、要帶時間軸的字幕檔案(SRT/VTT),還是要直接在剪輯裡成片的字幕,對應的工具不同;二是難點場景:方言、中英混說、多人對話區分說話人,這幾項各家差異最大,拿自己的真實錄音試一段再定;三是資料去向,線上工具會把音訊上傳到服務商,隱私或涉密錄音可以考慮在本機執行的開源模型。如果目標是開會出紀要和待辦,直接看「AI 會議紀要」那一頁。
能做這件事的工具
| 工具 | 選它的理由 | 免費額度 | 大陸直連 |
|---|---|---|---|
| 訊飛聽見 ↗科大訊飛 | 訊飛的專業轉寫平台,錄音、影片都能轉,支援區分說話人,並可匯出 SRT 字幕檔案。 | 以官網為準 | ✓ 直連 |
| 通義聽悟阿里巴巴 | 阿里出品,檔案轉寫與即時記錄都能做,支援區分發言人、方言識別和多語種翻譯。 | 以官網為準 | ✓ 直連 |
| 剪映字節跳動 | 給影片加字幕最順手:自動識別的字幕直接落在時間軸上,改完就能在剪輯裡成片。 | 以官網為準 | ✓ 直連 |
| 飛書智慧夥伴字節跳動 | 妙記可匯入本地音影片檔案轉寫,文字稿存成飛書文件,團隊內分享和檢索方便。 | 以官網為準 | ✓ 直連 |
| Whisper ↗OpenAI | OpenAI 開源的語音識別模型,可在自己電腦上離線跑、直接輸出 SRT/VTT,適合隱私錄音和批次轉寫。 | 開源免費(MIT 許可),本地執行不按時長計費,需自備電腦算力。 | 需海外網路 |
| DescriptDescript | 英文播客和口播影片後期常用:轉寫後改文字就能剪音影片,去口癖也在同一介面。 | 免費檔每月 60 分鐘媒體時長,匯出為 720p 且帶水印。 | 需海外網路 |
工具名鏈到本站入口頁(官網地址、免費額度、登入方式隨時複核);「需海外網路」只是客觀說明其官方服務不面向中國大陸,本站不介紹任何繞過方式。
怎麼做
- 先處理音源再轉——影片先抽出音軌,多段錄音按主題分開;背景音樂過響、多人同時說話的段落,能重錄就重錄。轉寫錯誤多半在這一步就定了,後期工具補不回來。
- 上傳前設好語種和詞表——選對普通話、粵語或中英混合等識別模式,把人名、品牌、術語、英文縮寫加進熱詞或自定義詞表(工具支援的話);多人對話記得開啟區分說話人。
- 轉完先核高風險位置:數字、金額、日期、人名和專有名詞,逐一對照原音回聽。其餘部分快速通讀,只改影響意思的錯字,不必逐字摳。
- 按用途整理——要文稿的,刪口頭禪和重複、補標點分段,可以讓大模型改成書面語,但要對照原文防止它添內容;要字幕的,按每行字數拆句,檢查時間軸有沒有提前或拖後。
- 匯出對應格式:字幕匯出 SRT 或 VTT 再匯入剪輯軟體或影片平台,文稿匯出 DOCX 或 TXT。幾小時的長音訊按章節切段處理、分段校對,出問題只重跑那一段。
常見坑
- 錄別人說話要先告知並取得同意;把他人的課程、講座、付費節目轉成文字或字幕再公開發布,涉及著作權,需要授權,自用整理和公開發布是兩回事。轉寫稿再經 AI 翻譯、配音後釋出的,按《人工智慧生成合成內容標識辦法》(2025 年 9 月 1 日起施行)在平台宣告入口如實標註。
- 線上工具會把音訊上傳到服務商。涉及未公開商業資訊、客戶隱私、醫療或法律諮詢的錄音,先確認服務商的資料留存期限與是否用於模型訓練,或改用在本機執行的開源模型。
- 方言、口音重、中英混說、多人搶話是準確率的塌陷區;一支麥收全場時,聲線相近的人容易被合併成同一個說話人。這類段落裡的數字和結論一律回聽原音。
- 大模型「潤色」轉寫稿時可能替聽不清的地方補出原音裡沒有的話;本地模型在長靜音、純音樂段也偶爾會輸出憑空的句子。釋出或引用原話前,以原音為準。
常見問題
語音轉文字有免費的工具嗎?
有。多數線上工具給新使用者或免費檔一定轉寫時長,但額度按分鐘計且經常調整,以官網當期規則為準。長期大量轉寫又不想按時長付費,可以在自己電腦上跑開源的 Whisper,代價是要一台效能夠用的電腦和一點安裝門檻。
影片怎麼自動生成字幕並匯出 SRT?
兩條路:在剪輯軟體裡用自動識別字幕,改好後直接成片或單獨匯出字幕檔案;或者把影片傳到轉寫工具,匯出帶時間軸的 SRT。SRT 是通用的純文本字幕格式,主流剪輯軟體和影片平台都能匯入,匯入後再統一調字型和樣式。
方言和多人對話能轉準嗎?
部分工具支援粵語等方言和說話人區分,但準確率明顯低於安靜環境下的單人普通話。多人場景每人一支麥最穩,一支麥錄全場時容易認錯人。先拿自己的真實錄音試 5 分鐘,比看宣傳的準確率數字可靠。
幾個小時的長音訊怎麼處理?
先看工具的單檔案時長和大小上限,超了就按章節或每 30~60 分鐘切段上傳,分段也方便分段校對。轉完可以讓大模型做分段摘要快速定位重點,但引用原話時要回到轉寫原文和原音核對。
相關新聞
- 微軟釋出 VibeVoice-ASR-Streaming-7B 流式語音識別模型2026-09-02