声音 - AI 影词组音转字幕
随着线上影片需求的增加,出现了越来越多“AI 转字幕”的工具,但很可惜目前几乎所有的线上 AI 转字幕工具都是要付费的,最多也都只有几分钟的免费额度,因此这篇教学会介绍一些免费额度较多的线上转字幕工具,以及如何在本机环境安装线上转字幕工具。
快速导览:
cSubtitle
cSubtitlea 是一款可以“不用注册”,且能“免费”将语音转换文字至少 3 分钟的线上工具,只需要打开网站,上传语音音档或影片,就可以将语音音档或影片的语音,转换成纯文字 ( txt ) 或是字幕 ( srt )。
上传文件后,cSubtitlea 就会开始透过 AI 分析音档内容,完成后就可以下载字幕文件或纯文字文件。
下方是转换后的字幕:
1
00:00:00,470 --> 00:00:02,770
測試語音轉文字
2
00:00:03,390 --> 00:00:07,290
不知道轉出來的效果準不準確
3
00:00:08,480 --> 00:00:13,900
五秒鐘不知道會不會太少十秒十一秒十二秒
4
00:00:15,080 --> 00:00:15,560
測試一下
5
00:00:16,160 --> 00:00:18,420
那就傳個二十秒
6
00:00:19,390 --> 00:00:19,910
完成
turboscribe
turboscribe 是一款可以“需要注册”,但可以“免费”将语音转换文字至少 30 分钟的线上工具,只需要打开网站并注册登录,就能上传语音音档或影片,将语音音档或影片的语音,转换成纯文字 ( txt ) 或是字幕 ( srt )。
上传文件后,可以选择语系、转录模式或一些进阶设定。
转换完成后,可以在网站上看见转换后的文字和时间戳记,从右侧也可以将其下载为 txt 或 srt 文件,不过下载时因为还要手动设定“每句的字词数量”,常导致字幕段落和预期不同,因此不建议使用它的下载功能,为了避免这种状况,可以先“手动复制”网站上转换后的文字。
接着使用任何一套 AI 工具 ( ChatGPT、Gemini、Poe AI 皆可 ),将刚刚复制的文字转换成字幕文件 ( ChatGPT 还会直接提供 .srt 文件下载 )。
幫我將下面這段字幕變成字幕檔 .srt
`
(0:00) 測試語音轉文字 (0:04) 不知道轉出來的效果準不準確 (0:08) 5秒鐘不知道會不會太少 (0:11) 10秒、11秒、12秒 (0:14) 測試一下 (0:16) 那就傳個20秒 (0:19) 完成
`
下方是转换后的字幕:
1
00:00:00,000 --> 00:00:04,000
測試語音轉文字
2
00:00:04,000 --> 00:00:08,000
不知道轉出來的效果準不準確
3
00:00:08,000 --> 00:00:11,000
5秒鐘不知道會不會太少
4
00:00:11,000 --> 00:00:14,000
10秒、11秒、12秒
5
00:00:14,000 --> 00:00:16,000
測試一下
6
00:00:16,000 --> 00:00:19,000
那就傳個20秒
7
00:00:19,000 --> 00:00:19,800
完成
本机安装 OpenAI Whisper 转字幕工具
由于现在几乎所有线上语音转字幕工具都“要收费”,就算有提供免费额度往往也不太够,所以如果不排斥“本机环境”,也可以安装 OpenAI 所开发的 Whisper,在本机环境转换字幕,就可以完全不受额度限制。Whisper 是由 OpenAI 所开发的一个开源自动语音辨识模型,能够将语音转换成文字,支援多种语言辨识与翻译,具备高度准确性和灵活性,Whisper 提供下列几种模型:
| 模型名称 | 精确度 | 执行速度 | 备注 |
|---|---|---|---|
| tiny | 低 | 最快 | 使用 CPU |
| base | 较低 | 块 | 使用 CPU |
| small | 中等 | 中等 | 使用 CPU,推荐 |
| medium | 高 | 慢 | 建议使用 GPU |
| large | 最高 | 最慢 | GPU,支援最多语言 |
Mac 环境安装
在 Mac 环境下安装,需要先安装 Homebrew ( 如果尚未安装 ),打开“终端机 ( Terminal )”输入下方指令:
/bin/bash -c "$(curl -fsSL https://raw.githubusercontent.com/Homebrew/install/HEAD/install.sh)"
接着安装 ffmpeg ( 让 Whisper 可以处理声音音讯 )
brew install ffmpeg
在 Python 环境中安装 Whisper ( 参考:使用 Python 虚拟环境 )
pip install -U openai-whisper
安装后就能在 Python 开发环境中,在终端机输入下列指令转换,转换后会在同一个目录下,产生一个同样档名的 srt 文件。
whisper sample.mp3 --language Chinese --output_format srt --task transcribe --model small
下方列出相关指令说明:
| 部分 | 功能 |
|---|---|
whisper |
启动 Whisper 命令列工具 ( 需安装 openai-whisper )。 |
sample.mp3 |
欲转换的音讯文件 ( 支援 .mp3, .wav, .m4a, .mp4 等格式 )。 |
--language |
指定语音的语言 ( 支援语言:English、Chinese、Japanese、French 等 )。 |
--task |
任务类型,选项为 transcribe 和 translate ( 会翻译为英文 )。 |
--model |
指定使用的模型。 |
下方是转换后的字幕文件:
1
00:00:00,000 --> 00:00:03,000
測試語音轉文字
2
00:00:03,000 --> 00:00:07,000
不知道轉出來的效果準不準確
3
00:00:08,000 --> 00:00:11,000
5秒鐘不知道會不會太少
4
00:00:11,000 --> 00:00:14,000
10秒、11秒、12秒
5
00:00:14,000 --> 00:00:16,000
測試一下
6
00:00:16,000 --> 00:00:19,000
那就轉個20秒
7
00:00:19,000 --> 00:00:21,000
完成
Windows 环境安装
在 Windows 中安装 Whisper 的步骤如下:
安装 Python,安装时请勾选“Add Python to PATH”,
安装 ffmpeg ( 下载链接 ),安装时选择
release full,解压缩后,将 bin 文件夹的路径 ( 例如C:\ffmpeg\bin) 加入到系统环境变数中的“Path”。打开命令提示字元 ( CMD 或 PowerShell ),建立并进入 Python 开发环境 ( 参考:使用 Python 虚拟环境 )。
使用下方指令安装 Whisper:
pip install -U openai-whisper使用 Whisper
whisper sample.mp3 --language Chinese --output_format srt --task transcribe --model small
下方列出相关指令说明:
| 部分 | 功能 |
|---|---|
whisper |
启动 Whisper 命令列工具 ( 需安装 openai-whisper )。 |
sample.mp3 |
欲转换的音讯文件 ( 支援 .mp3, .wav, .m4a, .mp4 等格式 )。 |
--language |
指定语音的语言 ( 支援语言:English、Chinese、Japanese、French 等 )。 |
--task |
任务类型,选项为 transcribe 和 translate ( 会翻译为英文 )。 |
--model |
指定使用的模型。 |
下方是转换后的字幕文件:
1
00:00:00,000 --> 00:00:03,000
測試語音轉文字
2
00:00:03,000 --> 00:00:07,000
不知道轉出來的效果準不準確
3
00:00:08,000 --> 00:00:11,000
5秒鐘不知道會不會太少
4
00:00:11,000 --> 00:00:14,000
10秒、11秒、12秒
5
00:00:14,000 --> 00:00:16,000
測試一下
6
00:00:16,000 --> 00:00:19,000
那就轉個20秒
7
00:00:19,000 --> 00:00:21,000
完成
小结
对于制作影片而言,字幕往往是最难处理的,如果可以透过一些 AI 工具辅助转换字幕,就能省下非常多“上字幕”的时间,赶快运用这篇教学所介绍的方法,加速自己的创作时间吧。
微信扫码关注
抖音扫码关注