搜索

生成式 AI (AIGC、GenAI) 教学

基本介绍

关于生成式 AI 关于 AI 绘图 AI 绘图的提示技巧 AI 绘图软件比较 ( 2023 ) AI 绘图软件推荐 ( 2024 ) 2025 生成式 AI 工具推荐

Vibe Coding 专区

Vibe Coding 教学导读 认识 Vibe Coding Vibe Coding 新手入门 Vibe Coding 规划架构流程 Vibe Coding 网页知识 Vibe Coding Python 知识 Vibe Coding 下载网页程序码 Vibe Coding Google App Script 部署网页 Vibe Coding Github 部署网页 Vibe Coding 使用外部图片 Vibe Coding 使用 SVG 图示 Vibe Coding 使用外部字体 Vibe Coding 固定网页样式 Vibe Coding + Spreadsheet 数据库 Vibe Coding + Firebase 即时数据库 Vibe Coding + Firestore 数据库 Vibe Coding 数据库安全防护 Vibe Coding 串接账号验证机制 Vibe Coding 串接 Google 云端硬盘 Vibe Coding 串接 Gemini API Vibe Coding 打造 LINE Bot Vibe Coding 实战:线上订餐系统 Vibe Coding 实战:文件上传系统 Vibe Coding 实战:线上点名单 Vibe Coding 实战:英文单字卡

AI 实用技巧

AI 语音转 srt 字幕

2025 AI 影音工具

ChatGPT - 图片提示词技巧 ChatGPT - 客制化机器人 ChatGPT - 使用画布功能 Gemini - 开始使用 Gemini - 客制化机器人 Gemini - 串接 Google 服务 Gemini - 使用画布功能 NotebookLM - 开始使用 NotebookLM - 建构知识库 Google AI Studio - 界面功能 Nano Banana - 图像生成与编辑 Gemini Educator 线上认证 图片 - AI 图片快速去背 图片 - AI 黑白照片上色 声音 - AI 影词组音转字幕 影片 - Pika 生成创意影片 影片 - KlingAI 生成影片 影片 - AI 影片趣味特效 影片 - AI 拥抱 ( AI Hug ) 影片 - AI 老照片动起来 图片 - Dreamina 生成图片 音乐 - SUNO 创作音乐 音乐 - 免费 AI 音乐素材

ChatGPT

认识 ChatGPT 开始使用 ChatGPT 优良的提示技巧 基本提示 实用组合提示 角色扮演&对话主题 阅读并模仿风格 对话中显示图片 创作长篇故事与小说 使用 Bing Chat 相关工具或服务

Poe ( Poe AI )

开始使用 Poe 聊天机器人 生成图片机器人 建立自己的机器人 Youtube 影片重点整理 PDF 重点整理 GPT-4o-mini 分析图片 读取网页进行重点整理 让 AI 美化提示词

Ideogram

开始使用 Ideogram 文字产生图片 图片 Retry 与 Remix

dzine

开始使用 dzine 提示词产生图片 图片产生图片 运用图层功能 运用文字和画笔 ( 范例 ) 室内设计透视图实体化 ( 范例 ) 名画转真人照片 ( 范例 ) 真人照片转卡通 ( 范例 ) 真人卡通贴图

Image Creator

开始使用 Image Creator 提示原则与技巧 搭配 Bing Copilot 产生图片 ( 范例 ) 产生分享文章缩图 ( 范例 ) 漫画书风格

Leonardo.Ai

Leonardo.Ai 教学导读 Leonardo.Ai vs Midjourney 认识 Leonardo.Ai 注册与登录 Leonardo.Ai 使用图片产生器 文字提示语法和准则 Elements 风格元素 使用图片产生图片 AI 图片编辑器 ( Canvas Editor ) 即时 AI 画布 ( Realtime Canvas ) 即时图片产生器 ( Realtime Gen ) 图片升级器 ( Universal Upscaler ) 产生图片的后续步骤 Prompt Magic 魔法提示 PhotoReal&Alchemy 特色模型 训练自己的模型 ( 范例 ) 填补缺少的披萨 ( 范例 ) 组合两片披萨 ( 范例 ) 虚拟陈雷 ( 范例 ) 修改人物年龄 ( 范例 ) 换脸特效 ( 范例 ) 隐藏的人脸或文字 ( 范例 ) 全部填满皮卡丘 ( 范例 ) 名画转真人照片

Recraft

开始使用 Recraft 位图 Raster image 向量图 Vector image 图示 Icon 与 Logo 系列图像 Image Set 原型示意图 Mockup 画框 Frame、文字 Text 放大 Upscale、改色 Recolor 图片去背、替换图片背景 添加、修改、移除景物 图片产生图片 位图转向量图 自定义图片风格 合并不同图片 ( 范例 ) 名画转真人照片 ( 范例 ) 照片转卡通插画 ( 范例 ) 自制表情贴图 ( 范例 ) 多格漫画风格 ( 范例 ) 图片中加入文字 ( 范例 ) 延伸图片范围

Midjourney

Midjourney 教学导读 认识 Midjourney 使用 Midjourney 使用 niji.journey 设定指令 功能参数 使用文字提示产生图片 使用图片产生图片 优良的提示技巧 多重提示的权重与顺序 style tuner 样式调校 remix 放大、修改与重绘 blend 混合多张图片 删除图片&传送信息 ( 范例 ) 修改人物年龄 ( 范例 ) 阿尔钦博托风格 ( 范例 ) 照片转卡通人物 ( 范例 ) 变胖、变瘦

Vidnoz AI

开始使用 Vidnoz AI ( 影片 ) 照片讲话 ( 图片 ) 人物换脸 ( 图片 ) 图片去背

Canva AI 魔法功能

AI 魔法媒体工具 ( 文字产生图片和影片 ) AI 魔法工作室 ( 使用 AI 编辑照片 ) AI 魔法变形工具 ( 转换文字或形状 ) AI 魔法文案工具 ( Magic Write )

Clipdrop

开始使用 Clipdrop 修改图片选取区域 延展图片并生成内容 人物换脸 图片去背 移除特定对象 放大与增强图像 图像打光 替换天空

Playground AI

开始使用 Playground AI Board 文字产生图片 Canvas 绘制与修改图片 Remix 与 Edit 图片 延展和放大增强图片 图片去背、移除对象 搭配 Poe AI 产生图片

Replicate 模型

认识 Replicate ( 修图 ) 黑白照片上色 ( 修图 ) 修复老照片 ( 修图 ) 增强与放大照片 ( 修图 ) 更换发型和表情 ( 绘图 ) 似颜绘贴图 ( 绘图 ) 真人照片转公仔 ( 绘图 ) 隐藏的图案或文字 ( 提示 ) 图片转提示词 ( 提示 ) 改善提示词

AI 绘图效果&范例

着色本效果 2D 卡通人物 物品开箱照 像素艺术 百科全书风格 卡通贴纸

AI 绘图风格大全

风格大全 ( 总览 ) 风格大全 ( 摄影、照片 ) 风格大全 ( 画面角度效果 ) 风格大全 ( 媒材、材质 ) 风格大全 ( 卡通、漫画 ) 风格大全 ( 艺术流派风格 ) 风格大全 ( 艺术家、画家 ) 风格大全 ( 插画风格 1 ) 风格大全 ( 插画风格 2 ) 风格大全 ( 特色风格 )

AI 语音转 srt 字幕

不知道大家有没有“语音转字幕”的需求呢?虽然现在 AI 蓬勃发展,但如果要精准做到语音转换字幕,并且产生精确的时间戳记的 srt 文件,不是需要额外花钱,就是产生的结果无法符合中文语系常见得需求 ( 例如中文、英文、数字或台语互相混杂的状况 ),这篇教学会介绍运用 Google Colab 搭配 Gemini 的做法,让产生具有精准时间戳记的 srt 字幕文件。

快速导览:

运用 AI 将语音转成精准时间戳记 srt 字幕文件

Google Colab 搭配 Gemini 的做法

Gemini 不仅可以生成文字、图片、影片和声音,还有一个神奇的隐藏功能“语音转文字”,运用 Gemini 可以将录制的声音精准的转换成逐字稿,过程中更能精准辨识中文、英文、台语、数字、语气等内容,而且识别的正确率非常高,对于想要快速整理声音文件的人来说非常的方便。

虽然 Gemini 可以产生精准的逐字稿,但对于字幕文件的“时间戳记”就非常不准确,不是无法正确对应语音,就是会将一整段很长的文字塞入一个时间戳记中,对于影片剪接而言非常不友善,为了改善时间戳记问题,可以搭配 Google Colab 辅助操作。

Google Colab 是一个 Google 推出的 Python 云端运行环境,可在免费的状态下,使用 Google 云端平台分配的 CPU 或 GPU 运算资源,透过 Google Colab 执行 OpenAI 的 whisper 自动语音辨识模型,就能够将语音文件转换成文字,产生具有精准字幕戳记的 srt 字幕文件。

虽然 Google Colab 运行 whisper 可以产生精准时间戳字幕档,但整体辨识的精准度仍有待加强,特别是不同语言混杂时,常常会就出现判断错误的状况,和 Gemini 的精准度仍有天壤之别。

因此最好的方式就是将 Gemini 的精准文字和 whisper 的精准时间戳互相整合,运用各自的优点,产生精准文字和精准时间戳记的字幕文件,这也是接下来的步骤要介绍的重点。

Google Colab 搭配 Gemini 的做法 - 将 Gemini 的精准文字和 whisper 的精准时间戳互相整合

使用 Gemini 将语音转换成精准文字档

打开 Gemini,上传要转换的声音文件,输入下方的提示词 ( 自行修改语系名称 ),模型选择“思考型”,并强调不要加上任何额外文字或意见,避免 AI 幻觉或自作主张添加内容。

附件是一段「中文」語音,幫我轉換成逐字稿。
注意:
- 轉換成「繁體中文」逐字稿。
- 語音內容可能會有中文、英文、數字或台語交錯的內容,請精準辨識。
- 逐字稿的中文字和英文數字之間保留半形空格。
- 不要加上任何額外文字或你自己分析意見,單純產生逐字稿。

使用 Gemini 将语音转换成精准文字档 - 使用提示词

送出提示词之后,Gemini 就会产生逐字稿,产生的速度根据内容文件的多寡决定,从下方“未经任何修正”的结果可以看出,产生的逐字稿非常的精准,连同台语都可以精准辨识 ( 除了圈叉叉圈没有辨识为 OXXO ),完成后就可以将文字文件内容存档为“.txt”文件。

使用 Gemini 将语音转换成精准文字档 - 产生精准文字文件

使用 Colab 将语音转换成精准时间戳记字幕

新增并打开 Google Colab 专案 ( 参考“开始使用 Colab:撰写第一支 Python 程序”),进入专案之后,首先要先选择免费的“GPU”资源,执行的速度和准确率才会比较好,选择“执行阶段 > 变更执行阶段类型”。

使用 Colab 将语音转换成精准时间戳记字幕 - 新增并打开 Google Colab 专案,变更执行阶段类型

选择“T4 GPU”硬件加速器,这是免费方案可以使用 GPU 资源,每天有免费的时间额度可以使用。

使用 Colab 将语音转换成精准时间戳记字幕 - 选择“T4 GPU”硬件加速器

点击右上角的“连线”,就可以和具有 T4 GPU 的云端硬件连线,连线成功后就可以看到出现绿色的勾勾。

使用 Colab 将语音转换成精准时间戳记字幕 - 点击右上角的“连线”,就可以和具有 T4 GPU 的云端硬件连线

在中间区域输入下列指令,点击黑色箭头“执行”,安装 OpenAI 的 whisper 模组。

!pip install git+https://github.com/openai/whisper.git

使用 Colab 将语音转换成精准时间戳记字幕 - 在中间区域输入下列指令,点击黑色箭头“执行”,安装 OpenAI 的 whisper 模组

点击左上方“+ 程序码”按钮,在下方新增一个程序码输入与执行字段。

使用 Colab 将语音转换成精准时间戳记字幕 - 点击“+ 程序码”按钮,在下方新增一个程序码输入与执行字段

点击左侧第一个按钮,打开左侧选单,点击“文件夹”图示,打开暂存用的云端空间。

使用 Colab 将语音转换成精准时间戳记字幕 - 点击左侧第一个按钮,打开左侧选单,点击“文件夹”图示,打开暂存用的云端空间

上传刚刚的录音文件,注意,因为是暂存用的云端空间,所以当 Colab 专案连线结束之后,就会删除上传的文件。

使用 Colab 将语音转换成精准时间戳记字幕 - 上传刚刚的录音文件

在程序码区域输入下列提示词,将“audio_path”更换成刚刚上传的录音文件档名,完成后按下前方圆形执行按钮,就会开始进行字幕文件的转换,第一次转换时会先下载 1.4G 左右的语言模型,在这次 Colab 专案连线过程中,就不会再重新下载。

import whisper
import os
from google.colab import files
from whisper.utils import get_writer

# 1. 載入模型
model = whisper.load_model("medium")

# 2. 設定檔案路徑
audio_path = "錄音.m4a"

# 3. 執行轉錄 (這部分維持原樣)
# Whisper 會自動在 result['segments'] 中儲存時間戳資訊
result = model.transcribe(audio_path, prompt="請轉錄以下繁體中文的內容:")

# 4. 產出 SRT 檔案
output_directory = "." # 輸出至目前目錄
file_name = os.path.splitext(os.path.basename(audio_path))[0]

# 使用 Whisper 內建的 writer 來處理 SRT 格式
# 參數說明: 格式("srt"), 輸出路徑
srt_writer = get_writer("srt", output_directory)
srt_writer(result, audio_path)

# 5. 下載檔案
files.download(f"{file_name}.srt")

使用 Colab 将语音转换成精准时间戳记字幕 - 在程序码区域输入下列提示词开始进行字幕文件的转换

执行完成后,就会自动产生并下载一个“.srt”字幕文件,内容就是具有精准时间戳记的字幕文件,下方是这个文件“未修改的内容”,从中可以看出,虽然具有精准的时间戳记,但内容辨识度仍然有些不准确,和 Gemini 的精准文字辨识仍有差异。

1
00:00:00,000 --> 00:00:01,540
哈囉大家好
2
00:00:01,800 --> 00:00:03,840
我是圈XX圈
3
00:00:04,100 --> 00:00:09,480
今天要來跟大家介紹語音轉逐自稿的
4
00:00:09,740 --> 00:00:10,760
精準用法
5
00:00:11,520 --> 00:00:15,360
不知道大家有沒有聽過Gemini呢
6
00:00:15,880 --> 00:00:18,440
Gemini是Google的
7
00:00:18,940 --> 00:00:20,740
很好用的AI工具
8
00:00:26,360 --> 00:00:28,680
使用起來非常的讚喔
9
00:00:29,660 --> 00:00:32,220
今天我們就來試試看吧
10
00:00:32,720 --> 00:00:33,500
現在
11
00:00:34,260 --> 00:00:36,060
我來測試一下
12
00:00:36,560 --> 00:00:37,840
數字好了
13
00:00:38,360 --> 00:00:41,180
我現在說1 2 3 4 5
14
00:00:41,940 --> 00:00:44,500
台語是這兩三四五
15
00:00:44,760 --> 00:00:47,320
不知道能不能精準辨識呢
16
00:00:48,600 --> 00:00:50,900
如果可以精準辨識的話
17
00:00:51,160 --> 00:00:54,240
就表示這段語音逐自稿還不錯
18
00:00:54,740 --> 00:00:55,520
掰掰

使用 Gemini 产生精准字幕与时间戳记字幕

当 Gemini 的精准字幕和 whisper 精准时间戳都完成之后,接下来就可以运用下列的提示词,让 AI 将两者结合在一起,下方使用 Gemini 示范。

有时候 AI 仍然会加入一些自己的臆测或幻觉,可使用“严格遵守”、“绝对”、“精确”等指令加强提示。

你是一個比對並修正字幕檔案的專家,我會提供你一份具有時間戳的 .srt 檔案與一份純文字 .txt 檔案,請幫我根據 .txt 檔,修正 .srt 檔案內容,過程中請嚴格遵守下方條件:

- 完成後用程式碼區塊提供我具有時間戳的 .srt 檔案。
- 完全精確保留 .srt 檔案的時間戳,只針對 .srt 內容修正。
- 每段字幕的「結尾」不需要逗號或句號,句中可以有標點符號 ( 根據語氣需求,結尾可以使用驚嘆號 )。
- 可適度移除語氣贅字!
- 絕對不要對 .srt 檔案時間戳進行任何更動!
- 不要加入自己的臆測或想法!

完成后就可以得到“精确时间戳 + 精确文字”的语音逐字稿,将文字储存为“.srt”文件,就可在影片中使用字幕。

1
00:00:00,000 --> 00:00:01,540
Hello 大家好
2
00:00:01,800 --> 00:00:03,840
我是圈叉圈
3
00:00:04,100 --> 00:00:09,480
今天要來跟大家介紹語音轉逐字稿的
4
00:00:09,740 --> 00:00:10,760
精準用法
5
00:00:11,520 --> 00:00:15,360
不知道大家有沒有聽過 Gemini 呢
6
00:00:15,880 --> 00:00:18,440
Gemini 是 Google 的一個
7
00:00:18,940 --> 00:00:20,740
很好用的 AI 工具
8
00:00:26,360 --> 00:00:28,680
使用起來非常的讚喔!
9
00:00:29,660 --> 00:00:32,220
今天我們就來試試看吧
10
00:00:32,720 --> 00:00:33,500
現在
11
00:00:34,260 --> 00:00:36,060
我來測試一下
12
00:00:36,560 --> 00:00:37,840
數字好了
13
00:00:38,360 --> 00:00:41,180
我現在說 1 2 3 4 5
14
00:00:41,940 --> 00:00:44,500
台語是 一二三四五
15
00:00:44,760 --> 00:00:47,320
不知道能不能精準辨識呢
16
00:00:48,600 --> 00:00:50,900
如果可以精準辨識的話
17
00:00:51,160 --> 00:00:54,240
就表示這段語音逐字稿還不錯喔
18
00:00:54,740 --> 00:00:55,520
Bye bye

常见问题与处理方法

这篇教学所介绍的做法,大部分的情况都可以正常运作,但有时 AI 仍然会发生奇怪的幻觉,在合并的过程中产生重叠或不流畅的时间戳记,因此建议使用“影片编辑器”进行最后检查 ( 或上传到 youtube 之后,透过 youtube 上传字幕之后进行检查 ),查看字幕是否可以正常运作,如果有发生字幕时间戳记问题,也可以直接在影片编辑中微调即可。

常见问题与处理方法 - 因此建议使用“影片编辑器”进行最后检查

小结

其实产生精准的字幕往往是影片拍摄者最大的痛点,因为坊间语音转字幕的软件或 AI,不是太贵,就是转换的质量不如预期,但只要可以活动手边的工具,就可以让工具各自的优点相辅相成,快速产生精准的字幕啰!

意见反馈

微信二维码 微信扫码关注 抖音二维码 抖音扫码关注