Whisper 教程:OpenAI 语音转文字工具
本页为你提供一份实用的 Whisper 教程,基于 OpenAI 开源的语音转文字工具。从安装配置到批量处理音频,再到常见坑点规避,帮你快速将会议录音、课堂笔记转为文字,大幅提升办公与学习效率。
详细介绍
语音转写太费时?你需要 Whisper
会议录音、采访素材、网课回放……手动整理成文字动辄数小时,效率极低。市面上不少语音转文字服务要么收费高,要么对专业术语识别差,要么限制时长。OpenAI 开源的 Whisper 模型则是一个强大的免费替代方案,支持近百种语言,对中文、英文的识别准确率都相当高,甚至能自动加标点。这篇 Whisper 教程将带你从零开始,真正把它用起来。
Whisper 核心功能一览
高精度多语言识别
Whisper 基于大型弱监督学习,处理嘈杂环境、口音、专业词汇的能力远比普通 API 强。它不仅能转写,还能翻译(例如将中文翻译成英文)。你不需要本地 GPU 也可运行,只是速度会慢一些。
- 支持音频和视频文件直接提取音轨转写
- 自动检测语言,生成带时间戳的 SRT 字幕
- 多种模型大小可选:tiny、base、small、medium、large-v3,按准确度和速度权衡
命令行 + Python 双接口
Whisper 提供最简单的命令行方式,一条命令即可转写整个文件夹;同时也开放 Python API,方便你嵌入自己的自动化流程。下面会演示最常用的命令。
Whisper 使用方法:手把手实操
1. 安装与准备
确保 Python 3.9 以上,然后执行:pip install openai-whisper。建议同时安装 ffmpeg(macOS 用 brew install ffmpeg,Windows 可下载安装包)。Whisper 会自动调用 ffmpeg 处理音频解码。
2. 基础转写命令
打开终端,进入音频所在目录,运行:
whisper meeting.mp3 --language zh --model medium参数解释:--language zh 指定中文,避免自动检测错误;--model medium 在准确率和速度间较均衡。输出文件默认生成 txt、srt、vtt 等格式,非常方便。
3. 批量处理与字幕导出
想要一次处理多个文件?可以用通配符:whisper *.mp3 --model large-v3 --output_format srt。如果想生成带时间轴的 Word 文档,可以配合 Pandoc 或脚本把 srt 转成 docx。对于长视频,建议先切成 10 分钟左右的片段再转写,避免内存溢出。
注意事项与避坑指南
- 首次运行会下载模型文件,需要科学网络环境;模型体积从 75MB 到 5GB 不等,别选错。
- CPU 转写很慢,一个 1 小时音频可能耗时数小时。有条件尽量用 GPU(NVIDIA CUDA)或选用 small 模型。
- 背景音乐、多人重叠说话时准确率下降,建议提前用工具降噪或分段。
- 转写结果仍是纯文本,涉及敏感信息需人工校对,不要直接商用。
掌握这篇 Whisper 教程后,你就能轻松将任意录音变成可搜索、可编辑的文字。配合 Python 脚本,还能自动归档会议纪要素材,让效率翻倍。
更新记录
最近更新:2026-08-18
下载
下载按优先级提供:国内网盘(第一优先,便于国内快速获取)→ 官方来源(官方正版背书)→ 源码地址(开源项目);网盘链接均经审核,如失效欢迎反馈。
怎么选(决策参考)
暂无公开信号
暂无公开信号
暂无公开信号
暂无公开信号
暂无公开信号
暂无公开信号
社区数据不足
暂无公开信号
暂无公开信号
暂无公开信号
常见问题
Whisper 对中文识别准确吗?
Whisper 对中文支持很好,使用 medium 或 large 模型时,在普通话、较清晰语音环境下准确率可达 95% 以上。建议指定 --language zh,并尽量避免背景噪音。
Whisper 可以免费商用吗?
Whisper 的模型和代码采用 MIT 协议,可免费商用。但需注意:转写结果可能包含敏感内容,商用前务必进行人工审核,并遵守相关法律法规。
电脑配置不高能跑 Whisper 吗?
可以,但建议使用 tiny 或 base 模型,并只处理短音频。例如 base 模型在 CPU 上转写 5 分钟音频约需 2-3 分钟。若音频很长,可分段处理。