完整操作手册如下(最终输出为 SRT 字幕文件):
Apple Silicon 本地 Whisper 字幕生成手册(mlx-whisper)
适用环境:macOS + Apple M 系列芯片
目标:隔离安装 + 生成 .srt 字幕文件
1. 创建隔离环境
# 创建专用目录
mkdir -p ~/whisper-isolated && cd ~/whisper-isolated
# 创建虚拟环境
python3 -m venv venv
# 激活虚拟环境
source venv/bin/activate
激活成功后,命令行前面会出现 (venv)。
2. 安装依赖
# 升级 pip
pip install --upgrade pip
# 安装 mlx-whisper 和 huggingface_hub
pip install mlx-whisper huggingface_hub
# 安装 ffmpeg(处理音视频必需)
brew install ffmpeg
3. 登录 Hugging Face(下载模型需要)
python -c "from huggingface_hub import login; login()"
- 浏览器打开:https://huggingface.co/settings/tokens
- 新建一个 Read 权限的 Token
- 复制 Token,粘贴到终端(粘贴时不显示字符,正常)
- 按回车完成登录
4. 生成 SRT 字幕(最终命令)
mlx_whisper '/Users/zen/Documents/media/Fucking The Police!The Best Of Hot Cops.mp4' \
--model mlx-community/whisper-medium.en-mlx \
--language en \
--output-format srt \
--output-dir .
参数说明:
--model:使用 medium.en 模型(英文优化)--language en:指定英语--output-format srt:输出 SRT 字幕文件--output-dir .:输出到当前目录
运行成功后,会在当前目录生成:
Fucking The Police!The Best Of Hot Cops.srt
5. 常用可选参数
# 同时输出多种格式(txt + srt + json)
--output-format all
# 指定输出文件名(不带扩展名)
--output-name my_subtitle
# 开启词级时间戳(更精确的字幕时间)
--word-timestamps True
# 翻译成英文(非英语音频时用)
--task translate
6. 以后再次使用
cd ~/whisper-isolated
source venv/bin/activate
mlx_whisper '你的视频或音频路径' \
--model mlx-community/whisper-medium.en-mlx \
--language en \
--output-format srt
7. 完全删除环境(不影响系统)
rm -rf ~/whisper-isolated
模型缓存默认在 ~/.cache/huggingface,如需一并清理可执行:
rm -rf ~/.cache/huggingface
当前正在运行的命令如果没有加 --output-format srt,生成的是 txt。
等它跑完后,直接用上面第 4 步的完整命令重新跑一次即可得到 SRT 文件。