完整操作手册如下(最终输出为 SRT 字幕文件):


Apple Silicon 本地 Whisper 字幕生成手册(mlx-whisper)

适用环境:macOS + Apple M 系列芯片
目标:隔离安装 + 生成 .srt 字幕文件


1. 创建隔离环境

# 创建专用目录
mkdir -p ~/whisper-isolated && cd ~/whisper-isolated

# 创建虚拟环境
python3 -m venv venv

# 激活虚拟环境
source venv/bin/activate

激活成功后,命令行前面会出现 (venv)


2. 安装依赖

# 升级 pip
pip install --upgrade pip

# 安装 mlx-whisper 和 huggingface_hub
pip install mlx-whisper huggingface_hub

# 安装 ffmpeg(处理音视频必需)
brew install ffmpeg

3. 登录 Hugging Face(下载模型需要)

python -c "from huggingface_hub import login; login()"
  1. 浏览器打开:https://huggingface.co/settings/tokens
  2. 新建一个 Read 权限的 Token
  3. 复制 Token,粘贴到终端(粘贴时不显示字符,正常)
  4. 按回车完成登录

4. 生成 SRT 字幕(最终命令)

mlx_whisper '/Users/zen/Documents/media/Fucking The Police!The Best Of Hot Cops.mp4' \
  --model mlx-community/whisper-medium.en-mlx \
  --language en \
  --output-format srt \
  --output-dir .

参数说明:

  • --model:使用 medium.en 模型(英文优化)
  • --language en:指定英语
  • --output-format srt:输出 SRT 字幕文件
  • --output-dir .:输出到当前目录

运行成功后,会在当前目录生成:

Fucking The Police!The Best Of Hot Cops.srt

5. 常用可选参数

# 同时输出多种格式(txt + srt + json)
--output-format all

# 指定输出文件名(不带扩展名)
--output-name my_subtitle

# 开启词级时间戳(更精确的字幕时间)
--word-timestamps True

# 翻译成英文(非英语音频时用)
--task translate

6. 以后再次使用

cd ~/whisper-isolated
source venv/bin/activate

mlx_whisper '你的视频或音频路径' \
  --model mlx-community/whisper-medium.en-mlx \
  --language en \
  --output-format srt

7. 完全删除环境(不影响系统)

rm -rf ~/whisper-isolated

模型缓存默认在 ~/.cache/huggingface,如需一并清理可执行:

rm -rf ~/.cache/huggingface

当前正在运行的命令如果没有加 --output-format srt,生成的是 txt。
等它跑完后,直接用上面第 4 步的完整命令重新跑一次即可得到 SRT 文件。