基于 CTranslate2 重实现 Whisper 的 Python 语音转写库,通过量化和批处理降低推理耗时与资源占用,适合搭建转写流水线,而非开箱即用的桌面应用。

适合维护字幕或录音转写流水线的开发者 · 已有NVIDIA显卡、显存预算有限的用户 · 不愿将内部录音交给云端处理的团队

亮点

  1. 量化压低显存门槛

    官方大模型测试中,INT8 将显存从原版约4.7GB降至2.9GB,转写也更快。

  2. 批处理换取高吞吐

    官方3070 Ti测试中,13分钟音频批处理仅需16秒,但会增加显存占用。

  3. 无需单装解码工具

    音频由内含FFmpeg库的PyAV解码,较原版少一道系统依赖配置。

取舍

选它的理由

  • 无需购买独立显卡也能用CPU转写
  • 已有Python流程可直接接入转写
  • 音频可在自有机器处理,无需上传云端
  • MIT许可便于集成到自有项目

先想清楚

  • 只想拖入音频就导出字幕,不愿配置Python
  • 希望直接获得实时听写、说话人分离或API服务
  • 主要依赖非NVIDIA显卡加速
  • 本体是代码库,没有开箱即用的图形界面

同类推荐

查看全部

更多「音视频工具」软件

软鉴 SoftMemo

AI 整理的软件知识库

AI 整理软件资料、版本动态、更新通知、订阅权益与对比分析,沉淀可复用的工具知识。