一款基于OpenAI Whisper的离线语音转文字与翻译桌面应用,支持多引擎、GPU加速和说话人识别,可导出SRT/VTT字幕。
适合需要离线转写机密会议或采访的记者、律师 · 想为音视频内容生成字幕的UP主与剪辑师
亮点
完全离线运行
所有转录与翻译均在本地执行,不上传任何音频,有效保护敏感对话隐私。
多引擎GPU加速
支持Whisper、Whisper.cpp、Faster Whisper,并利用Vulkan、CUDA、Apple Silicon加速,兼顾速度与精度。
说话人识别与语音分离
在转录前分离说话人并标注身份,嘈杂环境下的采访、会议转录更清晰。
取舍
选它的理由
- 所有数据本地处理,无隐私泄露风险
- 支持说话人识别,会议记录更高效
- 免费开源,无功能限制或订阅套路
- 多引擎支持及GPU加速,处理速度快
先想清楚
- 需要毫秒级实时转写(如同声传译)
- 不希望占用本地磁盘存储大模型
- Windows安装包未数字签名,触发SmartScreen警告
- 实时转录资源消耗高,可能延迟较大
同类推荐
查看全部更多「音视频工具」软件
WhisperSubTranslate
音视频工具开源本地运行的桌面字幕工具:用 whisper.cpp 把视频语音转成 SRT 字幕,再用内置腾讯 Hy-MT2 模型离线翻译成 15 种语言,也可接 DeepL、GPT、Gemini 等在线引擎,视频全程不上传。
mpv-Yaozhi
音视频工具开源面向 Windows 的 mpv 第三方整合包,自编译 mpv/FFmpeg/SDL2 核心,专攻 Dolby Vision、HDR Vivid、AV3A 沉浸声、5.1.4 至 9.1.6 具名多声道 PCM 与 HDR 图形字幕,并深度汉化 uosc 界面、内置弹幕与网盘直链播放。
ComfyUI-RH-MiniMax-H3
音视频工具开源把 MiniMax-H3 音视频联合生成模型接入 ComfyUI 的插件,支持文生视频+音频、首尾帧驱动和多模态参考三种任务,靠 INT8 量化与分层卸载在单张 24GB 显卡上跑完整流程。
Stash-Jellyfin Proxy
音视频工具开源一款 Python 代理服务器,通过模拟 Jellyfin HTTP API,让 Infuse、Swiftfin 等兼容播放器直接浏览与串流 Stash 媒体库,实现无缝的媒体消费体验。
Shutter Encoder
音视频工具开源由视频剪辑师开发的开源转码工具,用图形界面封装 FFmpeg,支持几乎所有音视频图像格式,并能对部分编码做无重编码剪切、字幕烧录与批量队列输出。
JAVM
音视频工具开源基于 Tauri 2 + Vue 3 + Rust 的桌面端 JAV 媒体库管理器,把本地扫描入库、番号刮削、下载队列和内置播放截图串成一条流水线,数据存本地 SQLite。
AI 整理的软件知识库
AI 整理软件资料、版本动态、更新通知、订阅权益与对比分析,沉淀可复用的工具知识。