Auto Caption 实时字幕工具:自由切换引擎与多语言翻译

软件简介

Auto Caption 是一款面向直播、会议与内容创作者的实时字幕工具,目前提供 Windows 安装版。它最大的特点是字幕引擎不绑定单一服务商,用户可以在 Gummy、Whisper 等不同引擎间切换,并根据自己的网络与算力条件选择最合适的一档。若使用默认的 Gummy 引擎,需要前往阿里云百炼平台申请 API Key 并配置到系统环境变量中,这一点在首次启动时会有明确提示,不算复杂。

核心功能

这款软件把字幕的「识别」和「呈现」拆开处理,每个环节都给足了自定义空间,具体来说包括:

  1. 字幕样式自由调整:字体大小、颜色、背景透明度、气泡样式、屏幕位置均可实时预览修改,适合直播叠加或后期录屏合成。
  2. 多引擎灵活切换:除 Gummy 外,可接入本地或远程的 Whisper 模型,离线环境也能用,且能对比不同引擎的准确率再选择。
  3. 多语言识别与翻译:支持中英日韩等多语种语音输入,并可将识别文本即时翻译为另一种语言,方便跨国会议或外语视频制作。
  4. 完整字幕记录与导出:所有识别内容会按时间轴保存在界面列表中,可一键导出为 SRT 或纯文本,省去事后手动整理。
  5. 双通道音源支持:既能生成麦克风说话的字幕,也能捕获系统播放的音频(如视频会议对方的声音)生成字幕,双人对话场景尤其好用。

使用体验

实际跑起来后,Gummy 引擎在普通话识别上表现出色,句末标点和断句基本不用二次修改,翻译速度也跟得上讲话节奏。如果你手头有 NVIDIA 显卡并想摆脱 API 限制,换成本地 Whisper 模型后延迟略高,但胜在免费且数据不出本机。适合经常做直播、录网课或需要给视频配字幕的独立创作者,也适合不习惯付费订阅制的小型团队内部使用。

需要注意的是,软件目前没有内置安装向导的引导步骤,第一次配置环境变量需要手动打开系统设置,对不太熟悉电脑操作的用户稍有一点门槛。项目源码已公开在 GitHub,开发者可以自行修改或提交问题,社区维护频率稳定。

软件截图

Auto Caption 实时字幕工具:自由切换引擎与多语言翻译 截图

下载地址

夸克网盘(永久有效):https://pan.quark.cn/s/aa2b2048ea6d

项目地址:https://github.com/HiMeditator/auto-caption

本站整理发布,仅供学习交流,请在下载后 24 小时内删除,喜欢请支持正版。

固定文章缩略图

新人必看的入站详细说明指南

解决的你的各种疑难杂症以及各种相关教程

前往查看 »
© 版权声明
THE END
喜欢就支持一下吧
点赞34 分享
评论 抢沙发
头像
欢迎您留下宝贵的见解!
提交
头像

昵称

取消
昵称表情代码图片

    暂无评论内容