惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

OSCHINA 社区最新新闻
OSCHINA 社区最新新闻
L
LangChain Blog
WordPress大学
WordPress大学
MyScale Blog
MyScale Blog
The Cloudflare Blog
J
Java Code Geeks
Google DeepMind News
Google DeepMind News
Recent Announcements
Recent Announcements
Microsoft Azure Blog
Microsoft Azure Blog
Y
Y Combinator Blog
有赞技术团队
有赞技术团队
Last Week in AI
Last Week in AI
酷 壳 – CoolShell
酷 壳 – CoolShell
Martin Fowler
Martin Fowler
小众软件
小众软件
量子位
月光博客
月光博客
P
Proofpoint News Feed
IT之家
IT之家
腾讯CDC
博客园 - 三生石上(FineUI控件)
博客园 - 司徒正美
雷峰网
雷峰网
V
Visual Studio Blog

少数派

派早报:Google 发布 Fitbit Air 等 - 少数派 「新人报到」確認需求,再開始 - 少数派 从 SOLO 独立开发者社区,我看到了越来越多开发者开始做自己的产品 - 少数派 我怎么管理那些"不常做,但总会忘"的生活事项 - 少数派 人形机器人量产元年,数据才是具身智能的“生死线” - 少数派 BuhoLaunchpad 高度还原 Mac 启动台:开发历程与思考 - 少数派 五年陪伴依然不舍,DIY 换壳后让罗技 MX Master 3 继续服役 - 少数派 新玩意 240|少数派的编辑们最近买了啥? - 少数派 一日一技|为什么你应该关闭 iOS 的键盘声音 - 少数派 我做了个插件和 Skills,一键提取任何网站的设计规范 Design.md - 少数派 住在三四线城市的你,该开始录播客了 - 少数派 甘南秘境,大白高国 - 少数派 AI的审美:谁让把我变成川内倫子 - 少数派 返工怎能不烦恼,打工人片单总有一部是你的「嘴替」 - 少数派 为了让「上厕所」更健康,我做了一个小工具 - 少数派 AI + Skill,能够让生成的文章去除 AI 味吗? - 少数派 新玩意|韶音OpenDots ONE 耳夹式耳机 - 少数派 《美满》| 在每一个春天的晚上相爱(362) - 少数派 新玩意|优篮子 PS01 MagSnap 磁吸支架 - 少数派 自我整合手记 | 我开始早睡了:用稳定规则,为自由托底 - 少数派 用龙虾(OpenClaw)两个多月,我最深的12个体会 - 少数派 听歌时间到,12 张你可能错过的 2025 华语乐坛好专辑 - 少数派 承诺能追吗 - 少数派 macOS 26启动台没了? 我做了个不一样的App启动器 - Keboard - 少数派 《四海为家的人》| INTJ对话INTJ(361) - 少数派 你发过的那些黑历史,是时候一次清干净了 - 少数派 新玩意:安安静静玩,越玩越专注:计客密码机 - 少数派 iPad 用户首次体验 Android 平板:vivo Pad6 Pro - 少数派 数据逻辑强 - 少数派 极北行+ | 一路向北,探访日本至北之地 | 001 - 少数派
33字幕: 快速制作双语字幕,识别外语更准确 - 少数派
2023-08-30 · via 少数派

更新:33字幕支持本地识别了,目前可以实现免费生成双语字幕了,具体方法参考:

介绍一种完全免费给视频翻译字幕的方法


33字幕是为了快速制作双语字幕而打造的一款AI字幕软件。

为了达到尽可能"快"的目的,准确是个非常重要的指标。

这里的准确具体包括:

  1. 识别少错字漏字,断句合理
  2. 时间轴基本能对上台词
  3. 翻译不要太生硬,句子通顺

我心目中理想的字幕工具便是:给音频识别出字幕,把几处出错的地方简单修正一下,便可以用了;如果需要翻译,不求信雅达,但要基本能看懂,语句通顺。

音频识别

第一步是音频转字幕,这里要感谢Whisper,如果没有它,那33字幕就要大打折扣了。

Whisper 是 Open AI 开源的一个语音识别模型,经过一段时间的测试,我们发现它的large模型识别准确度非常好,可以基本满足我们的要求。

吭哧吭哧一顿优化后,终于把它部署到了 GPU 云服务器上。

Whisper是33字幕目前识别外语的一个主力语音识别引擎,当然,我们也有集成了其他的一些语音识别引擎,但是在英语或者小语种方面,我建议还是使用Whisper。

即便 Whisper 的能力已经非常优秀,但是如果音频同时混合背景音乐和人声,识别精度也随下降,为了克服这个问题,我们支持识别前可以先进行提取人声:

这里其实是调用了另外一个分离音色的AI模型,也非常消耗GPU资源,尤其是长音频。

为了节省算力,我们建议你使用这个免费的服务:vocalremover

字幕翻译

在字幕翻译方面,我们也集成了很多家翻译商,虽然也尝试 ChatGPT,但由于无法稳定控制输出质量,最终还是放弃了。

我们目前测试效果表现最好的是 DeepL,看来贵是有贵的道理的。

效果对比

那最终识别和翻译的质量到底怎么样呢?

总的来说,目前 Whisper + DeepL 的效果是最理想的。下面这几个演讲视频,也是直接用33字幕来直出的。

另外,我随机测试的更多视频,并整理到了飞书文档上面,可以去大概感受一下,当然这不是严谨的基准测试:效果对比

字幕编辑

对于33字幕,它的设计初衷是希望通过结合AI的能力,用尽可能少的人工参与,低成本、高效率地制作双语字幕。

如果字幕需要大改的情形,并不适合用33字幕来进行处理,比如需要精细调整时间轴、设计复杂的字幕样式等情形,就不如使用 Aegisub 或者 Arctime pro 这类软件来处理更好一些。

不过我们也是有做了一些非常实用的字幕编辑功能,对于一些小修小补,它应付起来应该是游刃有余的。

(1)增 / 删 / 合并 / 调整时间

这些是字幕编辑器的基础要求,没啥特别的。

(2)撤销 / 恢复

不用担心操作失误,我们会帮你把操作记录下来。

你可以通过熟悉的 ctrl + zctrl + y 来迅速恢复。

(3)问题字幕检测

机器识别难免会出现一些问题行,软件会帮你检测有问题的行,你通过点击就可以快速定位并修正。

(4)全局替换

很多时间识别或者翻译出来的结果,错误的词也是惊人的一致,那么这个功能,就可以非常方面进行全局修改。

批量处理

另外一个想达到 "快" 的手段,便是同时处理多个任务了。因此33字幕在一开始,就考虑到了支持批量处理的特性。

单次批量处理同语种的音视频,或批量翻译同语种的字幕,都可以在33字幕上很好地支持:

批量识别
批量识别
批量翻译
批量翻译

数据隐私

因为很多计算都需要在云端完成,所以无法避免要上传用户的数据。我们只能在一定范围内去保护数据的安全和隐私。

我们并不会把你的整个视频都上传上去,而是只提取音频来上传,并且在识别后会第一时间删除掉音频。(当然这部分用户无法感知)

产品定位

这个产品最大的用户目前是我们自己哈哈。

对于大部分的中文视频创作者,我们并不推荐你使用33字幕

如果只是添加单轨中文字幕的需求,我们测试过剪映,生成字幕质量非常高,而且它是免费的,我们建议你首选它。

另外如有自己的 GPU 资源,可以尝试 buzz ;对于动手能力比较强的同学,还可以去 Google colab 部署个 Whisper 模型,白嫖一下谷歌的算力。

以下是33字幕比较擅长的:

  1. 只有外语视频,需要给视频添加字幕和中文翻译
  2. 有外语字幕文件,需要把字幕翻译成中文
  3. 想给中文视频加上外语字幕
  4. 需要批量翻译或批量识别字幕

总的来说,当你需要处理外语视频字幕时,请记得有这么一个工具(33字幕)可以帮到你

产品主页:33字幕