惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

G
Google Developers Blog
Apple Machine Learning Research
Apple Machine Learning Research
小众软件
小众软件
Recent Announcements
Recent Announcements
阮一峰的网络日志
阮一峰的网络日志
IT之家
IT之家
A
About on SuperTechFans
量子位
Engineering at Meta
Engineering at Meta
B
Blog
The Cloudflare Blog
博客园 - 【当耐特】
Hugging Face - Blog
Hugging Face - Blog
Y
Y Combinator Blog
J
Java Code Geeks
D
DataBreaches.Net
aimingoo的专栏
aimingoo的专栏
T
Tailwind CSS Blog
H
Help Net Security
钛媒体:引领未来商业与生活新知
钛媒体:引领未来商业与生活新知
V
V2EX
Stack Overflow Blog
Stack Overflow Blog
C
Check Point Blog
酷 壳 – CoolShell
酷 壳 – CoolShell

少数派

派早报:Google 发布 Fitbit Air 等 - 少数派 「新人报到」確認需求,再開始 - 少数派 从 SOLO 独立开发者社区,我看到了越来越多开发者开始做自己的产品 - 少数派 我怎么管理那些"不常做,但总会忘"的生活事项 - 少数派 人形机器人量产元年,数据才是具身智能的“生死线” - 少数派 BuhoLaunchpad 高度还原 Mac 启动台:开发历程与思考 - 少数派 五年陪伴依然不舍,DIY 换壳后让罗技 MX Master 3 继续服役 - 少数派 新玩意 240|少数派的编辑们最近买了啥? - 少数派 一日一技|为什么你应该关闭 iOS 的键盘声音 - 少数派 我做了个插件和 Skills,一键提取任何网站的设计规范 Design.md - 少数派 住在三四线城市的你,该开始录播客了 - 少数派 甘南秘境,大白高国 - 少数派 AI的审美:谁让把我变成川内倫子 - 少数派 返工怎能不烦恼,打工人片单总有一部是你的「嘴替」 - 少数派 为了让「上厕所」更健康,我做了一个小工具 - 少数派 AI + Skill,能够让生成的文章去除 AI 味吗? - 少数派 新玩意|韶音OpenDots ONE 耳夹式耳机 - 少数派 《美满》| 在每一个春天的晚上相爱(362) - 少数派 新玩意|优篮子 PS01 MagSnap 磁吸支架 - 少数派 自我整合手记 | 我开始早睡了:用稳定规则,为自由托底 - 少数派 用龙虾(OpenClaw)两个多月,我最深的12个体会 - 少数派 听歌时间到,12 张你可能错过的 2025 华语乐坛好专辑 - 少数派 承诺能追吗 - 少数派 macOS 26启动台没了? 我做了个不一样的App启动器 - Keboard - 少数派 《四海为家的人》| INTJ对话INTJ(361) - 少数派 你发过的那些黑历史,是时候一次清干净了 - 少数派 新玩意:安安静静玩,越玩越专注:计客密码机 - 少数派 iPad 用户首次体验 Android 平板:vivo Pad6 Pro - 少数派 数据逻辑强 - 少数派 极北行+ | 一路向北,探访日本至北之地 | 001 - 少数派
AI Hear 一款离线的实时语音转文字,翻译。字幕导出的软件 - ...
2024-11-02 · via 少数派

预览

主要功能

  • 录音:软件内选择系统声音、麦克风或指定软件,如腾讯会议、浏览器、播放器(免音频驱动)。
  • 语音识别:基于 OpenAI Whisper 模型的语音转文字。
  • 翻译:软件内自由切换引擎,支持 Ollama,OpenAI 等开放接口格式。
  • 保存:完成录制后自动保存音频、原本、译文、时间轴。
  • 导出:格式支持 SRT,TXT,VTT。

硬件要求

  • macOS 系统。M1及以上系列芯片。
  • Windows 系统还在测试阶段。

官网地址

作者心声

可能有人会问制作这款软件的动机。本文试着解答。

缘起

年初(2024年),家夫人单位业务拓展到美国,工作内容上了强度,需要与美国人沟通。中文环境下能说会道,用英语说就犯了难,最大的问题是听力差。

听不懂,看得懂就行。知道问题所在,就开始找“药方”,找同传软件。找到一款国内大厂出品的软件,花了 ¥98,效果呢,非常一般,没法开展工作的。

OpenAI Whisper 语音转文字模型

说到语音识别,常被称作语音转文字,我在想为什么不用 OpenAI Whisper 模型呢?Whisper 模型是 OpenAI 为数不多的开源模型,2023 年初就已开源,它的英文识别准确率真的强,我还曾用过它生成的字幕学英语生词。

开始在应用商店找基于 Whisper 模型的语音识别软件,无一例外的,这些软件只支持先录音再转文字。这就完全无法满足开会,这种要求实时的场景了。

技术上来说,Whisper 模型不是一个实时模型,可能这是制约了很多开发商不做实时语音转文字的一个理由。

让 Whisper 实时

眼馋 Whisper 模型语音转文字的效果之好,开始跟小伙伴一起尝试让 Whisper 模型实时转文字。答案是,确实可行,最终也成为形成了 AI Hear 这款软件。可行的基础,我想有这么几个:

  1. 自 2020 年起,苹果公司在 Mac 上全面使用 Apple Silicon 处理器。相比起之前的架构,这些芯片在机器学习方面有更强的性能。
  2. Georgi Gerganov 大神使用 C++ 重写了一遍 Whisper 模型的推理代码,应该是在 macOS 效率最高的 Whisper 推理实现了。

现在的 AI Hear 支持:

  1. 录音,支持后续导出。
  2. 基于 Whisper 的语音转文字。
  3. 支持 Ollama 本地翻译、及其他翻译引擎。
  4. 导出文字、字幕。

理想情况下,不依赖网络,一台电脑在本地就可以做到实时语音转文字 + 翻译。

我们的目标是让这款软件成为一款好用的、可以被买断的产品,安静躺在电脑里,想用就用,不需要再为云厂商缴纳月费了。

尾声

软件本身还有很多需要优化和改进的地方,欢迎指正。

联系我们:contact@thucydides.net