惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

MyScale Blog
MyScale Blog
博客园 - 司徒正美
A
About on SuperTechFans
Vercel News
Vercel News
H
Hackread – Cybersecurity News, Data Breaches, AI and More
爱范儿
爱范儿
I
InfoQ
freeCodeCamp Programming Tutorials: Python, JavaScript, Git & More
博客园_首页
Google DeepMind News
Google DeepMind News
T
Tailwind CSS Blog
奇客Solidot–传递最新科技情报
奇客Solidot–传递最新科技情报
F
Fortinet All Blogs
S
SegmentFault 最新的问题
阮一峰的网络日志
阮一峰的网络日志
D
Docker
钛媒体:引领未来商业与生活新知
钛媒体:引领未来商业与生活新知
G
Google Developers Blog
Stack Overflow Blog
Stack Overflow Blog
M
MIT News - Artificial intelligence
Jina AI
Jina AI
H
Help Net Security
量子位
IT之家
IT之家

少数派

派早报:Google 发布 Fitbit Air 等 - 少数派 「新人报到」確認需求,再開始 - 少数派 从 SOLO 独立开发者社区,我看到了越来越多开发者开始做自己的产品 - 少数派 我怎么管理那些"不常做,但总会忘"的生活事项 - 少数派 人形机器人量产元年,数据才是具身智能的“生死线” - 少数派 BuhoLaunchpad 高度还原 Mac 启动台:开发历程与思考 - 少数派 五年陪伴依然不舍,DIY 换壳后让罗技 MX Master 3 继续服役 - 少数派 新玩意 240|少数派的编辑们最近买了啥? - 少数派 一日一技|为什么你应该关闭 iOS 的键盘声音 - 少数派 我做了个插件和 Skills,一键提取任何网站的设计规范 Design.md - 少数派 住在三四线城市的你,该开始录播客了 - 少数派 甘南秘境,大白高国 - 少数派 AI的审美:谁让把我变成川内倫子 - 少数派 返工怎能不烦恼,打工人片单总有一部是你的「嘴替」 - 少数派 为了让「上厕所」更健康,我做了一个小工具 - 少数派 AI + Skill,能够让生成的文章去除 AI 味吗? - 少数派 新玩意|韶音OpenDots ONE 耳夹式耳机 - 少数派 《美满》| 在每一个春天的晚上相爱(362) - 少数派 新玩意|优篮子 PS01 MagSnap 磁吸支架 - 少数派 自我整合手记 | 我开始早睡了:用稳定规则,为自由托底 - 少数派 用龙虾(OpenClaw)两个多月,我最深的12个体会 - 少数派 听歌时间到,12 张你可能错过的 2025 华语乐坛好专辑 - 少数派 承诺能追吗 - 少数派 macOS 26启动台没了? 我做了个不一样的App启动器 - Keboard - 少数派 《四海为家的人》| INTJ对话INTJ(361) - 少数派 你发过的那些黑历史,是时候一次清干净了 - 少数派 新玩意:安安静静玩,越玩越专注:计客密码机 - 少数派 iPad 用户首次体验 Android 平板:vivo Pad6 Pro - 少数派 数据逻辑强 - 少数派 极北行+ | 一路向北,探访日本至北之地 | 001 - 少数派
我愿称它为:最强本地语音转文本神器! - 少数派
2026-02-05 · via 少数派

沙牛提示

阅读本文需要4分钟,安利一款体验极佳的本地语音转文本神器!

如果你喜欢本文,就分享给你的小伙伴!

01 语音转文本

在之前的文章中,我曾分享过自己的一套本地化语音/视频转文本的方案。

这套方案,是基于Windows平台的开源方案,我主要基于它,来将自己的实训营课程视频,转换为文本,投喂给AI,外加一些视频和音频转文本的需求,毕竟我读文字内容速度很快。

不过,最近买了一台Macbook Air,所以,便琢磨着在macOS上,也来实现这一套方案。

了解测试一番之后,发现了这样一款工具,无论是功能、速度还是体验,都绝对完爆之前在Windows上的方案!

02 MacWhisper

在Windows上,需要自己部署一整套方案,包括环境、大模型和GUI等等,这导致初次部署时,比较麻烦。

而在macOS上,这样的一套方案,全被集成在了一个app中:MacWhisper

官网:https://goodsnooze.gumroad.com/l/macwhisper

语言:英文

系统:看名字就知道,它目前仅支持macOS

费用:

  • 可免费使用,但功能有限,限制音频时长,及可下载的开源模型。
  • Pro版本:单用户64欧元,约540人民币,解锁全功能。

我自己试用之后,直接入手了Pro版本,主要原因有二:

  • 我使用它的频率非常高。
  • 我的课程视频都会加字幕,之前是每年购买剪映会员来完成,一年半的会员费用,就足以购买MacWhisper Pro版本了。

03 功能

跟之前Windows的开源方案相比,MacWhisper提供的功能,可简直太丰富了,看一下它的主界面:

在这里,你能够看到它的核心功能,包括:

  • 语音备忘录,录制即时语音,并转换成文本。这功能我不怎么使用。
  • 将音频或视频转换为文本,可批量处理。
  • 录制其他app的音频,并转换为文本。我用得很少,但在某些场景下,会非常实用,比如录制会议app的音频,并转换为文本,还能自动识别会议参与者。
  • 将播客音频转换为文本。
  • 通过链接,将对应的视频转换为文本,我试了Youtube和B站,前者未成功,后者直接不能用……不过倒是可以通过一些技术手段将视频下载下来再转换。

除了以上功能,MacWhisper还提供了很多其他非常实用的功能和特性,如:

  • 音频转文本时,顺便翻译。
  • 配置在线大语言模型API,对转换的文本生成摘要。
  • 将转换的文本作为知识库,进行问答。
  • 对经常识别错误的文本,进行自动替换。比如我的课程中,经常将“课时”识别为“科室”,那么,我就可以新建一条规则,在转换文本时,自动将其替换为正确的内容。
  • 监控指定文件夹,当该文件夹有新文件时,自动进行转换。
  • 添加说话人员。
  • ……

另外,MacWhisper还支持接入其他工具和服务,如n8n,后面有时间准备来折腾一下这个需求:

将B站收藏的视频自动下载到指定文件夹(已通过Docker实现),再使用MacWhisper监控此文件夹,并自动转换为文本,再调用Gemini将文本转换为带格式的Markdown文件。

04 流程

如果你也有使用MacWhisper的需求,那么,可以按照以下流程进行。

首先,你需要下载安装它,目前MacWhisper并未上架AppStore,所以你只能在官网下载。

安装之后,你需要配置用于将视频转换为文本的大语言模型,MacWhisper支持使用在线和本地模型,我主要使用的,是后者。

在MacWhisper中,你可以直接下载支持的模型:

强烈推荐使用 Large-v3-turbo,这是OpenAI的开源语音模型,无论是识别准确率,还是速度,都非常赞!

另外,macOS自带的Apple语音识别也能用,但识别率远不如 Large-v3-turbo。

现在,主要的配置选项已经完成,接下来,就可以用它,来将音频、视频转换为文本了。

直接选择一个或多个文件,便会开始转换:

转换后的文本,并没有分段和加标点,所以如果要转成文章,还需要用豆包之类的工具再处理一下。

转换时的内存占用:

我的Air是16G内存,还算够用,会使用约1GB的交换文件。

CPU方面,则完全够用,整个转换过程非常快——甚至比我32GB内存+4060Ti、使用同款模型的Windows电脑快不少。

05 吐槽

总体来说,MacWhisper无论是在功能、准确率、速度和体验方面,都非常完美,但有一点不得不吐槽!你看一下转换的文本,下图红框的内容:

这句话在我的音频内容中,是完全没有的,而是在使用Large-v3-turbo模型在转换过程中生成的,约有20%的概率,会遇到这样的问题。

怀疑是Large-v3-turbo模型在训练时,所使用语料的问题,导致的大模型污染