惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

罗磊的独立博客
大猫的无限游戏
大猫的无限游戏
WordPress大学
WordPress大学
酷 壳 – CoolShell
酷 壳 – CoolShell
T
Tailwind CSS Blog
Engineering at Meta
Engineering at Meta
MongoDB | Blog
MongoDB | Blog
爱范儿
爱范儿
小众软件
小众软件
MyScale Blog
MyScale Blog
美团技术团队
钛媒体:引领未来商业与生活新知
钛媒体:引领未来商业与生活新知
S
SegmentFault 最新的问题
G
Google Developers Blog
Stack Overflow Blog
Stack Overflow Blog
V
V2EX
量子位
云风的 BLOG
云风的 BLOG
A
About on SuperTechFans
阮一峰的网络日志
阮一峰的网络日志
Last Week in AI
Last Week in AI
Martin Fowler
Martin Fowler
C
Check Point Blog
月光博客
月光博客

少数派

派早报:Google 发布 Fitbit Air 等 - 少数派 「新人报到」確認需求,再開始 - 少数派 从 SOLO 独立开发者社区,我看到了越来越多开发者开始做自己的产品 - 少数派 我怎么管理那些"不常做,但总会忘"的生活事项 - 少数派 人形机器人量产元年,数据才是具身智能的“生死线” - 少数派 BuhoLaunchpad 高度还原 Mac 启动台:开发历程与思考 - 少数派 五年陪伴依然不舍,DIY 换壳后让罗技 MX Master 3 继续服役 - 少数派 新玩意 240|少数派的编辑们最近买了啥? - 少数派 一日一技|为什么你应该关闭 iOS 的键盘声音 - 少数派 我做了个插件和 Skills,一键提取任何网站的设计规范 Design.md - 少数派 住在三四线城市的你,该开始录播客了 - 少数派 甘南秘境,大白高国 - 少数派 AI的审美:谁让把我变成川内倫子 - 少数派 返工怎能不烦恼,打工人片单总有一部是你的「嘴替」 - 少数派 为了让「上厕所」更健康,我做了一个小工具 - 少数派 AI + Skill,能够让生成的文章去除 AI 味吗? - 少数派 新玩意|韶音OpenDots ONE 耳夹式耳机 - 少数派 《美满》| 在每一个春天的晚上相爱(362) - 少数派 新玩意|优篮子 PS01 MagSnap 磁吸支架 - 少数派 自我整合手记 | 我开始早睡了:用稳定规则,为自由托底 - 少数派 用龙虾(OpenClaw)两个多月,我最深的12个体会 - 少数派 听歌时间到,12 张你可能错过的 2025 华语乐坛好专辑 - 少数派 承诺能追吗 - 少数派 macOS 26启动台没了? 我做了个不一样的App启动器 - Keboard - 少数派 《四海为家的人》| INTJ对话INTJ(361) - 少数派 你发过的那些黑历史,是时候一次清干净了 - 少数派 新玩意:安安静静玩,越玩越专注:计客密码机 - 少数派 iPad 用户首次体验 Android 平板:vivo Pad6 Pro - 少数派 数据逻辑强 - 少数派 极北行+ | 一路向北,探访日本至北之地 | 001 - 少数派
语音转文字工具--Owl Meeting - 少数派
2026-02-23 · via 少数派

相信很多人已经用过豆包、千问的语音转文本功能了,但是某些人可能因为公司规定等无法使用在线服务解决这类问题。

Owl Meeting 是一款识别、存储等各项功能均运行在本地的语音转文本应用。

主要功能

  1. 支持普通话,中文方言,英语,日语、韩语以及25种欧洲语言。
  2. 边录边识别,支持同时录制麦克风和系统声音。
  3. 识别各类音视频文件。内置工具可处理声道、音频提取等问题。
  4. 无需GPU,CPU模式下,处理30min音频仅需1min(i5-11400H)
  5. 说话人分离,支持为同段音频中的每个人指定不同模型进行识别,以提高准确率。
  6. 强大的文本编辑功能。
    1. 自定义词典。根据词典内容自动对识别文本进行处理。
    2. 支持批量删除、替换,并可同步更新词典。
    3. 点击识别的文本自动播放对应音频,边听边改。
  7. 内置ollama接口,只需几步,即可调用ollama进行文本纠错、翻译、提取摘要等任务。
  8. 支持全局搜索。可以用它来管理音频文件。
  9. 拥有丰富的设置参数,满足各种场景需求。

功能演示

1、我有一段长音频,但是不知道选择哪个模型、使用哪个分段参数进行处理能达到我想要的效果

软件提供测试功能,点击测试按钮会随机截取大约三分钟的音频按设置参数进行处理。如果对识别结果或分段不满意,可以调整参数后再进行识别。

内置测试功能

2、我的音频或视频格式无法直接处理

内置了多声道转单声道和视频提取音频等功能。

音视频工具页面

3、有一个领导口音很重,识别速度快的模型识别不准。

如果启用了说话人分离功能,可以为同段音频中的每个人指定不同的模型进行识别。既要速度又要准确率。

说话人管理界面指定识别模型

4、我们领导只会说粤语,但是我粤语不好,识别结果不是普通话,我看不懂。

以下是使用ollama安装腾讯开源的HY-MT1.5-1.8B模型,对粤语进行纠正的结果。

模型2对于北方各地方言有很好的识别效果,不需要使用ollama进行转换。对于广普、川普等带口音的普通话,也不需要进行二次转换,只需要在词典中添加部分词语即可。以下功能只针对纯方言。

5、我识别的音频片段很多,怎么快速找到我想找的音频?

提供多种筛选方式,可按识别时间、类型、时长、说话人 对历史记录进行筛选。

提供全局搜索,只需要记得只言片语就能找到想要的音频。

历史页面筛选功能
全局搜索功能

6、我电脑配置比较好,我想充分利用本地大模型的能力解决我的问题

内置了ollama接口,提供一键连接ollama、模型管理功能。

内置多种模板,并支持自定义提示词完成各项任务。

对于qwen3:0.6b 或 deepseek-r1:1.5b 这类小模型,是无法完成会议摘要这类具有很长上下文的任务的。小模型仅限对单条文本进行简单处理,比如:翻译、纠错等。

ollama配置和模型管理页面
新建模板界面,可以使用内置模板或自定义prompt

7、我电脑配置很低能用吗?

我用十年前的笔记本神舟K650D做过测试,30min的音频转录完成只需要两分四十五秒(使用模型1,基于时间间隔进行分段)。

下载地址

windows 版本已测试完成上架微软商店,并进行了几轮更新。

Mac 版本还要做一些适配才能发布。

问题反馈

软件右上角有问题反馈按钮,使用过程中有任何问题可联系。