惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

量子位
Stack Overflow Blog
Stack Overflow Blog
人人都是产品经理
人人都是产品经理
The GitHub Blog
The GitHub Blog
Engineering at Meta
Engineering at Meta
Vercel News
Vercel News
奇客Solidot–传递最新科技情报
奇客Solidot–传递最新科技情报
Y
Y Combinator Blog
The Cloudflare Blog
Last Week in AI
Last Week in AI
B
Blog
钛媒体:引领未来商业与生活新知
钛媒体:引领未来商业与生活新知
T
Tailwind CSS Blog
V
Visual Studio Blog
博客园 - 三生石上(FineUI控件)
小众软件
小众软件
Google DeepMind News
Google DeepMind News
D
DataBreaches.Net
博客园 - 司徒正美
B
Blog RSS Feed
Microsoft Azure Blog
Microsoft Azure Blog
罗磊的独立博客
Hugging Face - Blog
Hugging Face - Blog
L
LangChain Blog

少数派

派早报:Google 发布 Fitbit Air 等 - 少数派 「新人报到」確認需求,再開始 - 少数派 从 SOLO 独立开发者社区,我看到了越来越多开发者开始做自己的产品 - 少数派 我怎么管理那些"不常做,但总会忘"的生活事项 - 少数派 人形机器人量产元年,数据才是具身智能的“生死线” - 少数派 BuhoLaunchpad 高度还原 Mac 启动台:开发历程与思考 - 少数派 五年陪伴依然不舍,DIY 换壳后让罗技 MX Master 3 继续服役 - 少数派 新玩意 240|少数派的编辑们最近买了啥? - 少数派 一日一技|为什么你应该关闭 iOS 的键盘声音 - 少数派 我做了个插件和 Skills,一键提取任何网站的设计规范 Design.md - 少数派 住在三四线城市的你,该开始录播客了 - 少数派 甘南秘境,大白高国 - 少数派 AI的审美:谁让把我变成川内倫子 - 少数派 返工怎能不烦恼,打工人片单总有一部是你的「嘴替」 - 少数派 为了让「上厕所」更健康,我做了一个小工具 - 少数派 AI + Skill,能够让生成的文章去除 AI 味吗? - 少数派 新玩意|韶音OpenDots ONE 耳夹式耳机 - 少数派 《美满》| 在每一个春天的晚上相爱(362) - 少数派 新玩意|优篮子 PS01 MagSnap 磁吸支架 - 少数派 自我整合手记 | 我开始早睡了:用稳定规则,为自由托底 - 少数派 用龙虾(OpenClaw)两个多月,我最深的12个体会 - 少数派 听歌时间到,12 张你可能错过的 2025 华语乐坛好专辑 - 少数派 承诺能追吗 - 少数派 macOS 26启动台没了? 我做了个不一样的App启动器 - Keboard - 少数派 《四海为家的人》| INTJ对话INTJ(361) - 少数派 你发过的那些黑历史,是时候一次清干净了 - 少数派 新玩意:安安静静玩,越玩越专注:计客密码机 - 少数派 iPad 用户首次体验 Android 平板:vivo Pad6 Pro - 少数派 数据逻辑强 - 少数派 极北行+ | 一路向北,探访日本至北之地 | 001 - 少数派
语音转文字工具--Owl Meeting - 少数派
2026-02-23 · via 少数派

相信很多人已经用过豆包、千问的语音转文本功能了,但是某些人可能因为公司规定等无法使用在线服务解决这类问题。

Owl Meeting 是一款识别、存储等各项功能均运行在本地的语音转文本应用。

主要功能

  1. 支持普通话,中文方言,英语,日语、韩语以及25种欧洲语言。
  2. 边录边识别,支持同时录制麦克风和系统声音。
  3. 识别各类音视频文件。内置工具可处理声道、音频提取等问题。
  4. 无需GPU,CPU模式下,处理30min音频仅需1min(i5-11400H)
  5. 说话人分离,支持为同段音频中的每个人指定不同模型进行识别,以提高准确率。
  6. 强大的文本编辑功能。
    1. 自定义词典。根据词典内容自动对识别文本进行处理。
    2. 支持批量删除、替换,并可同步更新词典。
    3. 点击识别的文本自动播放对应音频,边听边改。
  7. 内置ollama接口,只需几步,即可调用ollama进行文本纠错、翻译、提取摘要等任务。
  8. 支持全局搜索。可以用它来管理音频文件。
  9. 拥有丰富的设置参数,满足各种场景需求。

功能演示

1、我有一段长音频,但是不知道选择哪个模型、使用哪个分段参数进行处理能达到我想要的效果

软件提供测试功能,点击测试按钮会随机截取大约三分钟的音频按设置参数进行处理。如果对识别结果或分段不满意,可以调整参数后再进行识别。

内置测试功能

2、我的音频或视频格式无法直接处理

内置了多声道转单声道和视频提取音频等功能。

音视频工具页面

3、有一个领导口音很重,识别速度快的模型识别不准。

如果启用了说话人分离功能,可以为同段音频中的每个人指定不同的模型进行识别。既要速度又要准确率。

说话人管理界面指定识别模型

4、我们领导只会说粤语,但是我粤语不好,识别结果不是普通话,我看不懂。

以下是使用ollama安装腾讯开源的HY-MT1.5-1.8B模型,对粤语进行纠正的结果。

模型2对于北方各地方言有很好的识别效果,不需要使用ollama进行转换。对于广普、川普等带口音的普通话,也不需要进行二次转换,只需要在词典中添加部分词语即可。以下功能只针对纯方言。

5、我识别的音频片段很多,怎么快速找到我想找的音频?

提供多种筛选方式,可按识别时间、类型、时长、说话人 对历史记录进行筛选。

提供全局搜索,只需要记得只言片语就能找到想要的音频。

历史页面筛选功能
全局搜索功能

6、我电脑配置比较好,我想充分利用本地大模型的能力解决我的问题

内置了ollama接口,提供一键连接ollama、模型管理功能。

内置多种模板,并支持自定义提示词完成各项任务。

对于qwen3:0.6b 或 deepseek-r1:1.5b 这类小模型,是无法完成会议摘要这类具有很长上下文的任务的。小模型仅限对单条文本进行简单处理,比如:翻译、纠错等。

ollama配置和模型管理页面
新建模板界面,可以使用内置模板或自定义prompt

7、我电脑配置很低能用吗?

我用十年前的笔记本神舟K650D做过测试,30min的音频转录完成只需要两分四十五秒(使用模型1,基于时间间隔进行分段)。

下载地址

windows 版本已测试完成上架微软商店,并进行了几轮更新。

Mac 版本还要做一些适配才能发布。

问题反馈

软件右上角有问题反馈按钮,使用过程中有任何问题可联系。