惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

N
News and Events Feed by Topic
A
About on SuperTechFans
D
DataBreaches.Net
量子位
云风的 BLOG
云风的 BLOG
T
The Blog of Author Tim Ferriss
U
Unit 42
M
MIT News - Artificial intelligence
小众软件
小众软件
博客园 - Franky
GbyAI
GbyAI
OSCHINA 社区最新新闻
OSCHINA 社区最新新闻
Help Net Security
Help Net Security
Recorded Future
Recorded Future
The Last Watchdog
The Last Watchdog
S
Secure Thoughts
S
Security @ Cisco Blogs
MongoDB | Blog
MongoDB | Blog
Exploit-DB.com RSS Feed
Exploit-DB.com RSS Feed
IT之家
IT之家
L
LINUX DO - 热门话题
H
Hacker News: Front Page
V
Vulnerabilities – Threatpost
Security Latest
Security Latest
C
CXSECURITY Database RSS Feed - CXSecurity.com
博客园 - 叶小钗
J
Java Code Geeks
奇客Solidot–传递最新科技情报
奇客Solidot–传递最新科技情报
Hugging Face - Blog
Hugging Face - Blog
PCI Perspectives
PCI Perspectives
Cyberwarzone
Cyberwarzone
S
Schneier on Security
Scott Helme
Scott Helme
Microsoft Security Blog
Microsoft Security Blog
Attack and Defense Labs
Attack and Defense Labs
T
The Exploit Database - CXSecurity.com
C
Cisco Blogs
Y
Y Combinator Blog
D
Darknet – Hacking Tools, Hacker News & Cyber Security
T
Tenable Blog
Google DeepMind News
Google DeepMind News
T
Threat Research - Cisco Blogs
H
Hackread – Cybersecurity News, Data Breaches, AI and More
www.infosecurity-magazine.com
www.infosecurity-magazine.com
V
V2EX
美团技术团队
Cyber Security Advisories - MS-ISAC
Cyber Security Advisories - MS-ISAC
大猫的无限游戏
大猫的无限游戏
freeCodeCamp Programming Tutorials: Python, JavaScript, Git & More
Know Your Adversary
Know Your Adversary

博客园_首页

Plist 二进制格式 Milvus 和 PGVector,哪个更好? OpenClaw 已过时?在 VS Code 中运行 Hermes Agent! 第30篇文章:一个大三计科生的自白 Manim如何在数学公式中完美显示中文? Docker 部署 RocketMQ 5 并发编程核心概念辨析 C#事务处理最佳实践:别再让“主表存了、明细丢了”的破事发生 CLI 是什么?为什么大厂突然集体卷命令行? 【从0到1构建一个ClaudeAgent】协作-自主Agent UIImageView 设置图片不生效的原因排查 最小二乘问题详解20:无先验约束下的增量式SFM自由网平差 痞子衡嵌入式:大话双核i.MXRT1180之XIP应用里借助MU实现可靠Flash IAP的方法 AI Chat 封装, SemanticKerne.AiProvider.Unified 已发布 Windows下右键编辑js文件无法打开记事本——在注册表中使用环境变量 在后台服务中使用 Scoped 服务,为什么总是报错? H200 安装驱动并使用sglang启动模型 wireshark 抓包Trap上报告警内容 我用 AI 辅助开发了一系列小工具(2):图片压缩工具 [A Primer On MC and CC] 2.1 Memory Consistency 1 - 指令重排序和 SC 模型 Oracle数据库SCN推进技术详解与实践指南 玩转控件:封装个带图片的Label控件 Claude Code 4.7 真正该升级的不是模型,而是你的工作流 前端小白一句话,AI 帮我做了个颜值拉满的桌面媒体播放器。当代码不再是门槛,一句话编程就是现实。 5. WorkBuddy: 小龙虾的灵魂三件套,让你的小龙虾不只是工具 SQLite 分片方案实战:三种分片策略的深度对比 告别简陋 UI!一款基于 Fluent Design 和基于 WinUI 的开源免费、现代化的 Avalonia UI 控件库 关于二进制排列组合枚举的总结 AI开发-python-LangGraph框架(3-27-LangGraph从零实现大模型智能决策工作流) ElasticSearch主分片和副本分片概念详解 【002】HTTPS 粗解:证书、TLS 握手与对后端配置的影响 Hermes Agent 一周暴涨五万 Star,但我劝你别急着追 明明连接的是Redis的DB0,为什么能查到DB3的数据? 【从0到1构建一个ClaudeAgent】协作-Agent团队 熟悉电子元器件之后,电子小白下一步该怎么走? MAF快速入门(23)通过C#类定义Skills .NET 高级开发 | 手写一个对象映射框架 FastAPI数据库ORM怎么选?我肝了三个Demo后,终于不再纠结了 mysqldump 参数拾遗:在遗忘与铭记之间 C# .NET 周刊|2026年3月5期 Claude code入门 - 陈彦斌 一文学习入门 ThingsBoard 开源物联网平台 GitHub 热门项目 | 2026年04月16日 如何为GIT设置全局勾子,为每次提交追加信息 Number.isFinite和isFinite与isNaN()和Number.isNaN的区别 PortSwigger SQL注入LAB2 推荐一个测试人必备的Skills,从功能到性能全搞定(附详细实操和安装下载方式) 筑基期:掌握Odoo基础核心知识点02(Odoo XML 开发方式详解) GLM模型这么火,咱们用vllm也咧一个呗! 深入理解 AbortController:从底层原理到跨语言设计哲学 字符串学习笔记 多租户系统框架的基础模块设计和分析设计 Apache SeaTunnel Zeta 为什么能做到“又快又稳”? AI开发-python-LangGraph框架(3-26-LangGraph基本概念及第一个简单样例) Vue 3 组件通信,别只会用 Props 和 Emits 了,这几个狠活儿你得看看 ElasticSearch7.X版本配置密码 用Manim实现动态交点计算--从一个动点问题说起 团结引擎+Addressable+Instant Game打包抖音小游戏 function call 实战:让 LLM 自动判断 pod 异常、调用日志工具并完成故障分析 bubseek —— 让 Agent 的足迹,变成团队的洞察 通过 C# 读取并导出 PDF 书签 如何用 GitHub Actions 实现 Steam 自动化发布 【从0到1构建一个ClaudeAgent】并发-后台任务 .NET 高级开发 | 定制 ASP.NET Core 框架 电子小白:什么是运算放大器(运放) zero2Agent:面向大厂面试的 Agent 工程教程,从概念到生产的完整学习路线 堆上的ORW HC32F460 USB CDC通信异常:非对齐访问异常排查 20260413-Hyperbridge 攻击事件:发生在默克尔山上的验证绕过 那些喊着AI 要淘汰你的人,正在靠你的焦虑赚大钱! 深度学习进阶(八)Swin Transformer 最小二乘问题详解19:带先验约束的增量式SFM优化与实现 SnapTranslate 3.0 正式发布:全局划词翻译 + 完整英语学习闭环,一站式搞定查词、记词、复习 工作的意义、工作的困难认知再思考 .NET + AI 进阶实战:基于类的技能开发 - 打造可治理的 Agent 能力模块 【从0到1构建一个ClaudeAgent】规划与协调-技能 上周热点回顾(4.6-4.12) 电子小白的工具三件套:面包板、杜邦线、万能板 单表五亿数据的查询优化 | Mysql、StarRocks 2. WorkBuddy:从“我是谁”到“帮我干活” C# 如何减少代码运行时间:7 个实战技巧 基于HelixToolkit.SharpDX 渲染3D模型 - 笺上知微 从零开始的双臂具身VLA起源及现阶段发展综述 - SkyXZ 记对 xonsh shell 的使用, 脚本编写, 迁移及调优 - pluvium27 受够了Vibe Coding的失控?换个起点,让AI事半功倍 从开始配置漏洞环境到漏洞复现流程 - 難しい 关于10年工作经验的程序员对OpenClaw的实战经验分享以及看法 - 虚无境 Any metadata 的内存布局 C# .NET 周刊|2026年3月2期 - InCerry 我帮你测过了,测试圈排名第二的 Skill 依然很牛逼 Skill Discovery | 无监督技能发现的经典工作总结 - MoonOut 上下文工程是什么?过时了么?一文讲明白! - 一枫说码 开了 TUN 模式还是直连?90% 的人都踩过这个坑 AScript扩展多种脚本语言 - rockey627 AI 学习笔记:Agent 的记忆机制 你能被装进一个文件里吗?——7 万人把同事"蒸馏"成了 AI - 我没有三颗心脏 Claude Code 通关手册(七):给 AI 装上技能包——Skills 完全指南 - 暮色之狐 在浏览器中快速编辑代码:VSCode Web 集成实践 - Newbe36524 蒸馏自己 skill?基于 Deepseek 的蒸馏器,丐版蒸馏方式,简单便捷 - To_Carpe_Diem Spring AI Aliababa和AgentScope,哪个更好? - 苏三说技术
小落同学:可用十年前老笔记本纯CPU跑的全套虚拟人方案
程序员老奥 · 2026-05-04 · via 博客园_首页

一、前言

半个多月前,计划着给我的小落同学做个改版,当时的目标是在一张消费级3060的GPU上跑全套虚拟人ASR+TTS+3DAvatar

当时是计划着搞一台电脑,再去买一张3060的GPU,然后在上面跑全套的KWS+ASR+TTS+3DAvatar,但是后来想想现在去买3060实在有点过时,而如果要买新的50系列的卡呢又实在太贵,犹豫了几天后啥也没买,然后五一假期就到了。

于是,没办法,我只能继续在我这台10年前的老笔记本上折腾。
于是,整个五一我就门也没出,一个人在家折腾这个东西了。
于是,经过几天的折腾,现在终于有一个基础版本了。

市面上各种虚拟人方案多如牛毛,但是基本上清一色都需要GPU,咱买不起带GPU的电脑,所以自己手挫了这么一个方案。

简单汇总一下小落同学的优点如下:

  1. 免费、开源的纯CPU跑的数字人应用,无需任何的GPU。在99元/年的2H2G阿里云ECS即可支持部署运行(文本模式),十年前的老电脑可以跑全音频交互。
  2. 绿色免安装包,下载解压即可直接使用。无需Python环境,无需各种环境依赖,无需各种ASR/TTS/KWS/LLM/Embedding模型的下载与安装。
  3. 整个安装包仅830M,解压后约1.6G, 相比其他方案占用空间极小(同样对CPU/内存的要求也极小化)。
  4. 支持完全本机离线部署运行, 杜绝任何个人数据的外泄(需自行安装Ollama,并下载安装LLM模型)。

二、先看效果

不废话,先直接看效果。简单录了两个视频, 一个是纯文本交互模式的, 另一个是全语音交互模式。

1. 在99元/年的2H2G阿里云ECS上跑产品知识问答(文本交互)

https://www.bilibili.com/video/BV1htRvBWEfM

cover-image-for-yay-company-rag-demo

2. 十年前老笔记本(无GPU)上可跑全套语音交互,稍卡

https://www.bilibili.com/video/BV1xfReBVEQr

auto-voice-voices-speed-and-background

三、下载安装

1. 从github代码仓库下载

仓库地址:https://github.com/oddmeta/yay

克隆代码

git clone https://github.com/oddmeta/yay

安装依赖

cd metayay
pip install -r requirements.txt

运行服务

daphne -b 0.0.0.0 -p 8000 xiaoluo.asgi:application

2. Windows绿色免安装包

无需安装python环境,无法安装依赖包/下载安装模型等繁杂的操作,解压缩后即可直接运行,使用的是硅基流动的免费API。
私信:MetaYAY,即可获取。

  • 下载绿色免安装包。压缩包828M,解压后需要至少1.6G的空间
  • 解压缩到某一个目录下。如:d:\metayay
  • 进入该目录,找到里面的start.bat,双击运行。
  • 在浏览器中打开网址: http://localhost:8000
  • 测试你要的各项功能。

green-version-no-python-env-required

四、进阶玩法

1. 完全本地运行(可断网运行)

若要完全本地运行,需自行下载ollama,并下载模型,然后修改根目录下的环境变量配置文件.env,将模型切换为本地的ollama,然后关闭运行中的metayay,再双击start.bat重新运行。

  • 下载安装ollama

自行搜索教程。

  • 下载模型

根据你自己的硬件配置,下载不同尺寸的模型,具体什么模型适合你的硬件,可以把自己的硬件输入进去,问一下千问、豆包、Deepseek。

  • 修改大模型配置

打开.env文件,将下面的三个变量设置成下面这样:

LLM模型:

GPT_URL=http://127.0.0.1:11434/v1
GPT_MODEL=qwen3:4b-instruct-2507-q4_K_M
GPT_API_KEY=your_api_key

Embedding模型:

EMBEDDING_MODEL_URL=http://127.0.0.1:11434
EMBEDDING_MODEL_TYPE=ollama
EMBEDDING_MODEL=zailiang/bge-large-zh-v1.5
EMBEDDING_API_KEY=your_embedding_model_api_key

注:若有多个设置,最终实际生效的是最下面的一个。

  • 重启YAY

若已有启动YAY,先关闭,然后再双击 start.bat 重新启动。

  • 测试验证

浏览器打开:http://localhost:8000 ,测试验证。

2. 更新你自己的知识库

1)偷懒的办法

直接修改现有角色的知识库。

(1) 修改角色信息

打开根目录下的xiaoluo_config.py,找到角色配置,将其中的角色名name、唤醒词 wakeup、问候语 greeting_message、提示词 system_prompt等 改成你自己的。

            "id": 1,
            "name": "落鹤生",
            "keywords": ["落鹤生", "数字记忆体", "数字分身", "人生故事"],
            "wakeup": ["n ǐ h ǎo x iǎo l uò @你好小落", "x iǎo l uò x iǎo l uò @小落小落", "n ǐ h ǎo x iǎo k ě @你好小科", "x iǎo k ě x iǎo k ě @小科小科", "l uò h è sh ěng @落鹤生"], 
            "greeting_message": "我是落鹤生。这是我的数字记忆体和数字分身,将永久存储我的人生故事",
            "description": "你是我的数字记忆体和数字分身,将永久存储我的人生故事",
            "knowledge": "engine/oddllm_rag/informations_about_jacky.csv",
            "faiss_index_path": "engine/oddllm_rag/informations_about_jacky.faiss",

            "live2d_model": "/static/live2d/models/chang_an/index.json",
            "background_image": "/media/background/HIT.png",
            "model_avatar": "/media/live2d/avatars/chang_an.png",

            "notification": True,
            "notifier_config": "provider: wechatworkbot\nkey: 9ff5a0b3-9154-4917-a1c3-bf9aae1ebad4",

            "system_prompt": """你是一个有知识的数字记忆体和数字分身,将永久存储落鹤生的人生故事
请根据以下检索到的关于落鹤生的信息,回答用户关于落鹤生的问题。
如果检索到的数据中没有相关信息,请回答"要不您问点别的?"。

落鹤生的信息:
{context}

问题:
{question}

你需要根据上述个人信息,结合你的记忆来回答对方的问题,你需要用中文回答。
你的响应应该是第一人称的,简短的,包含不超过3句,每句不超过20个单词。
若问题与时间相关,请注意当前时间是{current_time}""",
(2) 修改知识库

打开配置文件中指定的knowledge的文件:engine/oddllm_rag/informations_about_jacky.csv
然后将你自己的数据、信息在这个文件里填写进去。

2)完整的办法

完整的办法,需要有一定的python基础,代码我都放在那里了,自己照着代码去修改即可。

五、改版重点介绍

本次改版,主要是考虑到不同的硬件配置,支持了三种不同的对话模式。

1. 硬件管够

如:自部署硬件。支持双向语音对话。语音唤醒,唤醒后直接语音对话,语音送到后端转写成文本,再送大模型,大模型响应文本TTS语音合成后再发回前端。

2. 硬件勉强

如:我的十年前老笔记本。语音输入,文本输出,不做TTS语音合成播报。如果你用双向语音对话模式运行,在运行过程中,发现卡顿或者延时大,建议关闭语音合成。在前端的Web界面的左上角有一个喇叭,点那个喇叭即可切换语音合成的开启与关闭。默认情况下,不开启语音合成播报。

3. 超低配硬件

如:我的68元一年的阿里云ECS,只有2C2G的配置,只支持文本对话。

对话模式在后端的配置文件中进行配置,修改配置后重启后端服务生效。前端连接上后端后,从后端获取模式设定,并自动调整界面上相关的组件及逻辑。

此外对话过程中发现若是时延较大,需要确认时延产生在什么地方,要么是大模型的时延,要么是ASR/TTS的时延,通常情况下建议先关闭自动语音播报。
若是发现卡顿,建议直接关闭自动语音播报。
前端左上角的那个喇叭就是切换自动语音播报的。

六、基础功能模块说明

1. ASR语音转写

基础的功能使用的是我的OddAsr项目(开源在 https://github.com/oddmeta/oddasr ),但是考虑到要在我自己的这台10年前老笔记本上运行整套功能,所以在这个版本里我用的是8bit量化后的SenseVoice的模型,加Silero VAD模型。

需要注意的是:这个版本的 SenseVoice 模型不支持热词/上下文偏置功能(只有 Transducer 类型的模型才支持 hotwords 参数),因此在一些非常见的词语的识别上可能效果不是很好,但为了能省CPU资源,我忍了。

2. TTS语音合成

同ASR功能,TTS的基础功能也用的是我早就开源出来的OddTTS项目(开源在 https://github.com/oddmeta/oddtts )。使用的模型是我3月底新整合的Kokoro,支持中英混合,但是也是8bit量化后的模型(同样为了省资源)。当前这个模型相比于OddTTS中使用的标准版本Kokoro模型,存在一个问题就是加了中英混合后,在分词器做分词后,那些阿拉伯数字会优化去匹配英文字典,导致阿拉伯数字合成出来的都是英文的。这个我后面再来搞一搞。

3. KWS语音唤醒

使用的基础版本的KeywordSpotter,简单、好用,也无需训练,基础功能的唤醒率、误唤醒率指标也都还可以。唤醒的指标跟你所使用的唤醒词也是有很大的关系的,一个设计良好的唤醒词,可以顶过花N多Money训练过的唤醒模型

4. LLM大模型

我自己在本地用的是 Ollama + qwen3:4b-instruct-2507-q4_K_M 的大模型,以及bge-large-zh-v1.5的embedding模型。在阿里云ECS上 ( https://x.oddmeta.net )则用的硅基流动的白嫖的大模型Qwen3-8Bbge-large-zh-v1.5

5. RAG知识库

支持两种模式。

  • Ollama纯本地运行模式
  • 远端OpenAI标准API接口模式

七、注意事项

1. 修改大模型的API及Key

为方便大家体验功能,目前版本里我给带了一个我自己在硅基流动上申请的免费的API Key,建议大家也可以去注册一个账号,然后那上面的免费白嫖的API(有请求数、Token数的限制),若注册账号可以考虑用一下我的推荐码:HDmQf3iQ,让我可以白嫖点他们的代金券。注册地址:https://cloud.siliconflow.cn/i/HDmQf3iQ

2. 数据安全问题

小落同学的目标是复刻一个数字版本的自己,在这个目标里有许多信息都是私人的,不方便公开给所有人来问答。但是为了方便演示,在阿里云版本里暂时开放了不需要登录也可检索知识库文档(不适用于我自用的落鹤生角色,因为该角色的知识库里有许多我个人的信息)。当然如果你跟我一样,目标也是在自己本地电脑运行的话,数据安全完全不是问题。

3. 公有云免费API限制

目前在我的阿里云ECS上跑的小落同学用的是硅基流动的免费API,主模型用的是Qwen3-8B,embedding模型用的是bge-large-zh-v1.5。而硅基流动免费白嫖的embedding模型最多只支持512 token的查询,因此若查询的内容若超512 token则很容易报错(我已尝试过用多种方式来绕过这个限制,包括分片,限内容,强制切割等等,但是不幸还是不能稳定绕过)。

siliconflow-free-embedding-model-limits

我在我笔记本上本地跑的是Ollama+qwen3:4b-instruct-2507-q4_K_M ,限于硬件配置,模型很小,所以有点笨,但由于我自己的需求是复刻一个数字版本的自己,类似角色养成,因此整个重点是要收集每天自己的一些经历、思考、心情等等数据,重要的只是这些数字,其它的包括模型、代码、功能都是浮云,都是完全没有价值的,可以慢慢搞。

4. Live2D角色

Demo里使用的Live2D角色是从网上下载下来的,不可商用。若有商用需求的话,请自行制作或者购买Live2D角色。

5. 语音合成中英混合问题

默认的语音合成功能使用的是Kokoro的模式,当前的中英混合语音合成已知存在一个问题,目前是英文优先,有待调整和修改。

6. 背景图设置

上个版本的小落同学里,有好几个同学说希望加一个背景图,以便让这个虚拟人以及整个场景看上去更专业一些,因此特地手搓了个背景设置的功能。

八、广而告之

关注公众号:奥德元

一起学习AI,一起追赶时代!

新建了一个AI技术交流群,欢迎大家一起加入讨论。
扫码加入AI技术交流群(微信)
若需联系作者,请加微信:oddmeta