惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

雷峰网
雷峰网
宝玉的分享
宝玉的分享
量子位
博客园 - Franky
The Cloudflare Blog
博客园 - 【当耐特】
Jina AI
Jina AI
Google DeepMind News
Google DeepMind News
WordPress大学
WordPress大学
Microsoft Security Blog
Microsoft Security Blog
博客园 - 叶小钗
OSCHINA 社区最新新闻
OSCHINA 社区最新新闻
罗磊的独立博客
V
V2EX
MongoDB | Blog
MongoDB | Blog
让小产品的独立变现更简单 - ezindie.com
让小产品的独立变现更简单 - ezindie.com
H
Help Net Security
博客园 - 聂微东
F
Fortinet All Blogs
GbyAI
GbyAI
奇客Solidot–传递最新科技情报
奇客Solidot–传递最新科技情报
Stack Overflow Blog
Stack Overflow Blog
博客园_首页
人人都是产品经理
人人都是产品经理

博客园 - PetterLiu

OpenReel开源项目 OpenConnector 技术白皮书 汽车行业高效办公AI实践案例集 微软开源Flint语义驱动的图表项目 工业互联网零信任安全应用进展与挑战 开发思维导论:从大白话创意到AI全自动执行 从微服务到 Agent:我们到底在焦虑什么? Drain3与LogParser-LLM技术优劣势及适用场景对比 人机协作的工程化进化路线与落地案例 长视频如何实现信息压缩与细节 AI 站点可靠性工程 (SRE) Agent 苹果公司"中国+1"布局的逻辑重塑与风险对冲 训练 Agent 最怕什么?不是模型笨,是环境烂。 大语言模型自我验证机制与环境鲁棒性前沿技术研究报告 全球软件产业智能化范式转移与商业价值重构研究报告 基于AJ-Bench智能体自我验证场景案 物业行业 AI 落地避坑指南 AI 驱动的视频内容自动化创作框架ShortGPT 2026年6月份个人回顾 Skill不是长Prompt:如何写出工业级 Skill AI 驱动下的上下文治理与管理范式革命 为什么 FDE 正在成为商业落地的唯一解药 《不懂人性,就别做管理》:软件研发管理的核心洞察解读 四周实现非母语教学APP Agent Mail 产品介绍与 Trae Solo Agent 实测 AI时代团队效能的非线性陷阱与组织重构升级 AI落地三大误区与组织提效路径 AI工程化人才的角色演变与组织冲击 揭秘AI搜索时代的"GEO全链路技能库" AI领域值得关注的人与机构
小米XiaoMiTTS-Local-Skill
PetterLiu · 2026-06-12 · via 博客园 - PetterLiu

小米XiaoMi-TTS-Local-Skill

背景

1. 传统TTS的级联式架构

  • 典型流程:文本规范化 → G2P(音素转换) → 声学建模 → 声码器生成
  • 局限性:误差在各环节累积,难以捕捉复杂语义关系
  • 代表技术:Tacotron+WaveNet、FastSpeech系列等

2. 基于LLM的TTS的语义驱动架构

  • 核心创新:将大语言模型作为"语音意图解码器",形成"文本→语义意图→声学特征"的闭环
  • 典型架构:
    • 文本预处理:分词+韵律预测+音素转换
    • 语义-声学建模:结合LLM上下文理解生成梅尔频谱
    • 情感控制器:注入情绪标签与强度参数
    • 声码器:HiFi-GAN还原为高保真波形音频

配置

以Trae IDE/Agent工具为例,配置好Skill如何目录,在scripts目录放入可以执行文件,注意这个版本是

windows 64版本从这儿下载EXE文件

https://gitee.com/Megadotnet/XiaomiTTS/releases/

需要从源码打包也可以,  项目已开源

dotnet publish -c Release -r win-x64 --self-contained true /p:PublishSingleFile=true /p:IncludeNativeLibrariesForSelfExtract=true

目录结构

├─.trae

│ └─skills

│ └─xiaomi-local-tts

│ │ SKILL.md

│ │

│ └─scripts

│ XiaomiTTS.exe

在环境变量MIMO_API_KEY配置好APIKEY

Skills

从互联网下载

https://skillhub.cn/skills/xiaomi-local-tts

测试

我们看到已经自动调用Skill, 当前使用的是Kimi2-0902模型,不需要太新LLM模型

clipboard

已生成音频文件

clipboard

  • 传统TTS:
    • 需为每个角色单独训练模型,成本高
    • 音色固定,难以适配不同角色或风格需求
    • 无法根据上下文保持语气一致性
  • 基于LLM的TTS:
    • 通过文本提示(prompt)即时切换角色声线与性格,无需重训
    • 支持3秒音色克隆,快速学习说话人音色和习惯
    • 在角色一致性测试中,92%用户认为其"像真人开口",远超传统TTS的58-73%


功能特性

  • 使用 mimo-v2.5-tts 模型进行高质量语音合成
  • 支持 非流式流式(SSE) 两种调用模式
  • 流式模式实时接收音频数据块,适合长文本合成
  • 自动生成标准 WAV 音频文件(24kHz / 16-bit / 单声道)
  • 批量处理 — 一键将整个目录的文本文件转换为音频
  • Native AOT 编译支持,生成零依赖单文件可执行程序(约 5.6 MB)
  • 实时进度显示,每秒更新合成进度
  • 基于 Serilog 的结构化日志系统,支持多输出目标
  • 完整的异常处理、错误日志输出与优雅的错误报告
  • 依赖注入架构,遵循 .NET Generic Host 设计模式
  • 基于环境的配置管理,支持热重载

结论

    随着大语言模型与语音技术的深度融合,基于LLM的TTS正在推动语音合成从"机械发声"向"情感传递"的质变,为内容创作、智能硬件和无障碍服务等领域带来革命性变化。通过skill调用已集成的TTS API,开发者能够快速构建具备情感化、个性化语音交互能力的应用,不仅大幅降低技术门槛和开发成本,更能借助专业语音技术团队的持续优化,让应用始终保持行业领先的语音交互体验。这种"技术能力即服务"的模式,正在成为智能应用开发的新标准,让开发者能够专注于核心业务创新,而非底层技术实现。