惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

N
Netflix TechBlog - Medium
IT之家
IT之家
博客园_首页
Hugging Face - Blog
Hugging Face - Blog
钛媒体:引领未来商业与生活新知
钛媒体:引领未来商业与生活新知
美团技术团队
小众软件
小众软件
博客园 - 叶小钗
WordPress大学
WordPress大学
OSCHINA 社区最新新闻
OSCHINA 社区最新新闻
博客园 - 三生石上(FineUI控件)
罗磊的独立博客
博客园 - Franky
freeCodeCamp Programming Tutorials: Python, JavaScript, Git & More
Last Week in AI
Last Week in AI
奇客Solidot–传递最新科技情报
奇客Solidot–传递最新科技情报
有赞技术团队
有赞技术团队
T
Tailwind CSS Blog
宝玉的分享
宝玉的分享
博客园 - 【当耐特】
月光博客
月光博客
Cyber Security Advisories - MS-ISAC
Cyber Security Advisories - MS-ISAC
酷 壳 – CoolShell
酷 壳 – CoolShell
人人都是产品经理
人人都是产品经理

Recent Commits to openclaw:main

test: merge chat side-result checks · openclaw/openclaw@ddd2c2a test: merge cron history checks · openclaw/openclaw@f7eb746 test: merge responsive navigation shell checks · openclaw/openclaw@c2e4b47 docs(changelog): add codex oauth fixes · openclaw/openclaw@628e6cd test: merge navigation routing cases · openclaw/openclaw@5d8cecb Tests: mock channel registry bundled fallback · openclaw/openclaw@2b08233 Secrets: avoid broad web search discovery for single plugin config · openclaw/openclaw@a464f59 test: merge config view browser checks · openclaw/openclaw@20cf511 fix(status): align oauth health with runtime · openclaw/openclaw@eed7116 feat: add macOS screen snapshots for monitor preview (#67954) thanks … · openclaw/openclaw@f377db1 fix: report shared auth scopes in hello-ok (#67810) thanks @BunsDev · openclaw/openclaw@0b6c39b Auto-reply: avoid eager bundled route fallback · openclaw/openclaw@3ea1bf4 Tests: narrow session binding contract setup · openclaw/openclaw@54e4e16 fix(macOS): enable undo/redo in webchat composer text input (#34962) · openclaw/openclaw@00951dc Tests: speed up channel setup promotion · openclaw/openclaw@82b529a Docs: refresh agent instructions · openclaw/openclaw@5775fe2 fix(auth): serialize OAuth refresh across agents to fix #26322 (#67876) · openclaw/openclaw@8e79080 test: allow ollama public surface boundary test · openclaw/openclaw@7d4f1a6 Docs: add test performance guardrails · openclaw/openclaw@89706d3 Tests: restore context-engine usage proof · openclaw/openclaw@e4c4f95 Tests: slim context engine runtime coverage · openclaw/openclaw@74c198f ci: retry failed custom checkouts · openclaw/openclaw@0ee5baf test: trim duplicate provider auth onboarding cases · openclaw/openclaw@1ffc02e matrix: fix sessions_spawn --thread subagent session spawning (#67643) · openclaw/openclaw@1ce2596 test: reduce auth choice fixture churn · openclaw/openclaw@857b9cd test: mock health status config boundaries · openclaw/openclaw@9d5ab4a test: mock onboard config io boundary · openclaw/openclaw@299694d test: mock legacy state plugin boundaries · openclaw/openclaw@2713089 test: mock channel install boundaries · openclaw/openclaw@b945248 test: mock doctor preview channel boundaries · openclaw/openclaw@b1a3ad4
feat(tts): add xiaomi mimo speech provider · openclaw/ope...
steipete · 2026-04-25 · via Recent Commits to openclaw:main

@@ -7,7 +7,7 @@ read_when:

77

title: "Text-to-speech"

88

---

9910-

OpenClaw can convert outbound replies into audio using ElevenLabs, Google Gemini, Gradium, Microsoft, MiniMax, OpenAI, Vydra, or xAI.

10+

OpenClaw can convert outbound replies into audio using ElevenLabs, Google Gemini, Gradium, Microsoft, MiniMax, OpenAI, Vydra, xAI, or Xiaomi MiMo.

1111

It works anywhere OpenClaw can send audio.

12121313

## Supported services

@@ -20,6 +20,7 @@ It works anywhere OpenClaw can send audio.

2020

- **OpenAI** (primary or fallback provider; also used for summaries)

2121

- **Vydra** (primary or fallback provider; shared image, video, and speech provider)

2222

- **xAI** (primary or fallback provider; uses the xAI TTS API)

23+

- **Xiaomi MiMo** (primary or fallback provider; uses MiMo TTS through Xiaomi chat completions)

23242425

### Microsoft speech notes

2526

@@ -36,7 +37,7 @@ or ElevenLabs.

36373738

## Optional keys

383939-

If you want OpenAI, ElevenLabs, Google Gemini, Gradium, MiniMax, Vydra, or xAI:

40+

If you want OpenAI, ElevenLabs, Google Gemini, Gradium, MiniMax, Vydra, xAI, or Xiaomi MiMo:

40414142

- `ELEVENLABS_API_KEY` (or `XI_API_KEY`)

4243

- `GEMINI_API_KEY` (or `GOOGLE_API_KEY`)

@@ -45,6 +46,7 @@ If you want OpenAI, ElevenLabs, Google Gemini, Gradium, MiniMax, Vydra, or xAI:

4546

- `OPENAI_API_KEY`

4647

- `VYDRA_API_KEY`

4748

- `XAI_API_KEY`

49+

- `XIAOMI_API_KEY`

48504951

Microsoft speech does **not** require an API key.

5052

@@ -60,6 +62,7 @@ so that provider must also be authenticated if you enable summaries.

6062

- [ElevenLabs Authentication](https://elevenlabs.io/docs/api-reference/authentication)

6163

- [Gradium](/providers/gradium)

6264

- [MiniMax T2A v2 API](https://platform.minimaxi.com/document/T2A%20V2)

65+

- [Xiaomi MiMo speech synthesis](/providers/xiaomi#text-to-speech)

6366

- [node-edge-tts](https://github.com/SchneeHertz/node-edge-tts)

6467

- [Microsoft Speech output formats](https://learn.microsoft.com/azure/ai-services/speech-service/rest-text-to-speech#audio-outputs)

6568

- [xAI Text to Speech](https://docs.x.ai/developers/rest-api-reference/inference/voice#text-to-speech-rest)

@@ -231,6 +234,34 @@ Resolution order is `messages.tts.providers.xai.apiKey` -> `XAI_API_KEY`.

231234

Current live voices are `ara`, `eve`, `leo`, `rex`, `sal`, and `una`; `eve` is

232235

the default. `language` accepts a BCP-47 tag or `auto`.

233236237+

### Xiaomi MiMo primary

238+239+

```json5

240+

{

241+

messages: {

242+

tts: {

243+

auto: "always",

244+

provider: "xiaomi",

245+

providers: {

246+

xiaomi: {

247+

apiKey: "xiaomi_api_key",

248+

baseUrl: "https://api.xiaomimimo.com/v1",

249+

model: "mimo-v2.5-tts",

250+

voice: "mimo_default",

251+

format: "mp3",

252+

style: "Bright, natural, conversational tone.",

253+

},

254+

},

255+

},

256+

},

257+

}

258+

```

259+260+

Xiaomi MiMo TTS uses the same `XIAOMI_API_KEY` path as the bundled Xiaomi model

261+

provider. The speech provider id is `xiaomi`; `mimo` is accepted as an alias.

262+

The target text is sent as the assistant message, matching Xiaomi's TTS

263+

contract. Optional `style` is sent as a user instruction and is not spoken.

264+234265

### OpenRouter primary

235266236267

```json5

@@ -345,7 +376,7 @@ Then run:

345376

- `tagged` only sends audio when the reply includes `[[tts:key=value]]` directives or a `[[tts:text]]...[[/tts:text]]` block.

346377

- `enabled`: legacy toggle (doctor migrates this to `auto`).

347378

- `mode`: `"final"` (default) or `"all"` (includes tool/block replies).

348-

- `provider`: speech provider id such as `"elevenlabs"`, `"google"`, `"gradium"`, `"microsoft"`, `"minimax"`, `"openai"`, `"vydra"`, or `"xai"` (fallback is automatic).

379+

- `provider`: speech provider id such as `"elevenlabs"`, `"google"`, `"gradium"`, `"microsoft"`, `"minimax"`, `"openai"`, `"vydra"`, `"xai"`, or `"xiaomi"` (fallback is automatic).

349380

- If `provider` is **unset**, OpenClaw uses the first configured speech provider in registry auto-select order.

350381

- Legacy `provider: "edge"` config is repaired by `openclaw doctor --fix` and

351382

rewritten to `provider: "microsoft"`.

@@ -359,7 +390,7 @@ Then run:

359390

- `maxTextLength`: hard cap for TTS input (chars). `/tts audio` fails if exceeded.

360391

- `timeoutMs`: request timeout (ms).

361392

- `prefsPath`: override the local prefs JSON path (provider/limit/summary).

362-

- `apiKey` values fall back to env vars (`ELEVENLABS_API_KEY`/`XI_API_KEY`, `GEMINI_API_KEY`/`GOOGLE_API_KEY`, `GRADIUM_API_KEY`, `MINIMAX_API_KEY`, `OPENAI_API_KEY`, `VYDRA_API_KEY`, `XAI_API_KEY`).

393+

- `apiKey` values fall back to env vars (`ELEVENLABS_API_KEY`/`XI_API_KEY`, `GEMINI_API_KEY`/`GOOGLE_API_KEY`, `GRADIUM_API_KEY`, `MINIMAX_API_KEY`, `OPENAI_API_KEY`, `VYDRA_API_KEY`, `XAI_API_KEY`, `XIAOMI_API_KEY`).

363394

- `providers.elevenlabs.baseUrl`: override ElevenLabs API base URL.

364395

- `providers.openai.baseUrl`: override the OpenAI TTS endpoint.

365396

- Resolution order: `messages.tts.providers.openai.baseUrl` -> `OPENAI_TTS_BASE_URL` -> `https://api.openai.com/v1`

@@ -391,6 +422,12 @@ Then run:

391422

- `providers.xai.language`: BCP-47 language code or `auto` (default `en`).

392423

- `providers.xai.responseFormat`: `mp3`, `wav`, `pcm`, `mulaw`, or `alaw` (default `mp3`).

393424

- `providers.xai.speed`: provider-native speed override.

425+

- `providers.xiaomi.apiKey`: Xiaomi MiMo API key (env: `XIAOMI_API_KEY`).

426+

- `providers.xiaomi.baseUrl`: override the Xiaomi MiMo API base URL (default `https://api.xiaomimimo.com/v1`, env: `XIAOMI_BASE_URL`).

427+

- `providers.xiaomi.model`: TTS model (default `mimo-v2.5-tts`, env: `XIAOMI_TTS_MODEL`; `mimo-v2-tts` is also supported).

428+

- `providers.xiaomi.voice`: MiMo voice id (default `mimo_default`, env: `XIAOMI_TTS_VOICE`).

429+

- `providers.xiaomi.format`: `mp3` or `wav` (default `mp3`, env: `XIAOMI_TTS_FORMAT`).

430+

- `providers.xiaomi.style`: optional natural-language style instruction sent as the user message; it is not spoken.

394431

- `providers.openrouter.apiKey`: OpenRouter API key (env: `OPENROUTER_API_KEY`; can reuse `models.providers.openrouter.apiKey`).

395432

- `providers.openrouter.baseUrl`: override the OpenRouter TTS base URL (default `https://openrouter.ai/api/v1`; legacy `https://openrouter.ai/v1` is normalized).

396433

- `providers.openrouter.model`: OpenRouter TTS model id (default `hexgrad/kokoro-82m`; `modelId` is also accepted).

@@ -432,9 +469,9 @@ Here you go.

432469433470

Available directive keys (when enabled):

434471435-

- `provider` (registered speech provider id, for example `openai`, `elevenlabs`, `google`, `gradium`, `minimax`, `microsoft`, `vydra`, or `xai`; requires `allowProvider: true`)

436-

- `voice` (OpenAI or Gradium voice), `voiceName` / `voice_name` / `google_voice` (Google voice), or `voiceId` (ElevenLabs / Gradium / MiniMax / xAI)

437-

- `model` (OpenAI TTS model, ElevenLabs model id, or MiniMax model) or `google_model` (Google TTS model)

472+

- `provider` (registered speech provider id, for example `openai`, `elevenlabs`, `google`, `gradium`, `minimax`, `microsoft`, `vydra`, `xai`, or `xiaomi`; requires `allowProvider: true`)

473+

- `voice` (OpenAI, Gradium, or Xiaomi voice), `voiceName` / `voice_name` / `google_voice` (Google voice), or `voiceId` (ElevenLabs / Gradium / MiniMax / xAI)

474+

- `model` (OpenAI TTS model, ElevenLabs model id, MiniMax model, or Xiaomi MiMo TTS model) or `google_model` (Google TTS model)

438475

- `stability`, `similarityBoost`, `style`, `speed`, `useSpeakerBoost`

439476

- `vol` / `volume` (MiniMax volume, 0-10)

440477

- `pitch` (MiniMax integer pitch, -12 to 12; fractional values are truncated before the MiniMax request)

@@ -498,6 +535,7 @@ These override `messages.tts.*` for that host.

498535

- **Other channels**: MP3 (`mp3_44100_128` from ElevenLabs, `mp3` from OpenAI).

499536

- 44.1kHz / 128kbps is the default balance for speech clarity.

500537

- **MiniMax**: MP3 (`speech-2.8-hd` model, 32kHz sample rate) for normal audio attachments. For voice-note targets such as Feishu and Telegram, OpenClaw transcodes the MiniMax MP3 to 48kHz Opus with `ffmpeg` before delivery.

538+

- **Xiaomi MiMo**: MP3 by default, or WAV when configured. For voice-note targets such as Feishu and Telegram, OpenClaw transcodes Xiaomi output to 48kHz Opus with `ffmpeg` before delivery.

501539

- **Google Gemini**: Gemini API TTS returns raw 24kHz PCM. OpenClaw wraps it as WAV for audio attachments and returns PCM directly for Talk/telephony. Native Opus voice-note format is not supported by this path.

502540

- **Gradium**: WAV for audio attachments, Opus for voice-note targets, and `ulaw_8000` at 8 kHz for telephony.

503541

- **xAI**: MP3 by default; `responseFormat` may be `mp3`, `wav`, `pcm`, `mulaw`, or `alaw`. OpenClaw uses xAI's batch REST TTS endpoint and returns a complete audio attachment; xAI's streaming TTS WebSocket is not used by this provider path. Native Opus voice-note format is not supported by this path.