剪藏#剪藏#老周AI实践笔记

OpenClaw + MiniMax 全模态配置指南:语音对话 + AI 绘图一键搞定

2026 年 4 月 1 日1 分钟
分享Twitter / XTelegram微博

MiniMax Token Plan × OpenClaw 配置指南

2026 国内 AI Coding Plan 终极横评:养虾时代的选套餐指南之前老周发布了一篇coding plan 的介绍,有不少朋友问到了老周到底怎么用token plan配置一个全模态的能听语音、会说话、会生图的龙虾。本篇老周将为你一一揭晓。

注意如果你的龙虾已经配置过模型,可以直接把这篇扔给龙虾让他自动配置。

前置要求

  • 用户已安装 OpenClaw

  • 用户已订阅 MiniMax Token Plan 并获得 API Key(以 sk-cp- 开头)

配置步骤

步骤 1:获取 Token Plan API Key

操作:访问 MiniMax 平台订阅 Token Plan

  1. 前往 platform.minimaxi.com(国际版)或 platform.minimax.io(国内版)注册/登录

  2. 在左侧导航栏找到「Token Plan」入口,选择适合的套餐:

  3. Starter (¥29/月):轻度使用,仅文本Plus (¥49/月):需要语音/图像Max (¥119/月):需要视频/音乐

  4. 完成支付后,进入「账号设置 → API Key」页面,复制以 sk-cp- 开头的 Token Plan Key

Notion image

注意区分国内/国际版

  • 国内用户:platform.minimax.io → API Host: https://api.minimax.io

  • 海外用户:platform.minimaxi.com → API Host: https://api.minimaxi.com

步骤 2:在 OpenClaw 中接入 MiniMax

操作:在 OpenClaw 控制台中配置 MiniMax 模型

OAuth 授权登录 点击「连接 MiniMax」→ 跳转授权页面一键登录 新手推荐
API Key 手动配置 在「模型设置」中填入 sk-cp- 开头的 Token Plan Key 开发者

手动配置步骤

  1. 打开 OpenClaw 控制台,进入「设置 → 模型提供商」

  2. 选择 MiniMax,点击「添加 API Key」

  3. 粘贴第一步获取的 sk-cp-xxxx Key

  4. 在「默认模型」中选择 MiniMax-M2.7 作为对话模型

Notion image

步骤 3:安装 minimax-multimodal Skill

操作:在对话中发送以下消息,让 Bot 自动安装

JAVASCRIPT
clawhub.ai/MiniMax-AI-Dev/minimax-multimodal 帮我安装这个多模态工具集

预期结果

  • ✅ speech-2.8-hd 模型可用

  • ✅ 语音合成正常

  • ✅ FFmpeg 已安装

  • ✅ 环境变量已写入 ~/.bashrc

Skill 包含的能力

  • TTS 语音合成(Speech 2.8)

  • 图像生成(image-01)

  • 音乐生成(Plus/Max 套餐)

  • 视频生成(Max 套餐)

步骤 4:配置 TTS 语音合成

安装完成后,TTS 能力已自动启用。

标准语音回复

JAVASCRIPT
帮我用语音说:欢迎来到我的频道,我是你的 AI 助手。

多音色混合朗读

JAVASCRIPT
/tts --mode multi
[旁白]: 这是一个风雨交加的夜晚
[角色A·女声]: 你听到了吗?外面有奇怪的声音
[角色B·男声]: 不用担心,我去看看

声音克隆(可选):

  1. 用户上传 10~30 秒清晰录音

  2. 执行 /voice clone --file [录音文件] --name [音色名称]

  3. 之后可用 --voice [音色名称] 调用

飞书语音气泡(飞书用户必选): 飞书平台的语音气泡只接受 Opus 格式,而 TTS 默认输出 MP3,直接发送会变成文件附件。需要额外安装 Skill:

JAVASCRIPT
clawhub.ai/feishu-voice-bubble-generation 帮我安装飞书语音气泡 Skill

Telegram 无需此步骤,原生支持语音气泡。

步骤 5:配置 STT 语音输入识别

问题:OpenClaw 默认不带 STT 引擎,需要单独安装。

操作:发送以下消息安装 mlx-whisper

JAVASCRIPT
帮我安装 mlx-whisper 并配置好语音输入识别

预期结果

  • ✅ mlx-whisper 安装完成

  • ✅ 转录脚本已创建

  • ✅ STT 音频识别已开启

  • ⚠️ 提示重启 Gateway

重要:安装完成后必须重启 Gateway,音频管线不支持热加载。

重启方式

  • 在 OpenClaw 设置中手动重启,或

  • 告诉用户「请重启 Gateway」

步骤 6:测试 AI 图像生成

安装 minimax-multimodal Skill 后,图像生成能力已自动启用。

文字生图

JAVASCRIPT
/imagine 一只赛博朋克风格的猫咪,坐在霓虹灯闪烁的城市屋顶,夜晚,高清,4K

参考图生图

JAVASCRIPT
/imagine --ref [已上传的图片] --prompt "将这张图改为水彩画风格" --strength 0.7

完整配置流程回顾

  1. ✅ 访问 MiniMax 平台,订阅 Token Plan,获取 sk-cp- API Key

  2. ✅ 在 OpenClaw 中接入 MiniMax(OAuth 或手动填入 Key)

  3. ✅ 把 clawhub.ai/MiniMax-AI-Dev/minimax-multimodal 链接发给 Bot,Bot 自动完成安装

  4. ✅ (飞书用户)安装 feishu-voice-bubble-generation Skill

  5. ✅ 安装 mlx-whisper 并配置 STT,完成后重启 Gateway

配置完成后的能力

🎙️ TTS 语音合成 ✅ 可用 Speech 2.8 模型,支持多音色、克隆
👂 STT 语音输入 ✅ 可用 mlx-whisper 本地识别,<2s 响应
🖼️ 图像生成 ✅ 可用 image-01 模型,文生图/图生图
💬 智能对话 ✅ 可用 MiniMax M2.7 编程模型

完整对话闭环: 语音输入 → STT 识别 → MiniMax 思考 → TTS 合成 → 语音气泡回复

实际效果示例

以下是在两个主流平台上的真实配置截图:

💙 飞书平台示例

Skill 安装 → 语音合成 → 图像生成,全部一键完成

Notion image

✈️ Telegram 平台示例

TTS 语音气泡 + 图像生成 +TTS支持语音识别,原生支持无需额外配置

Notion image

写在最后

以上就是完整的 MiniMax Token Plan × OpenClaw 配置指南。按照这个流程,你的 Bot 就能同时具备语音合成、语音识别和 AI 图像生成能力,实现真正的全模态交互。

如果在配置过程中遇到问题,欢迎在评论区留言讨论。

🚀 MiniMax Token Plan 惊喜上线! 新增语音、音乐、视频和图片生成权益。邀请好友享双重好礼,助力开发体验!

好友立享 9 折专属优惠 + Builder 权益,你赢返利 + 社区特权!

👉 立即参与https://platform.minimaxi.com/subscribe/token-plan?code=1m120uWvV3&source=link

欢迎关注「老周」,获取一手 AI 资讯和实用教程 👋

原文地址: https://mp.weixin.qq.com/s?__biz=MzA5NzQ4MTk4Nw==&mid=2247484057&idx=1&sn=731bbc0ec51c39083f29717b01498b7d&chksm=918383242c84099240e747e3751deeba32962985aafc68892cbe2c6cc5fe552fd941413fcc97&mpshare=1&scene=1&srcid=0401G737TBtbJul92Kpy4Yxz&sharer_shareinfo=81b47220a33417c5dacaebb58f64c4d7&sharer_shareinfo_first=81b47220a33417c5dacaebb58f64c4d7#rd

相关文章