OpenClaw + MiniMax 全模态配置指南:语音对话 + AI 绘图一键搞定

MiniMax Token Plan × OpenClaw 配置指南
2026 国内 AI Coding Plan 终极横评:养虾时代的选套餐指南之前老周发布了一篇coding plan 的介绍,有不少朋友问到了老周到底怎么用token plan配置一个全模态的能听语音、会说话、会生图的龙虾。本篇老周将为你一一揭晓。
注意如果你的龙虾已经配置过模型,可以直接把这篇扔给龙虾让他自动配置。
前置要求
-
用户已安装 OpenClaw
-
用户已订阅 MiniMax Token Plan 并获得 API Key(以
sk-cp-开头)
配置步骤
步骤 1:获取 Token Plan API Key
操作:访问 MiniMax 平台订阅 Token Plan
-
前往 platform.minimaxi.com(国际版)或 platform.minimax.io(国内版)注册/登录
-
在左侧导航栏找到「Token Plan」入口,选择适合的套餐:
-
Starter (¥29/月):轻度使用,仅文本Plus (¥49/月):需要语音/图像Max (¥119/月):需要视频/音乐
-
完成支付后,进入「账号设置 → API Key」页面,复制以
sk-cp-开头的 Token Plan Key

注意区分国内/国际版:
-
国内用户:
platform.minimax.io→ API Host:https://api.minimax.io -
海外用户:
platform.minimaxi.com→ API Host:https://api.minimaxi.com
步骤 2:在 OpenClaw 中接入 MiniMax
操作:在 OpenClaw 控制台中配置 MiniMax 模型
OAuth 授权登录 点击「连接 MiniMax」→ 跳转授权页面一键登录 新手推荐
API Key 手动配置 在「模型设置」中填入 sk-cp- 开头的 Token Plan Key 开发者
手动配置步骤:
-
打开 OpenClaw 控制台,进入「设置 → 模型提供商」
-
选择 MiniMax,点击「添加 API Key」
-
粘贴第一步获取的
sk-cp-xxxxKey -
在「默认模型」中选择 MiniMax-M2.7 作为对话模型

步骤 3:安装 minimax-multimodal Skill
操作:在对话中发送以下消息,让 Bot 自动安装
clawhub.ai/MiniMax-AI-Dev/minimax-multimodal 帮我安装这个多模态工具集预期结果:
-
✅ speech-2.8-hd 模型可用
-
✅ 语音合成正常
-
✅ FFmpeg 已安装
-
✅ 环境变量已写入 ~/.bashrc
Skill 包含的能力:
-
TTS 语音合成(Speech 2.8)
-
图像生成(image-01)
-
音乐生成(Plus/Max 套餐)
-
视频生成(Max 套餐)
步骤 4:配置 TTS 语音合成
安装完成后,TTS 能力已自动启用。
标准语音回复:
帮我用语音说:欢迎来到我的频道,我是你的 AI 助手。多音色混合朗读:
/tts --mode multi
[旁白]: 这是一个风雨交加的夜晚
[角色A·女声]: 你听到了吗?外面有奇怪的声音
[角色B·男声]: 不用担心,我去看看声音克隆(可选):
-
用户上传 10~30 秒清晰录音
-
执行
/voice clone --file [录音文件] --name [音色名称] -
之后可用
--voice [音色名称]调用
飞书语音气泡(飞书用户必选): 飞书平台的语音气泡只接受 Opus 格式,而 TTS 默认输出 MP3,直接发送会变成文件附件。需要额外安装 Skill:
clawhub.ai/feishu-voice-bubble-generation 帮我安装飞书语音气泡 SkillTelegram 无需此步骤,原生支持语音气泡。
步骤 5:配置 STT 语音输入识别
问题:OpenClaw 默认不带 STT 引擎,需要单独安装。
操作:发送以下消息安装 mlx-whisper
帮我安装 mlx-whisper 并配置好语音输入识别预期结果:
-
✅ mlx-whisper 安装完成
-
✅ 转录脚本已创建
-
✅ STT 音频识别已开启
-
⚠️ 提示重启 Gateway
重要:安装完成后必须重启 Gateway,音频管线不支持热加载。
重启方式:
-
在 OpenClaw 设置中手动重启,或
-
告诉用户「请重启 Gateway」
步骤 6:测试 AI 图像生成
安装 minimax-multimodal Skill 后,图像生成能力已自动启用。
文字生图:
/imagine 一只赛博朋克风格的猫咪,坐在霓虹灯闪烁的城市屋顶,夜晚,高清,4K参考图生图:
/imagine --ref [已上传的图片] --prompt "将这张图改为水彩画风格" --strength 0.7完整配置流程回顾
-
✅ 访问 MiniMax 平台,订阅 Token Plan,获取
sk-cp-API Key -
✅ 在 OpenClaw 中接入 MiniMax(OAuth 或手动填入 Key)
-
✅ 把
clawhub.ai/MiniMax-AI-Dev/minimax-multimodal链接发给 Bot,Bot 自动完成安装 -
✅ (飞书用户)安装
feishu-voice-bubble-generationSkill -
✅ 安装 mlx-whisper 并配置 STT,完成后重启 Gateway
配置完成后的能力
🎙️ TTS 语音合成 ✅ 可用 Speech 2.8 模型,支持多音色、克隆
👂 STT 语音输入 ✅ 可用 mlx-whisper 本地识别,<2s 响应
🖼️ 图像生成 ✅ 可用 image-01 模型,文生图/图生图
💬 智能对话 ✅ 可用 MiniMax M2.7 编程模型
完整对话闭环: 语音输入 → STT 识别 → MiniMax 思考 → TTS 合成 → 语音气泡回复
实际效果示例
以下是在两个主流平台上的真实配置截图:
💙 飞书平台示例
Skill 安装 → 语音合成 → 图像生成,全部一键完成

✈️ Telegram 平台示例
TTS 语音气泡 + 图像生成 +TTS支持语音识别,原生支持无需额外配置

写在最后
以上就是完整的 MiniMax Token Plan × OpenClaw 配置指南。按照这个流程,你的 Bot 就能同时具备语音合成、语音识别和 AI 图像生成能力,实现真正的全模态交互。
如果在配置过程中遇到问题,欢迎在评论区留言讨论。
🚀 MiniMax Token Plan 惊喜上线! 新增语音、音乐、视频和图片生成权益。邀请好友享双重好礼,助力开发体验!
好友立享 9 折专属优惠 + Builder 权益,你赢返利 + 社区特权!
👉 立即参与:https://platform.minimaxi.com/subscribe/token-plan?code=1m120uWvV3&source=link
欢迎关注「老周」,获取一手 AI 资讯和实用教程 👋