本地部署 Qwen3.5 模型:Ollama + LM Studio 双引擎实战,接入 OpenClaw 实现 Token 自由

最近在折腾本地大模型,发现通义千问的 Qwen3.5 系列模型在中文场景下表现相当不错。更关键的是,通过 Ollama 或 LM Studio 部署到本地后,再接入 OpenClaw,就能彻底摆脱 API Token 的限制。
这篇文章记录一下完整的实操流程,从模型下载到接入 OpenClaw,踩过的坑都写在这里了。
在本地部署大模型之前,我对比了几个主流开源模型:
-
• Llama 3.1:英文能力强,但中文理解稍弱
-
• Qwen3.5:阿里出品,中文场景优化好,指令跟随能力强
-
• DeepSeek:推理能力不错,但资源占用较高
最终选择 Qwen3.5 的原因很简单:中文场景下的实际表现更符合我的需求。我这次部署的是 9B 参数版本,在性能和资源占用之间取得了不错的平衡。
方案一:Ollama 部署
Ollama 是目前最简单的本地模型部署方案,命令行操作,几分钟就能跑起来。
1. 安装 Ollama
macOS / Linux:
curl -fsSL https://ollama.com/install.sh | shWindows: 直接下载安装包:https://ollama.com/download
安装完成后验证:
ollama --version2. 拉取 Qwen3.5 模型
Ollama 支持多个 Qwen3.5 版本,根据你的硬件配置选择:
# 9B 参数版本(推荐,性能和资源平衡)
ollama pull qwen3.5:9b模型会自动下载到本地,首次拉取需要等待一段时间(9B 版本约 6.6GB)。

3. 启动模型服务
ollama serve默认监听 http://localhost:11434,服务启动后可以测试一下:
curl http://localhost:11434/api/generate -d '{
"model": "qwen3.5:9b",
"prompt": "介绍一下你自己",
"stream": false
}'4. 验证 OpenAI 兼容接口
Ollama 提供了 OpenAI 兼容的 API 接口,这是接入 OpenClaw 的关键:
curl http://localhost:11434/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{
"model": "qwen3.5:9b",
"messages": [{"role": "user", "content": "你好"}]
}'方案二:LM Studio 部署
1. 下载安装 LM Studio
支持 Windows、macOS、Linux,下载对应版本安装即可。
2. 下载 Qwen3.5 模型
打开 LM Studio,在搜索框输入 qwen3.5,会看到多个版本:
-
•
qwen2.5-7b-instruct-q4_k_m.gguf(4-bit 量化) -
•
qwen2.5-9b-instruct-q4_k_m.gguf(推荐,性能和资源平衡) -
•
qwen2.5-14b-instruct-q4_k_m.gguf -
•
qwen2.5-32b-instruct-q4_k_m.gguf
点击下载按钮,模型会保存到本地(默认路径:~/.lm-studio/models)。

3. 加载模型并启动服务
-
- 在 LM Studio 左侧选择已下载的模型
-
- 点击 "Load Model" 加载到内存
-
- 切换到 "Local Server" 标签页
-
- 点击 "Start Server",默认监听
http://localhost:1234
- 点击 "Start Server",默认监听

4. 测试接口
curl http://localhost:1234/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{
"model": "qwen/qwen3.5-9b",
"messages": [{"role": "user", "content": "Hi."}]
}'
接入 OpenClaw:实现 Token 自由
接入 OpenClaw 之前,需要配置模型上下文长度。
-
• 在 LM Studio 右侧的配置栏中找到 "Context Length"(上下文长度)选项。
-
• 将默认的
2048或4096手动修改为 (16k) 或 (32k)。 -
• 注:Qwen 3.5 原生支持到 128k,但在 24G 内存上设置 32k 是最稳妥、不卡顿的选择。
-
• 找到 "GPU Offload",确保它被拉到最大(Max),让 GPU 来处理这些计算。
-
• 点击 "Reload Model"(重新加载模型),让设置生效。

1. 配置本地模型
进入 OpenClaw 配置页,选择 Model 进行 BaseUrl 和 ApiKey 配置。
openclaw configLM Studio 配置(Ollama类似):
models: {
mode: 'merge',
providers: {
'lm-studio': {
baseUrl: 'http://127.0.0.1:1234/v1',
apiKey: '__OPENCLAW_REDACTED__',
api: 'openai-completions',
models: [
{
id: 'qwen/qwen3.5-9b',
name: 'qwen/qwen3.5-9b (Custom Provider)',
api: 'openai-completions',
reasoning:false,
input: [
'text',
],
cost: {
input: 0,
output: 0,
cacheRead: 0,
cacheWrite: 0,
},
contextWindow: 16000,
maxTokens: 16000,
},
],
},
},
}3. 重启 Gateway
openclaw gateway restart现在你可以通过 OpenClaw 调用本地模型了,完全不受 Token 限制。

总结
通过 Ollama 或 LM Studio 部署 Qwen3.5 模型,再接入 OpenClaw,整个流程下来不到半小时就能搞定。对于日常开发、学习场景,本地模型完全够用,而且不用担心 API 费用和隐私问题。
如果你也在折腾本地大模型,欢迎交流踩坑经验。
相关资源:
-
• Ollama 官网:https://ollama.com
-
• LM Studio 官网:https://lmstudio.ai
-
• Qwen 模型库:https://huggingface.co/Qwen
-
• OpenClaw 文档:https://github.com/openclaw/openclaw