剪藏#剪藏#机器之魂

OpenAI 本地优先的替代方案:这款免费神器直接跑在你电脑上,连网都不用连!

2025 年 10 月 27 日1 分钟
分享Twitter / XTelegram微博

作为开发者,我们都喜欢用 AI 创造新事物。但有时,在我们还没来得及大展拳脚之前,就被 API Key 请求、高昂的费用、网络延迟和数据隐私问题分散了精力。你可能不止一次地想过:“要是我能在自己的机器上运行一个类似 OpenAI 的服务就好了。”

今天介绍的 开源项目(获得 35.6K Star) 可能就是你正在寻找的答案。

什么是 LocalAI

LocalAI 是一个免费、开源的 OpenAI 服务替代品。它的定位很明确:作为一个无缝替代的 REST API,让你能够在本地运行大语言模型 (LLMs) 并生成图像和音频,而无需将数据发送到任何第三方服务器。

Notion image

https://localai.io/

关键在于,它完全兼容 OpenAI 的 API 标准。这意味着,你现有的使用 OpenAI SDK 或 API 的代码几乎不需要或完全不需要修改——只需将 API 服务地址指向你本地的 LocalAI 服务地址,一切就会像往常一样工作。

Notion image

https://localai.io/gallery.html

这为开发者带来了几个明显的好处:

  • 数据隐私与安全:所有推理都在你自己的硬件上完成,数据永远不会离开你的设备。对于处理敏感信息或有合规要求的应用来说,这一点至关重要。

  • 成本可控:没有基于 token 的计费。一旦部署,你可以随心所欲地调用,无需担心费用。

  • 离线运行:即使没有互联网连接,你的 AI 应用也能继续工作。

快速开始

LocalAI 官方提供了几种安装方法,其中最方便的是 Bash 安装脚本和 Docker。

使用 Bash 安装脚本

对于大多数环境,一个简单的 curl 命令就足以完成基本安装:

JAVASCRIPT
curl https://localai.io/install.sh | sh

使用 Docker 安装

如果你更熟悉 Docker,官方提供了适用于不同硬件配置的镜像。

JAVASCRIPT
docker run -ti --name local-ai -p 8080:8080 localai/localai:latest #仅CPU镜像

如果你的机器有 NVIDIA 显卡,并且已安装相应的驱动程序和 CUDA 工具包,你可以使用 GPU 镜像以获得更好的性能。

JAVASCRIPT
# CUDA 12.0
docker run -ti --name local-ai -p 8080:8080 --gpus all localai/localai:latest-gpu-nvidia-cuda-12

# CUDA 11.7
docker run -ti --name local-ai -p 8080:8080 --gpus all localai/localai:latest-gpu-nvidia-cuda-11

如果你使用的是 Intel 显卡,可以使用以下命令安装 LocalAI:

JAVASCRIPT
docker run -ti --name local-ai -p 8080:8080 localai/localai:latest-gpu-intel

要从模型库安装模型,请使用模型名称作为 URI。例如,要使用 Hermes 模型运行 LocalAI,请执行:

JAVASCRIPT
local-ai run hermes-2-theta-llama-3-8b

仅安装模型,请使用:

JAVASCRIPT
local-ai models install hermes-2-theta-llama-3-8b

此外,如果你想快速体验 LocalAI 的功能,可以安装 AIO (All-In-One) 镜像:

JAVASCRIPT
# CPU 版本
docker run -ti --name local-ai -p 8080:8080 localai/localai:latest-aio-cpu

# NVIDIA CUDA 12 版本
docker run -ti --name local-ai -p 8080:8080 --gpus all localai/localai:latest-aio-gpu-nvidia-cuda-12

# NVIDIA CUDA 11 版本
docker run -ti --name local-ai -p 8080:8080 --gpus all localai/localai:latest-aio-gpu-nvidia-cuda-11

# Intel GPU 版本
docker run -ti --name local-ai -p 8080:8080 localai/localai:latest-aio-gpu-intel

AIO (All-In-One) 镜像预装了以下功能:

  • • 文本转语音 (TTS)

  • • 语音转文本

  • • 函数调用

  • • 用于文本生成的大语言模型 (LLM)

  • • 图像生成

  • • 嵌入服务器

一旦 LocalAI 服务启动,你就可以像调用 OpenAI API 一样向 http://localhost:8080 发送请求。

使用 LocalAI API

1. 文本生成

JAVASCRIPT
curl http://localhost:8080/v1/chat/completions \
    -H "Content-Type: application/json" \
    -d '{ "model": "gpt-4",role": "user "messages": [{"", "content": "How are you doing?", "temperature": 0.1}] }'

2. 图像生成

JAVASCRIPT
curl http://localhost:8080/v1/images/generations \
    -H "Content-Type: application/json" -d '{
        "prompt": "A cute baby sea otter",
        "size": "256x256"
      }'

3. 文本转语音

JAVASCRIPT
curl http://localhost:8080/v1/audio/speech \
-H "Content-Type: application/json" \
-d '{
  "model": "tts-1",
  "input": "The quick brown fox jumped over the lazy dog.",
  "voice": "alloy"
}' \
--output speech.mp3

4. 音频转录

JAVASCRIPT
curl http://localhost:8080/v1/audio/transcriptions \
  -H "Content-Type: multipart/form-data" \
  -F file="audio.wav" -F model="whisper-1"

如果你想了解如何调用视觉和嵌入 API,可以阅读官方文档。

支持的后端和加速推理引擎

文本生成和语言模型

llama.cpp LLM inference in C/C++ CUDA 11/12, ROCm, Intel SYCL, Vulkan, Metal, CPU
vLLM Fast LLM inference with PagedAttention CUDA 12, ROCm, Intel
transformers HuggingFace transformers framework CUDA 11/12, ROCm, Intel, CPU
exllama2 GPTQ inference library CUDA 12
MLX Apple Silicon LLM inference Metal (M1/M2/M3+)
MLX-VLM Apple Silicon Vision-Language Models Metal (M1/M2/M3+)

语音语言处理

whisper.cpp OpenAI Whisper in C/C++ CUDA 12, ROCm, Intel SYCL, Vulkan, CPU
faster-whisper Fast Whisper with CTranslate2 CUDA 12, ROCm, Intel, CPU
bark Text-to-audio generation CUDA 12, ROCm, Intel
bark-cpp C++ implementation of Bark CUDA, Metal, CPU
coqui Advanced TTS with 1100+ languages CUDA 12, ROCm, Intel, CPU
kokoro Lightweight TTS model CUDA 12, ROCm, Intel, CPU
chatterbox Production-grade TTS CUDA 11/12, CPU
piper Fast neural TTS system CPU
kitten-tts Kitten TTS models CPU
silero-vad Voice Activity Detection CPU
neutts Text-to-speech with voice cloning CUDA 12, ROCm, CPU

图像和视频生成

stablediffusion.cpp Stable Diffusion in C/C++ CUDA 12, Intel SYCL, Vulkan, CPU
diffusers HuggingFace diffusion models CUDA 11/12, ROCm, Intel, Metal, CPU

专业AI任务

rfdetr Real-time object detection CUDA 12, Intel, CPU
rerankers Document reranking API CUDA 11/12, ROCm, Intel, CPU
local-store Vector database CPU
huggingface HuggingFace API integration API-based

硬件加速

NVIDIA CUDA 11 llama.cpp, whisper, stablediffusion, diffusers, rerankers, bark, chatterbox Nvidia hardware
NVIDIA CUDA 12 All CUDA-compatible backends Nvidia hardware
AMD ROCm llama.cpp, whisper, vllm, transformers, diffusers, rerankers, coqui, kokoro, bark, neutts AMD Graphics
Intel oneAPI llama.cpp, whisper, stablediffusion, vllm, transformers, diffusers, rfdetr, rerankers, exllama2, coqui, kokoro, bark Intel Arc, Intel iGPUs
Apple Metal llama.cpp, whisper, diffusers, MLX, MLX-VLM, bark-cpp Apple M1/M2/M3+
Vulkan llama.cpp, whisper, stablediffusion Cross-platform GPUs
NVIDIA Jetson llama.cpp, whisper, stablediffusion, diffusers, rfdetr ARM64 embedded AI
CPU Optimized All backends AVX/AVX2/AVX512, quantization support

注意事项

如果你打算将 LocalAI 部署到公共网络环境中,请务必做好安全防护。最直接的方法是在启动服务时设置 API_KEY 环境变量,为你的 API 端点添加访问密码。

总结

LocalAI 项目为开发者提供了一个非常有用的选择。它让我们能以更私密、更经济、更可控的方式来构建和测试 AI 功能。无论你是想在个人项目中集成 LLM,还是在组织内部构建一个安全可控的 AI 推理服务,它都值得一试。

参考:https://github.com/mudler/LocalAI

原文地址: https://mp.weixin.qq.com/s?__biz=MzIyNDkxMjQ3OA==&mid=2247485967&idx=1&sn=262e476d4ef93cd414399f7b179237e7&chksm=e978c9bcf287c120040b31278c2a2f82dc29f522fd09385bb27ae6c9a4199f8cd8284e018ed0&mpshare=1&scene=1&srcid=1027vC3Xf7QfPKwXaCI69TYK&sharer_shareinfo=76487bccb970a5a6473f795f6950d9aa&sharer_shareinfo_first=76487bccb970a5a6473f795f6950d9aa#rd

相关文章