本地大模型
在本地运行大语言模型(LLM)可以保护数据隐私、降低 API 成本,并享受离线推理能力。Ubuntu 26.04 提供了优秀的本地 LLM 运行环境,本文将介绍主流的本地模型运行工具及推荐模型。

在终端、WebUI 或 OpenAI 兼容 API 客户端里发送一段文字。
Ollama / llama.cpp / LM Studio 把请求路由给模型并管理上下文。
权重在显存里逐 token 推理;纯 CPU 也能跑但慢一个量级。
token 边产生边返回,数据全程留在本机,不离开你的硬盘。
想搭建独立的”AI box”设备而不是在桌面运行?2026 年 6 月 Canonical 已经给出基于 Ubuntu Core 26 + gemma4 snap 的官方参考方案,提供 OpenAI 兼容 API(:8336/v1)和 WebUI(:8337)。最小化部署步骤见 26.04 发布后动态。
Ollama
Ollama 是目前最流行的本地模型运行框架,提供极简的安装和使用体验,支持大量开源模型。
安装 Ollama
# 一键安装(推荐)
curl -fsSL https://ollama.com/install.sh | bash
# 验证安装
ollama --version
# 检查 Ollama 服务状态
systemctl status ollama# 手动安装(如果自动脚本不适用)
# 下载并解压官方 tgz 包到 /usr
curl -L https://ollama.com/download/ollama-linux-amd64.tgz -o /tmp/ollama-linux-amd64.tgz
sudo tar -C /usr -xzf /tmp/ollama-linux-amd64.tgz
# 创建 Ollama 用户
sudo useradd -r -s /bin/false -m -d /usr/share/ollama ollama
# 创建 systemd 服务(用 sudo tee 写入需 root 权限的文件)
sudo tee /etc/systemd/system/ollama.service > /dev/null << 'EOF'
[Unit]
Description=Ollama Service
After=network-online.target
[Service]
ExecStart=/usr/bin/ollama serve
User=ollama
Group=ollama
Restart=always
RestartSec=3
Environment="HOME=/usr/share/ollama"
[Install]
WantedBy=default.target
EOF
sudo systemctl daemon-reload
sudo systemctl enable ollama
sudo systemctl start ollama拉取与运行模型
# 拉取模型(首次会下载模型文件)
ollama pull llama3.2
ollama pull qwen2.5:14b
ollama pull deepseek-r1:14b
# 运行模型进入对话
ollama run llama3.2
# 运行指定大小的模型
ollama run qwen2.5:7b
ollama run qwen2.5:14b
ollama run qwen2.5:32b
# 查看已下载的模型
ollama list
# 查看模型详细信息
ollama show qwen2.5:14b
# 删除不需要的模型
ollama rm llama3.2API 使用
Ollama 提供兼容 OpenAI 格式的 REST API,默认监听 http://localhost:11434。
# 生成文本(Generate API)
curl http://localhost:11434/api/generate -d '{
"model": "qwen2.5:14b",
"prompt": "解释 Python 中的装饰器",
"stream": false
}'
# Chat API(对话格式)
curl http://localhost:11434/api/chat -d '{
"model": "qwen2.5:14b",
"messages": [
{"role": "system", "content": "你是一位 Linux 专家"},
{"role": "user", "content": "如何查看 Ubuntu 的系统版本?"}
],
"stream": false
}'
# 兼容 OpenAI 格式的 API
curl http://localhost:11434/v1/chat/completions -d '{
"model": "qwen2.5:14b",
"messages": [
{"role": "user", "content": "Hello"}
]
}'
# 列出可用模型
curl http://localhost:11434/api/tagsPython 调用示例
# Ubuntu 26.04 默认禁止系统级 pip 安装(PEP 668),请在虚拟环境中安装
python3 -m venv ~/ollama-env
source ~/ollama-env/bin/activate
# 安装 ollama Python 库
pip install ollamaimport ollama
response = ollama.chat(model='qwen2.5:14b', messages=[
{'role': 'user', 'content': '用 Python 写一个快速排序算法'},
])
print(response['message']['content'])配置 Ollama
# 修改模型存储路径(默认 ~/.ollama/models)
sudo systemctl edit ollama
# 添加以下内容:
# [Service]
# Environment="OLLAMA_MODELS=/data/ollama/models"
# 允许远程访问(默认仅本地)
sudo systemctl edit ollama
# [Service]
# Environment="OLLAMA_HOST=0.0.0.0:11434"
# 设置 GPU 层数
# Environment="OLLAMA_NUM_GPU=999"
# 重启服务使配置生效
sudo systemctl restart ollama常用模型推荐
| 模型 | 参数量 | 显存需求 | 特点 |
|---|---|---|---|
qwen2.5:7b | 7B | 6 GB | 中文能力强,适合日常对话 |
qwen2.5:14b | 14B | 10 GB | 中文全面,代码能力好 |
qwen2.5-coder:7b | 7B | 6 GB | 专注代码生成与理解 |
llama3.2:3b | 3B | 3 GB | 轻量级,速度快 |
llama3.1:8b | 8B | 6 GB | 英文能力出色 |
deepseek-r1:14b | 14B | 10 GB | 推理能力强 |
mistral:7b | 7B | 6 GB | 欧洲模型,多语言 |
gemma2:9b | 9B | 7 GB | Google 开源模型 |
phi3:14b | 14B | 10 GB | 微软研究模型 |
nomic-embed-text | - | 1 GB | 文本嵌入模型 |
对于中文用户,强烈推荐 Qwen 2.5 系列模型。7B 版本适合 8GB 显存的显卡,14B 版本在 12GB 显存下表现优异。如果你只需要代码补全,qwen2.5-coder 是最佳选择。
LM Studio
LM Studio 是一款跨平台的图形化本地模型管理工具,提供模型下载、对话和本地 API 服务器功能。
下载安装
# 从官网下载 LM Studio AppImage(请到 https://lmstudio.ai/download 获取最新链接)
# 将下方 URL 替换为官网提供的实际下载地址
wget -O ~/LMStudio.AppImage "<官网最新 AppImage 下载链接>"
# 添加执行权限
chmod +x ~/LMStudio.AppImage
# 移动到应用目录
mkdir -p ~/.local/bin
mv ~/LMStudio.AppImage ~/.local/bin/lmstudio
# 创建桌面快捷方式
# 注意:.desktop 的 Exec 不会展开 $HOME 等变量,必须写绝对路径
# 请将下面的 YOUR_USER 替换为你的用户名(即 echo $USER 的输出)
cat > ~/.local/share/applications/lmstudio.desktop << 'EOF'
[Desktop Entry]
Name=LM Studio
Comment=Local LLM Management
Exec=/home/YOUR_USER/.local/bin/lmstudio --no-sandbox
Icon=lmstudio
Type=Application
Categories=Development;Science;
StartupNotify=true
EOF
# 启动 LM Studio
~/.local/bin/lmstudio安装依赖
# LM Studio 可能需要 FUSE 支持(AppImage 依赖)
sudo apt install -y libfuse2t64GUI 使用
LM Studio 的主要功能区域:
- Discover(发现) — 搜索和下载 Hugging Face 上的 GGUF 模型
- Chat(对话) — 加载模型后与之对话
- Developer(开发者) — 启动本地 API 服务器,兼容 OpenAI API 格式
启动本地 API 服务器:
在 Developer 标签页中,加载一个模型,然后点击 “Start Server”。默认地址为 http://localhost:1234。
# 测试 LM Studio 的本地 API
curl http://localhost:1234/v1/chat/completions -d '{
"model": "loaded-model-name",
"messages": [
{"role": "user", "content": "你好"}
]
}'LM Studio 的模型文件存储在 ~/.lmstudio/models/ 目录下。大模型文件可能占用数十 GB 空间,请确保有足够的磁盘空间。
llama.cpp
llama.cpp 是最底层的本地推理引擎,使用纯 C/C++ 编写,支持 CPU 和 GPU 推理,性能极高。Ollama 的底层也使用了 llama.cpp。
编译安装
# 安装编译依赖
sudo apt install -y build-essential cmake git
# 克隆仓库
git clone https://github.com/ggerganov/llama.cpp.git
cd llama.cpp
# 方法一:纯 CPU 编译
cmake -B build
cmake --build build --config Release -j$(nproc)
# 方法二:启用 CUDA GPU 加速(推荐,需要先安装 CUDA)
cmake -B build -DGGML_CUDA=ON
cmake --build build --config Release -j$(nproc)
# 方法三:启用 Vulkan GPU 加速(AMD/Intel/NVIDIA 通用)
sudo apt install -y libvulkan-dev
cmake -B build -DGGML_VULKAN=ON
cmake --build build --config Release -j$(nproc)下载模型
# llama.cpp 使用 GGUF 格式模型
# 从 Hugging Face 下载(以 Qwen 2.5 7B 为例)
mkdir -p ~/models
wget -O ~/models/qwen2.5-7b-q4_k_m.gguf \
"https://huggingface.co/Qwen/Qwen2.5-7B-Instruct-GGUF/resolve/main/qwen2.5-7b-instruct-q4_k_m.gguf"命令行推理
# 交互式对话
./build/bin/llama-cli \
-m ~/models/qwen2.5-7b-q4_k_m.gguf \
-ngl 999 \
-c 4096 \
--interactive \
--color
# 启动 OpenAI 兼容 API 服务器
./build/bin/llama-server \
-m ~/models/qwen2.5-7b-q4_k_m.gguf \
-ngl 999 \
-c 4096 \
--host 0.0.0.0 \
--port 8080
# 参数说明:
# -m 模型文件路径
# -ngl 999 尽可能多地使用 GPU 层
# -c 4096 上下文长度
# --host 监听地址
# --port 监听端口# 测试 API 服务器
curl http://localhost:8080/v1/chat/completions -d '{
"model": "qwen2.5",
"messages": [{"role": "user", "content": "你好"}]
}'GGUF 模型文件有不同的量化级别。Q4_K_M 是质量和大小的良好平衡,Q5_K_M 质量更高但文件更大,Q8_0 接近原始精度。对于日常使用,推荐 Q4_K_M 或 Q5_K_M。
Jan
Jan 是一款开源的本地 AI 对话客户端,提供友好的图形界面,支持多种模型和本地推理。
安装 Jan
# 下载 Jan 的 deb 包
wget -O /tmp/jan.deb "https://app.jan.ai/download/latest/linux-amd64-deb"
# 安装
sudo dpkg -i /tmp/jan.deb
sudo apt install -f -y
# 启动 Jan
jan# 或通过 AppImage 安装
wget -O ~/jan.appimage "https://app.jan.ai/download/latest/linux-amd64-appimage"
chmod +x ~/jan.appimage
~/jan.appimage界面使用
Jan 的主要功能:
- Hub — 浏览和下载推荐模型(一键下载)
- Chat — 与模型对话,支持多个会话
- Settings — 配置模型参数、GPU 加速等
Jan 支持导入自定义 GGUF 模型文件,将模型文件放入 ~/jan/models/ 目录即可。
# Jan 默认数据目录
ls ~/jan/
# 手动导入模型
mkdir -p ~/jan/models/my-custom-model
cp ~/models/qwen2.5-7b-q4_k_m.gguf ~/jan/models/my-custom-model/Jan 也提供本地 API 服务器,启用后兼容 OpenAI API 格式,默认端口 1337。
Open WebUI
Open WebUI 是一个功能丰富的 Web 界面,用于与本地模型交互,支持连接 Ollama 和 OpenAI 兼容 API。
Docker 部署
# 确保已安装 Docker
sudo apt install -y docker.io docker-compose-v2
sudo usermod -aG docker $USER
newgrp docker
# 方法一:连接本地 Ollama(最常用)
docker run -d \
--name open-webui \
--network=host \
-v open-webui:/app/backend/data \
-e OLLAMA_BASE_URL=http://127.0.0.1:11434 \
--restart always \
ghcr.io/open-webui/open-webui:main
# 方法二:内置 Ollama 的版本(一体化部署)
docker run -d \
--name open-webui \
--gpus all \
-p 3000:8080 \
-v ollama:/root/.ollama \
-v open-webui:/app/backend/data \
--restart always \
ghcr.io/open-webui/open-webui:ollama访问 Open WebUI
# 部署完成后,打开浏览器访问
# 方法一(--network=host): http://localhost:8080
# 方法二(-p 3000:8080): http://localhost:3000
# 首次访问需要创建管理员账号连接 Ollama
如果 Ollama 和 Open WebUI 在同一台机器上:
# 确保 Ollama 正在运行
systemctl status ollama
# Open WebUI 默认会连接 http://localhost:11434
# 在 Open WebUI 的 Settings > Connections 中确认 Ollama URLDocker Compose 部署
# 创建项目目录
mkdir -p ~/open-webui && cd ~/open-webui
# 创建 docker-compose.yml
cat > docker-compose.yml << 'EOF'
services:
open-webui:
image: ghcr.io/open-webui/open-webui:main
container_name: open-webui
ports:
- "3000:8080"
environment:
- OLLAMA_BASE_URL=http://host.docker.internal:11434
- WEBUI_AUTH=true
volumes:
- open-webui-data:/app/backend/data
extra_hosts:
- "host.docker.internal:host-gateway"
restart: always
volumes:
open-webui-data:
EOF
# 启动服务
docker compose up -d
# 查看日志
docker compose logs -f open-webuiOpen WebUI 支持多用户、对话历史、模型管理、RAG(检索增强生成)、Web 搜索等高级功能。它是个人和团队使用本地模型的最佳 Web 界面之一。
模型推荐对比表
以下是当前主流开源模型的对比,帮助你选择适合的模型:
| 模型系列 | 开发者 | 可用参数量 | 中文能力 | 代码能力 | 推理能力 | 许可证 |
|---|---|---|---|---|---|---|
| Llama 3.1/3.2 | Meta | 1B/3B/8B/70B/405B | 一般 | 良好 | 良好 | Llama 3 |
| Qwen 2.5 | 阿里 | 0.5B-72B | 优秀 | 优秀 | 良好 | Apache 2.0 |
| Qwen 2.5 Coder | 阿里 | 1.5B-32B | 良好 | 极佳 | 良好 | Apache 2.0 |
| DeepSeek R1 | 深度求索 | 1.5B-671B | 优秀 | 优秀 | 极佳 | MIT |
| DeepSeek V3 | 深度求索 | 671B | 优秀 | 优秀 | 优秀 | MIT |
| Mistral | Mistral | 7B/8x7B/8x22B | 一般 | 良好 | 良好 | Apache 2.0 |
| Gemma 2 | 2B/9B/27B | 一般 | 良好 | 良好 | Gemma | |
| Phi-3/4 | Microsoft | 3.8B-14B | 一般 | 良好 | 良好 | MIT |
| Yi | 零一万物 | 6B/9B/34B | 优秀 | 良好 | 良好 | Apache 2.0 |
| GLM-4 | 智谱 | 9B | 优秀 | 良好 | 良好 | 自定义 |
使用场景推荐
日常中文对话(8GB 显存):
ollama pull qwen2.5:7b
ollama run qwen2.5:7b代码编写辅助(12GB 显存):
ollama pull qwen2.5-coder:14b
ollama run qwen2.5-coder:14b复杂推理任务(16GB+ 显存):
ollama pull deepseek-r1:14b
ollama run deepseek-r1:14b纯 CPU 运行(无显卡):
ollama pull qwen2.5:3b
ollama run qwen2.5:3b
# 或使用更小的模型
ollama pull llama3.2:1b
ollama run llama3.2:1b如果你不确定选哪个模型,从 qwen2.5:7b 开始是个好选择。它中文能力强,资源占用适中,适合大多数日常使用场景。对于代码任务,qwen2.5-coder:14b 的表现接近商业模型。