Skip to Content
文档AI 工具本地大模型

本地大模型

在本地运行大语言模型(LLM)可以保护数据隐私、降低 API 成本,并享受离线推理能力。Ubuntu 26.04 提供了优秀的本地 LLM 运行环境,本文将介绍主流的本地模型运行工具及推荐模型。

1你的 Prompt

在终端、WebUI 或 OpenAI 兼容 API 客户端里发送一段文字。

2本地运行时

Ollama / llama.cpp / LM Studio 把请求路由给模型并管理上下文。

3GPU 推理

权重在显存里逐 token 推理;纯 CPU 也能跑但慢一个量级。

4流式响应

token 边产生边返回,数据全程留在本机,不离开你的硬盘。

Tip

想搭建独立的”AI box”设备而不是在桌面运行?2026 年 6 月 Canonical 已经给出基于 Ubuntu Core 26 + gemma4 snap 的官方参考方案,提供 OpenAI 兼容 API(:8336/v1)和 WebUI(:8337)。最小化部署步骤见 26.04 发布后动态。

Ollama

Ollama 是目前最流行的本地模型运行框架,提供极简的安装和使用体验,支持大量开源模型。

安装 Ollama

# 一键安装(推荐) curl -fsSL https://ollama.com/install.sh | bash # 验证安装 ollama --version # 检查 Ollama 服务状态 systemctl status ollama
# 手动安装(如果自动脚本不适用) # 下载并解压官方 tgz 包到 /usr curl -L https://ollama.com/download/ollama-linux-amd64.tgz -o /tmp/ollama-linux-amd64.tgz sudo tar -C /usr -xzf /tmp/ollama-linux-amd64.tgz # 创建 Ollama 用户 sudo useradd -r -s /bin/false -m -d /usr/share/ollama ollama # 创建 systemd 服务(用 sudo tee 写入需 root 权限的文件) sudo tee /etc/systemd/system/ollama.service > /dev/null << 'EOF' [Unit] Description=Ollama Service After=network-online.target [Service] ExecStart=/usr/bin/ollama serve User=ollama Group=ollama Restart=always RestartSec=3 Environment="HOME=/usr/share/ollama" [Install] WantedBy=default.target EOF sudo systemctl daemon-reload sudo systemctl enable ollama sudo systemctl start ollama

拉取与运行模型

# 拉取模型(首次会下载模型文件) ollama pull llama3.2 ollama pull qwen2.5:14b ollama pull deepseek-r1:14b # 运行模型进入对话 ollama run llama3.2 # 运行指定大小的模型 ollama run qwen2.5:7b ollama run qwen2.5:14b ollama run qwen2.5:32b # 查看已下载的模型 ollama list # 查看模型详细信息 ollama show qwen2.5:14b # 删除不需要的模型 ollama rm llama3.2

API 使用

Ollama 提供兼容 OpenAI 格式的 REST API,默认监听 http://localhost:11434。

# 生成文本(Generate API) curl http://localhost:11434/api/generate -d '{ "model": "qwen2.5:14b", "prompt": "解释 Python 中的装饰器", "stream": false }' # Chat API(对话格式) curl http://localhost:11434/api/chat -d '{ "model": "qwen2.5:14b", "messages": [ {"role": "system", "content": "你是一位 Linux 专家"}, {"role": "user", "content": "如何查看 Ubuntu 的系统版本?"} ], "stream": false }' # 兼容 OpenAI 格式的 API curl http://localhost:11434/v1/chat/completions -d '{ "model": "qwen2.5:14b", "messages": [ {"role": "user", "content": "Hello"} ] }' # 列出可用模型 curl http://localhost:11434/api/tags

Python 调用示例

# Ubuntu 26.04 默认禁止系统级 pip 安装(PEP 668),请在虚拟环境中安装 python3 -m venv ~/ollama-env source ~/ollama-env/bin/activate # 安装 ollama Python 库 pip install ollama
import ollama response = ollama.chat(model='qwen2.5:14b', messages=[ {'role': 'user', 'content': '用 Python 写一个快速排序算法'}, ]) print(response['message']['content'])

配置 Ollama

# 修改模型存储路径(默认 ~/.ollama/models) sudo systemctl edit ollama # 添加以下内容: # [Service] # Environment="OLLAMA_MODELS=/data/ollama/models" # 允许远程访问(默认仅本地) sudo systemctl edit ollama # [Service] # Environment="OLLAMA_HOST=0.0.0.0:11434" # 设置 GPU 层数 # Environment="OLLAMA_NUM_GPU=999" # 重启服务使配置生效 sudo systemctl restart ollama

常用模型推荐

模型参数量显存需求特点
qwen2.5:7b7B6 GB中文能力强,适合日常对话
qwen2.5:14b14B10 GB中文全面,代码能力好
qwen2.5-coder:7b7B6 GB专注代码生成与理解
llama3.2:3b3B3 GB轻量级,速度快
llama3.1:8b8B6 GB英文能力出色
deepseek-r1:14b14B10 GB推理能力强
mistral:7b7B6 GB欧洲模型,多语言
gemma2:9b9B7 GBGoogle 开源模型
phi3:14b14B10 GB微软研究模型
nomic-embed-text-1 GB文本嵌入模型
Tip

对于中文用户,强烈推荐 Qwen 2.5 系列模型。7B 版本适合 8GB 显存的显卡,14B 版本在 12GB 显存下表现优异。如果你只需要代码补全,qwen2.5-coder 是最佳选择。


LM Studio

LM Studio 是一款跨平台的图形化本地模型管理工具,提供模型下载、对话和本地 API 服务器功能。

下载安装

# 从官网下载 LM Studio AppImage(请到 https://lmstudio.ai/download 获取最新链接) # 将下方 URL 替换为官网提供的实际下载地址 wget -O ~/LMStudio.AppImage "<官网最新 AppImage 下载链接>" # 添加执行权限 chmod +x ~/LMStudio.AppImage # 移动到应用目录 mkdir -p ~/.local/bin mv ~/LMStudio.AppImage ~/.local/bin/lmstudio # 创建桌面快捷方式 # 注意:.desktop 的 Exec 不会展开 $HOME 等变量,必须写绝对路径 # 请将下面的 YOUR_USER 替换为你的用户名(即 echo $USER 的输出) cat > ~/.local/share/applications/lmstudio.desktop << 'EOF' [Desktop Entry] Name=LM Studio Comment=Local LLM Management Exec=/home/YOUR_USER/.local/bin/lmstudio --no-sandbox Icon=lmstudio Type=Application Categories=Development;Science; StartupNotify=true EOF # 启动 LM Studio ~/.local/bin/lmstudio

安装依赖

# LM Studio 可能需要 FUSE 支持(AppImage 依赖) sudo apt install -y libfuse2t64

GUI 使用

LM Studio 的主要功能区域:

  1. Discover(发现) — 搜索和下载 Hugging Face 上的 GGUF 模型
  2. Chat(对话) — 加载模型后与之对话
  3. Developer(开发者) — 启动本地 API 服务器,兼容 OpenAI API 格式

启动本地 API 服务器:

在 Developer 标签页中,加载一个模型,然后点击 “Start Server”。默认地址为 http://localhost:1234。

# 测试 LM Studio 的本地 API curl http://localhost:1234/v1/chat/completions -d '{ "model": "loaded-model-name", "messages": [ {"role": "user", "content": "你好"} ] }'
Note

LM Studio 的模型文件存储在 ~/.lmstudio/models/ 目录下。大模型文件可能占用数十 GB 空间,请确保有足够的磁盘空间。


llama.cpp

llama.cpp 是最底层的本地推理引擎,使用纯 C/C++ 编写,支持 CPU 和 GPU 推理,性能极高。Ollama 的底层也使用了 llama.cpp。

编译安装

# 安装编译依赖 sudo apt install -y build-essential cmake git # 克隆仓库 git clone https://github.com/ggerganov/llama.cpp.git cd llama.cpp # 方法一:纯 CPU 编译 cmake -B build cmake --build build --config Release -j$(nproc) # 方法二:启用 CUDA GPU 加速(推荐,需要先安装 CUDA) cmake -B build -DGGML_CUDA=ON cmake --build build --config Release -j$(nproc) # 方法三:启用 Vulkan GPU 加速(AMD/Intel/NVIDIA 通用) sudo apt install -y libvulkan-dev cmake -B build -DGGML_VULKAN=ON cmake --build build --config Release -j$(nproc)

下载模型

# llama.cpp 使用 GGUF 格式模型 # 从 Hugging Face 下载(以 Qwen 2.5 7B 为例) mkdir -p ~/models wget -O ~/models/qwen2.5-7b-q4_k_m.gguf \ "https://huggingface.co/Qwen/Qwen2.5-7B-Instruct-GGUF/resolve/main/qwen2.5-7b-instruct-q4_k_m.gguf"

命令行推理

# 交互式对话 ./build/bin/llama-cli \ -m ~/models/qwen2.5-7b-q4_k_m.gguf \ -ngl 999 \ -c 4096 \ --interactive \ --color # 启动 OpenAI 兼容 API 服务器 ./build/bin/llama-server \ -m ~/models/qwen2.5-7b-q4_k_m.gguf \ -ngl 999 \ -c 4096 \ --host 0.0.0.0 \ --port 8080 # 参数说明: # -m 模型文件路径 # -ngl 999 尽可能多地使用 GPU 层 # -c 4096 上下文长度 # --host 监听地址 # --port 监听端口
# 测试 API 服务器 curl http://localhost:8080/v1/chat/completions -d '{ "model": "qwen2.5", "messages": [{"role": "user", "content": "你好"}] }'
Tip

GGUF 模型文件有不同的量化级别。Q4_K_M 是质量和大小的良好平衡,Q5_K_M 质量更高但文件更大,Q8_0 接近原始精度。对于日常使用,推荐 Q4_K_M 或 Q5_K_M。


Jan

Jan 是一款开源的本地 AI 对话客户端,提供友好的图形界面,支持多种模型和本地推理。

安装 Jan

# 下载 Jan 的 deb 包 wget -O /tmp/jan.deb "https://app.jan.ai/download/latest/linux-amd64-deb" # 安装 sudo dpkg -i /tmp/jan.deb sudo apt install -f -y # 启动 Jan jan
# 或通过 AppImage 安装 wget -O ~/jan.appimage "https://app.jan.ai/download/latest/linux-amd64-appimage" chmod +x ~/jan.appimage ~/jan.appimage

界面使用

Jan 的主要功能:

  1. Hub — 浏览和下载推荐模型(一键下载)
  2. Chat — 与模型对话,支持多个会话
  3. Settings — 配置模型参数、GPU 加速等

Jan 支持导入自定义 GGUF 模型文件,将模型文件放入 ~/jan/models/ 目录即可。

# Jan 默认数据目录 ls ~/jan/ # 手动导入模型 mkdir -p ~/jan/models/my-custom-model cp ~/models/qwen2.5-7b-q4_k_m.gguf ~/jan/models/my-custom-model/

Jan 也提供本地 API 服务器,启用后兼容 OpenAI API 格式,默认端口 1337。


Open WebUI

Open WebUI 是一个功能丰富的 Web 界面,用于与本地模型交互,支持连接 Ollama 和 OpenAI 兼容 API。

Docker 部署

# 确保已安装 Docker sudo apt install -y docker.io docker-compose-v2 sudo usermod -aG docker $USER newgrp docker # 方法一:连接本地 Ollama(最常用) docker run -d \ --name open-webui \ --network=host \ -v open-webui:/app/backend/data \ -e OLLAMA_BASE_URL=http://127.0.0.1:11434 \ --restart always \ ghcr.io/open-webui/open-webui:main # 方法二:内置 Ollama 的版本(一体化部署) docker run -d \ --name open-webui \ --gpus all \ -p 3000:8080 \ -v ollama:/root/.ollama \ -v open-webui:/app/backend/data \ --restart always \ ghcr.io/open-webui/open-webui:ollama

访问 Open WebUI

# 部署完成后,打开浏览器访问 # 方法一(--network=host): http://localhost:8080 # 方法二(-p 3000:8080): http://localhost:3000 # 首次访问需要创建管理员账号

连接 Ollama

如果 Ollama 和 Open WebUI 在同一台机器上:

# 确保 Ollama 正在运行 systemctl status ollama # Open WebUI 默认会连接 http://localhost:11434 # 在 Open WebUI 的 Settings > Connections 中确认 Ollama URL

Docker Compose 部署

# 创建项目目录 mkdir -p ~/open-webui && cd ~/open-webui # 创建 docker-compose.yml cat > docker-compose.yml << 'EOF' services: open-webui: image: ghcr.io/open-webui/open-webui:main container_name: open-webui ports: - "3000:8080" environment: - OLLAMA_BASE_URL=http://host.docker.internal:11434 - WEBUI_AUTH=true volumes: - open-webui-data:/app/backend/data extra_hosts: - "host.docker.internal:host-gateway" restart: always volumes: open-webui-data: EOF # 启动服务 docker compose up -d # 查看日志 docker compose logs -f open-webui
Note

Open WebUI 支持多用户、对话历史、模型管理、RAG(检索增强生成)、Web 搜索等高级功能。它是个人和团队使用本地模型的最佳 Web 界面之一。


模型推荐对比表

以下是当前主流开源模型的对比,帮助你选择适合的模型:

模型系列开发者可用参数量中文能力代码能力推理能力许可证
Llama 3.1/3.2Meta1B/3B/8B/70B/405B一般良好良好Llama 3
Qwen 2.5阿里0.5B-72B优秀优秀良好Apache 2.0
Qwen 2.5 Coder阿里1.5B-32B良好极佳良好Apache 2.0
DeepSeek R1深度求索1.5B-671B优秀优秀极佳MIT
DeepSeek V3深度求索671B优秀优秀优秀MIT
MistralMistral7B/8x7B/8x22B一般良好良好Apache 2.0
Gemma 2Google2B/9B/27B一般良好良好Gemma
Phi-3/4Microsoft3.8B-14B一般良好良好MIT
Yi零一万物6B/9B/34B优秀良好良好Apache 2.0
GLM-4智谱9B优秀良好良好自定义

使用场景推荐

日常中文对话(8GB 显存):

ollama pull qwen2.5:7b ollama run qwen2.5:7b

代码编写辅助(12GB 显存):

ollama pull qwen2.5-coder:14b ollama run qwen2.5-coder:14b

复杂推理任务(16GB+ 显存):

ollama pull deepseek-r1:14b ollama run deepseek-r1:14b

纯 CPU 运行(无显卡):

ollama pull qwen2.5:3b ollama run qwen2.5:3b # 或使用更小的模型 ollama pull llama3.2:1b ollama run llama3.2:1b
Tip

如果你不确定选哪个模型,从 qwen2.5:7b 开始是个好选择。它中文能力强,资源占用适中,适合大多数日常使用场景。对于代码任务,qwen2.5-coder:14b 的表现接近商业模型。

Last updated on