目录

  1. 1. 为什么要本地部署大模型
  2. 2. Ollama是什么:一句话解释
  3. 3. 安装Ollama:三平台命令
  4. 4. 模型选择指南:别盲目拉大模型
  5. 5. 安装Open WebUI:Docker一条命令
  6. 6. 配置与使用:让它像ChatGPT一样好用
  7. 7. 用API对接你的应用
  8. 8. 性能优化:让推理速度翻倍
  9. 9. 常见报错排查
  10. 10. 成本与硬件建议

一、为什么要本地部署大模型

三个常见场景:

  • 数据安全:公司内部代码、合同、客户数据不能发到云端API。本地部署数据不出内网。
  • 成本控制:云端API按Token收费,高频使用一个月几百块。本地部署一次性硬件投入,后续零成本。
  • 网络限制:内网环境、保密环境无法访问外网。本地部署不依赖网络。

二、Ollama是什么:一句话解释

Ollama是一个本地大模型运行框架,把复杂的模型下载、量化、推理引擎配置全封装好了。你只需要一行命令就能拉模型、跑模型:

# 拉一个7B模型
ollama run qwen2.5:7b

# 直接开始对话
>>> 你好,介绍一下你自己

它自动处理模型量化(GGUF格式)、GPU/CPU推理切换、内存管理。不需要你懂CUDA、不需要你配PyTorch环境、不需要你处理模型权重文件。类似Docker之于容器——Ollama之于大模型。

三、安装Ollama:三平台命令

3.1 macOS

# 方式一:Homebrew(推荐)
brew install ollama

# 方式二:官网下载安装包
# https://ollama.com/download/mac

# 启动后台服务
ollama serve

# 另开一个终端,拉模型
ollama run qwen2.5:7b

3.2 Windows

# 方式一:官网下载安装包(推荐)
# https://ollama.com/download/windows
# 下载后双击安装,自动注册为系统服务

# 方式二:Winget
winget install Ollama.Ollama

# 安装后打开PowerShell
ollama run qwen2.5:7b

3.3 Linux

# 官方一键脚本
curl -fsSL https://ollama.com/install.sh | sh

# 启动服务
sudo systemctl start ollama
sudo systemctl enable ollama

# 拉模型
ollama run qwen2.5:7b
验证安装:运行 ollama --version,能打印版本号就说明安装成功。默认服务端口是 11434

四、模型选择指南:别盲目拉大模型

这是最容易踩坑的地方。不是模型越大越好——你的硬件跑不动大模型,推理速度会让你怀疑人生。

显存/内存对照表

模型 参数量 所需显存(GPU) 所需内存(CPU) 推理速度 适合场景
qwen2.5:0.5b 0.5B 1GB 2GB 极快 边缘设备、测试
qwen2.5:1.5b 1.5B 2GB 4GB 很快 轻量任务、分类
qwen2.5:7b 7B 5GB 8GB 日常对话(推荐起步)
qwen2.5:14b 14B 10GB 16GB 中等 代码生成、长文写作
qwen2.5:32b 32B 20GB 32GB 较慢 复杂推理、专业任务
qwen2.5:72b 72B 45GB 64GB 企业级、科研级
llama3.1:8b 8B 6GB 8GB 英文场景、通用对话
deepseek-r1:7b 7B 5GB 8GB 推理任务、数学
deepseek-r1:32b 32B 20GB 32GB 较慢 深度推理
选型建议:8GB内存的MacBook Air,从 qwen2.5:7b 起步。16GB内存选 qwen2.5:14b。32GB以上可以尝试 qwen2.5:32b。不要上来就拉72B——跑起来一条回复等30秒,体验极差。

常用模型对比

模型系列 强项 弱项 中文能力
Qwen2.5 中文理解、代码、通用对话 深度推理略弱
Llama 3.1 英文场景、生态丰富 中文不如Qwen 中等
DeepSeek-R1 数学推理、逻辑分析 日常对话偏啰嗦
Phi-3 小模型里质量高 参数量受限 中等

五、安装Open WebUI:Docker一条命令

Ollama自带命令行界面,但体验不太好。Open WebUI是一个类ChatGPT的Web界面,Docker一条命令就能起。

# 确保Docker已安装
docker --version

# 一条命令启动Open WebUI
# 如果Ollama在同一台机器上:
docker run -d -p 3000:8080 \
  --add-host=host.docker.internal:host-gateway \
  -v open-webui:/app/backend/data \
  --name open-webui \
  ghcr.io/open-webui/open-webui:main

# 如果Ollama在远程服务器上:
docker run -d -p 3000:8080 \
  -e OLLAMA_BASE_URL=http://你的服务器IP:11434 \
  -v open-webui:/app/backend/data \
  --name open-webui \
  ghcr.io/open-webui/open-webui:main

打开浏览器访问 http://localhost:3000,注册一个管理员账号(数据存在本地,不外传),就能看到类ChatGPT的界面了。

六、配置与使用:让它像ChatGPT一样好用

6.1 切换模型

在Open WebUI的对话框上方有模型选择下拉框,会自动列出你 ollama pull 过的所有模型。切换模型不需要重启。

6.2 设置系统提示词

在Settings → General → System Prompt里设置默认系统提示词。比如:

你是一个专业的技术助手。回答要简洁准确,代码要带注释。
如果不确定,请明确说"我不确定",不要编造答案。

6.3 开启文档对话(RAG)

Open WebUI自带RAG功能。点击对话框旁边的"+"号,上传PDF/Word/TXT文件,AI就能基于文件内容回答问题。底层用的是ChromaDB做向量存储。

6.4 多用户管理

管理员可以在Settings → Users里管理用户、设置权限。适合团队使用——每个人有自己的对话历史,管理员可以控制谁能用哪个模型。

七、用API对接你的应用

Ollama暴露了兼容OpenAI格式的API,可以直接对接你的应用:

import requests

# 调用Ollama API(兼容OpenAI格式)
response = requests.post(
    "http://localhost:11434/v1/chat/completions",
    json={
        "model": "qwen2.5:7b",
        "messages": [
            {"role": "system", "content": "你是一个代码审查助手"},
            {"role": "user", "content": "审查这段代码有没有安全问题:\n" + code}
        ],
        "temperature": 0.3
    }
)

result = response.json()
print(result["choices"][0]["message"]["content"])

如果你的应用已经对接了OpenAI API,只需要把 base_url 改成 http://localhost:11434/v1api_key 随便填,就能无缝切换到本地模型。

八、性能优化:让推理速度翻倍

8.1 确保用了GPU

# 检查Ollama是否在用GPU
ollama ps

# 输出里看PROCESSOR列
# 如果是"100% GPU"说明全用GPU
# 如果是"CPU"说明没用到GPU,需要排查

Mac的Apple Silicon(M1/M2/M3/M4)自带统一内存,Ollama会自动用Metal加速,不需要额外配置。

8.2 调整上下文窗口

# 创建自定义模型,设置更大的上下文窗口
# 创建Modelfile
cat > Modelfile << 'EOF'
FROM qwen2.5:7b
PARAMETER num_ctx 8192
PARAMETER temperature 0.7
PARAMETER top_p 0.9
EOF

# 构建自定义模型
ollama create my-qwen -f Modelfile

# 运行
ollama run my-qwen

8.3 并发请求

默认Ollama串行处理请求。如果需要并发,设置环境变量:

# Linux/Mac
export OLLAMA_NUM_PARALLEL=4
ollama serve

# 这样可以同时处理4个请求

九、常见报错排查

报错 原因 解决
Error: model not found 模型名拼错了或没pull 先 ollama pull qwen2.5:7b
Out of memory 显存/内存不够 换更小的模型,或关掉其他占内存的程序
推理速度极慢(<5 token/s) 没用上GPU 检查显卡驱动、CUDA版本;Mac检查是否Metal加速
connection refused 11434 Ollama服务没启动 ollama serve 或 sudo systemctl start ollama
Open WebUI连不上Ollama Docker网络隔离 加 --add-host=host.docker.internal:host-gateway
中文回答质量差 用了英文模型 换Qwen2.5系列,中文能力最强
模型下载慢 网络问题 设置代理:export HTTPS_PROXY=...

十、成本与硬件建议

预算 硬件方案 能跑的模型 体验
已有MacBook Air M2 8GB 不需要额外投入 7B及以下 日常对话够用,10-15 token/s
已有MacBook Pro M3 16GB 不需要额外投入 14B及以下 体验不错,15-25 token/s
2000-3000元 RTX 3060 12GB 14B及以下 GPU推理,速度好
5000-8000元 RTX 4070 Ti 16GB 32B(量化后) 体验接近云端API
15000+元 RTX 4090 24GB 32B流畅、72B勉强 企业级本地部署
租云GPU A100 80GB按小时租 72B流畅 约15-30元/小时

重要提醒:本地部署的7B模型在能力上跟GPT-4/Claude有显著差距。如果你的任务对推理质量要求高(复杂代码生成、深度分析),建议用大模型API。本地部署更适合:数据安全场景、简单对话/分类/摘要任务、开发测试环境。

省钱技巧:如果只是偶尔需要大模型能力,可以混合使用——日常简单任务用本地7B模型(零成本),复杂任务用云端API(按量付费)。这样月成本可以控制在50元以内。

本文基于Ollama 0.3.x + Open WebUI最新版本,2026年8月实测通过。

Logo

AtomGit AI 社区提供模型库、数据集、Agent、Token等资源

更多推荐