高级

本地跑大模型实战:Ollama 从零到私有知识库

用 Ollama + Open WebUI 在自己电脑上搭建完全离线的 AI 助手和文档知识库。

2026 年 8 月 6 日2 分钟读完本地部署

为什么要本地跑模型?

  • 隐私:聊天记录、公司文档不出本机
  • 免费:跑起来之后不限次数
  • 离线:没网也能用

代价是吃硬件:8GB 内存起步,16GB 舒适;有独显更好(显存越大能跑的模型越大)。

第一步:安装 Ollama

ollama.com 下载对应系统的安装包,装完后在终端验证:

ollama --version

第二步:跑第一个模型

# 7B 级别模型,8G 内存可跑
ollama run qwen3:8b

第一次会下载模型(几个 GB),之后直接进入对话。/bye 退出。

模型选择速查:

硬件推荐模型
8G 内存 / 6G 显存qwen3:4b、gemma3:4b
16G 内存 / 8G 显存qwen3:8b、deepseek-r1:8b
32G+ / 16G 显存qwen3:14b 及以上

第三步:装上图形界面(Open WebUI)

docker run -d -p 3000:8080 \
  -v open-webui:/app/backend/data \
  -e OLLAMA_BASE_URL=http://host.docker.internal:11434 \
  --name open-webui \
  ghcr.io/open-webui/open-webui:main

打开 http://localhost:3000,注册账号后就能在浏览器里用本地模型聊天了。

第四步:搭建私有知识库

Open WebUI 里点击「知识库」→ 上传你的 PDF / Markdown 文档 → 对话时选中该知识库。它会自动做 RAG:先从你的文档里检索相关内容,再让模型基于内容回答,答案带引用出处

常见问题

  • 速度慢:换小一档的模型;Mac 的 M 系列芯片体验最佳
  • 连不上 Ollama:确认 ollama serve 在运行(Docker 场景注意地址用 host.docker.internal
  • 想要 APIhttp://localhost:11434/v1 就是 OpenAI 兼容接口,直接给其他应用用
#Ollama#本地部署#RAG