为什么要本地跑模型?
- 隐私:聊天记录、公司文档不出本机
- 免费:跑起来之后不限次数
- 离线:没网也能用
代价是吃硬件:8GB 内存起步,16GB 舒适;有独显更好(显存越大能跑的模型越大)。
第一步:安装 Ollama
到 ollama.com 下载对应系统的安装包,装完后在终端验证:
ollama --version
第二步:跑第一个模型
# 7B 级别模型,8G 内存可跑
ollama run qwen3:8b
第一次会下载模型(几个 GB),之后直接进入对话。/bye 退出。
模型选择速查:
| 硬件 | 推荐模型 |
|---|---|
| 8G 内存 / 6G 显存 | qwen3:4b、gemma3:4b |
| 16G 内存 / 8G 显存 | qwen3:8b、deepseek-r1:8b |
| 32G+ / 16G 显存 | qwen3:14b 及以上 |
第三步:装上图形界面(Open WebUI)
docker run -d -p 3000:8080 \
-v open-webui:/app/backend/data \
-e OLLAMA_BASE_URL=http://host.docker.internal:11434 \
--name open-webui \
ghcr.io/open-webui/open-webui:main
打开 http://localhost:3000,注册账号后就能在浏览器里用本地模型聊天了。
第四步:搭建私有知识库
Open WebUI 里点击「知识库」→ 上传你的 PDF / Markdown 文档 → 对话时选中该知识库。它会自动做 RAG:先从你的文档里检索相关内容,再让模型基于内容回答,答案带引用出处。
常见问题
- 速度慢:换小一档的模型;Mac 的 M 系列芯片体验最佳
- 连不上 Ollama:确认
ollama serve在运行(Docker 场景注意地址用host.docker.internal) - 想要 API:
http://localhost:11434/v1就是 OpenAI 兼容接口,直接给其他应用用