Ollama 本地私有化部署 DeepSeek 与客户端接入指南
使用 Ollama 在本地 Mac (Apple Silicon)、Windows 或 Linux 服务器上部署 DeepSeek 模型,并通过标准 OpenAI 兼容接口接入编程工具与客户端。
本页内容
1. 显存与硬件需求对照表
根据你的本地设备显存(VRAM)或统一内存(Apple Silicon)选择合适参数量:
| 模型标签 | 参数量 | 最低显存/内存 | 推荐设备 |
|---|---|---|---|
deepseek-r1:1.5b | 1.5B | 4 GB | 轻薄笔记本 / 树莓派 |
deepseek-r1:7b / 8b | 7B ~ 8B | 8 GB | RTX 3060 / 4060 / Mac 8G+ |
deepseek-r1:14b | 14B | 12 GB | RTX 4070 / Mac 16G+ |
deepseek-r1:32b | 32B | 20 GB | RTX 3090 / 4090 / Mac 24G+ |
deepseek-r1:70b | 70B | 48 GB | 双卡 3090 / Mac 64G+ |
第 2 步
安装 Ollama 并一键拉取运行
- 前往 Ollama 官网 下载安装包并安装。
- 在终端中运行以下命令拉取并启动模型(以 7B 版本为例):
ollama run deepseek-r1:7b命令执行完毕后,Ollama 会自动在后台监听 http://127.0.0.1:11434 并提供完整的 OpenAI 兼容 API。
第 3 步
开启局域网与跨域服务 (可选)
若需让局域网其他电脑或 Web 前端访问本地 Ollama 服务,在系统环境变量中设置:
# macOS / Linux
export OLLAMA_HOST=0.0.0.0:11434
export OLLAMA_ORIGINS=*
ollama serve第 4 步
接入客户端与 VS Code
在任意支持自定义 OpenAI 接口的工具(如 Continue、Cherry Studio、DSH Custom Provider)中填写:
- API Base URL:
http://localhost:11434/v1 - API Key: 填写任意字符(如
ollama) - Model Name: 填写本地运行的模型名(如
deepseek-r1:7b)
5. 常见问题排查
启动报错 out of memory (OOM)
显存不足以容纳当前量化模型。请切换更小参数版本(例如从 14b 换为 7b 或 1.5b)。
输出速度过慢 (tokens/s 低)
检查模型是否被部分卸载(Offload)到 CPU 运行。使用 ollama ps 检查 GPU 层级占用情况。