DeepSeekDSH
独立社区指南与 DeepSeek 无隶属关系。下载版本与教程参考

Ollama 本地私有化部署 DeepSeek 与客户端接入指南

使用 Ollama 在本地 Mac (Apple Silicon)、Windows 或 Linux 服务器上部署 DeepSeek 模型,并通过标准 OpenAI 兼容接口接入编程工具与客户端。

本页内容

1. 显存与硬件需求对照表

根据你的本地设备显存(VRAM)或统一内存(Apple Silicon)选择合适参数量:

模型标签参数量最低显存/内存推荐设备
deepseek-r1:1.5b1.5B4 GB轻薄笔记本 / 树莓派
deepseek-r1:7b / 8b7B ~ 8B8 GBRTX 3060 / 4060 / Mac 8G+
deepseek-r1:14b14B12 GBRTX 4070 / Mac 16G+
deepseek-r1:32b32B20 GBRTX 3090 / 4090 / Mac 24G+
deepseek-r1:70b70B48 GB双卡 3090 / Mac 64G+
第 2 步

安装 Ollama 并一键拉取运行

  1. 前往 Ollama 官网 下载安装包并安装。
  2. 在终端中运行以下命令拉取并启动模型(以 7B 版本为例):
ollama run deepseek-r1:7b

命令执行完毕后,Ollama 会自动在后台监听 http://127.0.0.1:11434 并提供完整的 OpenAI 兼容 API。

第 3 步

开启局域网与跨域服务 (可选)

若需让局域网其他电脑或 Web 前端访问本地 Ollama 服务,在系统环境变量中设置:

# macOS / Linux export OLLAMA_HOST=0.0.0.0:11434 export OLLAMA_ORIGINS=* ollama serve
第 4 步

接入客户端与 VS Code

在任意支持自定义 OpenAI 接口的工具(如 Continue、Cherry Studio、DSH Custom Provider)中填写:

  • API Base URL: http://localhost:11434/v1
  • API Key: 填写任意字符(如 ollama)
  • Model Name: 填写本地运行的模型名(如 deepseek-r1:7b)

5. 常见问题排查

启动报错 out of memory (OOM)

显存不足以容纳当前量化模型。请切换更小参数版本(例如从 14b 换为 7b 或 1.5b)。

输出速度过慢 (tokens/s 低)

检查模型是否被部分卸载(Offload)到 CPU 运行。使用 ollama ps 检查 GPU 层级占用情况。

参考来源