DeepSeekDSH
独立社区指南与 DeepSeek 无隶属关系。下载版本与教程参考

LM Studio 图形化本地部署 DeepSeek 与本地服务 API 接入指南

LM Studio 提供了最友好的桌面可视化界面。无需命令行即可一键搜索下载 DeepSeek GGUF 量化模型,并启动本地 OpenAI 兼容服务器供 Cursor 或其他工具调用。

本页内容
LM Studio 模型显存推荐表
  • 1.5B ~ 7B 蒸馏版: 8GB 内存 / 4GB+ 显存(普通核显笔记本 / Apple M 系列 Mac)
  • 8B ~ 14B 蒸馏版: 16GB 内存 / 8GB~12GB 显存(RTX 3060 / 4060 / Mac 16GB+)
  • 32B 蒸馏版: 32GB 内存 / 20GB+ 显存(RTX 3090 / 4090 / Mac 24GB+)
  • 70B 蒸馏版: 64GB 统一内存 Mac 或双卡 3090/4090
第 1 步

下载 LM Studio 与搜索 DeepSeek 模型

  1. 前往 LM Studio 官网 下载对应系统的安装包(Windows / macOS / Linux)。
  2. 打开 LM Studio,点击左侧导航栏的 放大镜 (Discover 🔍)。
  3. 在搜索栏输入 deepseek-r1 或 deepseek-v3。
  4. 选择社区发布的优质 GGUF 量化版本(如 unsloth 或 bartowski 提供的量化包)。推荐日常使用 Q4_K_M 量化规格,兼顾响应速度与模型智商。
国内加速下载提示:如遇下载超时,在 LM Studio 设置中将 Hugging Face 镜像域名替换为 https://hf-mirror.com 即可跑满带宽。
第 2 步

开启 GPU 硬件加速与显存卸载 (GPU Offload)

在加载模型前,配置硬件加速以获得丝滑生成速度:

  • macOS (Apple Silicon): 默认自动调用 Apple Metal 统一内存加速,无需手动配置。
  • Windows (NVIDIA GPU): 在右侧模型控制面板中勾选 GPU Acceleration (CUDA),将 GPU Offload Layers 滑块拉至最大(全部层放入显存计算)。
第 3 步

开启本地 Local Server (OpenAI 兼容)

让本地其他软件能够调用 LM Studio 运行的 DeepSeek 模型:

  1. 点击左侧导航栏的 双向箭头 (Developer / Local Server ⇄) 图标。
  2. 在顶部下拉框选中已下载的 DeepSeek 模型。
  3. 点击 Start Server 启动服务。
  4. 默认本地监听端点为:http://localhost:1234/v1。
第 4 步

接入 Cursor / VS Code / 编程插件

在 Cursor、Continue、Cherry Studio 或 Zotero 中配置自定义提供商:

  • Base URL: http://localhost:1234/v1
  • API Key: 填写任意占位符(如 lm-studio)
  • Model ID: 填写当前加载的模型标识符
# 终端 curl 测试本地服务连接 curl http://localhost:1234/v1/chat/completions \ -H "Content-Type: application/json" \ -d '{"messages": [{"role": "user", "content": "你好,请确认本地服务连接正常"}]}'

常见排错清单

CUDA out of memory / 显存溢出崩溃

选取的模型参数量超过了显卡物理显存容量。请适度减少 GPU Offload 层数,或换用更小量化规格(例如从 Q8 换为 Q4_K_M,或从 14B 换为 7B/8B)。

跨设备访问报错 Connection Refused

在 LM Studio Local Server 设置中,将监听地址从 127.0.0.1 修改为 0.0.0.0 并允许局域网连接(CORS)。

参考来源