LM Studio 图形化本地部署 DeepSeek 与本地服务 API 接入指南
LM Studio 提供了最友好的桌面可视化界面。无需命令行即可一键搜索下载 DeepSeek GGUF 量化模型,并启动本地 OpenAI 兼容服务器供 Cursor 或其他工具调用。
本页内容
LM Studio 模型显存推荐表
- 1.5B ~ 7B 蒸馏版: 8GB 内存 / 4GB+ 显存(普通核显笔记本 / Apple M 系列 Mac)
- 8B ~ 14B 蒸馏版: 16GB 内存 / 8GB~12GB 显存(RTX 3060 / 4060 / Mac 16GB+)
- 32B 蒸馏版: 32GB 内存 / 20GB+ 显存(RTX 3090 / 4090 / Mac 24GB+)
- 70B 蒸馏版: 64GB 统一内存 Mac 或双卡 3090/4090
第 1 步
下载 LM Studio 与搜索 DeepSeek 模型
- 前往 LM Studio 官网 下载对应系统的安装包(Windows / macOS / Linux)。
- 打开 LM Studio,点击左侧导航栏的 放大镜 (Discover 🔍)。
- 在搜索栏输入
deepseek-r1或deepseek-v3。 - 选择社区发布的优质 GGUF 量化版本(如
unsloth或bartowski提供的量化包)。推荐日常使用 Q4_K_M 量化规格,兼顾响应速度与模型智商。
国内加速下载提示:如遇下载超时,在 LM Studio 设置中将 Hugging Face 镜像域名替换为
https://hf-mirror.com 即可跑满带宽。第 2 步
开启 GPU 硬件加速与显存卸载 (GPU Offload)
在加载模型前,配置硬件加速以获得丝滑生成速度:
- macOS (Apple Silicon): 默认自动调用 Apple Metal 统一内存加速,无需手动配置。
- Windows (NVIDIA GPU): 在右侧模型控制面板中勾选 GPU Acceleration (CUDA),将 GPU Offload Layers 滑块拉至最大(全部层放入显存计算)。
第 3 步
开启本地 Local Server (OpenAI 兼容)
让本地其他软件能够调用 LM Studio 运行的 DeepSeek 模型:
- 点击左侧导航栏的 双向箭头 (Developer / Local Server ⇄) 图标。
- 在顶部下拉框选中已下载的 DeepSeek 模型。
- 点击 Start Server 启动服务。
- 默认本地监听端点为:
http://localhost:1234/v1。
第 4 步
接入 Cursor / VS Code / 编程插件
在 Cursor、Continue、Cherry Studio 或 Zotero 中配置自定义提供商:
- Base URL:
http://localhost:1234/v1 - API Key: 填写任意占位符(如
lm-studio) - Model ID: 填写当前加载的模型标识符
# 终端 curl 测试本地服务连接
curl http://localhost:1234/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{"messages": [{"role": "user", "content": "你好,请确认本地服务连接正常"}]}'常见排错清单
CUDA out of memory / 显存溢出崩溃
选取的模型参数量超过了显卡物理显存容量。请适度减少 GPU Offload 层数,或换用更小量化规格(例如从 Q8 换为 Q4_K_M,或从 14B 换为 7B/8B)。
跨设备访问报错 Connection Refused
在 LM Studio Local Server 设置中,将监听地址从 127.0.0.1 修改为 0.0.0.0 并允许局域网连接(CORS)。