本地部署DeepSeek有五种主流路径:一、Ollama一键部署,适合小白,命令行执行ollama run deepseek-r1:7b即可;二、Hugging Face+Transformers手动部署,支持量化与微调;三、Gradio构建WebUI,访问http://localhost:7860交互;四、Cherry Studio桌面客户端,集成知识库与RAG;五、AMD用户可用LM Studio+ROCm加载GGUF模型。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

如果您希望在本地设备上运行DeepSeek模型,实现完全离线、数据不出域的AI能力,则可能面临环境配置、模型加载与交互界面搭建等环节的挑战。以下是完成DeepSeek本地部署并成功运行的多种可行路径:
一、使用Ollama一键部署方案
Ollama为轻量级本地大模型运行框架,适合无编程基础用户快速启动DeepSeek,全程无需手动下载模型文件或配置Python环境。
1、访问Ollama官网(https://ollama.com),下载对应操作系统(Windows/macOS/Linux)的安装包。
2、Windows用户建议安装至C盘根目录,双击安装包按提示完成安装。
3、按下Win+R键,输入cmd打开命令行窗口,执行:ollama -v,确认返回版本号(如0.5.7)即表示安装成功。
4、在命令行中执行:ollama run deepseek-r1:7b,系统将自动拉取并加载7B参数版本模型。
5、首次运行需等待模型下载完成(约2–5GB,取决于网络),完成后即可直接输入问题进行交互。
二、基于Hugging Face + Transformers手动部署
该方式提供更高控制权,支持模型量化、自定义tokenizer、多GPU分片及LoRA微调,适用于有Python开发经验的用户。
1、创建独立conda环境:conda create -n deepseek_env python=3.10,并激活环境。
2、安装PyTorch(匹配CUDA版本):pip install torch torchvision torchaudio --extra-index-url https://download.pytorch.org/whl/cu118。
3、安装核心库:pip install transformers accelerate bitsandbytes。
4、从Hugging Face加载模型(需登录并接受许可):from transformers import AutoModelForCausalLM, AutoTokenizer; model = AutoModelForCausalLM.from_pretrained("deepseek-ai/deepseek-r1-7b", device_map="auto")。
5、启用4-bit量化以降低显存占用:model = AutoModelForCausalLM.from_pretrained("deepseek-ai/deepseek-r1-7b", load_in_4bit=True, device_map="auto")。
三、Gradio图形界面快速启用
在命令行交互不便时,可通过Gradio快速构建本地WebUI,无需前端开发知识,所有操作均在Python脚本中完成。
1、安装Gradio:pip install gradio==4.0.0。
2、新建web_demo.py文件,填入以下核心逻辑:
统一LLM网关 - 一个API对接70+AI模型,使用单一API密钥即可调用GPT、Claude、Gemini、Qwen、Deepseek、Grok等主流模型。
3、修改代码中model_path变量为本地模型所在路径(如"./deepseek-r1-7b")。
4、在终端执行:python web_demo.py,启动后访问http://localhost:7860即可使用网页对话界面。
5、支持通过--server-port 8080等参数自定义端口,避免端口冲突。
四、Cherry Studio桌面客户端接入
Cherry Studio是开源跨平台AI客户端,提供可视化模型管理、会话历史、角色设定与知识库上传功能,适合日常高频使用。
1、前往Cherry Studio官网(https://cherry-studio.app)下载安装包,完成傻瓜式安装。
2、启动软件后,在设置中选择Backend → Ollama,确保Ollama服务正在运行。
3、在模型列表中刷新,确认deepseek-r1:7b已显示为可用状态。
4、点击“新建会话”,选择该模型,即可进入带格式化输出、复制按钮和上下文记忆的聊天界面。
5、如需构建个人知识库,可点击左侧“知识库”面板,上传PDF/Markdown/TXT文件并启用RAG检索。
五、显卡兼容性适配与AMD用户特别路径
AMD显卡用户无法直接使用CUDA生态,需通过ROCm或兼容层间接运行,Ollama目前仅原生支持NVIDIA GPU,但存在替代方案。
1、AMD用户须安装ROCm 5.7+驱动(推荐25.1.1版本),并验证hipcc编译器可用。
2、使用LM Studio替代Ollama:下载LM Studio(https://lmstudio.ai),其内置ROCm支持模块,可识别AMD显卡并加载GGUF格式模型。
3、在LM Studio中搜索deepseek-r1,选择GGUF量化版(如Q4_K_M),点击下载并加载。
4、加载成功后,点击右下角“Chat”按钮,即可在本地GUI中进行离线对话,无需命令行干预。
5、若显存不足,可在LM Studio设置中启用GPU Offloading(部分层卸载至CPU),平衡响应速度与资源占用。


















