DeepSeek本地部署首选Ollama一键方案:访问ollama.com下载安装,执行ollama run deepseek-r1:7b自动拉取加载7B模型,支持Windows/macOS/Linux,无需手动配置环境,适合无编程基础用户快速启动。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

你想在自己的电脑上跑DeepSeek模型,但不确定该用Ollama一键拉取、LM Studio图形界面加载,还是手动配置Python调用API——这三种路径的适用前提、硬件门槛和后续扩展能力完全不同,选错会导致模型加载失败、API连不上、甚至显存爆满蓝屏。
先看你的硬件能不能扛住
打开任务管理器(Ctrl+Shift+Esc),切到“性能”页签,记下两项真实数据:【GPU显存容量】和【物理内存总量】。这两项数字直接决定你能走哪条路:
• 显存<6GB 或无独立GPU → 只能选Ollama + 1.5B/7B模型,别碰32B;
• 显存≥12GB(如RTX 4070 Ti)→ Ollama或LM Studio都可,但LM Studio对GGUF格式支持更稳;
• 内存<16GB → 即使有高端显卡,Ollama加载32B模型也会因内存交换频繁而卡死,此时必须降级到7B或改用量化版。
Ollama方式:命令行快速启动,适合开发者
方法一:全自动拉取(仅限网络畅通且模型已上Ollama官方库)
打开终端,执行ollama run deepseek-r1:7b,Ollama会自动下载、解压、加载模型并进入交互模式。
方法二:离线加载(适用于内网环境或想控制模型文件位置)
从Hugging Face下载GGUF格式的deepseek-r1-Q4_K_M.gguf文件 → 把它放进~/.ollama/models目录 → 运行ollama create my-deepseek -f Modelfile,其中Modelfile内容为:FROM ./deepseek-r1-Q4_K_M.gguf → 执行ollama run my-deepseek。
注意:Ollama默认只监听localhost:11434,如果要用Python脚本远程调用,必须先编辑~/.ollama/config.json,把"host": "127.0.0.1"改成"host": "0.0.0.0",否则外部机器无法访问。
LM Studio方式:点选式操作,适合非程序员
第一步:安装LM Studio 0.3.10或更高版本,安装时勾选“Add to PATH”选项;
统一LLM网关 - 一个API对接70+AI模型,使用单一API密钥即可调用GPT、Claude、Gemini、Qwen、Deepseek、Grok等主流模型。
第二步:打开软件 → 左下角点击“Local Server” → 开启“Enable local server”并记下端口号(默认8080);
第三步:点击左侧“Search Models” → 输入“deepseek” → 选择带“GGUF”标签的模型(如deepseek-r1-7b-q8_0)→ 点击“Download”;
第四步:下载完成后,点击右上角“Open Model Folder” → 确认模型文件夹结构是两层嵌套(例如D:\models\deepseek\r1-7b),【不能直接放在D:\models\deepseek-r1-7b.gguf一级目录下】;
第五步:回到主界面 → 点击“Select Model” → 浏览到D:\models这一级目录 → 软件会自动扫描子文件夹并列出可用模型 → 选中后点击“Load”。
Python直连API方式:需要自己写代码调用
方法一:对接Ollama本地服务(最轻量)
确保Ollama正在运行 → 在Python中安装requests库 → 发送POST请求到http://localhost:11434/v1/chat/completions,body里必须包含{"model": "deepseek-r1:7b", "messages": [{"role": "user", "content": "你好"}]};
方法二:对接LM Studio内置服务(无需额外服务进程)
启动LM Studio并加载好模型 → 在Python中构造请求到http://localhost:8080/v1/chat/completions → 请求头加Content-Type: application/json → body结构与Ollama完全一致;
方法三:绕过前端工具,用transformers+llama.cpp直载(仅限高级用户)
安装llama-cpp-python → 下载GGUF模型 → 编写Python脚本初始化Llama类,指定n_gpu_layers=32(RTX 4090)或n_gpu_layers=0(纯CPU)→ 调用model.create_chat_completion()接口;
这一步容易踩坑:若n_gpu_layers设得比显存实际能容纳的层数还高,程序会直接崩溃退出,不会报错提示。


















