必须纯离线部署DeepSeek模型:①联网机导出依赖清单并下载wheel包;②下载校验模型压缩包;③离线机用Miniconda创建环境并本地安装;④Gradio或Ollama方式加载模型启动问答服务。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

要在无网络连接的电脑上运行DeepSeek模型并实现本地问答,必须绕过所有在线依赖环节,从环境、模型、UI到服务全部走纯离线路径——任何一步尝试联网都会导致部署失败或卡在下载阶段。
准备离线资源包(联网机操作)
这一步必须在有网的机器上完成,且不能跳过校验环节。直接复制粘贴命令即可执行:
① 创建隔离环境并导出纯净依赖清单:
conda create -n ds-offline python=3.10 && conda activate ds-offline && pip install torch==2.1.0+cu121 transformers==4.35.0 accelerate==0.27.2 gradio==4.39.0 && pip freeze > requirements.txt
② 批量下载wheel包(关键!必须加--no-deps避免递归联网):
pip download -r requirements.txt --no-deps --platform manylinux2014_x86_64 --python-version 310 --only-binary=:all: -d ./wheels
③ 下载模型压缩包:访问 Hugging Face 镜像站(hf-mirror.com),搜索 deepseek-ai/DeepSeek-R1-Distill-Qwen-7B,下载完整 .safetensors + config.json + tokenizer 的 tar.gz 包,命名为 deepseek-r1-7b-offline.tar.gz;【务必用 sha256sum 核对哈希值,否则解压后会报 model not found】
④ 将 ./wheels/ 目录和 deepseek-r1-7b-offline.tar.gz 一起打包成 offline-pkg.zip,拷贝至目标离线机的 /opt/deepseek/ 路径下。
离线机安装Miniconda与专用环境
不要复用系统Python,也不要调用conda默认源——所有包必须来自本地wheel。
下载 Miniconda3-latest-Linux-x86_64.sh(提前在联网机下载好)并执行:
bash Miniconda3-latest-Linux-x86_64.sh -b -p $HOME/miniconda3
初始化conda并创建空环境:
$HOME/miniconda3/bin/conda init bash && source ~/.bashrc && conda create -n ds-local python=3.10 -y
激活后强制仅从本地安装:
conda activate ds-local && pip install --find-links ./wheels --no-index --upgrade --force-reinstall torch transformers accelerate gradio
加载模型并启动问答服务
方法一:用Gradio写最简推理脚本(推荐,无需额外UI软件)
解压模型到固定路径:
tar -xzf deepseek-r1-7b-offline.tar.gz -C /opt/deepseek/models/
新建 app.py,内容如下:
from transformers import AutoModelForCausalLM, AutoTokenizer
import gradio as gr
import os
os.environ["HF_HUB_OFFLINE"] = "1"
model = AutoModelForCausalLM.from_pretrained("/opt/deepseek/models/DeepSeek-R1-Distill-Qwen-7B", device_map="auto")
tokenizer = AutoTokenizer.from_pretrained("/opt/deepseek/models/DeepSeek-R1-Distill-Qwen-7B")
def respond(msg): return tokenizer.decode(model.generate(tokenizer.encode(msg, return_tensors="pt").to("cuda"))[0])
gr.ChatInterface(respond).launch(server_name="0.0.0.0", server_port=7860, share=False)
运行:
python app.py
方法二:用Ollama离线加载(需提前在联网机导出模型)
在联网机执行:
ollama create ds7b -f Modelfile
其中Modelfile内容为:
FROM /path/to/deepseek-r1-7b-offline.tar.gz
RUN chmod -R 755 /root/.ollama/models/blobs/
SAVE ds7b
导出为 ollama-ds7b.tar:
ollama save ds7b > ollama-ds7b.tar
在离线机导入:
ollama load
【注意:Ollama方式必须用ollama load命令导入,不能直接复制models目录,否则无法识别】
绑定内网地址供多设备访问
默认Gradio只监听127.0.0.1,局域网其他设备无法访问。修改app.py中launch参数:
gr.ChatInterface(respond).launch(
server_name="0.0.0.0",
server_port=7860,
share=False,
auth=("admin", "123456")
)
防火墙放行端口:
sudo ufw allow 7860
在同局域网的手机或另一台电脑浏览器中输入 http://[离线机IP]:7860 即可打开问答界面。



















