讲师中心 微信公众号
AI工具推荐 视频效率加速

OnlyAI怎么离线使用_OnlyAI本地部署轻量模型教程

老静吖_7846

老静吖_7846

发布时间:2026-03-02 16:38:56

|

710人浏览过

|

来源于php中文网

原创

OnlyAI可离线运行,需替换为Ollama托管模型、部署Qwen1.5-0.5B代理层、嵌入all-MiniLM-L6-v2向量化、冻结前端直连FastAPI后端,或启用CPU-only PyTorch模式。

☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

onlyai怎么离线使用_onlyai本地部署轻量模型教程

如果您希望在无网络连接或隐私敏感环境下运行OnlyAI,但发现其默认依赖在线API或云端服务,则可能是由于未完成本地模型加载与服务绑定。以下是实现OnlyAI离线运行的多种可行路径:

一、替换为Ollama托管的轻量级替代模型

Ollama支持将Hugging Face上兼容GGUF格式的轻量模型(如Phi-4-mini-reasoning、all-MiniLM-L6-v2)封装为本地可调用服务,无需联网即可响应OnlyAI前端请求。该方法规避了原生OnlyAI对远程推理端点的硬编码依赖。

1、确认系统已安装Ollama并运行服务:执行ollama --version验证版本不低于0.3.12,且ollama list返回空列表或已有模型。

2、从Hugging Face下载目标模型权重文件(如phi-4-mini-reasoning.Q4_K_M.gguf),保存至本地路径/models/phi-4-mini-reasoning/。

3、在该目录下创建Modelfile,内容为:
FROM ./phi-4-mini-reasoning.Q4_K_M.gguf
PARAMETER num_ctx 2048
PARAMETER stop "###"

4、执行ollama create onlyai-offline -f ./Modelfile构建自定义模型。

5、启动服务:ollama run onlyai-offline,此时终端进入交互式本地推理会话。

二、使用Qwen1.5-0.5B构建All-in-One离线代理层

通过部署Qwen1.5-0.5B作为中间代理模型,接收OnlyAI原始输入,经Prompt工程转换后执行情感分析或对话生成,并将结构化结果回传。该方案仅需单个0.5B参数模型,完全脱离GPU与外部API。

1、新建Python虚拟环境:conda create -n onlyai-local python=3.10,激活后安装依赖:pip install torch==2.0.1 transformers==4.30.2 accelerate。

2、下载Qwen1.5-0.5B模型权重包(qwen1.5-0.5b),解压至./models/qwen1.5-0.5b目录。

3、编写proxy_server.py,使用transformers.pipeline加载模型,监听本地http://127.0.0.1:8000/onlyai/invoke端点。

4、修改OnlyAI客户端配置,将所有https://api.onlyai.com/v1/请求重定向至http://127.0.0.1:8000/onlyai/invoke。

5、运行python proxy_server.py,启动纯CPU离线代理服务。

三、嵌入all-MiniLM-L6-v2实现本地语义向量化

若OnlyAI核心功能依赖文本相似度匹配或检索增强(RAG),可直接集成all-MiniLM-L6-v2作为本地embedding引擎。该模型体积仅22.7MB,支持中英文混合输入,单句编码耗时低于35ms,全程离线运行。

1、执行ollama pull mxbai-embed-large或手动下载GGUF版all-MiniLM-L6-v2.Q6_K.gguf。

2、创建Embedding服务脚本embed_service.py,调用sentence-transformers库加载模型,暴露/v1/embeddings接口。

Qwen Vision
Qwen Vision

利用通义千问视觉API(阿里云灵积)分析图像和视频,支持图像理解、OCR及视觉推理。

下载

3、设置OnlyAI配置文件中的EMBEDDING_PROVIDER为local,并指定EMBEDDING_ENDPOINT=http://127.0.0.1:8001/v1/embeddings。

4、运行python embed_service.py,启动本地向量服务。

5、验证:发送POST请求至http://127.0.0.1:8001/v1/embeddings,携带{"input": "测试文本"},确认返回data[0].embedding为384维浮点数组。

四、冻结OnlyAI Web前端+本地FastAPI后端直连

剥离OnlyAI的云端JavaScript SDK,将其静态资源(HTML/CSS/JS)下载至本地./dist目录,再用FastAPI构建最小后端,直接调用本地模型API,彻底切断外网请求链路。

1、使用curl -k https://onlyai.com/static/app.js -o ./dist/app.js获取前端逻辑,搜索fetch(定位所有API调用点。

2、将所有fetch("https://api.onlyai.com/...替换为fetch("/api/...。

3、新建main.py,基于FastAPI定义/api/chat等路由,内部调用transformers.pipeline或Ollama requests.post("http://localhost:11434/api/chat")。

4、配置CORS中间件允许http://localhost:3000访问,启用静态文件服务指向./dist。

5、执行uvicorn main:app --host 0.0.0.0 --port 3000,浏览器访问http://localhost:3000即启用全离线OnlyAI。

五、启用CPU-only PyTorch + 内存优化模式

当OnlyAI底层调用PyTorch模型但报错“CUDA out of memory”或“no module named torch.cuda”,说明其尝试启用GPU失败。强制切换至CPU推理并开启内存压缩,可保障基础功能离线可用。

1、卸载GPU版本PyTorch:pip uninstall torch torchvision torchaudio。

2、安装CPU专用版本:pip install torch==2.0.1+cpu torchvision==0.15.2+cpu torchaudio==2.0.2+cpu -f https://download.pytorch.org/whl/torch_stable.html。

3、在OnlyAI启动前设置环境变量:export PYTORCH_CUDA_ALLOC_CONF=max_split_size_mb:128与export TRANSFORMERS_MEMORY_EFFICIENT=true。

4、验证CUDA状态:python -c "import torch; print(torch.cuda.is_available())"应输出False。

5、启动OnlyAI主程序,观察日志中是否出现Using device: cpu及Memory-efficient attention enabled提示。

热门AI工具

更多
UpDream
UpDream Hot

一款AI视频创作工具,主要用于哔哩哔哩推出的自研AI视频创作工具,适合需要提升相关任务效率的用户。

豆包大模型

豆包大模型是一款由字节跳动推出的企业级大语言模型服务平台。

SkildArt
SkildArt Hot

SkildArt是一款AI文本写作工具,一站式 AI 视觉创作平台。

VibeKnow
VibeKnow Hot

一款AI视频创作工具,主要用于全球首个AI知识视频创作平台,文档、文章、网页,一键生成视频,适合需要提升相关任务效率的用户。

WorkBuddy

一款AI办公效率工具,主要用于腾讯云推出的AI原生桌面智能体工作台,适合需要提升相关任务效率的用户。

咔片AIPPT

一款在线AI演示文稿制作工具,可根据主题和内容需求辅助生成PPT结构与页面,提高演示材料制作效率。

DeepSeek

DeepSeek是一款面向对话、写作、编程和推理场景的AI大模型工具。

音述AI
音述AI Hot

一款AI音频处理工具,主要用于音述AI是一个以“用声音述说故事”为核心的 AI 音乐创作与声音分享社区,适合需要提升相关任务效率的用户。

Loomy
Loomy Hot

一款AI工具,主要用于科大讯飞发布的桌面级 AI 助理,比 OpenClaw 更易用、更安全!,适合需要提升相关任务效率的用户。

相关专题

更多
FrankenPHP集成Laravel详细教程
FrankenPHP集成Laravel详细教程

本专题提供FrankenPHP集成Laravel的详细配置指南,全面解析运行原理、开发环境搭建、Caddyfile配置、Octane工作模式、数据库连接、队列任务、定时任务和生产环境优化,解决部署过程中常见的报错与兼容性问题。

0

2026.10.08

LLVM自定义Pass怎么写
LLVM自定义Pass怎么写

本专题聚焦LLVM自定义Pass开发,整理Pass类结构、run()方法、PreservedAnalyses、CMake构建、插件注册、-load-pass-plugin加载和测试用例编写流程。

120

2026.09.30

LLVM RISC-V参数配置教程
LLVM RISC-V参数配置教程

本专题介绍LLVM对RISC-V基础ISA和扩展的支持方式,涵盖RV32、RV64、标准扩展、实验性扩展、厂商扩展、-menable-experimental-extensions和版本差异。

100

2026.09.30

LLVM IR中间表示入门指南
LLVM IR中间表示入门指南

本专题整理LLVM IR的核心概念,包括中间表示作用、模块结构、函数、基本块、SSA形式、类型系统和常见语法,帮助新手理解LLVM编译流程中的关键层。

80

2026.09.30

PDF转图片方法
PDF转图片方法

需要把 PDF 页面用于上传、预览、分享或图片归档时,PDF 转图片方法专题整理 JPG/PNG 格式选择、逐页导出、清晰度设置、批量下载和结果检查等流程,帮助用户稳定完成 PDF 图片化处理。

80

2026.09.30

PixTV AI视频生成与无限画布创作
PixTV AI视频生成与无限画布创作

PixTV专题整理AI视频与视觉内容创作相关功能使用教程,涵盖AI生图、视频生成、无限画布、多模型创作、素材管理、声音音乐及视频剪辑等功能,帮助用户快速掌握PixTV从创意到成片的完整制作方法。

100

2026.09.29

Buffalo框架数据库开发全教程
Buffalo框架数据库开发全教程

本专题围绕Buffalo框架数据库开发,讲解database.yml多环境配置、soda与fizz迁移生成回滚、模型结构体标签、增删改查与条件查询、一对多与多对多关联、数据校验、回调钩子、事务处理及原生SQL执行能力。

300

2026.09.23

Buffalo框架路由与请求处理实操指南
Buffalo框架路由与请求处理实操指南

本专题讲解Buffalo框架路由与请求处理机制,涵盖路由注册与分组、资源路由、Handler编写规范、Context上下文方法、参数绑定、中间件编写挂载、Session与Cookie读写、Flash消息及错误页面定制方法。

180

2026.09.23

Buffalo框架零基础入门教程
Buffalo框架零基础入门教程

本专题整理Buffalo框架入门内容,涵盖Go环境准备、buffalo CLI安装、新项目生成、目录结构说明、dev热加载启动、数据库连接配置与常见报错排查,帮助新手按约定优于配置的思路跑通第一个Buffalo框架应用。

140

2026.09.23

热门下载

更多
网站特效
/
网站源码
/
网站素材
/
前端模板

精品课程

更多
相关推荐
/
热门推荐
/
最新课程
关于我们 免责申明 举报中心 意见反馈 讲师合作 广告合作 最新更新
php中文网:公益在线php培训,帮助PHP学习者快速成长!
关注服务号
PHP中文网订阅号
每天精选资源文章推送

Copyright 2014-2026 https://www.php.cn/ All Rights Reserved | php.cn