WorkBuddy提供三类OCR引擎:默认内置轻量模型(支持简中/英文,不支持竖排繁体及手写体,识别快且低耗);联网时自动调用腾讯云高精度OCR(提升复杂图像召回率42%);支持本地部署Ollama多模态大模型(如qwen2-vl:7b),可离线识别手写、竖排、模糊内容并理解语义。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

你需要从一张截图、扫描件或手机相册里的图片中准确提取文字,但不确定WorkBuddy底层调用的是哪个模型——这直接关系到识别效果、是否支持手写体、能否处理竖排繁体,甚至影响你是否要提前预处理图像。
WorkBuddy默认OCR引擎(内置轻量级模型)
该模型随客户端自动安装,无需额外下载,适用于日常办公中90%的清晰截图与标准文档扫描件。
1、打开WorkBuddy桌面端,点击底部导航栏“识别”或“扫描”图标即可触发此引擎。
2、它原生支持简体中文、英文及中英文混排,但【不支持竖排文本、繁体字、手写体】,遇到这类内容会跳过或输出乱码。
3、识别速度极快,单图平均耗时1.2秒,内存占用低于300MB,适合Win10/Intel Mac用户快速响应。
腾讯云通用文字识别(高精度版)
这是WorkBuddy在联网状态下自动调用的云端模型,仅当本地引擎识别失败或用户主动启用高级功能时激活。
统一LLM网关 - 一个API对接70+AI模型,使用单一API密钥即可调用GPT、Claude、Gemini、Qwen、Deepseek、Grok等主流模型。
方法一:自然语言指令触发
在聊天框输入“用高精度OCR识别这张图”,WorkBuddy会自动切换至腾讯云API,并返回带坐标框的文字结果。
方法二:手动开启云端识别
进入【设置 → 识别设置 → OCR服务模式】,将选项从“本地优先”改为“云端优先”。【切换后所有识别请求均走腾讯云,需确保网络通畅且账户已绑定腾讯云API密钥】
该模型能处理复杂版式、小字号、低对比度图像,对发票、表格、带水印截图的召回率比本地引擎高42%。
本地多模态大模型(需手动配置)
如果你已部署Ollama并下载qwen2-vl:7b或llava:13b等视觉语言模型,WorkBuddy可通过插件调用它们执行OCR,完全离线、无隐私风险。
第一步:确认Ollama服务正在运行(终端执行ollama list,应显示qwen2-vl:7b状态为running)
第二步:在WorkBuddy中进入【设置 → 高级 → 本地模型路径】,填入Ollama API地址(默认http://127.0.0.1:11434)
第三步:新建任务时,在模型选择下拉菜单中勾选“qwen2-vl:7b(本地)”
这个组合能识别手写笔记、竖排古籍截图、模糊涂改稿,还能同步理解语义——比如识别出“¥298.50”后自动标注为“金额”,但首次加载模型需等待约8秒冷启动。
















