需开通Minimax文档解析权限并按路径上传:一、登录平台开通权限;二、Web端传PDF(≤200页/100MB);三、识图图标传图片/PDF启用OCR;四、API分片处理超大文件;五、批量OCR扫描件PDF。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

如果您尝试使用海螺AI对本地文档进行内容理解、结构提取或问答交互,但发现无法直接粘贴全文或系统提示“不支持该格式”,则可能是由于未启用文件上传通道、文件类型不在白名单内或账号权限受限。以下是实现文件上传与分析的具体操作路径:
一、确认Minimax文档解析权限已开通
海螺AI的文件分析能力依赖后台Minimax平台的文档解析服务,未开通权限时,所有PDF、扫描件及结构化报表上传入口将被禁用或仅返回“格式不支持”提示。
1、访问https://www.php.cn/link/403965e22c311cf3c37ebc98554b1ece并使用海螺AI关联账号登录。
2、在左侧导航栏点击“模型服务” → “文档解析”,查看状态栏是否显示已启用。
3、若显示“未开通”,点击“申请开通”按钮,并完成企业认证或开发者身份验证。
二、通过Web界面上传PDF并启动解析
该方式适用于单次处理≤200页、总大小≤100MB的PDF文件,系统自动执行OCR识别(含扫描件)、文本层重建与语义分块,为后续问答提供可靠上下文基础。
1、进入Minimax文档解析控制台后,点击新建解析任务按钮。
2、在弹出窗口中点击“选择文件”,仅支持扩展名为.pdf的文件。
3、勾选启用结构化提取与保留页码索引两项选项。
4、点击“开始解析”,等待状态栏变为已完成,即可导出结构化文本或跳转至海螺AI对话界面发起提问。
三、上传图片或扫描件启用OCR识别
该方法适用于发票、合同截图、手写笔记等图像类材料,调用MiniMax自研abab6.5 MoE模型中的多模态专家模块,先完成高精度文字识别,再激活语义理解进行关键信息抽取。
1、点击海螺AI界面右下角识图图标。
2、选择本地JPG/PNG/PDF文件(单文件≤100MB)。
3、上传完成后,系统自动触发OCR流程;若识别效果不佳,可手动点击重试OCR切换引擎模式。
4、OCR结束即进入分析阶段,在提示框中输入具体任务,例如:“提取本张发票的开票日期、金额与销售方名称”。
四、调用API接口实现超大文件分片处理
针对超过200页或单文件超100MB的PDF,需拆分为多个逻辑段落分别上传,再通过API注入上下文锚点,引导模型建立跨段推理链,避免信息割裂。
1、在Minimax控制台“API密钥”页面复制有效Secret Key,并记录Endpoint地址:https://api.minimax.io/v1/document/parse。
2、对PDF执行预分割:使用pdfseparate或Python PyPDF2按每50页切分,生成doc_part_1.pdf至doc_part_n.pdf。
3、逐个构造POST请求,Header中设置Authorization: Bearer {your_secret_key},Body为multipart/form-data,包含file字段与mode=structure。
4、每份分片解析完成后,获取task_id,向/v1/document/result?task_id={id}轮询直至status为success,再将各段文本按原始顺序拼接并注入海螺AI会话。
五、对PDF扫描件进行批量OCR处理
针对多页PDF文档,海螺AI支持整份文件上传后逐页解析,保留原始页码索引与图文位置关系,特别适用于合同、论文、教材等学术与办公材料的数字化归档。
1、点击底部识图图标,进入上传页后点击右上角“更多”按钮。
2、选择上传PDF,从文件管理器中选取本地PDF文件(≤50页,总大小≤30MB)。
3、上传完成后,系统显示分页缩略图,每页右下角标注OCR中…状态标签。
4、待全部页面识别完毕,点击“导出文本”,选择“按页分段”或“合并为单文本”,生成带页码标记的Markdown格式结果。


















