已获准接入MiniMax开放平台或使用海螺AI等集成abab6.5系列模型产品的用户,可通过三种实测有效路径调用:一、API直连,支持200k上下文与3万字/秒处理;二、海螺AI客户端高级模式,适配中文长文本任务;三、本地ONNX轻量化部署,支持离线高并发。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

如果您已获准接入MiniMax开放平台或正在使用海螺AI等集成abab6.5系列模型的产品,但尚未掌握其具体调用方式与最佳实践,则可能是由于模型接口配置、上下文长度管理或部署环境适配未达最优。以下是实测验证有效的多种使用路径与部署建议:
一、通过MiniMax开放平台API直接调用
该方式适用于开发者需自主控制输入输出格式、批量处理长文本或构建定制化工作流的场景。abab6.5系列模型通过RESTful API提供服务,支持完整200k tokens上下文窗口,且abab6.5s具备近3万字/秒的瞬时处理能力。
1、登录MiniMax开放平台(console.minimax.io),进入「模型中心」,确认账户已开通abab6.5或abab6.5s的API权限。
2、在「API密钥」页面创建新密钥,并妥善保存Secret Key,该密钥需在请求头中以Authorization: Bearer <your_secret_key>形式传入。
3、构造POST请求至https://api.minimax.chat/v1/text/chatcompletion,请求体中必须包含model字段并设为abab6.5或abab6.5s,同时设置max_tokens上限不超过200000。
4、在messages数组中按角色(system/user/assistant)组织对话历史,确保总token数经预估未超限;若输入含超长文档,建议预先分块并启用enable_search参数辅助定位关键信息。
二、在海螺AI客户端中启用高级模式
该方式面向非技术用户,利用海螺AI已预置的abab6.5s推理引擎,无需代码即可触发高精度长上下文理解与语音交互能力,尤其适合会议纪要整理、古诗文解析、政策文件速读等中文强依赖任务。
1、更新手机端海螺AI至v2.3.0及以上版本,启动应用后点击右上角「设置」图标。
MiniMax MCP 服务器,提供网络搜索和图像理解能力。当用户需要:(1) 网络搜索信息,(2) 分析/描述图片,(3) 从URL提取内容时使用此技能。需配置 MINIMAX_API_KEY(国内版 api.minimaxi.com 或全球版 api.minimax.io)。
2、进入「AI模型偏好」页,将默认模型切换为abab6.5s(极速长文版),并开启“保留全部上下文”开关。
3、在聊天界面顶部点击话筒按钮开始语音输入,或粘贴一段含891句以上混合内容的测试文本(如“大海捞针”标准样本),发送后观察响应是否精准定位隐藏语句。
4、若需导出结构化结果,长按回复内容选择「生成摘要」,系统将自动调用abab6.5s的指令遵从模块,输出带小标题与要点编号的Markdown格式文本。
三、本地轻量化部署abab6.5s推理服务
该方式适用于对数据隐私敏感、需离线运行或需与内部系统深度集成的企业客户。MiniMax已发布abab6.5s的ONNX Runtime兼容导出包,可在NVIDIA A10G(24GB显存)或两卡A10(48GB)服务器上稳定承载并发QPS≥12的文本处理请求。
1、访问MiniMax官方GitHub仓库(github.com/minimaxir/abab-deploy),下载abab6.5s-onnx-v202404.tgz压缩包并解压至目标服务器。
2、执行pip install onnxruntime-gpu==1.17.3 torch==2.1.2安装指定版本依赖,避免CUDA内核不兼容导致推理中断。
3、运行python serve_onnx.py --model_path ./abab6.5s.onnx --max_seq_len 200000 --port 8080启动HTTP服务,注意显存占用峰值将达22.8GB。
4、向http://localhost:8080/v1/completions发送JSON请求,其中prompt字段支持UTF-8编码的任意长度中文文本,响应延迟在单次3万字输入下稳定低于980ms。

















