智东西7月6日消息,美团今日正式对外开源其全新万亿级参数大模型——longcat-2.0,并同步发布专为国产ai芯片深度适配的高效推理代码。该模型总参数量达1.6万亿,平均激活参数约为480亿,成为业内首个在五万张国产算力卡构成的集群上完成完整训练与推理流程的万亿参数大模型。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

▲LongCat-2.0开源(图源GitHub)
根据官方披露的评测结果,LongCat-2.0展现出卓越的综合性能。在聚焦深层工程能力的SWE-bench Pro基准测试中,其得分高达59.5,超越Gemini 3.1 Pro(54.2)、GPT-5.5(58.6)及Claude Opus 4.6(57.3);在多语言编程能力评估SWE-bench Multilingual中取得77.3分,与Claude Opus 4.6(77.8)基本持平;在终端真实指令交互测试Terminal-Bench 2.1中获得70.8分。

▲LongCat-2.0与各主流模型评分对比(图源LongCat)
在贴近实际业务场景的任务评测中,LongCat-2.0同样表现亮眼:搜索智能体能力测试RWSearch得分为78.8,生产力工具类任务FORTE得分为73.2,网页浏览理解任务BrowseComp得分为79.9,各项指标均已达到或逼近当前顶尖闭源模型水平。
智东西实测发现,LongCat-2.0在长文本生成方面具备较强的语义理解能力,能准确捕捉用户意图并输出结构清晰、可读性强的长篇内容;在编程任务中,代码生成响应迅速,但偶有不稳定现象,部分界面渲染存在异常。
此外,该模型在创意表达与3D动画生成方面亦具优势,能够快速响应用户需求并构建出符合描述的视觉化内容;其逻辑推理能力同样突出,在处理复杂数学题时步骤严谨、推导简洁。
LongCat-2.0采用MoE(Mixture of Experts)稀疏架构,原生支持长达100万token的超长上下文输入,并针对Agentic Coding(智能体编程)任务进行了专项优化,在代码理解、生成与执行环节均做了深度增强。
该模型包含三大核心技术突破:一是自主研发的LongCat稀疏注意力机制(LSA),将传统注意力计算的平方级复杂度降至线性级别,显著提升百万级长上下文下的训练与推理效率;二是在MoE专家网络之外引入N-gram Embedding作为新型参数扩展方式;三是在后训练阶段采用多教师在线蒸馏策略,将专家模块细分为Agent、推理与交互三大类别,分别强化自主执行、动态推理与安全对齐等核心能力。
智东西围绕“真实任务交付”与“高难度逻辑推理”两大维度,对LongCat-2.0展开系统性实测。
开源地址如下:
模型权重(Model Weights):
HuggingFace:
https://www.php.cn/link/4f9e0e5af19779ec492f63dfcd9104d3
GitHub:
https://www.php.cn/link/baa2df75c4532c125ce37daf4473f05e
ModelScope:
https://www.php.cn/link/8a1e9214b234a63b44c6afaeb492d195
推理代码(Inference Code):
GPU版本:
https://www.php.cn/link/92b7dfcb130a3cae6bcb5bf2156e85e3
NPU适配版:
https://www.php.cn/link/f6624d9e89c50bfc372d18455649a5c3
API平台(API Platform):
https://www.php.cn/link/df4a1c09d895e9cafa606634d20791bf
01.
长篇网文创作、AIME真题求解
一键生成3D像素世界
在真实任务执行能力验证中,我们首先检验其长文本生成与上下文一致性表现:要求模型创作一部种田题材网络小说,涵盖人物设定、百章剧情大纲及开篇章节,全文近三万字。
结果显示,模型对任务的理解精准无偏差。无论是角色背景设定、世界观铺陈,还是关键情节设计与高潮节奏把控,均体现出较强的整体规划能力。开篇以主角穿越后即将被贩卖为切入点,节奏紧凑、代入感强,完全契合网文写作规范。

▲LongCat-2.0生成的长文本
随后我们对其创意表达与逻辑能力进行交叉测试,指令其开发一款面向儿童的互动训练游戏。首次尝试“点击消泡泡”小游戏时,虽功能可运行,但界面出现方块乱码与问号占位符等显示异常。

▲LongCat-2.0生成的异常“消泡泡”游戏
第二次尝试“数字华容道”益智游戏,模型一次性输出全部可用代码,响应速度快,且运行流畅、画面规整,在多次实测中未出现卡顿或渲染错误。

▲LongCat-2.0生成的“数字华容道”游戏
我们还测试了其3D场景构建能力,指令其创建“公园长椅上玩耍风车的小朋友”这一像素风格3D艺术作品。模型首次响应即成功搭建完整场景,包含天空、绿树、木质长椅、旋转风车及动态孩童等全部要素,空间层次与细节刻画均较为到位。

▲LongCat-2.0生成的3D动画场景
为验证其逻辑推理上限,我们选用一道AIME 2026官方真题进行测试。题目如下:

▲AIME 2026真题
本题综合考查对数运算还原、指数方程求解、韦达定理应用及质因数分解能力,是典型高阶数学推理题。LongCat-2.0在60秒内完成思考,仅用四步推导即得出正确答案441。整个解题过程条理清晰、计算准确,表明其在标准化数学竞赛题上的推理链路稳定可靠。

▲LongCat-2.0对AIME真题的解题步骤
02.
数据查询、代码迁移、游戏开发
3D演示+小说创作——单模型全流程覆盖
在美团内部多轮真实场景压力测试中,LongCat-2.0展现出端到端任务闭环交付能力:
AI SQL Agent构建:业务人员可通过自然语言发起数据查询请求,LongCat-2.0自动完成意图识别、SQL生成、结果解析与可视化洞察提炼,实现从提问到决策支持的全链路自动化。

▲LongCat-2.0的内测(图源LongCat)
插件代码迁移:给定旧版插件源码与新版SDK文档,模型可自主完成架构分析、逻辑梳理、接口重构与隐患修复,最终产出兼容新平台的完整插件代码,编译一次通过,功能零丢失。

▲LongCat-2.0的内测(图源LongCat)
完整应用开发:输入“儿童AI游戏训练场”创意概念后,模型自动完成技术栈选型、页面结构设计、游戏规则建模、UI动效定义,并一次性输出首页及三个可玩小游戏的全部前端代码。

▲LongCat-2.0在内测中生成的儿童训练游戏(图源LongCat)
3D交互式演示:仅需一句自然语言描述,即可生成基于Three.js的完整3D可视化页面,包含透明烧瓶容器、荧光液体流动、泡沫喷发动态、液面下降与堆积物理效果,所有交互逻辑封装于单一HTML文件中。
AI小说工厂:依托LongCat-2.0构建的多智能体协同写作系统,支持从灵感输入开始,自动完成世界观设定、章节并行生成、质量自动评估与迭代修订,凭借百万级上下文能力保障长篇连载设定统一性,并适配微信公众号、知乎、起点等多平台格式自动发布。
03.
稀疏注意力机制、N-gram嵌入层
多教师蒸馏三项关键技术协同优化
LongCat-2.0继承LongCat-Flash整体框架,并围绕长上下文处理、代码生成与智能体任务三大方向,实施三项关键升级:
针对智能体任务中常见的百万级Token输入需求,LongCat-2.0创新引入LongCat稀疏注意力机制(LSA),融合流感知索引、跨层索引与层级化索引三重策略,在不牺牲模型精度的前提下,大幅降低内存访问碎片化与冗余计算,使超长上下文训练与推理效率显著提升。

▲LongCat稀疏注意力设计总览(图源:LongCat)
在MoE专家网络之外,LongCat-2.0新增N-gram Embedding作为第二条参数扩展路径。由于当前MoE稀疏度已达97%,单纯增加专家数量边际收益递减;而将135B参数分配至N-gram Embedding模块,可在有限参数增长下带来更优性能增益。该模块参数占比控制在10%以内,兼顾扩展效率与模型结构稳定性。

▲N-gram Embedding总览(图源:LongCat)
后训练阶段,LongCat-2.0采用多教师在线蒸馏机制,将专家模块按功能划分为Agent、推理、交互三类,分别专注自主任务执行、动态问题求解与人机安全对齐。最终借助MOPD(Multi-Objective Parameter Distribution)架构,在国产算力集群上实现三类能力无缝融合,使模型兼具深度推理、自主执行与精准交互能力。

▲基于MOPD的多专家后训练架构总览(图源:LongCat)
04.
结语:万亿参数开源的意义
智能体模型正加速迈向真实生产力落地
此前,国内已有基于国产芯片开展模型推理与微调的相关实践,但LongCat-2.0是国内首个真正意义上全程依托国产算力完成训练与推理的万亿参数大模型,训练峰值规模突破五万张国产AI加速卡,创下当前国产算力平台最大规模训练纪录。
当下,大模型竞争重心正由单纯参数比拼转向真实场景生产力转化。未来,智能体任务执行能力、工程化落地能力以及软硬协同优化能力,或将构成开源大模型新一轮竞争的核心维度。
本文来源微信公众号“智东西”(ID:zhidxcom),作者:田忠婷,编辑:程茜,36氪经授权发布。


















