过去几天,ai领域再度迎来密集爆发:
OpenAI将Codex与ChatGPT深度整合,并同步取消Codex原有的5小时使用时长限制,还为用户一次性重置了额度;
Anthropic再度延长Claude Fable 5的限时优惠周期,同时Claude Code周额度提升50%的活动仍在持续进行中;
Grok 4.5口碑迅速攀升,不少用户反馈其实际体验已超越Opus 4.8,马斯克这次或真要跻身第一梯队;
腾讯混元Hy3仅激活21B参数,却敢于直面更大规模的旗舰模型,在多项任务中表现不落下风,WorkBuddy用户规模持续高速增长;
智谱正式推出“TouchHigh摸高计划”,宣布未来两年将重点投入长程任务、自治智能体、完全自我训练及安全治理体系构建。
信息洪流令人应接不暇,但串联起来看,清晰的趋势脉络已然浮现。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

趋势一:前沿模型的领先窗口正急剧收窄
此前大家还在热议Fable 5与GPT-5.6的基准测试成绩,如今Grok 4.5已被广泛评价为“比Opus 4.8更顺手”;
腾讯Hy3凭借仅21B的激活参数,在部分Agent任务与办公场景中,已能与顶级模型打成平手。
在多数人印象中,Grok、混元等模型起步较晚,甚至经历过架构重构,基础能力一度明显落后于头部阵营,结果短短数月便实现快速追赶——这背后究竟有何逻辑?
答案并非偶然。
当前主流模型的核心技术路径已趋于公开,后训练门槛显著降低;而代码生成与Agent类任务天然具备自动评估机制,为后来者提供了高效迭代的捷径。
因此,在传统问答与基础编程等通用能力上,各头部模型的评测分数日趋接近,真实使用体验差异反而越来越难被量化体现。
更关键的是,用户真正接触的并非孤立模型,而是“模型+提示工程+工具链+记忆系统+重试策略”构成的完整工作流。
一个稍逊一筹的模型,若嵌入成熟框架,完全可能在主观体验上反超更强的裸模型。
这意味着,过去一款新模型可维持数月乃至半年的领先优势,而如今可能仅剩几周甚至数天。
随着领先窗口持续压缩,未来用户关注的焦点,将不再是“全球最强单模”,而是能力分层:有的精于编程,有的强于长周期任务,有的专攻办公交付效率。
多模型路由将成为常态,企业也势必摒弃“单点押注”,转向组合式AI部署策略。
趋势二:商业能力的分化速度远超模型性能本身
普通用户已切实感受到:优质模型正变得愈发慷慨。
例如,Anthropic将Claude Fable 5的促销期延至7月19日,并取消此前单独设置的50%额度上限;
OpenAI则临时解除Codex五小时使用限制,并全额重置用户额度,目前Codex活跃用户已达600万。
这种打法,酷似早期互联网烧钱抢夺流量,只不过当下燃烧的是GPU算力与Token资源,把免费额度当作获客成本。
模型厂商之所以甘愿短期牺牲毛利,核心在于当前主推的Agent类产品迁移门槛极高——远高于传统聊天机器人。
一旦补贴周期结束,留存下来的将是真正认可长期价值的付费客户。
随着各模型在Benchmark上的差距不断缩小,未来商业维度的差距反而可能加速拉大。
用户基数、Agent任务数据沉淀、企业级入口卡位、推理成本控制、开发者生态建设、现金流健康度……这些要素将共同驱动领先者的数据飞轮越转越快。
统一LLM网关 - 一个API对接70+AI模型,使用单一API密钥即可调用GPT、Claude、Gemini、Qwen、Deepseek、Grok等主流模型。
下一阶段,模型公司的真正对手,未必是更强大的模型,而是竞对以更低价格、更优入口、更快复制能力发起的用户争夺战。
趋势三:模型评价体系正从参数榜单转向任务总成本
腾讯Hy3正是这一转变的典型代表:
总参数量达295B,但仅激活21B,采用MoE稀疏架构,聚焦Agent执行效率与办公场景落地效果,且深度集成微信生态。
像Hy3这类“轻量激活+超级App分发”的模型,已足以覆盖绝大多数白领日常工作任务,性价比优势极为突出。
这也解释了为何业内普遍认为,腾讯此次出手堪称“静默王炸”:能力够用、入口庞大、成本可控。
参数规模早已不再是模型宣传的核心卖点,用户与企业真正关心的是:完成一项任务总共花费多少成本?成功率几何?操作是否流畅自然?
趋势四:护城河正演变为“模型-产品-数据”三位一体闭环
Grok 4.5联合Cursor,基于真实软件工程数据联合训练;
Hy3持续从腾讯内部50余款产品的真实反馈中迭代优化;
Codex与Claude Code则大量吸收Agent运行轨迹中的失败案例用于强化学习……
这些来自真实交互场景的数据,正成为下一代模型最稀缺、最具壁垒性的燃料。
产品使用频次越高,数据飞轮运转越快,模型进化也就越迅速,从而形成正向循环。
当一家公司拥有海量真实用户、让模型每日承担实际任务、并将执行结果反哺训练体系时,所构筑的才是难以撼动的技术护城河。
趋势五:中国大模型厂商正分化出两条清晰路径
腾讯代表“向下扎根”路线:
强调激活参数效率、Agent任务成功率、WorkBuddy/CodeBuddy等可落地产品,依托真实反馈驱动模型进化,走的是工程提效+超级入口协同演进之路。
智谱则代表“向上突破”路线:
智谱创始人唐杰在内部信《巨浪已来》中明确表示,未来两年暂不追求短期商业化,集中资源攻坚长程任务、自治智能体、完全自我训练及安全治理,并计划投入百亿级资源攻关机械可解释性。
表面看二者方向迥异,实则目标高度一致——最终都将交汇于Agent能力的全面跃迁。
区别仅在于:腾讯选择从产品侧出发,自下而上推动技术升级;智谱则先拉升技术天花板,再逐步开放赋能。前者重普及效率,后者重上限突破,两种路径均具深远观察价值。
趋势六:下一代模型竞争或将重新拉开代际差距
当本轮模型仍在激烈争夺用户心智时,下一代竞争其实早已悄然启动。
OpenAI正全力投入新型预训练架构、合成强化学习、长程Agent、机器人控制及消费级硬件研发;
Anthropic聚焦长任务处理、AI辅助AI研发(AI-for-AI)、以及机械可解释性研究;
Google则持续推进世界模型、虚拟仿真环境与具身智能布局。
既然当前模型迭代速度如此之快,后来者几个月就能追平第一梯队,那未来模型是否会日趋同质化?
事实上,下一代模型仍极有可能再次拉开显著差距。
真正具备代差潜力的方向,集中在长程Agent、AI自主研发、世界模型与机器人四大领域。
其中,世界模型与机器人领域的壁垒可能尤为深厚。
因为现实世界数据无法简单爬取,必须依赖实体机器人、多模态传感器、高保真仿真平台及长期实地部署才能持续积累。
谁能率先打通“设备采集→数据沉淀→世界建模→行动决策”的全链路闭环,其优势将远超纯语言模型时代,复制难度也将呈指数级上升。
但这条路径发展节奏更慢:硬件投入巨大、安全合规要求严苛、真实部署周期漫长,注定不会一夜爆发。
因此,“下一个GPT-4时刻”依然会到来,只是形态将更为多元、落地更重、门槛更高。
而伴随技术扩散速度持续加快,模型层面的领先窗口,仍将保持极度短暂的特性。
本文来自微信公众号“世界模型工场”,作者:世界模型工场,36氪经授权发布。

















