一个月内,9款旗舰级大模型密集登场,这在大模型领域实属罕见。
从月初腾讯混元Hy3正式发布并开源,到月末Anthropic推出Claude Opus 5,中间Kimi K3、Qwen3.8-Max预览版、Grok 4.5等模型接连亮相。7月由此成为近一年来少有的模型发布高峰。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

各家厂商的发布时间并不统一:有的趁竞品更新后的空档快速跟进;有的选在世界人工智能大会(WAIC)前后集中发布;也有的通过价格策略调整,主动应对市场竞争。
但7月的意义不仅在于发布数量多,更关键的是——这一轮密集上新折射出两大深层趋势。
第一,头部模型的能力鸿沟正在加速收窄。根据Artificial Analysis最新发布的综合智能指数,主流模型之间的得分差距显著缩小。随着迭代节奏加快,“最强模型”的王座愈发难以长期稳坐,厂商正转向差异化突围,在特定任务中建立优势,而非执着于单一维度的绝对领先。
第二,开源模型已正式跻身第一梯队。本次7月发布的新模型中,腾讯混元Hy3、Kimi K3等均选择开放权重(即公开模型参数,支持开发者本地下载与部署)。尤为突出的是,Kimi K3在Code Arena前端编程榜单中拔得头筹,力压GPT-5.6 Sol与Claude Fable 5。过去两年,开源模型常被视作闭源模型的“追赶者”;而本轮竞争表明,其已在部分开发场景中具备与闭源旗舰同台竞技的实力。
那么,这场集中爆发究竟带来了哪些实质性变化?又预示着怎样的行业走向?
01. 竞争逻辑正在重构:不再唯“智商”论英雄
过去几年,大模型比拼的核心是通用能力——谁知识更广、回答更准、逻辑更严密。如今,战场早已悄然转移。
本轮最鲜明的争夺焦点,落在了代码能力上。
OpenAI持续加码编程与复杂推理能力,并不断拓展Codex生态,意图以开发工具链深度绑定程序员群体;Anthropic则聚焦代码理解与安全审计能力,瞄准大型工程项目的系统性风险识别;Grok 4.5主打响应速度与成本优势,深度集成AI编程工具Cursor,覆盖高频、轻量的日常开发需求。
大模型研究者姚宇航向「定焦One」指出:“几乎所有头部厂商都在编程方向重兵投入,能力差距正被迅速抹平。比如Kimi K3的代码生成质量提升显著,已逼近一线闭源模型水准。”

图源 / pexels
Agent(智能体)则是另一条核心战线。GPT-5.6 Sol依托Codex探索自动化编程闭环;Opus 5强调长周期任务的连贯执行能力;Kimi K3演示了多步连续任务调度与完成;腾讯混元Hy3则尝试结合微信生态,落地轻量级智能体应用。
不过,当前智能体仍处于“能跑通”但“难实用”阶段。独立开发者北城坦言,现有产品短板不在调用工具的能力,而在任务拆解与资源调度逻辑。“比如Codex的Ultra模式会启动大量子代理,多个子代理反复读取同一文件、重复分析同类内容,导致Token激增,但有效产出并未同步提升。”在他看来,智能体进化的关键并非堆叠子代理数量,而是构建“该不该分析、哪里可跳过”的判断机制。
姚宇航持相似观点:智能体无疑是当前最具潜力的方向,但距离真正成熟仍有明显距离。他特别指出,医疗、金融等垂直领域的智能体落地空间更大;下一阶段的竞争胜负手,将不只是模型本身有多强,更取决于它在真实业务场景中是否好用、客户是否愿意为其实效付费。
国产模型则另辟蹊径,通过强化细分能力破局。Kimi K3重点突破长上下文理解、前端编程及产品设计能力,在多项编程评测中稳居前列,整体表现已接近国际闭源旗舰水平。
参数规模与推理效率的博弈,亦成新主线。
7月亮相的多款模型参数量迈入万亿乃至数万亿级别,但“参数大≠能力强”已成共识。得益于MoE(Mixture of Experts)架构普及,模型可在保持海量参数的同时,仅激活其中一小部分参与推理,大幅降低实际算力开销。
由此,行业自然分化出两条路径:
一是继续扩大参数规模,以“更大”换取“更强”;
二是聚焦推理效率,用更小的激活参数实现媲美旗舰的性能表现。
价格,也成为本轮竞争中最直观的变量。
海外厂商普遍采用分层定价策略。OpenAI进一步细化GPT-5.6产品线,按任务复杂度划分版本,引导用户精准匹配模型;Anthropic坚持高性能旗舰路线,以Opus系列锚定高价值企业与开发者市场;Grok 4.5则走极致性价比路线,单次输出价格仅为Opus系列的1/4,并借与Cursor深度整合吸引中小开发者。
国内厂商则更强调成本优势。过去半年,多家国产模型厂商持续下调API报价,旨在以低门槛打开开发者与中小企业市场,加速生态渗透。
一句话概括:7月的大模型竞争,已从单维“智力竞赛”,全面升级为涵盖代码能力、智能体落地、参数效率与商业定价的多维竞合。
02. 谁惊艳全场?谁争议不断?谁尚待验证?
综合对比前代升级幅度、权威榜单排名及一线开发者反馈,7月发布的新模型大致可分为三类。
首先,明显超出预期的代表:Kimi K3、Grok 4.5、混元Hy3。
最受瞩目的当属Kimi K3。该模型采用MoE架构,总参数达万亿级,重点强化长上下文处理、前端编程与产品设计能力。上线当日即以1679分登顶Code Arena前端编程榜榜首,相较前代Kimi K2.6(第18名)跃升17位;一周后,在Arena综合榜中首次闯入全球Top 10。
但Kimi K3亦有清晰的能力边界。Artificial Analysis知识可靠性测试显示,其幻觉率从前代39%升至51%,输出速度约33 Token/s,显著低于同类竞品。
开发者实测印证了这种“偏科”特性。北城评价称:“Kimi K3相比上一代确有质变,尤其在前端开发、UI设计和产品表达上优势突出。例如优化网站界面、设计APP原型,它给出的方案往往更贴近真实需求;但在涉及底层架构或跨模块协同的复杂工程任务中,稳定性仍显不足。”

图源 / pexels
同样引发广泛关注的是Grok 4.5。7月9日发布后,它迅速跻身Artificial Analysis智能指数前列,并在多项工具调用测试中表现亮眼,被不少开发者视为“高性价比之选”。
北城的体验与此一致:“Grok 4.5最大优势是快——同样一个需求,用它可能3–5分钟搞定,GPT-5.6有时要耗时20分钟甚至半小时。加上价格更低,特别适合需要快速交付的场景。”姚宇航补充道,Grok 4.5的编程能力经过专项优化,配合Cursor使用体验流畅。值得注意的是,SpaceX已于近期宣布收购Cursor母公司Anysphere,交易预计三季度完成;xAI与Cursor的数据合作,也被认为直接助推了Grok 4.5在编程场景的体验升级。
混元Hy3则代表了“效率派”的突破。该模型总参数295B,但激活参数仅21B,以不到旗舰模型五分之一的活跃计算量,在多个公开基准测试中成绩逼近更大体量竞品。不过在SWE-Bench Pro(代码修复能力评测)中,混元Hy3得分为57.9,仍落后于Claude Opus 4.8的69.2分,说明其在复杂工程问题上的修复能力尚需补强。
姚宇航评价:“混元Hy3相比腾讯此前模型确有进步,加之开源+轻量化设计,对中等规模团队而言是个务实的选择。”
其次,稳居第一梯队、但突破有限的代表:GPT-5.6 Sol与Claude Opus 5。
二者依然牢牢占据头部位置,但未带来颠覆性升级。GPT-5.6 Sol在复杂推理与智能体编程能力上小幅增强,在Terminal-Bench 2.1(命令行环境任务完成能力评测)中达88.8%,Ultra模式进一步提升至91.9%;Claude Opus 5延续其在复杂工程、代码理解与安全分析方面的可靠表现,性能逼近Fable 5,价格却仅为后者一半。
两款模型虽仍在第一梯队,但缺乏重大技术跃迁。
北城坦言:“GPT-5.6基本覆盖我日常开发所需,遇到特别棘手的问题时,才会调用Opus 5。不过更强能力也意味着更高成本——对我而言,Opus 5更像是关键时刻启用的‘专家顾问’。”
最后,反馈两极、尚待验证的代表:Gemini 3.6 Flash与Qwen3.8-Max预览版。
最具代表性的是Gemini 3.6 Flash。其在Artificial Analysis智能指数中得分50,与前代3.5 Flash持平。开发者社区普遍反馈:本代升级不明显,综合表现亦逊于同期竞品。但也有声音指出,作为轻量级模型,其基础输出质量仍属合格。
独立开发者卡普迪姆认为:“Gemini 3.6 Flash日常使用体验流畅,虽然编程能力不算突出,但多模态理解依旧出色。它支持任意格式文件输入,聊天风格自然,文风体验甚至优于不少竞品。”
Qwen3.8-Max预览版7月上线后效果波动较大,市场评价分歧明显。北城感受最深的是其“思考深度高但易卡顿”:“有时陷入长时间推理,像自己绕进了逻辑迷宫,最终却没能给出有效解法。”卡普迪姆则直言低于预期——他用自建前端审美测评集测试发现,模型实际能力与宣传存在明显落差。作为尚未定型的预览版本,其最终表现仍需等待正式版发布后验证。
7月没有诞生“全能冠军”,不同模型正围绕具体场景形成天然分工。
以北城为例:GPT-5.6负责常规开发;Grok 4.5用于快速响应需求;Kimi K3专攻产品与前端设计;Claude Opus 5攻坚复杂难题。卡普迪姆的组合则不同:常用Claude Fable 5或Opus 5进行任务规划,再交由GPT-5.6 Sol执行落地。
03. 发布节奏加速,开源与闭源博弈再升温
这轮密集发布背后,藏着三个关键问题:为何迭代越来越快?为何集中爆发于7月?开源浪潮又将如何重塑商业模式?
首先,模型升级范式正在发生根本转变。以往,能力跃升依赖从头训练更大模型,周期长、成本高。而今,强化学习、后训练(即基础模型训练完成后,通过微调、RLHF等方式持续优化)等技术日趋成熟,模型进化更多依靠训练后优化。
姚宇航向「定焦One」透露:“近两年发布节奏明显加快,核心原因之一正是后训练方法日益成熟。现在许多能力提升无需重训整套模型,只需在既有基座上持续精调,借助强化学习或自我迭代即可达成。”
这意味着模型竞争周期正在压缩:过去一款领先模型或可维持数月优势;如今,版本更新带来的领先窗口可能仅剩数周。若发布节奏滞后,就极易被新版本反超。对厂商而言,发布本身已不仅是技术成果展示,更成为战略卡位的关键动作。

图源 / pexels
其次,7月恰逢多重节点交汇。对国内厂商而言,世界人工智能大会(WAIC)在此月举办,成为集中发布、技术秀肌肉的天然窗口;对海外厂商而言,多家头部公司亦选择同期更新模型,意在开发者生态与商业竞争中抢占先机。
再者,行业竞争规则正悄然改写。“模型够强”已非唯一目标,真正的较量延伸至“如何被用”与“如何变现”。
这也解释了为何开源与闭源之争在7月再度白热化。长期以来,开源模型与闭源模型之间存在客观能力差距。但随着Kimi K3、混元Hy3等进入第一梯队,一个现实拷问浮现:当高性能模型可免费获取,模型公司的API调用收入与订阅服务是否会遭遇分流?
开源阵营主张:开放权重能大幅降低技术门槛,激发更多企业与开发者参与AI创新;技术提供方让渡部分短期利益,实为推动整个生态繁荣。闭源阵营则担忧用户流失,Anthropic等公司更强调:模型能力越强,开放权重带来的安全与滥用风险越高,亟需更严格的治理框架。
这场争论背后,本质是不同利益主体的诉求博弈。对英伟达等基础设施厂商而言,模型开源意味着更多部署需求,等于更大的算力市场;对OpenAI、Anthropic等模型厂商而言,闭源模式仍是保障API与订阅收入的核心护城河。但另一面亦不可忽视:开源虽能扩大部署规模,但随着参数效率提升,单位任务的算力消耗也可能被摊薄,算力市场的增量未必与开源程度完全同步。对国内厂商而言,开放权重不仅是技术路线选择,更是争夺开发者生态、云服务入口及后续商业化主动权的战略支点。
7月之后,大模型竞逐不会停歇。开发者社区普遍预测,DeepSeek V4正式版、Fable 5.1、GPT-6等新模型将在8月陆续登场。
模型能力差距持续收窄,单靠发布一款“更强模型”已难以构筑长期壁垒。接下来真正值得关注的指标包括:DeepSeek V4正式版能否刷新开源模型能力上限;API价格是否会进一步下探;智能体能否出现稳定可持续的付费场景;以及开源模型能否真正进入更多企业的私有化部署体系。这些问题的答案,远比榜单排名更能揭示这场混战究竟改变了什么。
*题图来源于pexels 。
本文来自微信公众号 “定焦”(ID:dingjiaoone),作者:雷晶,36氪经授权发布。


















