讲师中心 微信公众号
AI工具推荐 视频效率加速

一个月9款旗舰,大模型进入“月抛”时代?

秋瑶同学_7009

秋瑶同学_7009

发布时间:2026-08-06 23:23:44

|

1038人浏览过

|

来源于php中文网

原创

一个月内,9款旗舰级大模型密集登场,这在大模型领域实属罕见。

从月初腾讯混元Hy3正式发布并开源,到月末Anthropic推出Claude Opus 5,中间Kimi K3、Qwen3.8-Max预览版、Grok 4.5等模型接连亮相。7月由此成为近一年来少有的模型发布高峰。

☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

一个月9款旗舰,大模型进入“月抛”时代?

各家厂商的发布时间并不统一:有的趁竞品更新后的空档快速跟进;有的选在世界人工智能大会(WAIC)前后集中发布;也有的通过价格策略调整,主动应对市场竞争。

但7月的意义不仅在于发布数量多,更关键的是——这一轮密集上新折射出两大深层趋势。

第一,头部模型的能力鸿沟正在加速收窄。根据Artificial Analysis最新发布的综合智能指数,主流模型之间的得分差距显著缩小。随着迭代节奏加快,“最强模型”的王座愈发难以长期稳坐,厂商正转向差异化突围,在特定任务中建立优势,而非执着于单一维度的绝对领先。

第二,开源模型已正式跻身第一梯队。本次7月发布的新模型中,腾讯混元Hy3、Kimi K3等均选择开放权重(即公开模型参数,支持开发者本地下载与部署)。尤为突出的是,Kimi K3在Code Arena前端编程榜单中拔得头筹,力压GPT-5.6 Sol与Claude Fable 5。过去两年,开源模型常被视作闭源模型的“追赶者”;而本轮竞争表明,其已在部分开发场景中具备与闭源旗舰同台竞技的实力。

那么,这场集中爆发究竟带来了哪些实质性变化?又预示着怎样的行业走向?

01. 竞争逻辑正在重构:不再唯“智商”论英雄

过去几年,大模型比拼的核心是通用能力——谁知识更广、回答更准、逻辑更严密。如今,战场早已悄然转移。

本轮最鲜明的争夺焦点,落在了代码能力上。

OpenAI持续加码编程与复杂推理能力,并不断拓展Codex生态,意图以开发工具链深度绑定程序员群体;Anthropic则聚焦代码理解与安全审计能力,瞄准大型工程项目的系统性风险识别;Grok 4.5主打响应速度与成本优势,深度集成AI编程工具Cursor,覆盖高频、轻量的日常开发需求。

大模型研究者姚宇航向「定焦One」指出:“几乎所有头部厂商都在编程方向重兵投入,能力差距正被迅速抹平。比如Kimi K3的代码生成质量提升显著,已逼近一线闭源模型水准。”

一个月9款旗舰,大模型进入“月抛”时代?

图源 / pexels

OpenAI Codex Operator
OpenAI Codex Operator

在目标项目目录中运行 OpenAI Codex CLI,完成实现、调试等编码任务。当用户请求 OpenClaw 使用 Codex 时触发。

下载

Agent(智能体)则是另一条核心战线。GPT-5.6 Sol依托Codex探索自动化编程闭环;Opus 5强调长周期任务的连贯执行能力;Kimi K3演示了多步连续任务调度与完成;腾讯混元Hy3则尝试结合微信生态,落地轻量级智能体应用。

不过,当前智能体仍处于“能跑通”但“难实用”阶段。独立开发者北城坦言,现有产品短板不在调用工具的能力,而在任务拆解与资源调度逻辑。“比如Codex的Ultra模式会启动大量子代理,多个子代理反复读取同一文件、重复分析同类内容,导致Token激增,但有效产出并未同步提升。”在他看来,智能体进化的关键并非堆叠子代理数量,而是构建“该不该分析、哪里可跳过”的判断机制。

姚宇航持相似观点:智能体无疑是当前最具潜力的方向,但距离真正成熟仍有明显距离。他特别指出,医疗、金融等垂直领域的智能体落地空间更大;下一阶段的竞争胜负手,将不只是模型本身有多强,更取决于它在真实业务场景中是否好用、客户是否愿意为其实效付费。

国产模型则另辟蹊径,通过强化细分能力破局。Kimi K3重点突破长上下文理解、前端编程及产品设计能力,在多项编程评测中稳居前列,整体表现已接近国际闭源旗舰水平。

参数规模与推理效率的博弈,亦成新主线。

7月亮相的多款模型参数量迈入万亿乃至数万亿级别,但“参数大≠能力强”已成共识。得益于MoE(Mixture of Experts)架构普及,模型可在保持海量参数的同时,仅激活其中一小部分参与推理,大幅降低实际算力开销。

由此,行业自然分化出两条路径:
一是继续扩大参数规模,以“更大”换取“更强”;
二是聚焦推理效率,用更小的激活参数实现媲美旗舰的性能表现。

价格,也成为本轮竞争中最直观的变量。

海外厂商普遍采用分层定价策略。OpenAI进一步细化GPT-5.6产品线,按任务复杂度划分版本,引导用户精准匹配模型;Anthropic坚持高性能旗舰路线,以Opus系列锚定高价值企业与开发者市场;Grok 4.5则走极致性价比路线,单次输出价格仅为Opus系列的1/4,并借与Cursor深度整合吸引中小开发者。

国内厂商则更强调成本优势。过去半年,多家国产模型厂商持续下调API报价,旨在以低门槛打开开发者与中小企业市场,加速生态渗透。

一句话概括:7月的大模型竞争,已从单维“智力竞赛”,全面升级为涵盖代码能力、智能体落地、参数效率与商业定价的多维竞合。

02. 谁惊艳全场?谁争议不断?谁尚待验证?

综合对比前代升级幅度、权威榜单排名及一线开发者反馈,7月发布的新模型大致可分为三类。

首先,明显超出预期的代表:Kimi K3、Grok 4.5、混元Hy3。

最受瞩目的当属Kimi K3。该模型采用MoE架构,总参数达万亿级,重点强化长上下文处理、前端编程与产品设计能力。上线当日即以1679分登顶Code Arena前端编程榜榜首,相较前代Kimi K2.6(第18名)跃升17位;一周后,在Arena综合榜中首次闯入全球Top 10。

但Kimi K3亦有清晰的能力边界。Artificial Analysis知识可靠性测试显示,其幻觉率从前代39%升至51%,输出速度约33 Token/s,显著低于同类竞品。

开发者实测印证了这种“偏科”特性。北城评价称:“Kimi K3相比上一代确有质变,尤其在前端开发、UI设计和产品表达上优势突出。例如优化网站界面、设计APP原型,它给出的方案往往更贴近真实需求;但在涉及底层架构或跨模块协同的复杂工程任务中,稳定性仍显不足。”

一个月9款旗舰,大模型进入“月抛”时代?

图源 / pexels

同样引发广泛关注的是Grok 4.5。7月9日发布后,它迅速跻身Artificial Analysis智能指数前列,并在多项工具调用测试中表现亮眼,被不少开发者视为“高性价比之选”。

北城的体验与此一致:“Grok 4.5最大优势是快——同样一个需求,用它可能3–5分钟搞定,GPT-5.6有时要耗时20分钟甚至半小时。加上价格更低,特别适合需要快速交付的场景。”姚宇航补充道,Grok 4.5的编程能力经过专项优化,配合Cursor使用体验流畅。值得注意的是,SpaceX已于近期宣布收购Cursor母公司Anysphere,交易预计三季度完成;xAI与Cursor的数据合作,也被认为直接助推了Grok 4.5在编程场景的体验升级。

混元Hy3则代表了“效率派”的突破。该模型总参数295B,但激活参数仅21B,以不到旗舰模型五分之一的活跃计算量,在多个公开基准测试中成绩逼近更大体量竞品。不过在SWE-Bench Pro(代码修复能力评测)中,混元Hy3得分为57.9,仍落后于Claude Opus 4.8的69.2分,说明其在复杂工程问题上的修复能力尚需补强。

姚宇航评价:“混元Hy3相比腾讯此前模型确有进步,加之开源+轻量化设计,对中等规模团队而言是个务实的选择。”

其次,稳居第一梯队、但突破有限的代表:GPT-5.6 Sol与Claude Opus 5。

二者依然牢牢占据头部位置,但未带来颠覆性升级。GPT-5.6 Sol在复杂推理与智能体编程能力上小幅增强,在Terminal-Bench 2.1(命令行环境任务完成能力评测)中达88.8%,Ultra模式进一步提升至91.9%;Claude Opus 5延续其在复杂工程、代码理解与安全分析方面的可靠表现,性能逼近Fable 5,价格却仅为后者一半。

两款模型虽仍在第一梯队,但缺乏重大技术跃迁。

北城坦言:“GPT-5.6基本覆盖我日常开发所需,遇到特别棘手的问题时,才会调用Opus 5。不过更强能力也意味着更高成本——对我而言,Opus 5更像是关键时刻启用的‘专家顾问’。”

最后,反馈两极、尚待验证的代表:Gemini 3.6 Flash与Qwen3.8-Max预览版。

最具代表性的是Gemini 3.6 Flash。其在Artificial Analysis智能指数中得分50,与前代3.5 Flash持平。开发者社区普遍反馈:本代升级不明显,综合表现亦逊于同期竞品。但也有声音指出,作为轻量级模型,其基础输出质量仍属合格。

独立开发者卡普迪姆认为:“Gemini 3.6 Flash日常使用体验流畅,虽然编程能力不算突出,但多模态理解依旧出色。它支持任意格式文件输入,聊天风格自然,文风体验甚至优于不少竞品。”

Qwen3.8-Max预览版7月上线后效果波动较大,市场评价分歧明显。北城感受最深的是其“思考深度高但易卡顿”:“有时陷入长时间推理,像自己绕进了逻辑迷宫,最终却没能给出有效解法。”卡普迪姆则直言低于预期——他用自建前端审美测评集测试发现,模型实际能力与宣传存在明显落差。作为尚未定型的预览版本,其最终表现仍需等待正式版发布后验证。

7月没有诞生“全能冠军”,不同模型正围绕具体场景形成天然分工。

以北城为例:GPT-5.6负责常规开发;Grok 4.5用于快速响应需求;Kimi K3专攻产品与前端设计;Claude Opus 5攻坚复杂难题。卡普迪姆的组合则不同:常用Claude Fable 5或Opus 5进行任务规划,再交由GPT-5.6 Sol执行落地。

03. 发布节奏加速,开源与闭源博弈再升温

这轮密集发布背后,藏着三个关键问题:为何迭代越来越快?为何集中爆发于7月?开源浪潮又将如何重塑商业模式?

首先,模型升级范式正在发生根本转变。以往,能力跃升依赖从头训练更大模型,周期长、成本高。而今,强化学习、后训练(即基础模型训练完成后,通过微调、RLHF等方式持续优化)等技术日趋成熟,模型进化更多依靠训练后优化。

姚宇航向「定焦One」透露:“近两年发布节奏明显加快,核心原因之一正是后训练方法日益成熟。现在许多能力提升无需重训整套模型,只需在既有基座上持续精调,借助强化学习或自我迭代即可达成。”

这意味着模型竞争周期正在压缩:过去一款领先模型或可维持数月优势;如今,版本更新带来的领先窗口可能仅剩数周。若发布节奏滞后,就极易被新版本反超。对厂商而言,发布本身已不仅是技术成果展示,更成为战略卡位的关键动作。

一个月9款旗舰,大模型进入“月抛”时代?

图源 / pexels

其次,7月恰逢多重节点交汇。对国内厂商而言,世界人工智能大会(WAIC)在此月举办,成为集中发布、技术秀肌肉的天然窗口;对海外厂商而言,多家头部公司亦选择同期更新模型,意在开发者生态与商业竞争中抢占先机。

再者,行业竞争规则正悄然改写。“模型够强”已非唯一目标,真正的较量延伸至“如何被用”与“如何变现”。

这也解释了为何开源与闭源之争在7月再度白热化。长期以来,开源模型与闭源模型之间存在客观能力差距。但随着Kimi K3、混元Hy3等进入第一梯队,一个现实拷问浮现:当高性能模型可免费获取,模型公司的API调用收入与订阅服务是否会遭遇分流?

开源阵营主张:开放权重能大幅降低技术门槛,激发更多企业与开发者参与AI创新;技术提供方让渡部分短期利益,实为推动整个生态繁荣。闭源阵营则担忧用户流失,Anthropic等公司更强调:模型能力越强,开放权重带来的安全与滥用风险越高,亟需更严格的治理框架。

这场争论背后,本质是不同利益主体的诉求博弈。对英伟达等基础设施厂商而言,模型开源意味着更多部署需求,等于更大的算力市场;对OpenAI、Anthropic等模型厂商而言,闭源模式仍是保障API与订阅收入的核心护城河。但另一面亦不可忽视:开源虽能扩大部署规模,但随着参数效率提升,单位任务的算力消耗也可能被摊薄,算力市场的增量未必与开源程度完全同步。对国内厂商而言,开放权重不仅是技术路线选择,更是争夺开发者生态、云服务入口及后续商业化主动权的战略支点。

7月之后,大模型竞逐不会停歇。开发者社区普遍预测,DeepSeek V4正式版、Fable 5.1、GPT-6等新模型将在8月陆续登场。

模型能力差距持续收窄,单靠发布一款“更强模型”已难以构筑长期壁垒。接下来真正值得关注的指标包括:DeepSeek V4正式版能否刷新开源模型能力上限;API价格是否会进一步下探;智能体能否出现稳定可持续的付费场景;以及开源模型能否真正进入更多企业的私有化部署体系。这些问题的答案,远比榜单排名更能揭示这场混战究竟改变了什么。

*题图来源于pexels 。

本文来自微信公众号 “定焦”(ID:dingjiaoone),作者:雷晶,36氪经授权发布。

热门AI工具

更多
LibLibAI
LibLibAI Hot

一款AI视频创作工具,主要用于国内领先的AI创意平台,以海量模型、低门槛操作与“创作-分享-商业化”生态,让小白与专业创作者都能高效实现图文乃至视频创意表达,适合需要提升相关任务效率的用户。

WorkBuddy

一款AI办公效率工具,主要用于腾讯云推出的AI原生桌面智能体工作台,适合需要提升相关任务效率的用户。

Atoms
Atoms Hot

Atoms是一款AI智能体工具,第一支自动构建真实业务的 AI 团队。

咔片AIPPT

一款在线AI演示文稿制作工具,可根据主题和内容需求辅助生成PPT结构与页面,提高演示材料制作效率。

音述AI
音述AI Hot

一款AI音频处理工具,主要用于音述AI是一个以“用声音述说故事”为核心的 AI 音乐创作与声音分享社区,适合需要提升相关任务效率的用户。

豆包大模型

豆包大模型是一款由字节跳动推出的企业级大语言模型服务平台。

DeepSeek

DeepSeek是一款面向对话、写作、编程和推理场景的AI大模型工具。

SkildArt
SkildArt Hot

SkildArt是一款AI文本写作工具,一站式 AI 视觉创作平台。

Laper
Laper Hot

Laper是专为编剧、导演和制片人推出的 AI 原生剧本创作工具。

相关专题

更多
Buffalo框架数据库开发全教程
Buffalo框架数据库开发全教程

本专题围绕Buffalo框架数据库开发,讲解database.yml多环境配置、soda与fizz迁移生成回滚、模型结构体标签、增删改查与条件查询、一对多与多对多关联、数据校验、回调钩子、事务处理及原生SQL执行能力。

20

2026.09.23

Buffalo框架路由与请求处理实操指南
Buffalo框架路由与请求处理实操指南

本专题讲解Buffalo框架路由与请求处理机制,涵盖路由注册与分组、资源路由、Handler编写规范、Context上下文方法、参数绑定、中间件编写挂载、Session与Cookie读写、Flash消息及错误页面定制方法。

0

2026.09.23

Buffalo框架零基础入门教程
Buffalo框架零基础入门教程

本专题整理Buffalo框架入门内容,涵盖Go环境准备、buffalo CLI安装、新项目生成、目录结构说明、dev热加载启动、数据库连接配置与常见报错排查,帮助新手按约定优于配置的思路跑通第一个Buffalo框架应用。

20

2026.09.23

Conan创建软件包配方指南
Conan创建软件包配方指南

本专题介绍通过conanfile.py创建软件包的方法,讲解包名、版本、依赖和构建设置等基础信息,以及source、build、package、package_info等常用方法的作用及编写思路。

0

2026.09.22

Conan二进制包配置指南
Conan二进制包配置指南

本专题介绍Conan根据操作系统、编译器、架构和构建类型生成二进制包的方法,讲解Profile、Settings、Options及Package ID的作用,帮助管理不同平台和编译环境下的包版本。

20

2026.09.22

Conan私有仓库搭建教程
Conan私有仓库搭建教程

本专题系统的讲解Conan私有仓库的搭建流程,涵盖仓库服务部署、存储目录配置、用户认证、权限划分和远程地址添加,并介绍内部C++依赖包的上传、下载及版本维护方法。

20

2026.09.22

loomy官网入口地址合集
loomy官网入口地址合集

本专题汇总了 Loomy 桌面 AI 助理的官方入口地址合集及使用指南。提供 macOS 与 Windows 客户端下载 。Loomy 是讯飞推出的桌面级 AI 工作搭子,支持文件整理、数据分析、网页操作及通过飞书/钉钉远程操控电脑,助你高效完成本地办公任务 。

20

2026.09.22

NumPy常见函数使用方法
NumPy常见函数使用方法

本专题整理 NumPy 常见函数使用方法相关教程,覆盖函数大全、参数用法、数组运算、统计聚合、排序处理、where 条件筛选、linspace 创建数列等常用场景,帮助读者快速掌握 NumPy 函数调用思路和实际数据处理技巧。

0

2026.09.22

NumPy性能优化版本更新与常见报错排查
NumPy性能优化版本更新与常见报错排查

本专题整理 NumPy 性能优化、版本更新与常见报错排查相关教程,覆盖向量化计算、广播性能、内存布局、NumPy 2.0 升级、版本兼容冲突、安装导入报错、dtype 溢出、矩阵运算异常和 broadcasting 报错修复,帮助读者系统掌握 NumPy 性能调优与问题定位方法。

20

2026.09.22

热门下载

更多
网站特效
/
网站源码
/
网站素材
/
前端模板

精品课程

更多
相关推荐
/
热门推荐
/
最新课程
关于我们 免责申明 举报中心 意见反馈 讲师合作 广告合作 最新更新
php中文网:公益在线php培训,帮助PHP学习者快速成长!
关注服务号
PHP中文网订阅号
每天精选资源文章推送

Copyright 2014-2026 https://www.php.cn/ All Rights Reserved | php.cn