讲师中心 微信公众号
AI工具推荐 视频效率加速

Grok-1源码解析:深入理解混合专家模型(MoE)的架构设计

星杰姑娘_6297

星杰姑娘_6297

发布时间:2026-06-23 14:46:18

|

441人浏览过

|

来源于php中文网

原创

Grok-1通过硬编码num_selected_experts=2实现每个token仅激活2个专家,路由分三步:计算概率、top-k选专家、加权求和;8个专家物理隔离且可分片,显存增长远低于线性。

☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

要真正看懂grok-1如何用3140亿参数实现高效推理,必须打开它的源码,逐层拆解moe模块的组织逻辑、路由决策机制和专家调度方式。

定位MoE核心组件:从model.py切入

进入Grok-1代码仓库根目录,直接打开model.py文件,搜索class MoELayer——这是整个混合专家架构的主干实现,位于第272行附近。这个类不是装饰性封装,而是所有专家激活、路由分发、梯度分流的实际执行入口。

紧接着向下翻,找到class Router定义(通常在MoELayer上方),它继承自hk.Module,负责为每个输入token生成专家选择概率分布。注意:Router不参与前向计算中的权重更新,只做轻量级门控决策,这是MoE保持稀疏性的第一道防线。

【num_selected_experts必须严格等于2】——查看Router初始化参数,self.num_selected_experts被硬编码为2。这意味着无论输入是什么,每个token永远只被分配给2个专家处理,这是Grok-1实现“25%参数激活率”的工程锚点,不可修改。

理解专家路由的三步计算链

在MoELayer.__call__方法内部,路由过程由三段紧密耦合的JAX操作构成:

第一步:调用self.router.compute_routing_prob(inputs, padding_mask, self.num_experts),输出routing_probs张量,形状为[batch_size, seq_len, num_experts],每个位置代表该token被分配给对应专家的概率值。

第二步:执行jax.lax.top_k(routing_probs, k=self.router.num_selected_experts),提取每行概率最高的2个索引及其数值。这一步是稀疏激活的关键开关,它直接丢弃其余6个专家的全部计算路径。

第三步:将选中的2个专家输出加权求和,权重即为top-k返回的expert_gate值;未被选中的专家输出完全不参与后续计算,内存与算力零消耗。

Grok
Grok

Grok是由埃隆·马斯克旗下xAI公司开发的AI助手,2023年11月推出。其最大特色是与X平台深度整合,可实时获取最新信息,并以幽默、直率的对话风格区别于其他AI。功能涵盖文本问答、图像生成、文档分析及语音交互,最新版本已具备多模态识别与深度推理能力。

下载

专家网络的物理组织方式

方法一:查看self.layer_fn参数传入方式。它是一个可调用对象,在MoELayer初始化时注入,实际指向一个封装了8个独立FFN子网络的工厂函数。每个子网络拥有完全隔离的权重矩阵,彼此不共享参数。

方法二:观察专家实例化逻辑。在__call__中,通过jnp.stack([expert(x) for expert in self.experts], axis=-2)批量调用全部专家,但随后立即用expert_index做高级索引切片——只有被top-k选中的那2列结果保留,其余6列在JAX图编译阶段就被剪枝掉。

注意:8个专家并非均匀分布在GPU上。源码中shard_activations=True配置启用后,每个专家的激活值会被自动按model_axis维度切片,跨设备分布存储,这是支撑3140亿参数模型不OOM的核心内存优化手段。

验证MoE稀疏性效果的实操检查

运行一次最小规模前向传播,在MoELayer.__call__末尾插入print(f"Activated experts: {expert_index.shape}"),你会看到输出形如Activated experts: (batch_size, seq_len, 2)——始终是2,绝不会是8或其它数字。

再检查expert_gate的sum值:对每个token位置执行jnp.sum(expert_gate, axis=-1),结果恒等于1.0。这证明路由输出是标准概率分布,且仅靠2个专家就完成了完整信息建模,没有信息坍缩。

最后对比显存占用:禁用MoE(设num_experts=1)与启用MoE(num_experts=8)两次运行nvidia-smi,你会发现后者显存增长不到前者1.3倍,而非8倍——这就是稀疏激活在真实硬件上的量化体现。

热门AI工具

更多
咔片AIPPT

一款在线AI演示文稿制作工具,可根据主题和内容需求辅助生成PPT结构与页面,提高演示材料制作效率。

DeepSeek

DeepSeek是一款面向对话、写作、编程和推理场景的AI大模型工具。

豆包大模型

豆包大模型是一款由字节跳动推出的企业级大语言模型服务平台。

超级简历WonderCV

一款AI办公效率工具,主要用于免费求职简历模版下载制作,应届生职场人必备简历制作神器,适合需要提升相关任务效率的用户。

火山引擎

火山引擎是一款面向企业的云计算与AI服务平台。

Loomy
Loomy Hot

一款AI工具,主要用于科大讯飞发布的桌面级 AI 助理,比 OpenClaw 更易用、更安全!,适合需要提升相关任务效率的用户。

UpDream
UpDream Hot

一款AI视频创作工具,主要用于哔哩哔哩推出的自研AI视频创作工具,适合需要提升相关任务效率的用户。

WorkBuddy

一款AI办公效率工具,主要用于腾讯云推出的AI原生桌面智能体工作台,适合需要提升相关任务效率的用户。

VibeKnow
VibeKnow Hot

一款AI视频创作工具,主要用于全球首个AI知识视频创作平台,文档、文章、网页,一键生成视频,适合需要提升相关任务效率的用户。

相关专题

更多
Grok使用教程大全
Grok使用教程大全

从注册登录到高级提示词应用,全面讲解Grok使用教程、常见问题解决方案和效率提升技巧。

422

2026.06.12

Grok工具推荐合集
Grok工具推荐合集

本专题整合了Grok工具合集,阅读专题下面的文章了解更多详细内容。

342

2026.06.12

Grok AI模型选择推荐
Grok AI模型选择推荐

本专题整合了Grok模型推荐指南,阅读专题下面的文章了解更多详细内容。

502

2026.06.12

grok搭建部署教程合集
grok搭建部署教程合集

本专题整合了grok搭建部署教程合集,阅读专题下面的文章了解更多详细内容。

518

2026.06.12

Buffalo框架数据库开发全教程
Buffalo框架数据库开发全教程

本专题围绕Buffalo框架数据库开发,讲解database.yml多环境配置、soda与fizz迁移生成回滚、模型结构体标签、增删改查与条件查询、一对多与多对多关联、数据校验、回调钩子、事务处理及原生SQL执行能力。

0

2026.09.23

Buffalo框架路由与请求处理实操指南
Buffalo框架路由与请求处理实操指南

本专题讲解Buffalo框架路由与请求处理机制,涵盖路由注册与分组、资源路由、Handler编写规范、Context上下文方法、参数绑定、中间件编写挂载、Session与Cookie读写、Flash消息及错误页面定制方法。

0

2026.09.23

Buffalo框架零基础入门教程
Buffalo框架零基础入门教程

本专题整理Buffalo框架入门内容,涵盖Go环境准备、buffalo CLI安装、新项目生成、目录结构说明、dev热加载启动、数据库连接配置与常见报错排查,帮助新手按约定优于配置的思路跑通第一个Buffalo框架应用。

0

2026.09.23

Conan创建软件包配方指南
Conan创建软件包配方指南

本专题介绍通过conanfile.py创建软件包的方法,讲解包名、版本、依赖和构建设置等基础信息,以及source、build、package、package_info等常用方法的作用及编写思路。

0

2026.09.22

Conan二进制包配置指南
Conan二进制包配置指南

本专题介绍Conan根据操作系统、编译器、架构和构建类型生成二进制包的方法,讲解Profile、Settings、Options及Package ID的作用,帮助管理不同平台和编译环境下的包版本。

0

2026.09.22

热门下载

更多
网站特效
/
网站源码
/
网站素材
/
前端模板

精品课程

更多
相关推荐
/
热门推荐
/
最新课程
Grok官方手册
Grok官方手册

共0课时 | 0人学习

关于我们 免责申明 举报中心 意见反馈 讲师合作 广告合作 最新更新
php中文网:公益在线php培训,帮助PHP学习者快速成长!
关注服务号
PHP中文网订阅号
每天精选资源文章推送

Copyright 2014-2026 https://www.php.cn/ All Rights Reserved | php.cn