大语言模型的“思考”本质是Transformer中可追踪的张量运算:从Token化、嵌入、位置编码,到自注意力、多头机制、残差归一化及前馈网络,逐层完成语义与位置信息的动态建模与非线性增强。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

如果您希望理解大语言模型如何真正“思考”,就必须深入其底层计算流程。Transformer 架构并非黑箱,而是由一系列可追踪、可验证的张量运算构成。以下是对其核心计算逻辑的逐层拆解:
一、Token化与序列张量化
文本必须先被离散化为基本处理单元,才能进入数值计算系统。Tokenization 不是简单切分,而是依据语义边界与子词频率进行智能划分,确保每个Token承载合理的信息密度。该步骤将原始字符串映射为整数ID序列,为后续嵌入提供索引基础。
1、输入句子“我喜欢Transformer”被送入Tokenizer;
2、Tokenizer依据训练时学习到的分词规则,输出ID序列如[1245, 367, 8901, 234, 5678];
3、该序列被组织为形状为 (batch_size=1, seq_len=5) 的整数张量。
二、词嵌入层:静态向量查表
每个Token ID需转换为稠密向量,以便参与神经网络运算。嵌入层本质是一张可学习的查找表(Embedding Table),其行数等于词表大小,列数等于模型维度d_model。此阶段生成的向量不携带上下文信息,但为后续动态建模提供初始语义锚点。
1、使用ID序列索引嵌入表,取出对应行向量;
2、拼接得到形状为 (1, 5, d_model=512) 的浮点型张量;
3、该张量中每个位置的向量值在训练初期固定,仅在反向传播时更新表项。
三、位置编码注入:恢复序列顺序
自注意力机制本身不具备顺序感知能力,因此必须显式注入位置信息。正弦余弦位置编码(Sinusoidal PE)以确定性函数生成,其频率随维度变化,使模型能线性组合不同偏移量的位置关系,从而支持相对位置推断。
1、根据当前seq_len=5和d_model=512,生成形状为 (1, 5, 512) 的PE张量;
2、将PE张量与嵌入张量按元素相加;
3、叠加后的结果仍保持 (1, 5, 512) 形状,但每个Token now carries positional identity.
四、自注意力层:动态权重分配
该层通过Query-Key-Value三元组机制,让每个Token自主决定应关注序列中哪些其他Token。计算过程包含缩放点积、Softmax归一化与加权求和,最终输出融合全局上下文的新表示。
1、对输入张量分别乘以Q、K、V三个可学习权重矩阵,得到形状均为 (1, 5, 512) 的三组张量;
2、计算Q与K^T的点积,除以√(d_k=64),得到 (1, 5, 5) 的注意力分数矩阵;
3、对每行应用Softmax,使各行和为1,形成注意力权重分布;
4、用该权重矩阵对V张量加权求和,输出形状为 (1, 5, 512) 的注意力输出。
五、多头注意力:并行视角融合
单头注意力易陷入局部最优,多头机制将d_model维度切分为h=8个子空间,每个子空间独立执行自注意力计算,再拼接并线性投影回原维度,实现语义特征的多样化捕获与整合。
1、将输入张量沿最后一维切分为8组,每组维度为64;
2、每组分别经过独立的Q/K/V线性变换与自注意力计算;
3、将8个输出张量沿最后一维拼接,得到形状为 (1, 5, 512) 的中间结果;
4、对该拼接结果乘以最终投影矩阵,完成维度对齐与信息压缩。
六、残差连接与层归一化
为缓解深层网络梯度退化与内部协变量偏移,每个子层后均添加残差路径与LayerNorm。该操作保障信号稳定传递,并使各层输入分布保持均值为0、方差为1,加速收敛且提升泛化性。
1、将子层输入与子层输出相加,形成残差连接;
2、对相加结果沿d_model维度执行LayerNorm,即减去均值、除以标准差、再乘以可学习缩放和平移参数;
3、归一化后张量仍维持 (1, 5, 512) 形状,进入下一流程。
七、前馈神经网络:非线性特征增强
该模块由两层全连接网络构成,中间插入ReLU或GELU激活函数,对每个位置独立进行非线性变换。其设计保证了位置间无信息交换,与自注意力形成互补:前者建模局部复杂模式,后者建模全局依赖关系。
1、输入张量经第一层线性变换,扩展至隐藏层维度 d_ff=2048;
2、应用GELU激活函数,引入非线性;
3、再经第二层线性变换,压缩回 d_model=512 维度;
4、输出张量形状仍为 (1, 5, 512),准备进入下一编码器层。

















