讲师中心 微信公众号
AI工具推荐 视频效率加速

大模型到底是什么?教你快速掌握 LLM 的基本逻辑与分类

秋浩同学_7910

秋浩同学_7910

发布时间:2026-03-16 20:18:01

|

437人浏览过

|

来源于php中文网

原创

大模型是参数超十亿、依赖TB级数据预训练、具涌现能力的深度学习系统;其底层为Transformer架构,经预训练、指令微调、对齐优化三阶段训练;按功能分为Base、Chat、多模态、Agent四类。

☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

大模型到底是什么?教你快速掌握 llm 的基本逻辑与分类

如果您看到“大模型”“LLM”“基础模型”等术语频繁出现,却难以厘清其本质与内在逻辑,则可能是由于概念层级混杂、技术路径多样所致。以下是帮助您快速掌握大模型基本逻辑与分类的核心路径:

一、大模型的本质定义

大模型并非单指某类特定结构或用途的模型,而是对一类具备超大规模参数、依赖海量数据训练、拥有强泛化能力的深度学习系统的统称。其“大”首先体现为参数量级——从十亿(如LLaMA-2 7B)到万亿(如GPT-4 Turbo宣称可达1.8万亿)不等;其次体现为训练数据规模,通常覆盖TB级互联网文本、代码、书籍等多源语料;最后体现为能力涌现性,即在未显式训练的任务上突然展现出推理、工具调用、多步规划等高级行为。

1、参数规模是区分大模型与传统模型的关键硬指标,低于十亿参数的模型一般不被视为现代意义上的大模型。

2、训练方式以自监督预训练为主,核心任务是预测下一个词元(next token prediction),无需人工标注即可从原始文本中自动构建学习信号。

3、模型输出并非固定答案,而是基于概率分布采样生成的序列,受温度(temperature)、top-p等解码参数实时调控。

二、LLM 的底层逻辑:Transformer 与三阶段训练

当前所有主流LLM均基于Transformer架构,其核心是自注意力机制(Self-Attention),使模型能动态评估输入中任意两个词元之间的关联强度,从而建模长距离语义依赖。整个工作流程严格遵循“输入→嵌入→多层注意力与前馈网络→logits输出→采样生成”的固定链路。

1、预训练阶段:在无标注语料上进行海量迭代,目标是最大化语言建模损失,习得通用语法、事实知识与世界常识。

Baoyu Danger Gemini Web
Baoyu Danger Gemini Web

通过逆向工程的Gemini网页API生成图像和文本。支持文本生成、提示词图像生成以及用于视觉输入的参考图像等。

下载

2、指令微调阶段:使用高质量指令-响应对(如Alpaca格式)进行有监督训练,使模型理解“写邮件”“翻译成法语”“总结要点”等人类意图表达。

3、对齐优化阶段:通过人类反馈强化学习(RLHF)或直接偏好优化(DPO),将模型输出与人类价值观、安全性、有用性对齐,此阶段不提升知识量,但显著改变响应风格与可靠性。

三、LLM 的主要类型划分

按功能定位与训练路径差异,LLM可划分为若干互斥且正交的类型,同一模型可能同时属于多个类别。分类依据不依赖参数大小,而取决于训练目标与部署形态。

1、Base模型:仅完成预训练,输出为连续文本流,不具备指令遵循能力,典型代表为LLaMA-3 8B Base、Qwen2-7B Pretrained。

2、Chat模型:在Base模型基础上经指令微调与对齐优化,专为对话交互设计,能识别系统提示词、维护上下文、拒绝越界请求。

3、多模态LLM:除文本外,额外接入图像编码器(如CLIP)、音频编码器或视频时空建模模块,实现跨模态对齐与联合推理,例如Qwen-VL、Gemini 1.5 Pro支持图文混合输入。

4、Agent模型:在Chat模型基础上集成规划器(Planner)、记忆模块(Memory)、工具调用接口(Tool Calling),可自主拆解目标、调用API、反思执行结果。

热门AI工具

更多
DeepSeek

DeepSeek是一款面向对话、写作、编程和推理场景的AI大模型工具。

Seko
Seko Hot

一款AI视频创作工具,主要用于商汤科技推出的创编一体的AI短视频创作Agent,适合需要提升相关任务效率的用户。

Loomy
Loomy Hot

一款AI工具,主要用于科大讯飞发布的桌面级 AI 助理,比 OpenClaw 更易用、更安全!,适合需要提升相关任务效率的用户。

UpDream
UpDream Hot

一款AI视频创作工具,主要用于哔哩哔哩推出的自研AI视频创作工具,适合需要提升相关任务效率的用户。

WorkBuddy

一款AI办公效率工具,主要用于腾讯云推出的AI原生桌面智能体工作台,适合需要提升相关任务效率的用户。

切问学术

切问学术是一款AI论文写作工具,复旦大学NLP团队推出的AI学术智能体。

豆包大模型

豆包大模型是一款由字节跳动推出的企业级大语言模型服务平台。

AionClaw
AionClaw Hot

AionClaw是一款面向办公、创作和编程任务的AI桌面智能体。

墨刀AI
墨刀AI Hot

一款AI图像与设计工具,主要用于产品经理的专属智能体,适合需要提升相关任务效率的用户。

相关专题

更多
FrankenPHP集成Laravel详细教程
FrankenPHP集成Laravel详细教程

本专题提供FrankenPHP集成Laravel的详细配置指南,全面解析运行原理、开发环境搭建、Caddyfile配置、Octane工作模式、数据库连接、队列任务、定时任务和生产环境优化,解决部署过程中常见的报错与兼容性问题。

0

2026.10.08

LLVM自定义Pass怎么写
LLVM自定义Pass怎么写

本专题聚焦LLVM自定义Pass开发,整理Pass类结构、run()方法、PreservedAnalyses、CMake构建、插件注册、-load-pass-plugin加载和测试用例编写流程。

120

2026.09.30

LLVM RISC-V参数配置教程
LLVM RISC-V参数配置教程

本专题介绍LLVM对RISC-V基础ISA和扩展的支持方式,涵盖RV32、RV64、标准扩展、实验性扩展、厂商扩展、-menable-experimental-extensions和版本差异。

100

2026.09.30

LLVM IR中间表示入门指南
LLVM IR中间表示入门指南

本专题整理LLVM IR的核心概念,包括中间表示作用、模块结构、函数、基本块、SSA形式、类型系统和常见语法,帮助新手理解LLVM编译流程中的关键层。

80

2026.09.30

PDF转图片方法
PDF转图片方法

需要把 PDF 页面用于上传、预览、分享或图片归档时,PDF 转图片方法专题整理 JPG/PNG 格式选择、逐页导出、清晰度设置、批量下载和结果检查等流程,帮助用户稳定完成 PDF 图片化处理。

80

2026.09.30

PixTV AI视频生成与无限画布创作
PixTV AI视频生成与无限画布创作

PixTV专题整理AI视频与视觉内容创作相关功能使用教程,涵盖AI生图、视频生成、无限画布、多模型创作、素材管理、声音音乐及视频剪辑等功能,帮助用户快速掌握PixTV从创意到成片的完整制作方法。

100

2026.09.29

Buffalo框架数据库开发全教程
Buffalo框架数据库开发全教程

本专题围绕Buffalo框架数据库开发,讲解database.yml多环境配置、soda与fizz迁移生成回滚、模型结构体标签、增删改查与条件查询、一对多与多对多关联、数据校验、回调钩子、事务处理及原生SQL执行能力。

300

2026.09.23

Buffalo框架路由与请求处理实操指南
Buffalo框架路由与请求处理实操指南

本专题讲解Buffalo框架路由与请求处理机制,涵盖路由注册与分组、资源路由、Handler编写规范、Context上下文方法、参数绑定、中间件编写挂载、Session与Cookie读写、Flash消息及错误页面定制方法。

180

2026.09.23

Buffalo框架零基础入门教程
Buffalo框架零基础入门教程

本专题整理Buffalo框架入门内容,涵盖Go环境准备、buffalo CLI安装、新项目生成、目录结构说明、dev热加载启动、数据库连接配置与常见报错排查,帮助新手按约定优于配置的思路跑通第一个Buffalo框架应用。

140

2026.09.23

热门下载

更多
网站特效
/
网站源码
/
网站素材
/
前端模板

精品课程

更多
相关推荐
/
热门推荐
/
最新课程
关于我们 免责申明 举报中心 意见反馈 讲师合作 广告合作 最新更新
php中文网:公益在线php培训,帮助PHP学习者快速成长!
关注服务号
PHP中文网订阅号
每天精选资源文章推送

Copyright 2014-2026 https://www.php.cn/ All Rights Reserved | php.cn