
经常听说一个模型多少 BBillion, 10亿单位参数如GPT-3 175BLlama3 70BQwen3 32B一个 LLM 大模型发布首先被注意到的是它有多大也就是支持多少 B 参数。如智谱最新发布的 GLM 5.2 总参数量有 744B7440亿支持 1M 上下文。这些参数是如何计算的它们分别由哪些部分组成本文试图从 Transformer 训练流程的角度拆解这些参数期间会涉及一些底层概念当把这些底层概念和参数计算连接在一起时他们共同构成了 Transformer 基本原理。1、什么是参数Parameters参数本质上就是神经网络中的可训练数字。我们以一个简单的神经网络线性层来举例说明Y X*W b假设X [x1,x2,x3]输出为2维Y [y1,y2]那么这里总的参数量为86个权重2个bias8个参数所以我们可以得出下面这个公式模型参数数量 所有可训练权重矩阵元素个数之和。注更多有关神经网络、单层感知机线性层以及 MLP 的历史故事可参考理解 LLM 的关键数学概念万能近似定理贯穿人工智能发展简史。2、Transformer 里的参数主要来自哪里Transformer Block 是大模型里面一个完整的信息加工单元最基本的积木这些 Blocks 可以无限堆叠构成了整个 Transformer 模块。一个 Block 通常由以下四部分组成Attention执行 QKV 矩阵计算负责Token之间的信息交流MLP前馈网络对每个Token对表示做非线性变换提取和组合更复杂的特征。Redisual残差连接保留原始信息防止特征退化同时提供梯度捷径这是 Block 可以不断叠加的关键所在。更多详见理解 LLM 的关键数学概念残差 ResidualNorm归一化层保持数值稳定。一个 Block 的参数则主要来自 Attention 和 MLP 部分。1 Attention 参数QKV 投影Q X * WqK K * WkV V * Wv假设隐藏层Hidden Layer的 hidden_size4096Transformer 里也被写作 d_model4096。那么Wq 矩阵大小为4096 * 4096参数数量为 16777216约16.8M同理Wq, Wk, Wv 三份矩阵总参数量为16.8 * 3 50.4M同时现在 Attention 基本是Multi-Head所以还有个Wo矩阵 16.8M这样计算下来Attention的总参数量为67.2M 16.8M * 4注隐藏层是比 Transformer 还早的概念随着 MLP 的诞生1980s而一起出现的早期1957神经网络是输入-输出多层神经网络是输入-隐藏层-输出因为单层网络表达能力太弱所以引入了中间的隐藏层。根据理解 LLM 的关键数学概念万能近似定理贯穿人工智能发展简史的知识隐藏层越大LLM 表达能越万能。2 MLP前馈网络 参数Transformer 最大的参数量不是 Attention 部分而是 MLP。这里要引入一个新的名词 intermediate_size在2017年的《Attention Is All You Need》论文里FFNFeed Forward Network首次成为标准结构为了让FFN可以在更高维的特征空间施加非线性变换所以需要升维d_ffFeed Forward Dimension用来表示需要升维的维度大小直到后来的BERT2018以及Hugging Face的官方表达现在 intermediate_size 名称统一指代 FFN 的矩阵维度大小。理论上维度越高模型的表达能力则越强。但是通常不会无限升维因为计算资源是有限的。当前几乎所有主流模型的intermediate_size大小为hidden_size的4倍因为很多模型训练发现2倍表达能力不足8倍效果提升有限但参数量和计算量都大幅增加4倍性价比最好。当然也有例外如 Llama 使用了 Gated Linear UnitSwiGLU结构为了保持参数量和计算量平衡比例调整到了约 2.7 倍例如 4096 → 11008下面我们就拿 Llama举例说明hidden_size 4096intermediate_size 11008第一层为4096 * 11008 45M第二层为11008 * 4096 45M合计90M至此我们计算完了一个Block的参数量157M 67M 90MAttention 参数量 67MMLP 参数量 90M如果 Transformer 的 Blocks 总共有32层即32个Block如 Llama 7B那么总参数量为 5B 157M * 32此外还需要加上 EmbeddingRMSNorm以及LM Head最终约为7B即7B参数模型。3、Transformer 模型的通用估算公式关于标准 Transformer 的参数业界也有一个经验估算公式例如上面的 Llama 7B有32层每层hidden_size为4096则总参数量为12 * 32 * 4096*4096 6.4B再加上 Embedding等约等于 7B再比如 GPT-3 为什么是175BGPT-3有96层每层hidden_size12288则总参数量约为12 * 96 * 12288 174B这个值与真实的175B已经非常接近了。最后附上一张全景图这里给大家精心整理了一份全面的AI大模型学习资源包括AI大模型全套学习路线图从入门到实战、精品AI大模型学习书籍手册、视频教程、实战学习、面试题等资料免费分享扫码免费领取全部内容1. 成长路线图学习规划要学习一门新的技术作为新手一定要先学习成长路线图方向不对努力白费。这里我们为新手和想要进一步提升的专业人士准备了一份详细的学习成长路线图和规划。可以说是最科学最系统的学习成长路线。2. 大模型经典PDF书籍书籍和学习文档资料是学习大模型过程中必不可少的我们精选了一系列深入探讨大模型技术的书籍和学习文档它们由领域内的顶尖专家撰写内容全面、深入、详尽为你学习大模型提供坚实的理论基础。书籍含电子版PDF3. 大模型视频教程对于很多自学或者没有基础的同学来说书籍这些纯文字类的学习教材会觉得比较晦涩难以理解因此我们提供了丰富的大模型视频教程以动态、形象的方式展示技术概念帮助你更快、更轻松地掌握核心知识。4. 2026行业报告行业分析主要包括对不同行业的现状、趋势、问题、机会等进行系统地调研和评估以了解哪些行业更适合引入大模型的技术和应用以及在哪些方面可以发挥大模型的优势。5. 大模型项目实战学以致用当你的理论知识积累到一定程度就需要通过项目实战在实际操作中检验和巩固你所学到的知识同时为你找工作和职业发展打下坚实的基础。6. 大模型面试题面试不仅是技术的较量更需要充分的准备。在你已经掌握了大模型技术之后就需要开始准备面试我们将提供精心整理的大模型面试题库涵盖当前面试中可能遇到的各种技术问题让你在面试中游刃有余。7. 资料领取全套内容免费抱走学 AI 不用再找第二份不管你是 0 基础想入门 AI 大模型还是有基础想冲刺大厂、了解行业趋势这份资料都能满足你现在只需按照提示操作就能免费领取扫码免费领取全部内容