🧠 大模型中的“权重”概念 在大模型(LLM)的语境下,权重是指模型中的参数(Parameters),它们是模型在训练过程中学习到的数值。 简单来说,如果把大模型想象成一个巨型的人脑网络,那么: 1. 权重的本质和作用 例如: 当模型看到“猫”这个词时,与“猫”相关的权重可能被激活,并指导模型在生成下一个词时偏向于“抓”、“毛茸茸”、“宠物”等词汇。 2. 权重和模型大小的关系 3. 权重分布和量化的关系(承接 INT4 话题) 当讨论到**量化(Quantization)**时,权重分布变得非常重要: 因此,“权重”是模型的大脑和记忆,而“权重分布”是它的数值特征,决定了我们能用多高效的方式(如 INT4 量化)来存储和运行它。 1. 正态分布的特点与量化挑战 大型语言模型的权重(Weight)在训练后,通常表现为**以零为中心的、服从正态分布(Normal Distribution)**的形状,也被称为“钟形曲线”: 2. NF4 如何匹配正态分布(非均匀量化) NF4 的核心思想是实现非均匀量化,即在权重集中的区域分配更多的量化点,在稀疏的区域分配更少的量化点。 量化点 NF4 的分配原则 均匀量化的分配原则 靠近 0 的区域 分配更多的量化点,使得 $0$ 附近的细微数值变化能被精确地编码。 数量少,数值间的间隔大。 远离 0 的区域 分配更少的量化点,允许数值间的间隔更大。 数量多,但大部分时候用不上。 NF4 实现这种匹配的关键在于它是一种归一化浮点格式 (Normalized Float 4): ① 步骤:归一化 (Normalization) 首先,NF4 会找到权重矩阵中的最大绝对值 $M$(即归一化常数),然后将所有权重值 $W$ … Continue reading 大模型概念之: 权重
Copy and paste this URL into your WordPress site to embed
Copy and paste this code into your site to embed