文章主要内容和创新点主要内容本文聚焦大型语言模型(LLMs)的激活稀疏性(即输入仅激活部分神经元),旨在通过高效预测激活模式降低计算成本。由于直接预测单个神经元的激活状态计算开销极大(因神经元数量庞大),作者提出一种基于聚类的激活模式压缩框架:将相似的激活模式分组为少量代表性聚类,通过预测聚类分配而非单个神经元状态,实现高效推理。实验基于Mistral-7B模型和WikiText-2数据集,采用阈值机制确保前馈网络(FFN)层50%的稀疏性,同时开发了定制化的激活感知聚类(AWC)算法。结果显示,该算法聚类精度最高达79.34%,优于标准二进制聚类方法;在足够多聚类的情况下,困惑度(PPL)低至12.49,证明其在减少计算开销的同时能保持模型性能。创新点聚类替代单个神经元预测:不再独立处理每个神经元,而是将相似激活模式聚类为代表性质心,大幅降低预测复杂度(计算开销减少约76万倍)。定制化聚类算法(AWC):针对LLMs激活稀疏性设计,聚类时仅关注活跃神经元(而非所有神经元),提升聚类精度,尤其在非ReLU激活函数的LLMs上有效。兼容性与实用性:无需修改模型架构,适用于采用SiLU或GELU激活函数的现代LLMs,解决了现有方法依赖ReLU或需修改模型的局限。性能与效率平衡:在高稀疏性(如20%)下仍保持低困惑度(12.49),验证了通过聚类优化激活稀疏性的可行性,为