MoBA(稀疏注意力方法)

MoBA(稀疏注意力方法)

MoBA,全称混合块注意力(Mixture of Block Attention),是一种用于大语言模型的稀疏注意力方法,由月之暗面Kimi团队联合清华大学、浙江大学的研究人员提出。该方法受混合专家(MoE)原理启发,通过将全上下文划分为多个块,使每个查询令牌(query token)动态选择关注最相关的键值(KV)块,旨在降低长序列处理的计算复杂度 。

MoBA已部署于支持Kimi的长上下文请求处理。在多项长文本基准测试中,采用MoBA的模型性能与全注意力模型相当 。其在处理1M(百万)token时比全注意力计算快6.5倍,在处理1000万token时,可实现16倍以上的加速 。

想要了解更多“MoBA(稀疏注意力方法)”的信息,请点击:MoBA(稀疏注意力方法)百科

标签:MoBA(稀疏注意力方法),MoBA,基本特征