← 返回资讯
研究 HuggingFace Daily Papers

Motif 3 技术报告

Motif 3是一款仅解码器的专家混合(MoE)语言模型,总参数3,140亿,每token激活132亿。稀疏MoE层包含384个路由专家,每token选择8个。模型基于分组差分潜注意力(GDLA)构建,整合了分组差分注意力与多头潜注意力的压缩key-value表示,并采用改进的流形约束超连接机制。

查看原文
解读生成中或暂时不可用,请稍后刷新重试,或直接查看原文。