← 返回资讯
研究 HuggingFace Daily Papers

LLaDA MoE v2:专家混合扩散语言模型的规模化研究

系统研究了专家混合扩散语言模型的规模化行为,发现其优化超参数缩放规律与自回归模型存在显著差异:最优批次大小增长更快,最优学习率衰减更快,且等计算量分析显示模型-数据分配策略也有所不同。

查看原文
解读生成中或暂时不可用,请稍后刷新重试,或直接查看原文。