← 返回资讯
大模型 HuggingFace Daily Papers

N-GRPO:嵌入级邻居混合增强策略优化

N-GRPO 是 GRPO 框架内的一种新型探索策略,通过语义邻居混合增强大语言模型的数学推理能力,在保持语义一致性的同时注入多样性。

查看原文
解读生成中或暂时不可用,请稍后刷新重试,或直接查看原文。