← 返回资讯
研究 HuggingFace Daily Papers

用动态评分标准作为奖励的强化学习用于音频推理

音频推理对机器理解声学世界至关重要。强化学习配合可验证奖励能激发推理能力,但现有奖励设计各有局限:基于结果的奖励仅监督最终答案,模型可能不关注音频;基于过程的奖励评估推理本身,但依赖粗糙、人工制定且固定的标准,不能针对具体问题调整也无法锚定声学证据。

查看原文
解读生成中或暂时不可用,请稍后刷新重试,或直接查看原文。