Google DeepMind 试点全球首个前沿模型双盲评测:密文环境防基准污染
Google DeepMind 8-27 试点其称为全球首个针对专有前沿模型的双盲评测:借助机密计算,评测方看不到 Gemini 模型权重、Google 看不到评测方试题,以防基准污染。伙伴含新加坡 AI Safety Institute、OpenMined、AVERI、MLCommons,首个受测模型为 Gemini Flash Lite。
查看原文解读生成中或暂时不可用,请稍后刷新重试,或直接查看原文。
Google DeepMind 8-27 试点其称为全球首个针对专有前沿模型的双盲评测:借助机密计算,评测方看不到 Gemini 模型权重、Google 看不到评测方试题,以防基准污染。伙伴含新加坡 AI Safety Institute、OpenMined、AVERI、MLCommons,首个受测模型为 Gemini Flash Lite。
查看原文