GPTProto

OSReward: Instituting Standardized Evaluation for Cross-Platform Computer-Use Reward Models

HuggingFace Daily Papers(社区热门论文)·Jul 30, 2026, 8:00 AM·Model Releases

OSReward 是一个用于评估视觉语言模型(VLM)作为计算机操作智能体(CUA)轨迹评判者的高质量基准,并衍生出聚焦困难案例的 OSReward-Hard 与细粒度评分的 OSReward-Multi。