OSReward: Instituting Standardized Evaluation for Cross-Platform Computer-Use Reward Models
OSReward 是一个用于评估视觉语言模型(VLM)作为计算机操作智能体(CUA)轨迹评判者的高质量基准,并衍生出聚焦困难案例的 OSReward-Hard 与细粒度评分的 OSReward-Multi。
OSReward 是一个用于评估视觉语言模型(VLM)作为计算机操作智能体(CUA)轨迹评判者的高质量基准,并衍生出聚焦困难案例的 OSReward-Hard 与细粒度评分的 OSReward-Multi。