Surfacing Pathological Behaviors in Language Models
Transluce 发布研究报告,提出 PRBO(倾向下界)作为稀疏奖励的代理,训练 RL 调查智能体生成真实自然的提示,以激发开源权重模型的指定罕见行为,覆盖 Llama 3.1/4、Qwen 2.5 和 DeepSeek-V3。
Transluce 发布研究报告,提出 PRBO(倾向下界)作为稀疏奖励的代理,训练 RL 调查智能体生成真实自然的提示,以激发开源权重模型的指定罕见行为,覆盖 Llama 3.1/4、Qwen 2.5 和 DeepSeek-V3。