ARTICLE · 人工智能
模型部署后还能越跑越强!淘天 × 华科大最新提出 SERPO,在开放式任务上实现无标注自进化
一语总结本文提出 SERPO,通过自进化 rubric 在无标注情况下让模型在开放式任务上持续自我提升,实验显著提升多项基准得分。
文章介绍了由淘天集团与华中科技大学联合提出的 SERPO(Self‑Evolving Rubric Policy Optimization)方法,旨在解决测试时强化学习(TTRL)在开放式生成任务中的标注依赖问题。SERPO 不依赖外部奖励模型或人工标注,而是让模型从自身回答的差异中自动生成质量判据(rubric),并利用这些判据为策略提供训练信号,实现模型在部署后的持续自进化。实验在 Qwen3‑4B 和 Qwen3.5‑9B 上进行,HealthBench 从 32.30 提升至 49.83,ResearchQA 从 57.29 提升至 77.60,六项评测平均达 61.98,仅比使用外部裁判和官方 rubric 的特权监督低 0.91 分;消融实验表明完整的答复池、rubric 进化和 actor 更新三者缺一不可,且在多个 OOD 设定和长周期进化中均保持性能提升。文章还讨论了自进化的上界在于评估能力,并指出未来需要引入外部反馈以避免封闭循环的偏好强化。
- SERPO 通过自进化 rubric 实现无标注的测试时强化学习。
模型利用自身回答的差异生成质量判据,以判据为依据为策略生成奖励,从而在没有外部标注的情况下持续更新模型参数。
- 在多个基准上 SERPO 显著提升性能,接近特权监督水平。
HealthBench 提升 17.53 分,ResearchQA 提升 20.31 分,六项评测平均达 61.98,仅比使用外部裁判和官方 rubric 的特权监督低 0.91 分,说明其有效性。
- 消融与长期实验验证了方法的必要性和持续性。
冻结 actor 导致性能回落至基线;答复池、rubric 进化和 actor 更新三者缺一不可;在 45 epoch 后性能曲线仍在上升,8 个 OOD 设定均超过基线。
模型部署后还能越跑越强!淘天 × 华科大最新提出 SERPO,在开放式任务上实现无标注自进化
文章介绍了由淘天集团与华中科技大学联合提出的 SERPO(Self‑Evolving Rubric Policy Optimization)方法,旨在解决测试时强化学习(TTRL)在开放式生成任务中的标注依赖问题。SERPO 不依赖外部奖励模型或人工标注,而是让模型从自身回答的差异中自动生成质量判据(rubric),并利用这些判据为策略提供训练信号,实现模型在部署后的持续自进化。实验在 Qwen3‑4B 和 Qwen3.5‑9B 上进行,HealthBench 从 32.30 提升至 49.83,ResearchQA 从 57.29 提升至 77.60,六项评测平均达 61.98,仅比使用外部裁判和官方 rubric 的特权监督低 0.91 分;消融实验表明完整的答复池、rubric 进化和 actor 更新三者缺一不可,且在多个 OOD 设定和长周期进化中均保持性能提升。文章还讨论了自进化的上界在于评估能力,并指出未来需要引入外部反馈以避免封闭循环的偏好强化。
文章金句
"SERPO 将 HealthBench 从 32.30 提升到 49.83 ,将 ResearchQA 从 57.29 提升到 77.60 ;六项评测的平均分达到 61.98 ,与使用外部裁判和官方 rubric 的特权监督仅差 0.91 分。
"自进化到底“自”到什么程度