ARTICLE · 人工智能

模型部署后还能越跑越强!淘天 × 华科大最新提出 SERPO,在开放式任务上实现无标注自进化

作者:青稞AI 来源:青稞AI 2026-08-07 00:00 18 分钟 14 阅读 4356 字
强化学习测试时强化学习自进化开放式生成Rubric 优化
一语总结

本文提出 SERPO,通过自进化 rubric 在无标注情况下让模型在开放式任务上持续自我提升,实验显著提升多项基准得分。

AI 总结

文章介绍了由淘天集团与华中科技大学联合提出的 SERPO(Self‑Evolving Rubric Policy Optimization)方法,旨在解决测试时强化学习(TTRL)在开放式生成任务中的标注依赖问题。SERPO 不依赖外部奖励模型或人工标注,而是让模型从自身回答的差异中自动生成质量判据(rubric),并利用这些判据为策略提供训练信号,实现模型在部署后的持续自进化。实验在 Qwen3‑4B 和 Qwen3.5‑9B 上进行,HealthBench 从 32.30 提升至 49.83,ResearchQA 从 57.29 提升至 77.60,六项评测平均达 61.98,仅比使用外部裁判和官方 rubric 的特权监督低 0.91 分;消融实验表明完整的答复池、rubric 进化和 actor 更新三者缺一不可,且在多个 OOD 设定和长周期进化中均保持性能提升。文章还讨论了自进化的上界在于评估能力,并指出未来需要引入外部反馈以避免封闭循环的偏好强化。

核心要点
  1. SERPO 通过自进化 rubric 实现无标注的测试时强化学习。

    模型利用自身回答的差异生成质量判据,以判据为依据为策略生成奖励,从而在没有外部标注的情况下持续更新模型参数。

  2. 在多个基准上 SERPO 显著提升性能,接近特权监督水平。

    HealthBench 提升 17.53 分,ResearchQA 提升 20.31 分,六项评测平均达 61.98,仅比使用外部裁判和官方 rubric 的特权监督低 0.91 分,说明其有效性。

  3. 消融与长期实验验证了方法的必要性和持续性。

    冻结 actor 导致性能回落至基线;答复池、rubric 进化和 actor 更新三者缺一不可;在 45 epoch 后性能曲线仍在上升,8 个 OOD 设定均超过基线。

模型部署后还能越跑越强!淘天 × 华科大最新提出 SERPO,在开放式任务上实现无标注自进化

文章介绍了由淘天集团与华中科技大学联合提出的 SERPO(Self‑Evolving Rubric Policy Optimization)方法,旨在解决测试时强化学习(TTRL)在开放式生成任务中的标注依赖问题。SERPO 不依赖外部奖励模型或人工标注,而是让模型从自身回答的差异中自动生成质量判据(rubric),并利用这些判据为策略提供训练信号,实现模型在部署后的持续自进化。实验在 Qwen3‑4B 和 Qwen3.5‑9B 上进行,HealthBench 从 32.30 提升至 49.83,ResearchQA 从 57.29 提升至 77.60,六项评测平均达 61.98,仅比使用外部裁判和官方 rubric 的特权监督低 0.91 分;消融实验表明完整的答复池、rubric 进化和 actor 更新三者缺一不可,且在多个 OOD 设定和长周期进化中均保持性能提升。文章还讨论了自进化的上界在于评估能力,并指出未来需要引入外部反馈以避免封闭循环的偏好强化。

文章金句

"

SERPO 将 HealthBench 从 32.30 提升到 49.83 ,将 ResearchQA 从 57.29 提升到 77.60 ;六项评测的平均分达到 61.98 ,与使用外部裁判和官方 rubric 的特权监督仅差 0.91 分。

"

自进化到底“自”到什么程度