共计 7 篇文章
2026
Rubric-Based RL 十月洞察
MeRF: 训练时告诉模型评分规则会怎样?
DeepSeek-R1: 只奖励结果,推理能力会自己长出来吗?
RAGEN-2: 模型还在认真胡说,但已经不看题了
RAGEN: LLM Agent也能通过强化学习学会“思考”和“自我进化”吗?
TRACE: A Unified Rollout Budget Allocation Framework for Efficient Agentic Reinforcement Learning
The Landscape of Agentic Reinforcement Learning for LLMs: A Survey