DeepSeek R1 and DAPO
Overview
This presentation summarizes DeepSeek-R1 and DAPO, focusing on optimization objectives, training behavior, and practical implications for reasoning performance.
Papers
- DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning
- DAPO: An Open-Source LLM Reinforcement Learning System at Scale
- GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization