logo
强化学习
  1. GRPO 入门:群体相对策略优化

    AI
    LLM
    推理模型
    GRPO
    强化学习
  2. DeepSeek-R1 的训练思路与开源影响

    AI
    LLM
    DeepSeek
    推理模型
    强化学习