MiniMind GRPO 训练源码深度解析
深入剖析 MiniMind 项目的 GRPO (Group Relative Policy Optimization) 算法实现。
2764 字
|
14 分钟
PPO (RLHF) 到 DPO 的完整数学推导
严格按照 DPO 论文推导 Section 3-4 及 Appendix A.1-A.2 的核心公式。
1668 字
|
8 分钟
MiniMind DPO 训练源码深度解析
深入剖析 MiniMind 项目的 DPO (Direct Preference Optimization) 算法实现。
2708 字
|
14 分钟
MiniMind PPO 训练源码深度解析
深入剖析 MiniMind 项目的 PPO (Proximal Policy Optimization) 算法实现。
4907 字
|
25 分钟
AtCoder ABC456_D: D - Not Adjacent 2 Editorial
AtCoder 算法题解:D - Not Adjacent 2 Editorial
1066 字
|
5 分钟
AtCoder ABC450_D: D - Minimize Range Editorial
AtCoder 算法题解:D - Minimize Range Editorial
569 字
|
3 分钟
AtCoder ABC449_D: D - Make Target 2 Editorial
AtCoder 算法题解:D - Make Target 2 Editorial
604 字
|
3 分钟
AtCoder ABC448_D: D - Integer-duplicated Path Editorial
AtCoder 算法题解:D - Integer-duplicated Path Editorial
305 字
|
2 分钟