有人看完一条11分钟的视频,给出的评价只有一句:比预期好。视频讲的是三个强化学习里的老面孔——PPO、GRPO、DPO。

发帖人的原话更直接:他觉得做不出这种东西的模型,大概是不抽大麻的。这句调侃指向的是视频里那套可视化讲解,把三个算法放在一起对照着讲。

打开网易新闻 查看精彩图片

三个缩写,三种路线

PPO、GRPO、DPO,都是围绕模型偏好对齐展开的方法。视频没有停留在名词解释,而是用可视化把三者的差异摆出来,看完能分清各自在做什么。

发帖人只留下一句"看完你就懂",没有展开技术细节。这条内容本身更像一次推荐,而不是教程。

564次浏览背后的信号

这条帖子发布于9月27日深夜,浏览量564。数字不大,但评论区之外的那句"比预期好",说明可视化讲解这类内容正在被更多人当成理解算法的入口。

对做模型的人来说,PPO、GRPO、DPO不是新词,难的是讲清楚。一条11分钟的视频能做到,本身就是件值得转的事。