突然就想写点应用、开发相关的东西,一方面是不断有企业和朋友问我他们可以用DeepSeek做什么,怎么用;另一方面是这个方向的职业、行业也在不知不觉中慢慢改变。干脆顺便一起梳理一下,记录在案。
DeepSeek R1后LLM新范式
本文通过10篇R1相关的研究,介绍R1后LLM的新范式。其核心就是如何进一步增强LLM的能力。
基本框架
首先是整体的框架,如下所示。
- Base+SFT
- R1冷启动
- LIMO (817 Data Selection)
- s1 (1000)
- Base+RL
- GRPO: R1-Zero
- GRPO: oat-zero (Base can Aha、RL enhance)
- PPO: LIMR (Data Selection)
- PPO: orz (Scaling quality, diversity)
- DPO: Online-DPO-R1 (Different RL Algo)
- DPO: LIMD (Data Selection)
- SFT+RL
- R1蒸馏
- DeepScaleR (Length Scaling)
- Self-rewarding correction (LLM can reward itself, explicit Aha)、L1(LCPO)
我将其分成3个部分,前两个部分是Base模型的基础上使用SFT或RL提升效果,最后是SFT结合RL进一步提升效果。每个部分的第一个都是R1论文中的内容,上面没有R1本身,是因为R1本身是一个比较综合的过程。
值得说明的是,关于R1相关的研究肯定不止这些,列出这些一方面是因为我自己精力有限,只仔细阅读了这些;另一方面是逐步整理的过程中感觉到框架基本趋于完善。因此,本文也算是一个阶段性整理的输出。
本文内容相对比较通俗,如果对相关内容感兴趣,可以移步到对应的解读文章。
OMNI论文速览(2025)
OMNI相关论文。
R1相关:DPO数据选择与DPO等RL算法
本文介绍两篇与DPO以及其他RL算法相关的。R1-Zero在表现出潜力后,GRPO自不必多说,得到大家关注。PPO、Reinforce++等也被用来尝试实验,结果也很亮眼。既然如此,其他RL算法可以吗,尤其是前LLM时代流行的DPO。于是就有了本文的两篇研究。
预训练:NTP和Scaling Law
LLM、强化、蒸馏讨论
2025年2月26日下午,Datawhale Paper群突然开启了一番关于AI相关的讨论,涉及成员主要包括:X、Y、D、S、M、A和C。我觉得内容相当有意思,因此记录在案备查。
其中对我个人印象比较深的几个观点:
- X提出的新的大模型训练范式:预训练,long-cot, sft(long2short)。可以理解为先用大规模语料预训练学习知识,然后用少量SFT或RL(可以一起用)提升long-cot,然后再做SFT使其根据情况自动选择long或short。
- 关于如何让模型自动选择思考长度(或不思考)的讨论,X认为主要靠强化,只是奖励这块需要涉及,就是是否需要思考,问题的难易,需要有个奖励来控制、设计。集成和自适应prm都是挺好的点,其实现在的重心就是什么样的奖励和怎么自动奖励。
- 关于蒸馏分布的讨论。蒸馏之前做的不多,没想过这么细,不过如何桥接教师和学生的讨论确实有启发。
对讨论结果分别使用DeepSeek和DeepSeek-R1进行了整理,前者相对比较忠于讨论内容,后者则更加抽象有高度一些,各有优势。
R1相关:RL数据选择与Scaling
本文介绍两篇对RL Scaling进一步探索的论文,都是关于数据方面的,结论有一定互补性。
R1相关:少量高质量数据SFT激活LLM推理能力
本文介绍两篇最新的用少量高质量数据SFT激活LLM推理能力的研究,分别是LIMO和s1。众所周知,一般说到SFT,尤其是参数比较大的模型,都是需要大量数据的;再加上推理任务本身又比较复杂,所需的数据可能更多。但这两篇文章的结论有点颠覆认知。这里的核心是:LLM本身需要具备如此能力,才有可能通过少量高质量数据SFT激活,否则可能难以见效。随着R1的出现,后训练算是彻底发生改变了。
DeepSeek R1深度技术解析及其影响
本文是2025年2月15日《2025 iFLYTEK 开发者TALK 杭州站《DeepSeek深度技术解析》分享的文字版,PPT可以在这里找到。由于时间关系,实际分享是本文的简化版。文字内容是近半个月陆陆续续记录的一些阅读笔记和思考,中途接到分享邀请(还好有点积累,不然怕是难顶doge),成稿于分享后。
距离2022年底ChatGPT发布开启LLM时代才过去两年多一点时间,刚进入2025年,DeepSeek-R1就将LLM真正推向了深度思考时代。
两年多的高速发展,前所未有的按周迭代,如今想来都一阵恍惚。2023年是LLM最快速发展的一年,被称为LLM元年,新的开发范式出现(感兴趣的读者可以关注HuggingLLM),全民AI浪潮涌现。2024年,基于LLM的应用已经开始成熟,Agent百花齐放,进入元年,各种应用层出不穷,一个人公司成为可能。
当我们以为LLM基本就这样按部就班向”应用“时,R1出现了,它发迹于OpenAI-o1,但超越了o1。关于o1,我的观点和OpenAI前首席研究官Bob的观点一致:它的目标是解决复杂问题,大多数人日常工作中并不会遇到需要o1的需求(可以参考关于AI前沿的思考)。但是R1提升了LLM的整体能力,让模型真正在推理时进行自我反思和验证,这当然适用于复杂问题,但日常工作很多场景也能受益,AI更加像人。我觉得这是R1对整个行业的贡献,其作用不亚于ChatGPT的发布。
我为什么做开源?
开源到书籍
从《ChatGPT原理与应用开发》这本书开始吧,它获得了异步2024年影响力图书。这本身是一个开源项目HuggingLLM,当时(23年4月)的初衷很简单,就是想帮助更多的中小企业使用AI,让非算法的工程师也能借助AI实现算法相关功能和服务。另外,本书另一位作者玉琳说网上太多智商税的课程了,觉得我们应该做点什么,于是一拍即合就有了这个项目。但具体开始做的时候,我觉得还是应该有一些创新,并且内容的生命力尽量持久些。思来想去,再结合市场调研结果,决定以NLP算法常见任务为导向,通过借助LLM让普通程序员也能做NLP算法工程师的工作。同时内容尽量保持实战性,代码可直接复用到工作环境。这是从NLP范式角度展开的一本书,是最大的创新点,同时范式是不容易改变的,也保证了书籍的生命力。
书籍出版后,其实还是有点担心的,我当时对这本书的评价是有一定价值,但整体质量其实一般。不过有一点我觉得是好的,就是到现在为止书的框架依然是正确的,且目测会在很长一段时间内仍然有效。后来微信读书评价果然还可以,有评价说看得出作者在NLP领域浸淫多年,这是不错的,有些东西光眼看不经历实际项目是没用的。其实我当时还看了微信读书的基本同类型书,有些书质量不错,但也有些拼凑感很重,都是网上到处整理的资料,果然,这些书的评论里就有不少人提到了,看来读者的眼睛是雪亮的。说回本书,其实我觉得整体还是太粗糙了,毕竟时间点紧,没太多时间打磨,内容呢也比较简单,是真的非常简单,毕竟是给非行业人士看的。我都跟业内人说你们别看,太简单了,不要浪费时间,当然更不要买,网上都有全书电子稿。