8号一大早出门团建,赶路过程中看到群里X哥来了句“5感觉有点难评”,H哥来了句“感觉有点失望”。X哥接着补充“我感觉o系列有点打乱openai本来的节奏,我理解本来5应该预想是全模态模型”。是的,没错,今天凌晨GPT-5发布,反响不一,但总体来看好像并没有达到大家的预期。至于大家的预期是什么,那肯定不一而足,不过就发布的内容来看——一个正常的LLM、一个推理模型和一个动态router,这显然是不能让绝大部分人满意的。
注意!注意!注意!本文观点一家之言,如有不当之处,恳请读者批评指正!
8号一大早出门团建,赶路过程中看到群里X哥来了句“5感觉有点难评”,H哥来了句“感觉有点失望”。X哥接着补充“我感觉o系列有点打乱openai本来的节奏,我理解本来5应该预想是全模态模型”。是的,没错,今天凌晨GPT-5发布,反响不一,但总体来看好像并没有达到大家的预期。至于大家的预期是什么,那肯定不一而足,不过就发布的内容来看——一个正常的LLM、一个推理模型和一个动态router,这显然是不能让绝大部分人满意的。
注意!注意!注意!本文观点一家之言,如有不当之处,恳请读者批评指正!
OpenAI终于开源了,无论如何,他们的一举一动总是会受人关注的。第一时间阅读了技术报告,乍一看好像没什么,而且好像有大量安全方面的内容。不过仔细阅读后,还是发现有一些不一样的细节。
周六下午出去日常“漫游”,地铁上看了数据标注公司Surge AI创始人Edwin Chen的访谈和Manus的上下文工程两篇文章,结合自己之前的一些思考,感觉很多东西又串联起来了,突然就想把它们写出来。晚上回来,从23点写到凌晨3点,终于搞定,是有此文。
好吧,准确来说,GiGPO[1](Group-in-Group Policy Optimization)还是GRPO,只不过它扩展到Agent范围。简单来说,就是把采样轨迹分成多个组,每个组当然对应关键步骤。稍微通用一点来看,其实是更加细粒度的GRPO。很自然地,有两个不同的级别:
上篇Reward Model建模 | Yam[1]我们介绍了Reward相关的建模方案,本文继续介绍几篇Reward数据相关的论文。
Reward 数据的价值远不止于监督信号本身。本文剖析的三项研究揭示:Skywork-Reward-V2 优化了人机协同的标注效率;Spurious Rewards 的核心发现表明,RL 训练(如 GRPO)的核心作用常在于“激活”而非“教授”——虚假奖励亦能激发基座模型预训练习得的优势推理策略(如代码推理);Anthropic ICM 则利用模型内部一致性实现无监督引导。这昭示着 Reward 建模的新方向:深刻理解基座模型的“潜能图谱”,并设计机制(协同标注、激活信号、一致性约束)将其高效释放,最终迈向规则驱动的“演绎式”智能。
偶尔看到这篇文章:如何不通过提示词或微调来引导大模型的输出 - 知乎[1],感觉很有意思,于是根据文章提供的代码做了一些实验,同时,也查阅了相关Paper,补充了一些实验和论文阅读,一并记录在此。
本文写于6月26号晚,当天25年上半年软考成绩公布。
下午看到有公众号发消息说成绩出来了,怀着有点紧张的心情打开网站查分——居然过了!属实有点没想到,本来还以为这次比较难通过的。正好写一下自己的一些经验。
Table of Contents generated with DocToc
由于工作需要和个人兴趣,最近看了一些指令跟随(Instruction Following)相关的文章,特整理如下。其实自从LLM表现出强大的能力后,指令跟随自然而然就是一个非常重要的方向了。
关于指令跟随,最重要(也最简单)的策略就是调整提示词了,由此甚至诞生了Prompt Engineer这个行当。不过这个笔者早就提过了(比如这里:ChatGPT 影响冲击:职业、行业与产业 | Yam[1]),一定会过时,倒不是说提示词工程会过时,而是说它应该会变成一种通用技能,就像Office办公软件一样,现在没有人会把Office作为自己的技能写到简历上了吧。
关于提示词工程,笔者应该是国内比较早写过文章的(23年1月发表的:ChatGPT Prompt工程:设计、实践与思考 | Yam[2]),后面就再没写过了,实在是觉得这东西没多少好说的,就是trial-and-error,或者trial-and-improve。提示词其实本质上是沟通能力,你描述得清楚效果就好。而且,随着模型不断变强,提示词的作用相对弱化(但你还是要把话说清楚,这是基本)。以上观点至今未变。
但是指令跟随却很重要,因为我们最终是要用LLM去完成某项任务的,虽说指令大部分情况下都需要写的比较清楚(比如”按Json格式输出“),但也有一些隐藏的指令(比如”应特别注意用户提到XX产品信息“),或者比较复杂的指令(比如实际生产环境,三五千字的系统提示词太常见了)。本文就来简单梳理一下近期相关研究(只记录了笔者觉得比较有新意的地方)。
来自MiniMax-M1: Scaling Test-Time Compute Efficiently with Lightning Attention[1]中的一个发现。其实R1-Zero后,关于GRPO的优化和研究已经有相当不少的文章了,光笔者自己都梳理过不少,如下。
没想到还能继续出新。
本文介绍几篇关于Reward的文章,Reward经历了RLHF的scalar,到LLM-as-Judge,以及DeepSeek-R1的Rule,很自然地逐渐转移到通用领域——如何针对非推理(无标准答案)Query,给出模型响应的Reward。只要解决好这个问题,R1-Zero的方法就可以很自然地扩展到通用领域。而这也可以和之前在DeepSeek R1深度技术解析及其影响 | Yam[1]中提到的强化学习执念很好地融合在一起。