这项由浙江大学、新加坡国立大学、上海交通大学与美团联合完成的研究,于2026年7月以预印本形式发布,论文编号为arXiv:2607.26784,感兴趣的读者可通过该编号查阅完整论文。研究团队提出了一个名为SkillRise的强化学习框架,核心目标是让AI智能体在完成一系列相关任务的过程中,不断积累可复用的"经验技巧",并将这些技巧带到下一个任务中去——就像一位经验丰富的手艺人,每做完一件活儿,都能把心得记在脑子里,下次遇到类似的活儿就能做得更顺手。

现有的AI智能体大多患有一种"健忘症"。每次开始一个新任务,它们都得从零开始摸索,完全不记得之前做过什么、踩过哪些坑。就好比一个学徒工,每天上班都会忘记昨天学的所有东西,永远停留在"初学者"阶段,这显然既低效又浪费。SkillRise就是为了解决这个问题而生的——它让AI智能体拥有了一本可以随时翻阅、不断更新的"工作手册",并且学会了如何把每次的经验提炼成真正有用的通用技巧,而不只是记住某一件具体事情的做法。

研究团队在三个经典的文字交互环境中验证了这一框架的效果。ALFWorld是一个模拟家居场景的环境,AI需要在虚拟房间里找到物品、放到指定地方,甚至加热或清洁东西。WebShop则是一个模拟网络购物的环境,AI需要根据自然语言描述的需求,搜索、筛选并购买合适的商品。ScienceWorld则更有趣,它是一个模拟小学科学实验的交互环境,AI需要完成各种科学探究任务。在这三个场景中,SkillRise的表现都超过了所有对比方法,优势幅度从2.3个百分点到8.5个百分点不等。

一、为什么"会总结经验"的AI比"努力干活"的AI更厉害

先来理解一下这个研究想解决的根本问题。传统的AI强化学习方法,通常是让AI反复尝试同一个任务,通过不断试错来改进自己的行为策略。这就像让一个孩子每天做同一道数学题,做上几千遍,他当然会做那道题了,但换一道类似的题,他可能还是不会。

另一种思路是给AI建一个"经验库",把之前遇到过的好方法存进去,下次遇到相似问题就去查一查。听起来不错,但这种方法有个麻烦:经验的提取、存储、检索、使用是四个不同的步骤,每一步都可能出问题,而且一旦最终结果不好,你很难判断到底是哪个环节出了差错,就像一道工序复杂的菜不好吃,你不知道是食材有问题、调料放错了,还是火候没掌握好。

SkillRise的解决思路则简洁得多。它不搞复杂的多阶段流水线,而是让同一个AI策略(可以理解为同一个"大脑")既负责完成任务,也负责在任务结束后总结经验、更新"工作手册"。这本手册的内容会直接传递给下一个任务时的AI,而不需要经过任何中间环节的检索或筛选。这就好比一个老工匠在每天收工后,亲自把当天的心得写进自己的笔记本,第二天上工时就把这本笔记放在手边翻阅——整个过程完全由他本人掌控,省去了中间人传话可能产生的误差。

二、SkillRise的工作方式:手艺人的三步修炼法

SkillRise的整体设计可以用一个手艺人学艺的故事来理解,而且这个故事贯穿整个系统的始终。

故事的第一步,是精心安排练习顺序。就像一个好的师傅不会让徒弟一上来就做最难的活儿,SkillRise会把同一类任务从简单到复杂排成一列。比如在WebShop购物场景中,同一个产品类别下,先安排只需要匹配一两个属性的简单购物任务,再安排需要同时满足颜色、尺寸、价格等多个条件的复杂任务。这样,前面简单任务中积累的经验,就能在后面复杂任务中发挥出更大的价值。每一批训练数据包含16个任务序列,每个序列由3个来自同一任务家族但具体内容不同的任务组成,并且对每个序列同时进行8次独立尝试,以便比较不同尝试之间的好坏。

故事的第二步,是干活与总结交替进行。当AI面对序列中的第一个任务时,它的"工作手册"还是空白的,只能凭本事硬干。任务结束之后,AI立刻切换身份,变成一个"总结者":它回顾刚才的整个交互过程,把有用的经验提炼成通用的步骤,把踩到的坑记录为"注意事项",然后把这些内容写进手册,交给处理下一个任务的自己。值得注意的是,切换身份的是同一套AI参数,只是使用的提示语(相当于"岗位职责描述")不同。此外,手册里绝对不允许出现"苹果1号放在抽屉3里"这种具体实例的记录,而必须提炼成"把目标物品放入指定容器"这样的通用规则。这个"去实例化"的要求非常关键,它确保了手册里的内容能跨任务通用,而不是成为某道题答案的小抄。

故事的第三步,是聪明地分配"功劳"与"反馈"。这里有一个微妙但重要的设计。AI干活时收到的好坏反馈(即这个任务有没有完成),用来训练它的"干活能力";而AI总结经验写手册时收到的反馈,则来自后续任务的完成情况。具体来说,如果AI在第一个任务后写了一份手册,这份手册的质量好不好,要等到第二个、第三个任务完成后才能知道,而且越近的后续任务反馈权重越大(通过一个折扣系数γ来调节,研究中设为0.6)。这就像一个老师傅评价自己指导徒弟的效果,不是看自己写的笔记有多漂亮,而是看徒弟拿着这本笔记之后,后续的工作做得好不好。这种设计让"总结技能"的训练信号与"干活技能"的训练信号彼此独立,不会相互干扰,从而让AI能同时把两件事都学好。

在计算每次尝试的"进步信号"(即强化学习中的优势值)时,SkillRise也很讲究:同样位于序列第一个任务、同样处于"干活"阶段的多次尝试,才会互相比较好坏;干活阶段和总结阶段的尝试,绝不混在一起比较。这就像体育比赛的赛制,跳高选手和跳远选手不会放在同一组排名,否则比较毫无意义。

三、手册长什么样:从具体案例看技能是如何沉淀的

研究团队在论文中展示了两个真实的训练案例,非常生动地展示了这本"工作手册"的更新过程。

第一个案例讲的是从失败中学习。AI面对的第一个任务是把两个喷雾瓶放进柜子,但它只放了一个就找不到另一个了,任务失败。任务结束后,AI总结道:如果需要放置多个同类物品,应该对每个物品重复整套"找到-拿起-移动-放入"的流程。这条通用规则被写进手册。下一个任务是把两个胡椒粉瓶放进柜子,任务涉及的是完全不同的物品,但手册里的规则同样适用,AI顺利完成了任务。一个来自失败的教训,在不同的具体场景中发挥了作用,这正是"可迁移技能"的价值所在。

第二个案例展示的是成功之后的技能迭代。第一个任务是把一部手机放到床上,目标位置(床)不需要打开,AI顺利完成,手册里记录了基本的"找到物品-拿起-移动到目的地-放下"流程。第二个任务是把一个番茄放进微波炉,AI发现微波炉的门是关着的,所以需要先开门再放东西。任务成功后,手册更新了:在第五步"把物品放到目标容器"之前,增加了一条新规则:"检查目标容器是否可以打开,如果是关闭状态,先开门"。这条新增规则使用的是"目标容器"这种通用表达,而不是"微波炉"这个具体词语,因此未来遇到柜子、冰箱、箱子等任何需要开门的容器时,同样适用。这种从具体经验提炼通用规则的能力,正是SkillRise着力培养的核心技能。

四、实验结果:数字背后的意义

研究团队在三个基准测试环境中,与多种方法进行了系统比较。对比的方法涵盖三类:零样本提示、ReAct(一种将推理和行动交替进行的经典方法)、Reflexion(一种让AI通过语言自我反思来改进的方法)属于不需要专门训练的提示类方法;PPO、RLOO、GRPO、GiGPO属于标准强化学习方法;LaMer则是一种元学习方法,它让AI对同一个任务反复尝试,并从每次尝试的反思中积累经验。

在ALFWorld的六种家居任务(拿取物品、查找物品、清洁物品、加热物品、冷却物品、拿取两件物品)上,SkillRise的总体成功率达到85.9%,而表现最好的基线方法GiGPO为83.6%,领先了2.3个百分点。在六个子任务中,SkillRise有五个排到了第一或第二名。在WebShop购物任务上,SkillRise的成功率为84.4%,而GiGPO为77.3%,领先幅度扩大到7.1个百分点。在ScienceWorld科学实验场景中,SkillRise达到54.6%,GiGPO为46.1%,领先了8.5个百分点。

论文还测试了"Pass@2"和"Pass@3"指标,也就是对同一个测试任务进行两次或三次尝试时,只要有一次成功就算通过。在这个设定下,AI会把上次尝试的手册带入下一次,相当于在同一个任务上使用技能迭代。SkillRise在这两个指标上同样领先所有方法,并且超越了专门为"同任务多次尝试"而设计的LaMer方法。在ScienceWorld的Pass@3上,SkillRise达到61.0%,而LaMer仅为46.8%,差距高达14.2个百分点。这说明SkillRise学到的"总结经验"能力,不仅能跨任务工作,也能在同一任务的反复尝试中发挥作用——尽管它压根就不是为这个目的专门训练的。

五、越干越聪明:序列越长,表现越好

这项研究中最有趣、也最有说服力的一个发现,是"跨任务测试时间扩展"现象。研究团队做了这样一个实验:把相同的128个测试任务,分别组织成长度为2、4、6的相关任务序列,每个任务只尝试一次,但AI可以在序列内积累手册。结果发现,SkillRise的Pass@1成功率从序列长度为2时的83.6%,稳步提升到序列长度为6时的87.5%,提升了3.9个百分点。

这个发现的关键之处在于:每个任务都只尝试一次,所以性能的提升绝对不是因为对同一题目多次抽样带来的运气成分,而是真真切切地因为之前任务积累的技能帮助了后面的任务。相比之下,LaMer、GiGPO、GRPO这三个对比方法在序列长度增加时,并没有表现出持续稳定的提升趋势。这正好印证了SkillRise学到的是真正可迁移的技能,而不仅仅是对某一具体任务的过拟合。当序列长度增加到6时,SkillRise与最强基线之间的差距从3.9个百分点扩大到8.6个百分点,优势随着"积累的任务经验越多"而越来越显著。

六、消融实验与效率对比:哪些设计真正有效

研究团队还做了一系列对照实验,来验证各个设计选择的必要性。

关于折扣系数γ的选择,研究团队测试了0.3、0.4、0.6、0.7四个取值,发现四种设置下的训练曲线几乎重合,最终性能相差不超过一个百分点。这说明SkillRise的设计对这个超参数非常不敏感,不需要精心调参才能奏效,具有很强的实用性。

关于"总结经验"这一步骤是否真的有必要,研究团队设计了一个"无总结变体":保持同样的K=3任务序列和同样的环境交互次数,但去掉任务间的手册更新步骤,阻止技能在任务间传递。实验结果显示,在训练初期三种方法差不多,但随着训练的推进,有手册总结的SkillRise开始拉开差距,最终比"无总结变体"高出约3个百分点,比普通的GRPO高出超过6个百分点。这证明了两件事:仅仅把任务排成序列是不够的,必须显式地把经验提炼成手册;跨任务的技能积累提供了超越单任务优化的额外学习信号。

在与其他"有外部技能管理流水线"的方法相比时,SkillRise的效率优势更为突出。RetroAgent是一种生成反思、存入记忆库、检索相关经验、更新效用分数的多步骤系统;SkillRL则需要借助强大的教师模型来提炼轨迹、分层构建技能库、冷启动监督微调、技能检索和迭代更新等多个阶段。在ALFWorld上,SkillRise的平均成功率与RetroAgent持平,均为85.9%,比SkillRL高出12.5个百分点。然而在运行时间上,RetroAgent需要SkillRise的6.0倍,SkillRL需要4.3倍。由此可见,复杂的外部管理流水线并不一定带来性能提升,反而会大幅增加计算开销,而SkillRise用更简洁的端到端设计,实现了同等甚至更好的效果。

七、从小到大都管用:不同模型规模下的表现

研究团队还测试了SkillRise在不同模型规模下的表现,以确认其优势不依赖于特定大小的模型。实验使用了Qwen3-1.7B(约17亿参数)和Qwen3-4B(约40亿参数)两个规模的语言模型,并与GRPO和LaMer进行比较。

在1.7B的较小模型上,SkillRise就已经达到78.1%,超过最强基线3.1个百分点。换到4B的较大模型后,SkillRise提升到85.9%,领先优势进一步扩大到6.2个百分点。更值得关注的是提升幅度:从1.7B到4B,GRPO提升了4.7个百分点,LaMer提升了3.3个百分点,而SkillRise提升了7.8个百分点。这意味着模型越大,SkillRise从中获益越多。研究团队的解释是,SkillRise需要AI同时学会"完成任务"和"从任务中抽象通用技能"两种能力,更大的模型在处理这种复合型学习任务时拥有更强的能力上限,因此提升空间也更大。

说到底,SkillRise想要解决的是一个非常基础但长期被忽视的问题:AI应该能从经验中学习,而且这种学习应该是可迁移的,而不是对某一具体场景的死记硬背。通过把相关任务组成序列、让AI在任务间维护一本不断更新的"技能手册"、并用后续任务的结果来评价手册的质量,这个研究提供了一种清晰、高效、可端到端训练的解决方案。

归根结底,这项研究告诉我们,让AI变得"越来越聪明"不一定需要无限增加模型的规模,也不一定需要搭建极其复杂的管理系统。有时候,给AI一本可以自己更新的工作手册,并且让它学会如何正确地总结经验、如何把具体的遭遇提炼成通用的智慧,才是更根本的进步方向。随着未来更大规模的模型和更复杂的现实任务场景被纳入测试,这种跨任务技能学习的范式是否能持续稳定地发挥作用,以及如何在没有"任务家族"标签的开放环境中自动识别相关任务,仍然是值得深入探索的方向。有兴趣深入了解技术细节的读者,可以通过论文编号arXiv:2607.26784查阅完整原文。

Q&A

Q1:SkillRise与传统强化学习方法有什么根本区别?

A:传统强化学习把每个任务当作独立的事件来处理,AI完成一个任务后不会把经验带到下一个任务,每次都从零开始。SkillRise则让AI在完成一个任务后,立即总结经验并更新一份"技能手册",这份手册会直接传递给处理下一个任务的AI,形成跨任务的经验积累。这种设计让AI在面对一系列相关任务时,表现会随着任务数量的增加而持续提升。

Q2:SkillRise的技能手册里会记录什么内容,又怎么保证不同任务都能用得上?

A:手册里记录的是提炼过的通用步骤和注意事项,而不是某次具体经历的原始记录。系统的设计要求AI在总结时必须把具体实例替换为通用概念——比如"苹果1号放在抽屉3里"要被改写成"把目标物品放入指定容器"。这种"去实例化"处理确保手册内容能够适用于不同具体对象,从而在新任务中同样有参考价值。

Q3:SkillRise的训练成本比其他技能学习方法高吗?

A:恰恰相反,SkillRise比其他有外部技能管理流水线的方法效率更高。实验数据显示,RetroAgent和SkillRL的运行时间分别是SkillRise的6倍和4.3倍,但它们的性能并没有相应的优势,SkillRL甚至比SkillRise低12.5个百分点。SkillRise不需要外部教师模型、独立的记忆存储模块或检索系统,用同一套AI参数完成任务执行和经验总结两件事,结构简洁,计算开销低。