编辑|Panda
最近,办公 Agent 真是火。
飞书 Aily、WorkBuddy、千问办公轮番上阵,挤破头想要抢占企业办公入口,AI Agent 正以前所未有的速度走进真实工位。写周报、跑数据、处理工单、盯流程……越来越多重复性的办公任务,开始被交到 Agent 手里。热闹背后,一个更根本的问题却容易被忽略:这些每天准时「上班」、反复干着同一类活儿的 Agent,真的会因为干得多而变得更好用吗?
答案往往是不会。而这,正指向了眼下 AI 圈另一个热爆了的话题:持续学习。
再强的基座,训练结束、参数冻结、进入部署后,就停止了成长。但 AI 界显然不打算让模型永远停在「毕业」那一刻,让模型像人一样「活到老学到老」正在成为整个行业最烫手的话题。
比如智谱在 GLM-5.2 的规划里明确表示,下一步要攻克的关键技术包括记忆、持续学习和自我评判。年初从 OpenAI 离职的推理模型大佬 Jerry Tworek 离职后便很快创立 Core Automation,直接剑指持续学习。就连图灵奖得主、强化学习之父 Richard Sutton 近日也亲自下场创业,成立 Oak Lab,致力于建立能从自身经验中持续学习和进化的 AI。持续学习,正从少数人的探索演变成行业共识。
那么,问题来了:到底该怎么做持续学习?
放眼这条正在持续变热的赛道,Pyromind(火思动力)已经给出了一个答案:这家成立于 2025 年 10 月的创业公司已经率先把 Agent 后训练产品化,用 AutoRL 打通了从任务反馈到模型更新的完整闭环,还用多项让人眼前一亮的成果证实价值,成为了走得最靠前的那一批。
该公司的定位是一家专注于持续学习与进化的 RLaaS(强化学习即服务)公司,押注的判断也很清晰:Agent 的下一次进步,应该来自于上一次运行的反馈与积累。
而 Pyromind 选择产品化后训练这个切口,正是因为持续学习说起来性感,做起来极难。
让一个 Agent 从任务里持续学习,至少要回答几个环环相扣的问题:哪些真实反馈值得学?学到的东西怎么不破坏原有能力(灾难性遗忘)?怎么把散落在日志、轨迹、评估里的经验变成一次真正的模型更新?又怎么让这一整套流程在企业的算力和成本约束下稳定、可验证地跑起来?
业界给出的答案五花八门。有的靠外挂记忆和外部技能库,有的靠 test-time training 在推理时微调,有的干脆把后训练(尤其是强化学习)搬到部署之后,让真实任务的反馈直接进入训练闭环。路线不同,但指向同一个终点:把「经验」沉淀成「能力」。
为此,需要把算法、分布式工程、算力调度、效果验证这些散落的环节,真正组合成一条能在生产环境里稳定跑起来的闭环。而这正是 Pyromind 想做也正在做的事。
要理解 Pyromind 的道路和技术选择,得先看清 Agent 眼下正处在一个什么样的转折点上。
Agent 正在真正转化为生产力
Agent 的使用方式正在发生一次根本性的变化。
当它还停留在 Demo 阶段时,衡量标准很简单:能不能把一件事做完。但当 Agent 开始进入真实业务、长期运行、反复执行同一类任务,标准就变了:能不能在运行中越用越好,稳定性、适应性和长期成本能不能扛得住。
这个转折并不轻松。就在上个月底,IT 服务巨头 Cognizant 宣布成立一个专门的 EMEA(欧洲、中东、非洲)AI 部门。靶心直指一个正困扰整个行业的难题:太多企业的 Agent 项目,卡在了从演示走向生产的那一步。
根据其发布报道中引用的 AI 可观测性公司 Fiddler AI 的生产可靠性研究,一些在受控演示里表现优异的企业 Agent,单次运行的成功率约为 60%,可一旦放到生产负载下连续跑 8 次,成功率就跌到了 25%!
普林斯顿的研究者评测了 14 个 Agent 后也发现,尽管过去 18 个月里模型能力突飞猛进,可靠性的提升却微乎其微。
前沿模型的可靠性提升落后于准确性提升,来自 arXiv:2602.16666
演示环境看不出问题,是因为它往往用的干净数据、接口文档清晰、流程约束良好;而真实的企业环境往往难以同时满足这些条件。
从演示环境到真实企业环境的转变正在发生,这也同时带来了三个新的产业条件。
其一,模型使用方式从单次调用变成长期运行。Agent 会在生产环境里持续运转、反复处理任务,于是稳定性、对业务变化的适应能力和长期调用成本,都从技术指标变成了实打实的生产问题。
其二,生产环境的反馈开始出现。真实任务每天都在产生成功、失败、人工修正和业务反馈,这些原本被丢弃的数据,却正好是优化模型能力最直接的原料。
其三,优化对象发生变化。企业关心的不再只是一个通用模型有多强,而是 Agent 能不能贴合自己的业务、并在使用中持续提升。
把 Agent 类比成一名员工会更容易理解:大模型给了它基本知识,提供了能力起点;Prompt 和工作流告诉它这次要做什么;而一名员工真正的价值在于把每一次工作的经验沉淀成长期能力,越做越好。今天大部分 Agent 缺的正是这最后一环。
记忆、Prompt 和 SFT 为什么都还不够
要让 Agent 从任务中学习,业界尝试过不少路径,但它们各自解决的问题并不相同,但在生产环境中,都存在明确的局限。
它们都很有用,但都难以针对长期、多步、动态变化的真实业务做持续优化。一个 Agent 即使执行了海量任务,如果这些任务里的成功与失败没有进入训练和验证,它也不会因此自动变好。
在 Pyromind 看来,自进化和持续学习是解决之道。以强化学习(RL)为代表的后训练可把真实任务中的成功、失败和业务反馈转化为奖励信号,通过持续训练提升模型在单次执行、多步决策和复杂目标上的稳定表现。
可以说预训练决定了 Agent 能力的起点,而后训练决定的是它最终能走多远。
这个判断也正是那些明星团队不约而同的选择。无论是智谱把持续学习写进 GLM-5.2 的技术规划,还是 Sutton 用 Oak Lab 去追求「从运行时经验中实时学习」,抑或 Core Automation 想让模型在生产中直接更新权重,它们的共识都是:静态部署的时代正在过去,真正的进步要来自运行之后。而这条路线的难点在于「怎么把 AI 变成一套能持续运行的系统」。
闭环怎么转
从任务反馈到模型更新
Pyromind 给出的答案是把后训练拆解成一条可以持续运转的闭环链路。
在它的设计里,Agent 在真实工作中产生的成功、失败、人工修正和业务反馈,要依次经过采集、分析、奖励生成、模型训练、效果验证和模型更新,最后重新应用回实际任务。并且,这条链路是可以自动运行、反复迭代的。原本分散在不同工具和系统里的后训练环节,被连接成一套完整的学习闭环。
这背后的工程挑战,正是制约行业落地的最大阻碍。比如强化学习开源项目 AReaL 团队曾直言,自进化 Agent 的关键瓶颈不只是模型有多强、算法多先进,而是缺少一套能服务真实 Agent 的在线强化学习基础设施;他们还披露过一个细节:在搜索类 Agent 的训练中,单条轨迹最长的探索时间可能长达一到两小时,这种长尾会把整批数据拖慢、造成大量 GPU 闲置,让训练效率急剧下降。
把这样一条链路工程化、并让它稳定持续地转起来,正是 Pyromind 想跨过的门槛。
Pyromind 在做什么
把后训练产品化
一套能持续运转的后训练闭环,听起来很有前景,但要真要落到产品上却有一个绕不开的问题:强化学习的门槛太高了。
算法、分布式训练、算力调度、奖励设计、效果验证……每一环都需要专门的团队和大量试错。大多数企业其实都想让 Agent 持续学习,但却被这条链路的复杂度挡在了门外。
Pyromind 的产品设计正是为了简化这一切。它把面向开发者和企业的一系列能力,归纳进一个关键词:AutoRL(自动强化学习),其目标用一句话概括就是:把复杂的强化学习过程自动化,让任何团队都能轻松像搭乐高一样开始后训练,而不必自己从零搭建。
这也正是其官网那句 slogan 「RL For Everyone Not Only Experts」所表达的意思:不只是专家,任何人都能做强化学习。
如上图所示,该公司已经在这个方向上做出了一整套产品,但核心都可归因到一件事:Pyromind 就是一个 AutoRL 平台!
更具体而言,对于「Agent 持续学习」这一任务,Pyromind 将其划分成了三层层次的能力,从底层能力到上层体验层层递进。
第一层是后训练的基础设施,目标很简单:简化训练。为此,Pyromind 打造了一个可视化工具,只需把核心组件直接拖拽到画布上、简单配置就能连成一条可编辑的训练管线,支持 SFT、GRPO、DPO 等多种训练方式,还能联动机器人仿真沙箱,实时查看训练轨迹、奖励值等关键指标。过去分散在代码和环境配置里的工作,就此被沉淀成清晰、可复用的流程。
第二层是后训练的奖励构建。奖励信号是强化学习的方向盘,直接决定模型往哪儿学。Pyromind 在这一层提供了生成式的奖励构建能力,既能面向准确性的奖励生成建模,也可面向偏好建模,进而帮助企业针对不同任务目标,更高效地设计出合适的奖励。
在这两层之上还有一层是让后训练「无感化」,即把「训练」和「上线」这两个很重要的任务都藏到了用户看不见的地方,但这也是最核心的一层。系统会在日常使用中自动收集会话信息、学习用户习惯,并在后台完成持续训练;训练好的模型再自动发布成推理端点、通过灰度切流平滑地接管线上 Agent。用户要做的,仅仅是设定一个预算上限,就能在预算之内坐享 Agent 效果的持续提升。
这三层之下,Pyromind 还备有一套配套基础设施,包括弹性开发环境、安全仿真沙箱、高性能推理部署和统一存储底座,让数据、模型和训练任务能在整个平台里顺畅流动。
也正是在这个意义上,Pyromind 成为最早把 Agent 后训练产品化的公司之一。
把这些拼在一起,Pyromind 想交付的其实是一个开箱即用的后训练平台框架。企业不需要自建强化学习团队、不需要反复趟坑,就能让 Agent 在上线之后持续学习和改进。
这也正是 Pyromind 与赛道上其他玩家最不同的地方。传统云厂商和 MaaS 平台主要提供算力、推理或轻量微调,Agent 开发框架帮助组织和执行任务,它们解决的是「怎么把 Agent 跑起来」;而 Pyromind 聚焦的是 RL 训练的全链路工程化与持续自进化,想解决的是「怎么让 Agent 跑起来之后越用越好」。
更长远地看,Pyromind 的愿景是让每一个 Agent 都拥有从任务中持续学习和进化的能力,进而让每一次任务都成为它下一次能力提升的基础。
面向后训练
Pyromind 实力的技术注脚
「持续学习」的判断是否成立?最终要靠落地来检验。Pyromind 近期已经陆续拿出了几项成果,构成了它「值得被相信」的初步证据。
其中一项是PyroDash,这是一套全新的范式,可将小模型的低成本和大模型的高性能结合在一起。
长期以来,行业普遍认为模型的性能和成本两者无法兼得。而PyroDash 证明了通过精准的后训练与模型协同,完全可以在极低成本下实现甚至超越大模型的表现。
在五项数学推理基准上,PyroDash 一边把平均准确率做到超过纯大模型基线,一边把推理成本大幅压低;偏重成本的配置下,总成本可以降低九成以上。对于要长期、高频调用大模型的 Agent 场景来说,这意味着一条更省钱也更可持续的路径。目前 PyroDash 的模型、数据集与测试代码均已开源。在这样的新范式下,大小模型不再是互斥关系,而是协同进化。并且随着落地场景的逐步扩展,后训练也将自然延伸并演进为 Agent 的持续学习。
PyroDash 的协同推理架构(小模型优先,一次性大模型补全)
另一项成果R2VLA则把「从经验中学习」的思路延伸到了物理世界。机器人 AI 进入真实产线,第一步不是部署模型,而是要先拿到一批能用于后训练的高质量真机动作数据,但这批数据过去主要靠人工遥操作采集,慢且贵。
R2VLA 的解法是让产线上已有的规则系统先当「老师」,在真实设备上自动生成动作轨迹,再经过时间对齐、自动打标、质量筛选和后训练,形成一条自驱动的数据管线。据介绍,这条管线可以连续 24 小时零人工运行,把整体数采时间降低 50% 以上。本质上讲,R2VLA 是把传统规则系统变成了 AI 的「数据工厂」。
更关键的是,模型上线之后,产线仍会持续产生新数据回流进训练,实现下一轮成长。这正是「持续学习」在物理世界里的一次具体印证。
从数字世界的推理成本,到物理世界的数据生产,PyroDash 和 R2VLA 指向的其实是同一件事:无论是屏幕里的数字 Agent,还是产线上的物理 Agent,都能被纳入同一套「持续学习」的框架里,从自己的每一次运行中获得成长。
这背后是 Pyromind 更深层的愿景和对下一代 Agent 的长期判断:持续学习不该是某一类 Agent 的专属能力,而应该是所有 Agent 的通用底座。数字世界和物理世界或许形态迥异,但「让 Agent 从经验中变强」却能够共享同一套方法论。
而这些成果,正是 Pyromind 把这个想象一项项变成现实的开始。
支撑这些成果的是一支小却资深的团队。据了解,Pyromind 由阿里云、字节等背景的资深工程师组成,成立至今已完成千万级美元融资,投资方包括高瓴创投、百度风投、蓝驰创投、Atypical Ventures 和 HyperCompute 等多家机构。
在能力验证上,团队在 ICRA 2026 全球具身智能挑战赛中获得第 7 名,是国内唯一以「大模型微调+强化学习后训练」为核心技术路线进入该赛道全球前十的团队;场景侧,Pyromind 已与优必选、欢网、华秋智联等多家客户完成签署,覆盖具身 VLA、端侧 GUI Agent 和电路 EDA 等多个场景。
结语
Agent 正在从演示走向真实生产,竞争的重点也随之从「能否完成任务」转向「能否在任务中持续学习和提升」。这是一个仍在展开的行业命题,也是 Pyromind 从第一天起就锚定的方向。
总结起来,Pyromind 是一家专注于 Agent 持续学习与后训练基础设施的 AI 公司,它用一个 AutoRL 平台,把「让 Agent 从每一次任务中成长」变成了企业开箱即用的能力。它想验证的判断也很简单:如果真实任务中的轨迹、结果和反馈能够顺畅地进入训练、验证与模型更新,任务经验就能稳定地转化为新的能力。
如果这个判断成立,那么衡量一个 Agent 的标准,或许就该从「它做过多少任务」,变成「它从这些任务里学会了多少」。而 Pyromind 想做的,正是让每一个 Agent 都拥有这种从工作中持续成长的能力。
一个 AI 持续进化的未来,似乎正在我们眼前,徐徐展开。