Continual Learning,智能的下一个方向?

Liao Jiayi Liao Jiayi #AI

Continual Learning,持续学习,指的是模型随着用户使用(推理)过程中,不断接收反馈,进行自我迭代的过程。这一理念在当前既有的 Pre-Training 和 Post-Training/RL 以外,增加了一条新的产生智能的路径。

最近频繁听到这个概念是在梁文峰 Deepseek 融资内容泄漏的 PDF 里看到,他提到 LLM 的持续学习能力的 priority,要远高于多模态等新的表达范式,并且模型是否有持续学习能力,才是真正能落地的重要依据之一。

我的实际感受

没有一个属于我自己的 AI

除 Coding 外,我在日常使用 AI 的过程中,最大痛点就是 AI 不能持续获取信息并“内化”,单纯的依赖 .md 文件并不能完全解决记忆之间的深度交叉(不够懂你)。

举个例子,我想知道“理想汽车 7 月份的销量情况”,如果我直接发这条消息给 ChatGPT,会有两个问题:

  1. 默认行为,它会直接 predict 出 2025 年的数据给我,原因是 pre-training 里并没有这条数据;
  2. 即使调用 Tool 后给了最新数据,但他并不知道我已经问过 6月/5月/../1月的数据,因为我持续在关注“理想汽车”这家公司;

而我期望的是,它能够放弃所谓的我不需要的 “General Knowledge”(比如 CAD 绘图的能力,我觉得我这辈子都不会用到),而是像我周边同事/朋友一样,和我有相似的 background,帮我解决我实际的问题,并且在这些问题中不断成长,和我拥有同样的 context。

我选择“蒸馏”了自己,但效果不大

为了想让 codex 懂我,我在 Github 上建了一个项目,并且用「定时任务」的功能,让 codex 每天总结我的所有 session 内容,总结提炼到一个 daily 的 .md 文件里。

但是就像我上面说的,即使做了 harness 工作,它能做到的,也就是类似 RAG 的能力,召回类似的内容,并且告诉我 xx 时间看过类似的内容罢了,对我的帮助非常有限。

什么算是 Continual Learning?

声明一点,我这里的 Continual Learning 不是 Harness(类似 AK 的 auto-research 项目,这种叫 self-evolvment,当然最后也可能殊途同归),而是指的把日常使用产生的知识内化成模型的智能。

更深层次一点,就像模型 Input 的 Context 经过 Attention 后会让历史内容产生交叉,挖掘出更多的隐藏信息,让你感觉到:哇,我说的那么简单,还有错别字,模型也能生成那么多高质量且很酷的内容。我说的 Continual Learning 就是指,你在日常里跟模型说过所有的话,Input 和 Response,都会实时的训练到模型里(也许是变成新的 hidden states 或者另一个小模型的 weights),这里有两个关键点:

  1. 实时;
  2. 模型化;

和互联网的推荐系统机制也是有些类似

这个能力给我的第一反应,是和我之前的推荐系统经历相关,在推荐系统里,你看过的所有内容,以及针对这些内容发生的行为(如点击、关注),会经过一个实时的 Pipeline 处理,变成正负样本进到模型里训练,再通过高频的 Parameter Server 更新实现分钟级别的用户偏好更新,让用户觉得这个软件“懂”他一样。

如果有这个能力,会有什么用?

想象一下,如果 Model 在一个通识的基模上持续根据你的日常工作生活去进化,输入的知识、技能都和你一样,那岂不是你有了自己的一个数字分身?

1. 真正的解放生产力

对于软件开发过程里,当前很多工作已经变成了,人和 AI 对话,拿到结论后再和另一个人对话,另一个人再和他的 AI 对话,这个流程太复杂且低效。最好是我可以和你的 AI 对话,让你的 AI 直接解决我的问题,或者我的 AI 去找你的 AI,为什么要让人在中间传话呢?

多 Agent 协作当前推进不了,我认为也是缺乏持续学习能力的原因,如果多个通识 Agent 在那里互相协作,每个 Agent 都半斤八两,那合作的意义是什么?反而加大了 Agent 之间的沟通成本,就像人和人的协作一样!

2. 不止是 ToC,拓展到 ToB 的作用会更大

17 年有幸经历过国内一家早期 SaaS startup,后来发现至少在国内,所谓的 Software-as-a-Service 把复杂系统标准化,对于国内这些小客户完全行不通!原因是:

  1. 国内市场卷,即使是小客户,业务上也得有差异化才能生存,换句话说,对于我们提供的 SaaS 服务有很强的定制化需求,小到一个图标修改,大到一个系统按他的业务模式来重构;
  2. 小客户付费能力低,定制化需求 ROI 打不正,并且复杂系统里提供的 90% 功能,都是这些客户不需要的。道理很简单,因为复杂系统本来就是由那些“成功大企业”方法论实践而来,而小客户的诉求是生存和增长;

如果有持续学习能力,用一个小模型来内化 B 端企业的实际场景,再加上 Deepseek-Harness 这种 Agent 框架,期望每个企业都会很容易的拥有属于自己的一套最称手的软件服务。

当前技术阶段和 Startup

TTT(Test-Time Training)

我们先从学术界聊起,有兴趣可以阅读 https://keyurramoliya.com/posts/Test-Time-Training/。Test-Time Training 指的是在 Test 或者 Inference 的过程中,也能训练模型,而不是只在 backward 阶段去更新模型 weights。

这里主要是结合 RNN 和 Attention 的思想:

  • RNN 有压缩记忆的能力,不断把历史信息压缩到一个指定 dim 的 RNN 单元里,这种模式有信息遗忘的问题,所以有 LSTM 这种门控机制来控制信息遗失(但是门控依赖模型的人为设计);
  • Attention 是针对所有 token,做一次 O(L^2) 的 attention 计算,没有信息遗失但会造成超长 Context 场景下计算复杂度的问题;

而 TTT 结合两者特点,有 Linear 和 MLP 两种模式:

  • TTT-Linear:不带 backward,在 hidden states 的基础上做一个 Linear 小模型,采用 RNN 的方式,根据新的 hidden states 去更新小模型的 weights,小模型的 weights 就是历史所有 Input(也是 hidden states)的压缩;
  • TTT-MLP:和 Linear 模式类似,只不过加入了非线性层,能够进一步挖掘到 hidden states 的内部交叉信息,并且通过 backward 来更新 model weights;

TML(ThinkingMachineLab)

细节参考:https://thinkingmachines.ai/blog/lora/#what-matters-for-lora

上面是 TML 发布的关于 LoRA 的文章,本质上是在说明小模型(或者是基模 + LoRA),能够获得跟 FullFT(Full Parameters Fine Tuning)一样的效果,也就是说,大模型 pre-training 学到的东西,也许 LoRA 也能学。

其他的一些关键结论还有:

  • LoRA 加在 All Layers 的效果,比单独加在 Attention 层会更好;
  • SFT 的学习效率是 O(N),RL 的学习效率是 O(1),原因是 SFT 里的每个 token 都是“正确答案”,指导一次 backward 传播,而 RL 里的一条 episode 对应一个“正确答案“;
  • LoRA 和 FullFT 在 Learning Rate 的不同;

但从发布的产品上看,还是在走 B 端路线。(https://thinkingmachines.ai/blog/on-policy-distillation/?utm_source=chatgpt.com)

MindLab

MindLab 可以说是国内的 TML 技术,并且有一系列的 Paper 来佐证他们的研究成果,就是还不清楚实际落地的情况。我整体读下来,亮点有两个:

  • 超长记忆和 Adapter:用小模型(矩阵)吸收不断增长的历史,以及用一个 Adapter 来实时更新模型;
  • 百万个 LoRA:对应的 MoL(Mix-of-LoRA)架构,这样能保证一组人/一个人的信息被压缩到很多个 LoRA 矩阵里;

其中几篇关键内容的 paper 解读:

  1. δ-mem:用一个很小的在线矩阵吸收不断增长的历史
    • 主要是解决大模型“没有记忆”或者 Context Harness 带来的幻觉问题
    • 原理:先用 SFT 把 “记忆” 矩阵给训出来,就做记忆的读写。然后在此基础之上,加一个变化的矩阵,真实推理的过程中,只调整这个新增的可变矩阵,保留用户积累的关联信息,每个 Token 之后都要更新。
  2. PEFT(Parameter-efficient fine-tuning)
    • 这篇 paper 讲的是 MindLab 的整体架构思想:base model 提供先验,通过 adapter 的能力来提供偏好、习惯、记忆的个性化能力;
    • 里面提到 3 个概念:
      • Scale Up:万亿参数级 MoE 模型可以被反复做 adapter 更新,越强的模型越有利于 LoRA 激发出基模潜力;
      • Scale Down:小模型对于个性化信息的记忆是充分的,更高的 rank(模型参数量)反而会增加额外的存储和训练成本;
      • Scale Out:当验证了 Scale Down 之后,可以尽可能的增加更多的 adapter,以满足不同人群的个性化需要;
    • 业务层面上合理的 Pipeline:
      • 当前对话先进入显式上下文;有重复价值的信息进入在线记忆;经确认、去敏和多次验证后的稳定偏好,才蒸馏到长期 adapter;精确事实仍保存在可检索、可删除、可审计的外部存储。
  3. Mint(MindLab Toolkit):MindLab 的推理和训练框架,主要是对上面 PEFT 的训练架构阐述;
  4. LongStraw:Long-Context RL Beyond 2M Tokens under a Fixed GPU Budget
    • MindLab 的 RL 系统:主要针对 GRPO 的优化,正常的 GRPO 计算 advantage 后,会对之前的 token 产生的 hidden states(包括 response 里的前 n 个和 prompt)进行反向传播,更新梯度和参数;
    • 这里把 prompt 对应的 hidden state 进行冻结,不再反向传播,所以 RL 的时候减少了很多计算量(可以把计算量看做是 prompt hidden states 的前向反向 + response 的前向反向)
      • 由于多个 response 可能从第一个 token 就开始分叉,所以直接导致了所有 response 的 hidden state 可能都没法复用;
    • LongStraw 证明了固定 GPU 预算内超长上下文 response-side RL update 的可执行性,而不是证明了它与完整梯度训练等价,也还没有证明超长 RL 的任务收益。

RiverAI

由 xAI 的 co-founder 创立,前两天刚融了 1.1B 的美金,https://river.ai/ 里写到:At River, our mission is to create personal AI owned and shaped by each individual,很明显是往 C 端个人定制化 model 的路线去走。