少步生成·映射篇:任意两点间跳跃
这是“少步生成”系列的第二篇。上一篇讲了两条盯着轨迹形状做文章的路:一致性(跳过轨迹)与直线化(掰直轨迹)。它们都还锁死在一个特定对象上——要么“当前点 → 干净端”,要么“整条路径”。这一篇换一个更一般、更灵活的对象:流映射 \(\Phi_{s\to t}\),以及它的速度形式平均速度 \(u\)。学会了“任意两时刻之间怎么跳”,一步、两步、多步就都只是同一张映射上取不同的 \((s,t)\)——2026 年一步生成 ImageNet-256 逼近多步质量(FID 1.72),就长在这条线上。
半群两条 PDE、MeanFlow 恒等式、SplitMeanFlow 代数恒等式、AYF 两个极限这几处,我都写全了中间步骤。
0. 从 CTM 说起:这一篇的主角是“流映射”
先把上一篇 §0.4那三根轴接过来:
- 轴 A|匹配什么:轨迹/端点映射 · 边际分布 · 判别器。
- 轴 B|学什么映射:跳到干净端 \(t\to0\) · 任意两点 \(t\to s\) · 拉直整条路径。
- 轴 C|要不要教师:蒸馏 vs 从头训 few-step。
上一篇的 CM 站在轴 B 的“端点”格子里:它只学 \(\Phi(\cdot,t,0)\),把任意点映回干净端。而这一篇整篇,都在填轴 B 的“任意两点”这一格。这个跨越的枢纽,是上一篇一致性支里出现过、但没展开的 CTM(Consistency Trajectory Models)。
CTM 把“端点”推广成“任意两点”。 在 VE 路径 \(x_t=x_0+t\varepsilon\) 下,定义流映射为 PF-ODE 的精确解
即“把 \(t\) 时刻的 \(x_t\) 沿 PF-ODE 送到 \(s\) 时刻”。为焊死初值,写成 \(x_t\) 与一个函数 \(g\) 的凸组合:
它有两个关键极限,恰好把上一篇的两个老对象收编进来:
- \(s\to t\) 退回 score/去噪器。 记 \(f(u)=\tfrac{x_u-\mathbb E[x|x_u]}{u}\)、\(F(s)=\int_t^s f\,du\)(故 \(F(t)=0\)、\(F'(s)=f(s)\)),积分式即 \(G=x_t+F(s)\)。把它与凸组合式 \(G=\tfrac st x_t+(1-\tfrac st)g\) 相等,解出 \(g=x_t+\tfrac{F(s)}{1-s/t}=x_t+\tfrac{t\,F(s)}{t-s}\)。再对 \(\tfrac{F(s)}{t-s}\) 用洛必达:\(\lim_{s\to t}\tfrac{F(s)}{t-s}=\tfrac{F'(t)}{-1}=-f(t)\),于是
即 \(g_\theta(x_t,t,t)\) 就是去噪器/score。
- \(s=0\) 退回 CM。 \(G_\theta(x_t,t,0)=g_\theta(x_t,t,0)\)(因 \(s/t=0\)),恰是“跳到端点”的一致性函数。
所以 CM 与 score 都只是流映射 \(G\) 的两条边,CTM 填满整个上三角。
CTM 怎么训(soft consistency matching)。 目标是让“学生直接从 \(t\) 跳到 \(s\)”等于“教师先解一段 \(t\to u\)、学生再从 \(u\) 跳到 \(s\)”(\(u\in[s,t)\) 随机)。为在同一空间比较,把两侧的 \(s\)-预测都用 stop-grad 学生再送回 \(0\) 时刻:
再叠一个把 \(g\) 练得和教师一样好的 DSM 辅助项 \(\mathbb E\|x_0-g_\theta(x_t,t,t)\|^2\)(消除 \(s\to t\) 时 \(g\) 的梯度消失)与一个 GAN 项,总损失 \(\mathcal L=\mathcal L_{\text{CTM}}+\lambda_{\text{DSM}}\mathcal L_{\text{DSM}}+\lambda_{\text{GAN}}\mathcal L_{\text{GAN}}\)。它在 CIFAR-10 拿到单步 FID 1.73、ImageNet-64 1.92。多步采样用它自己的 \(\gamma\)-sampling:每步先跳到干净端、再按比例 \(\gamma\) 重加噪回去,\(\gamma\) 把“确定性长跳”(\(\gamma{=}0\))与“CM 式多步随机采样”(\(\gamma{=}1\))连成一族。取 \(\gamma\approx0\) 时质量随 NFE 稳步变好,而 \(\gamma{=}1\) 反而随 NFE 变差——这正是 CM“多步先升后降”的老毛病,CTM 靠调小 \(\gamma\) 避开它。论文除了给出这条 FID 曲线,还配了个两步的总变差界 \(\mathcal O\big(\sqrt{T-\sqrt{1-\gamma^2}\,t+t}\big)\):\(\gamma{=}0\) 时是 \(\sqrt T\),\(\gamma{=}1\) 时涨到 \(\sqrt{T+t}\),重加噪确实要付累积代价。
再往前一步是甩掉教师。 CTM 仍然是蒸馏,要教师 solver 生成监督。而只要有一条不解 ODE 就能自监督的恒等式,一个模型就能从头直接学这张“任意两点映射”,既不用教师也不用 reflow。这一支的分歧就在于选哪条恒等式,以及各自的取舍。
1. 半群:自洽恒等式的来源
要从头学流映射 \(\Phi_{s\to t}\),得有个不依赖教师的约束。这个约束几乎就是“流映射”的定义本身——半群(semigroup):先从 \(s\) 映到中间时刻 \(\tau\)、再从 \(\tau\) 映到 \(t\),应当和直接 \(s\to t\) 一样。
各家论文的字母习惯不同,本文的约定是:下标带箭头的 \(\Phi_{s\to t}\) 一律读作“从 \(s\) 送到 \(t\)”,\(s\) 是起点、\(t\) 是终点;而写成函数参数的形式(\(G(x_t,t,s)\)、\(u(x_t,r,t)\))则沿各自论文的习惯,第一个空间参数所在的那个时刻是当前位置。用到时会点明谁是起点。
Flow Map Matching(FMM) 把这条约束做成系统理论,按它自己的说法收进了 CM(终点固定在干净端)、CTM(终点任意)与渐进蒸馏(下面的 Shortcut 比 FMM 晚四个月,论文没提,但同样落在这个视角里)。它给出两条自洽 PDE,是本篇几乎所有方法的共同源头。
两条 PDE。 推导只用一个事实:\(\Phi\) 是速度场 \(v\) 的流,即沿真轨迹有 \(\Phi_{s\to t}(x_s)=x_t\)。
(a)对终端时刻 \(t\) 求导 → Lagrangian 式。 固定起点 \((s,x)\)。\(\Phi_{s\to t}(x)\) 作为 \(t\) 的函数,就是“从 \(x\) 出发、沿 ODE \(\dot z=v(z,\cdot)\) 走到时刻 \(t\) 的位置”。按流的定义,终点随 \(t\) 的移动速度就是该处的速度场:
(b)对起始时刻 \(s\) 求导 → Eulerian 式。 固定终点时刻 \(t\)。取一条真轨迹 \(x_s\)(满足 \(\dot x_s=v(x_s,s)\)),沿这条轨迹移动起点:无论从哪个 \(s\) 出发,只要沿轨迹走,送到 \(t\) 的落点 \(\Phi_{s\to t}(x_s)=x_t\) 恒定不变。于是它对 \(s\) 的全导数为零。链式法则(对 \(\Phi_{s\to t}\) 的第一个时间变量 \(s\) 与空间变量 \(x\) 分别求导):
把 \(x_s\) 记回一般点 \(x\):
半群式与它们是同一件事的另一种写法,而且能直接推出 \(\eqref{eq:eul}\):在 \(\Phi_{s\to t}=\Phi_{\tau\to t}\circ\Phi_{s\to\tau}\) 里对中间时刻 \(\tau\) 求导,左边与 \(\tau\) 无关故为零,再令 \(\tau=s\)(此时 \(\Phi_{s\to s}=\mathrm{id}\),且由 \(\eqref{eq:lag}\) 有 \(\partial_\tau\Phi_{s\to\tau}(x)\big|_{\tau=s}=v(x,s)\)),得到的正是 \(\eqref{eq:eul}\)。所以半群、\(\eqref{eq:lag}\)、\(\eqref{eq:eul}\) 三者在边界条件 \(\Phi_{t\to t}=\mathrm{id}\) 下彼此等价——这也是本节标题的意思:真正被训练用起来的自洽性,源头就是这条半群。
两式里 \(v\) 都是瞬时速度,可用流匹配的无偏条件速度 \(\varepsilon-x_0\) 估计,不需要教师。训练就把两条 PDE 写成回归损失(导数用一次前向自动微分 JVP 算):
生成时,一步就是 \(\Phi_\theta(x_1,1,0)\);要更稳就分段 \(\Phi_\theta(\cdot,t_{i+1},t_i)\) 顺次跳,NFE = 段数。
Consistency-FM(Yang et al. 2024)是同一思想的变体:它不在样本位置、而在速度/流空间施一致性,要求不同时刻预测出的“终点速度方向”彼此一致——比在样本空间做 CM 更贴合 FM 的几何。
这两条 PDE 后面还会反复出现:MeanFlow 走的是 Lagrangian 那条的“平均速度”化身,AYF 则把 Eulerian 那条(EMD)做成了统一 CM/FM 的总框架。
2. 平均速度这一路:从 Shortcut 到 MeanFlow
流映射 \(\Phi_{s\to t}\) 直接学“位置到位置”的映射;但还有个更省事的等价对象——平均速度。位移 = 平均速度 × 区间长,所以学平均速度和学流映射是一体两面,而平均速度的恒等式往往更简洁。
2.1 前身:Shortcut Models 把“步长”喂进网络
Shortcut Models 要化解一个具体矛盾:普通 FM 训出的网络只知道某点的瞬时速度 \(v(x_t,t)\),可少步采样偏偏得用大步 Euler 去积分,步子一大截断误差就爆。做法是让网络多吃一个输入——你打算走多长的步 \(d\)——输出“从 \((x_t,t)\) 出发朝干净端走 \(d\) 这整段的平均速度” \(u_\theta(x_t,t,d)\);这一大步落到 \(x_{t-d}=x_t-d\,u_\theta(x_t,t,d)\)(本文 \(t=1\) 是噪声端,去噪是 \(t\) 减小,故带负号;Shortcut 原论文的时间轴与此相反,下面的式子已按本文方向翻好)。把步长做成条件还白送一个好处:同一网络天然覆盖任意步数。
没有教师怎么学这个平均速度?靠两块拼成的单阶段损失:
- 边界:\(d\to0\) 时平均速度退化为瞬时速度 \(u_\theta(x_t,t,0)=v(x_t,t)\),而 \(v\) 直接用 FM 无偏条件速度 \(\varepsilon-x_0\) 回归——这块就是标准 FM,不碰教师。
- 自洽:走一大步 \(2d\) 的平均速度,应等于拆成两个 \(d\) 小步的等权平均,
右边两项用 stop-grad 当目标。边界把小 \(d\) 锚在真速度上,自洽再把小 \(d\) 的知识一路自举到大 \(d\)。这条“大步 = 两小步等权平均”正是下面 SplitMeanFlow“区间可加”在等分情形的特例——所以 Shortcut 是平均速度思想的直接前身。
2.2 MeanFlow 恒等式:把积分变成逐点微分
MeanFlow 让网络学 \(u_\theta(x_t,r,t)\):吃“当前点 \(x_t\) + 起止两时刻 \(r,t\)”,输出这段的平均速度。先给理想目标——轨迹在 \(t\) 时刻经过 \(z\) 的平均速度场:
于是一步生成天然成立(总位移 = 平均速度 × 区间长):
问题只剩怎么在不解 ODE 的前提下学出这个含积分的 \(u\)。办法是把积分换成逐点微分。
MeanFlow 恒等式的推导。 令 \(I(t):=(t-r)\,u(x_t,r,t)=\int_r^t v(x_\tau,\tau)\,\mathrm d\tau\)(\(r\) 固定)。两边对 \(t\) 求导:
- 右边由微积分基本定理:\(\dfrac{\mathrm dI}{\mathrm dt}=v(x_t,t)\);
- 左边按乘积法则 + 沿轨迹全导数(\(\dot x_t=v\),故 \(\tfrac{\mathrm d}{\mathrm dt}u=\partial_t u+v\,\partial_x u\)):
两者相等,解出 \(u\):
右端的方向导数 \(\partial_t u+v\,\partial_x u\) 用一次 JVP 算出(与上一篇 sCM 同款基建)。训练是对这个自生成目标做回归:
其中 \(v\) 取条件速度 \(\varepsilon-x_0\)(FM 式无偏目标,无需教师,从头训)。既不解 ODE、也不用预训练模型,只用一次 JVP 把恒等式右端算成回归目标。生成:一步 \(x_0=x_1-u_\theta(x_1,0,1)\);多步就把 \([0,1]\) 切几段、每段调一次 \(u_\theta\) 累加位移(NFE = 段数,质量随步数升)。
MeanFlow 在 ImageNet 一步生成刷到当时 SOTA。它正是“CTM 的两点映射(§0)+ sCM 的连续时间/JVP(上一篇 §2.4)”的合流——把学的对象从“位置流映射 \(G\)”换成“平均速度 \(u\)”,恒等式更简洁。
2.3 SplitMeanFlow:把微分恒等式换成代数区间可加
MeanFlow 的恒等式含微分项(要 JVP),实现有门槛、某些设置不稳。SplitMeanFlow 用一条纯代数的恒等式取代它。
区间可加一致性(Interval Splitting Consistency)。 对任意 \(r\le s\le t\),由定积分可加性 \(\int_r^t=\int_r^s+\int_s^t\):
即“\([r,t]\) 总位移 = \([r,s]\) 位移 + \([s,t]\) 位移”。这是代数等式,无任何导数,可直接作训练目标(采 \(r<s<t\),把 \(u_\theta\) 代入三项、最小化两边差),彻底绕开 JVP。
MeanFlow 恒等式是它的 \(s\to t\) 极限。
点开看验算(除以 $(t-s)$、令 $s\to t$)
令 \(h(s):=(s-r)\,u(x_s,r,s)\),上式即 \(h(t)-h(s)=(t-s)\,u(x_t,s,t)\)。除以 \((t-s)\)、令 \(s\to t\):
- 左边 \(\dfrac{h(t)-h(s)}{t-s}\to h'(t)\);
- 右边 \(u(x_t,s,t)\to u(x_t,t,t)=v(x_t,t)\)(零长区间平均速度 = 瞬时速度);
- 而 \(h'(t)=u+(t-r)(\partial_t u+v\,\partial_x u)\)。
代入 \(h'(t)=v\) 即 \(u+(t-r)(\partial_t u+v\,\partial_x u)=v\),正是 §2.2 的 MeanFlow 恒等式 \(\eqref{eq:mf}\)。
所以 SplitMeanFlow 的代数恒等式 \(\eqref{eq:smf}\) 更一般,MeanFlow 是其无穷小极限;用有限的 \((r,s,t)\) 训练更稳更省,并支持课程式从大区间到小区间。它已在大规模语音合成产品(豆包)上一步/两步落地,~20× 提速。
2.4 α-Flow:诊断 MeanFlow 目标的内在冲突
α-Flow 做的是理解并改进 MeanFlow。它先把 MeanFlow 目标分解成两项——轨迹流匹配(TFM)与轨迹一致性;梯度分析发现两项强负相关,互相拉扯,导致收敛慢。据此提出一族目标,用一个一致性步长比 \(\alpha\) 控制中间时刻 \(s=\alpha r+(1-\alpha)t\) 在 \([r,t]\) 的相对位置:
\(\alpha\) 成了统一旋钮:取 \(\tilde v_{s,t}{=}v_t\) 时,\(\alpha{=}1\) 是纯 TFM、\(\alpha\to0\) 的梯度收敛到 MeanFlow;\(\alpha{=}1/2\) 对应 Shortcut,但这一个特例要同时把 \(\tilde v_{s,t}\) 换成 \(u_{\theta^-}(z_t,s,t)\)——三个特例里只有它动了这一项,代进去得到的是 \(2\mathcal L_{\text{SC}}\),与 Shortcut 损失差一个常数因子。训练用课程把 \(\alpha\) 从 1 平滑退火到 0——从“高偏差低方差”的 FM 过渡到“低偏差高方差”的 MeanFlow,解开两项冲突。纯 DiT 从头训 ImageNet-256:1-NFE FID 2.58、2-NFE 2.15,同架构下超过 MeanFlow。
3. 把 MeanFlow 修良定:iMF
MeanFlow 效果好,但训练方差高。iMF(Improved Mean Flows) 把病根定位在 JVP 的输入切向量上,而不是此前普遍怀疑的“目标里含不含网络”。
一个看起来对、其实无效的修法。 直觉上可以把 §2.2 那条含 \(u_\theta\) 的目标 \(\eqref{eq:mf}\) 改写成“合成速度对固定 FM 目标回归”:
让回归目标 \(\varepsilon-x_0\) 与网络无关。但这个改写与原始 MeanFlow 目标其实恒等,方差同样高——“目标是否含网络”根本不是病根。
病根与 iMF 的修法。 上式的 JVP 需要一个切向量(tangent);原始 MeanFlow 取的切向量是条件速度 \(v=\varepsilon-x_0\)(即 \(e-x\))。于是合成预测 \(V_\theta\) 同时依赖 \((z_t,\,e-x)\) 两个输入,不是 \(z_t\) 的合法函数——正是这个“非法输入”被 JVP 放大成高方差。iMF 的核心改动是把 JVP 的切向量从条件速度换成网络预测的边际速度 \(v_\theta\):
这样 \(V_\theta\) 重新变成只依赖 \(z_t\) 的合法函数,JVP 不再放大伪输入方差;再对固定 FM 目标 \(\varepsilon-x_0\) 回归。
再把 CFG 变成显式条件。 MeanFlow 把引导强度写死在训练里;iMF 一面把引导做成条件变量,一面用 in-context 条件架构(替代 adaLN-zero)承载它,测试期可调(同上一篇 §1.3 guided-distill 的“\(w\)-条件单网”精神)。一步 ImageNet-256 FID 1.72,较 MeanFlow 的 3.43 降约一半,是从头一步生成的新 SOTA。
4. 给分布层面一个保证:Terminal Velocity Matching
前面的方法都只保逐点回归最优(平方损失最优 = 条件期望,见第一篇 §1.1)。TVM(Terminal Velocity Matching) 少见地给出分布级保证。
它和 MeanFlow 呼应但求导对象不同。 记两时刻位移 \(\mathbf f(x_t,t,s)=\int_t^s\mathbf u\,\mathrm dr\)(\(t\) 为起始、\(s\) 为终端时刻;被积的 \(\mathbf u\) 是瞬时速度,也就是零长区间的平均速度 \(\mathbf u(\cdot,r,r)\)),TVM 把输入锚在起始 \(t\)、对终端时刻 \(s\) 求导:
让一步跳映射到的终点处的终端速度与真速度一致(故名 terminal velocity)。
为什么值得单列:分布层面的上界(须带条件)。 TVM 证明——在 \(\mathbf u_\theta(\cdot,s)\) Lipschitz 连续(常数 \(L(s)\))前提下——生成分布(一步 pushforward \(\mathbf f^\theta_{t\to0}\#p_t\))与数据分布 \(p_0\) 的 2-Wasserstein 距离被训练目标上界控制:
其中 \(\lambda[L](s)\) 是依赖 Lipschitz 常数的权重泛函、\(C\) 是不可优化的加性常数。两点必须讲清(否则会夸大):(i)因有 \(+C\),把损失压到 0 只保 \(W_2^2\le C\)、并非 \(\to0\);(ii)Lipschitz 前提不是摆设——TVM 的主要工程贡献正是“DiT 本身不 Lipschitz”,故加 RMSNorm/QK-norm/时间嵌入归一化把它拉成 Lipschitz。这仍是少步生成里少见的分布级(而非逐点)保证:CM/MeanFlow 只保逐点回归最优,TVM 把逐点目标翻成 \(W_2\) 的上界。
5. 统一 CM 与 FM,并给一个“负结果”:AYF
Nvidia 的 AYF(Align Your Flow) 先甩出一个负结果,再给一个统一框架。
负结果:CM 多步会累积误差。 AYF 在各向同性高斯数据这个可解析的设定下证明:CM/sCM 的目标严格预测干净 \(x_0\),故多步采样时会累积误差(这一证明的适用范围见本节末的小注)。这就解释了上一篇一致性模型“多步质量先升后降”不是调参问题,而是目标本身的结构缺陷。据此它转向 flow-map(CTM 泛化)\(\Phi_{s\to t}\),学任意两点映射而非死盯 \(x_0\)。
两条连续时间目标,以及它们的统一。 对着 §1 那两条自洽 PDE,AYF 给出 Eulerian 与 Lagrangian 两个版本的目标:
两式分别是把 \(\eqref{eq:eul}\) 与 \(\eqref{eq:lag}\) 的残差直接当损失。
关键在 AYF-EMD 把两个已知损失作为极限特例统一进来(两个极限别搞反):
- 两时刻重合极限 \(s\to t\)(\(\Phi_{s\to t}\to\mathrm{id}\),区间趋零、映射的导数变成瞬时速度)\(\Rightarrow\) EMD 退化为流匹配损失;
- 终点取到干净端(\(\Phi_{s\to t}\) 的终点 \(t=0\),映射变成“任意点 → 干净 \(x_0\)”)\(\Rightarrow\) EMD 退化为连续时间一致性损失(上一篇 §2.4 sCM)。
(AYF 原文把这张映射写成 \(f_\theta(x_t,t,s)\),起点是 \(t\)、终点是 \(s\),与这里 \(\Phi_{s\to t}\) 的字母刚好相反;对着原文核时留意一下。)
于是 CM 与 FM 恰是 AYF-EMD 的两个端点(前者盯干净端、后者盯零区间)。为补强条件文生图的锐度,再叠 autoguidance 蒸馏 + 轻量对抗微调 \(\mathcal L=\mathcal L_{\text{EMD/LMD}}+\lambda\mathcal L_{\text{adv}}\)(对抗原理见第三篇)。LoRA 蒸 FLUX.1,把 few-step flow-map 推上大规模文生图。
小注:那条“CM 多步必累积误差”的解析证明,是在各向同性高斯数据 \(p_{\text{data}}=\mathcal N(0,c^2I)\) 设定下给出、辅以经验验证——是很强的启发性论证,但不是对任意数据分布的普适定理。
TiM(Transition Models)是同一“负结果”的另一种回应:它学任意状态转移 \(\Phi_{s\to t}\),但用 §1 那条 Eulerian 一致性 \(\partial_s\Phi_\theta+(\nabla_x\Phi_\theta)v=0\)(\(\eqref{eq:eul}\))的规模化版本训练。它补上了 CM 的老毛病:CM 多步质量先升后降,而 TiM 单模型支持任意 NFE 且随步数单调变好——仅 865M 参数,GenEval 上 1-NFE 0.67、128-NFE 0.83,越过 SD3.5(8B)/FLUX.1(12B)。
6. 换第一性原理:Transition Matching 把速度场抬成“转移核”
前面都在学“确定的”映射/速度。Transition Matching 把学习对象抬高一层:不学瞬时速度 \(v(x_t,t)\),直接建模相邻状态之间的转移分布 \(p(x_{t_{i+1}}\mid x_{t_i})\),让每一大步由一个有表达力的生成模型(而非一个确定速度)给出——单步可以走得很大、NFE 少,且天然允许随机转移。
为什么流匹配是它的特例。 把区间 \([t_i,t_{i+1}]\) 的转移写成“条件期望位移 + 涨落”。若强制转移是确定的、且步长 \(\to0\),最优转移核塌缩成沿瞬时速度的一步 Euler
这正是流匹配。TM 因此定义了一族更宽的目标:Difference TM(DTM)(建模差分/位移,退化极限即 FM)、Autoregressive TM(ARTM)(把转移做成 token 级自回归)等;训练即让模型的转移核在数据前向过程诱导的真实转移分布上做最大似然/匹配。表达力换来“少步 + 可随机”,代价是每步一次小生成。
与蒸馏的关系(接第三篇)。 TM 本身是从头生成范式,不是蒸馏;但它给了“几步大转移”的合法框架,第三篇要讲的 TMD(Transition Matching Distillation)正是借这一范式,把一个大扩散教师蒸成几步转移过程。两者同名同源、一生成一蒸馏,不可混。
7. 换一把度量尺:IMM 的矩匹配
前面所有方法都在逐点比较两个样本:CM/CTM 要求“学生这一跳的落点 = 教师轨迹上的对应点”。跨度一大、终点分布多模态时,这种平方损失的最优解是条件均值(见第一篇 §1.1),几个模式一平均就糊。IMM(Inductive Moment Matching) 把对齐从“逐点”抬到“逐分布”,顺带给出一个更硬的结论:CM 其实是 IMM 的单粒子、一阶矩特例——每次只拿一个样本、只对上一阶矩,这也部分解释了 CM 训练为何不稳。
不再要求落点逐一对上,而要求学生一跳诱导出的分布,与“先跳到中间、再跳过去”的分布在矩上一致。度量选 MMD(最大均值差异)——只需从两个分布各采样、算核 \(k\) 的期望,不碰密度或 score。记学生从 \(t\) 直接跳到 \(s\) 的分布为 \(q^\theta_{s\mid t}\),自举参照是“先到中间 \(r\)、再用 stop-grad 学生跳到 \(s\)”的 \(q^{\mathrm{sg}(\theta)}_{s\mid r}\!\circ q_{r\mid t}\):
其中 \(a,a'\) 采自学生一跳、\(b,b'\) 采自自举分布。所谓“归纳(inductive)”:以 \(s{=}t\)(恒等映射)为基例,只要中间 \(r\) 处已对齐,这条自洽就把匹配从 \(r\) 推广到更大跨度,像数学归纳一样保证全时间对齐。它单阶段、不需预训练 score,且有分布级收敛保证(这正是 CM 缺的那一块):ImageNet-256 用 8 步拿到 FID 1.99、CIFAR-10 两步 1.98。它把“分布级对齐”(GAN/矩匹配那套)干净地移植到少步生成,是第三篇分布匹配的先声。
8. 规模化 / 框架化 / RL:这条线怎么长到工业级
平均速度的原始恒等式是在最简单的 \(x_t=x_0+t\varepsilon\) 上推的;真正上大规模还差几块拼图,由下面这些续作补上:
- Stabilizing/Scaling & Enhancing MeanFlow(2026;arXiv 2605.17834)——把 MeanFlow 做成工业级蒸馏,两个训练技巧各治一个病。一是“离散解 warm-up”:早期先用离散解替代微分 MeanFlow 目标,避免 stop-grad 项欠训致塌缩,再切回微分目标。二是加一条轨迹分布对齐辅助损失治“求均值发糊”,也就是把第三篇的 mode-seeking 引进 MeanFlow 线。工程上配 FlashAttention-JVP 与模型并行,蒸 FLUX.1-dev(12B)、扩到 HunyuanImage 3.0(80B)。
- Cumulative Flow Maps(2026;arXiv 2605.03623)——不是单个模型,而是参数化无关的框架:把平均速度/累积流映射从 \(u\)-FM 推广到 \(x_1\)-FM、EDM、DDIM 等多种参数化,MeanFlow 是其 \(u\)-FM 特例。
- MeanFlowNFT(2026;arXiv 2607.15273)——把前向过程 RL 引入平均速度生成器,给 MeanFlow 类加后训练/对齐能力。这里的前向过程 RL 指 DiffusionNFT 那类“在加噪前向过程上做 reward-weighted 回归”的做法,后面另开的《对齐系列》会专门讲。
9. 小结:映射这条线,和它通向哪
把本篇钉回三根轴:
- 共同对象是流映射 \(\Phi_{s\to t}\) / 其速度形式平均速度 \(u\)——(A)轨迹/端点映射的推广 +(B)任意两点 +(C)多为从头训(条件速度当目标,无需教师)。
- 共同的根是半群,求导出 Lagrangian / Eulerian 两条自洽 PDE。核心恒等式:MeanFlow 微分式 \(u=v-(t-r)(\partial_t+v\partial_x)u\)(\(\eqref{eq:mf}\)),及其更一般的 SplitMeanFlow 代数式 \((t-r)\,u(x_t,r,t)=(s-r)\,u(x_s,r,s)+(t-s)\,u(x_t,s,t)\)(\(\eqref{eq:smf}\))。
- 这一支是上一篇 CTM 与 sCM 在“从头训练”语境下的会师:iMF 把 MeanFlow 目标修回良定(一步 ImageNet FID 1.72),TVM 给出 \(W_2\) 上界,AYF 指出 CM 多步会累积误差并统一 CM/FM。再往外,Transition Matching 把速度场抬成转移核,IMM 换成矩匹配,规模化续作则把它蒸到 80B。
到这里,前两篇都还站在“学一个确定映射/速度、对齐轨迹或分布的矩”的立场上。还有一支更激进,直接让学生的输出分布去逼近数据分布,不回归任何轨迹目标。撑起它的是一条恒等式:两个模型的分数之差 = 它们对数密度比的梯度。DMD / SiD / Diff-Instruct / f-distill / Uni-Instruct 全串在这条上,而 IMM 的矩匹配已经探到了它的边。下一篇讲这条恒等式,以及它撑起的整个家族。