你的自监督模型不是学坏了,是根本没学会:给表征坍塌正名之后,VISReg干了件什么

你的自监督模型不是学坏了,是根本没学会:给表征坍塌正名之后,VISReg干了件什么

LeCun 6月在他的社交媒体上连续转了一篇论文。标题算不上惊骇,但值得注意—— VISReg(Variance-Invariance-Sketching Regularization),它要改变的不是自监督学习,而是这个行业对待一个五年老问题的全部态度。

这个老问题叫表征坍塌(representation collapse):自监督模型在训练过程中,倾向于把所有不同输入映射到相似或完全相同的向量上。你以为它在学特征,它其实在折叠。等到下游任务上拿数据时,模型是什么都回答不上来,因为只有一种答案,

它不是训练不收敛,而是收敛到了一个漂亮但危险的死胡同里。五年来主流解法围绕一套启发式技巧——EMA动量更新、教师-学生网络、停止梯度、冻结层……这些技巧加在一起,像是在把坍塌推后了,而不是把它根治了。更重要的是,每一个额外的trick都让训练变得更脆弱、更难复现,也越让人失去对底层动力学的直觉。

前几条路,都走到断了自己的路上

自监督学习从2017年开始,大部分解决坍塌的方法走了一条大致相同的路线:诱导模型不要走向同一套嵌入空间。手段包括但不限于门控网络、温度参数、伪标签、对比对……但本质上,它们都是在一个高维分布的表层打补丁,最终凑出几个沿着稳定边缘行走的办法。

2021年的VICReg是一条很聪明的折中。它把损失拆成三项:方差、不变性、协方差。协方差项约束嵌入维度之间的相关性,防止全部维度都关联到了同一个方向。但协方差只到二阶统计量。它能区分均值和方差,但无法区分”两个方差完全一样、可整体分布形状完全不同”的表征。

VICReg之后是SIGReg,它的突破在于用了Cramér-Wold定理,通过sketching把整个嵌入分布对齐到标准高斯。它不是说”方差最好不好小”,而是说”整个分布形状最好像标准高斯”。这从二阶提升到了完整分布形状层。

但SIGReg有两个硬缺陷。

第一,梯度消失:当模型已经处于坍塌状态时,SIGReg的梯度信号会随着坍塌加深而衰减;也就是说在最需要它拉你一把的时候,它的力反而最小——这构成了一个自我强化的恶性循环。你掉得越深,越没人来拉你。 第二,尺度与形状混在一起优化:风速和形状在损失中是被捆绑的,一个变了另一个跟着变。这意味着在长尾、低秩、低质量数据上,SIGReg极度敏感。这让它在严苛条件下的稳健性被打了折扣。

> 更直白地说:前人的努力不是没有用,但每一步都是在用更大的覆盖来掩盖前一个治标带来的新伤,直到VISReg站出来问了另一个问题——为什么要两个目标被锁在同一个锁子里?

VISReg的答案:把「尺度」和「形状」拆成两个独立的老虎

VISReg的核心设计非常干净:

保留VICReg的方差项,用它来控制尺度把原SIGReg里的Sketcing功用基于Sliced Wasserstein距离的sketching目标替代,用来控制形状对标准差施加stop-gradient,让两个目标彻底解耦

这不是调参,而是倔强的定分止争。给尺度一个项,给形状一个项,两者互相不越界。当模型陷入坍塌时,尺度正则的梯度趋于一个常数。这意味着即使你在最深深不见底的地方,它也能用一个稳定的力把你拉出来。这是SIGReg做不到的。

形状正则部分通过Cramér-Wold定理,把高维分布沿随机方向投影到一维,再逐一对齐到标准高斯分位数。高维空间里的复杂分布形状,被简化成了一堆廉价的一维排序操作。这是理论上的优雅与工程上的简洁同时达到。LeCun的一句话概括了这一切的传承:”VICReg begat SIGReg which begat VISReg。”从方差到分布,从分布到解耦,一条不断归零又不断扩大的技术家族树。

数据说明一切,尤其是 1/10 的数据

研究团队把VISReg放在15个数据集上和7种主流自监督方法做了对比,包括MoCoV3、DINO、iBOT、I-JEPA、MAE、data2vec。

几个极有力的信号:

域内线性探测:在不使用任何启发式技巧的情况下,VISReg ViT-B/16达到75.7%,超过MAE(75.1%);ViT-L/14达到77.0%,超过LeJEPA(75.6%)。而在使用启发式技巧的方法面前,它只略低。这说明它的能力是内生的。不需要老师学生、不需要冻结层,不需要动量更新,它自己站得住。

分布外(OOD)泛化:这是更残酷的测试。覆盖医疗、天文、遥感、纹理六个OOD数据集中,VISReg在所有方法、所有骨干规模上都取得了平均精度最佳。ViT-B/16平均70.19%,ViT-L/14平均70.63%,均明显优于DINO(69.56%)、I-JEPA(68.55%)。在数据分布完全不同的世界,依靠”调参技巧”的方法纷纷失效,VISReg泛化得最好。

数据效率:在ImageNet-22K上预训练(约1400万张图),6个OOD基准的平均精度为72.94%,与基于LVD-142M(1.42亿张图,规模是它十倍)上的DINOv2的72.93%基本持平。1/10数据,同等水平。这代表的不是参数调得好,而是表征本身的通用性在更高一维。有权的东西少,但能走得更远。

迁移和生成引导上:在CIFAR-10/100、Flowers、ImageNet-1K、Galaxy10的全部五个数据集上微调后,VISReg都优于DINO和全监督预训练。用SiT做生成引导时,三项指标优于DINO。

这就是不堆砌trick的真正力量:训练过程变干净了,模型的「骨骼」也变结实了。迁移、生成、微调、跨域——凡是考验「是否真的学会了」的场景,VISReg都在示强。

更值得注意的一点:跑到地平线上

VISReg的计算复杂度是O(N·D·K)——随batch size、维度、切片数线性增长。而VICReg的协方差项是O(N·D²),随维度平方增长。而且随机切片可以分摊到多张GPU上独立计算后拼接。实验从单卡K不够扩大到8卡K/M,精度差距从2.4%缩小到0.22%。在大规模训练中,这几乎是免费的横向扩展。

更本质的:核心正则逻辑仅需约15行PyTorch代码。这不是更大的模型,不是更多的算力,是一种微小但正确的结构重定义带来的质变。LeCun的转发罕见但毫不意外:这是自监督学习从「窍门工程」向「第一性原理」回归的标志。

这对你意味着一件传统行业不想承认的事

如果你正在用对比学习、用自监督预训练,或者把JEPA世界模型集成到某个真实应用里——你不可能不面对这个问题:你的模型看起来学到了东西,但它可能只是把自己塞进了一个安全的坍塌角落里。

表征坍塌不是训练失败,它是一个隐性成功——一个向平庸收敛的成功。当模型学会把看起来不同的所有输入映射到同一个安全区域,它在训练集上完成了任务,但在物理世界面前失效了。

VISReg的价值不仅是技术指标更好。它证明了一件事:你把损失函数拆对了,不需要大堆trick,模型自己就能学会判别性的、稳定的、可迁移的表征。不是更大的模型、不是多十倍的算力、不是更多层的冻结策略——是把两个被绑在一起的目标松绑。

自适应学习的敌人从来不是坍塌本身,而是我们拿它当症状,却一直在治疗错误的病人。

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注