AI 快讯V1类脑结论,可能是评测错觉
开发心得

V1类脑结论,可能是评测错觉

2026-08-22T17:03:39.300Z
V1类脑结论,可能是评测错觉

一项最新研究发现,模型输入分辨率会显著改变不同学习规则与人脑 V1 的相似性结论。所谓随机初始化 CNN 超越反向传播 CNN 的现象,可能主要是评测分辨率造成的分析伪象。

V1类脑结论,可能是评测错觉

一项发表于 2026 年 8 月的新预印本研究指出,模型评测时使用的输入分辨率,足以改变关于哪种学习规则最像人脑初级视觉皮层 V1 的结论。

这不是一个单纯的图像预处理问题,而是一次对类脑模型研究方法的提醒:如果研究者只在单一分辨率下比较模型,就可能把评测设置造成的差异,误认为是模型学习机制本身的差异。

研究聚焦于一个在模型—大脑比较领域反复出现的结论:未经训练的卷积神经网络,可能在 V1 表征相似性上匹配、甚至超过经过反向传播训练的卷积神经网络。新研究认为,这一现象很大程度上是评测分辨率的产物,而不是随机权重天然具备更接近大脑的视觉机制。

从 32px 到 224px 的多分辨率评测流程,以及不同学习规则在 V1 表征相似性上的非单调变化示意图

研究结论:评测分辨率不是背景参数,而是实验变量

评测分辨率是指输入模型进行比较时,视觉刺激被缩放到的空间尺寸;它会同时影响模型能看到的局部细节、物体轮廓和空间频率分布。

在这项研究中,研究者固定了模型权重和归一化方式,只改变输入图像的分辨率,然后观察不同学习规则对应的模型表征如何与人类 V1 的 fMRI 数据匹配。结果显示,模型之间的相对排名会随着分辨率变化,训练模型与未训练模型之间的差距也不是简单地随分辨率增加而扩大或缩小。

具体来说,实验使用了从 32px 到 224px 的 6 个输入分辨率。32px 是模型训练阶段使用的分辨率,224px 则接近许多现代视觉模型和大规模图像基准常用的输入尺寸。研究者没有重新训练模型,而是将同一组固定权重放入不同分辨率的评测流程中。

这一设计很关键。它排除了重新训练带来的影响,意味着观察到的变化不能简单归因于模型在高分辨率下学到了更多信息。模型本身没有变,变的是评测时提供给模型的视觉尺度。

研究的主要发现是,反向传播训练模型与随机初始化模型之间的 V1 相似性差距呈现非单调趋势。非单调趋势是指,随着输入分辨率变化,差距并不会按照一条直线持续增大或持续减小,而可能在不同分辨率之间反复变化。

换句话说,研究者如果只选用 32px、64px 或 224px 中的某一个尺度,都可能得到不同的故事:某个学习规则在一个分辨率下看起来更类脑,换到另一个分辨率后,排名却发生变化。

实验怎么做:一个小 CNN,五种学习规则,六档分辨率

这项研究使用的是一个在 CIFAR-10 子集上训练的小型卷积神经网络,而不是大规模视觉 Transformer 或通用多模态模型。

实验比较了 5 种学习规则或初始化条件:随机初始化、标准反向传播、反馈对齐、预测编码和 STDP。它们分别代表了从无训练基线、现代深度学习主流优化方式,到神经科学启发的局部或脉冲学习机制的一组候选方案。

| 学习规则或条件 | 代表含义 | 在实验中的作用 | |---|---|---| | 随机初始化 | 权重未经过任务训练 | 检验随机特征是否能与 V1 表征接近 | | 反向传播 BP | 通过全局误差梯度更新参数 | 作为现代深度学习标准基线 | | 反馈对齐 FA | 使用固定或近似反馈权重传递学习信号 | 检验是否必须依赖精确反向传播 | | 预测编码 PC | 通过预测误差驱动表征更新 | 代表神经科学启发的误差最小化机制 | | STDP | 基于脉冲时间差的突触可塑性规则 | 代表局部、时间依赖的神经形态学习机制 |

模型使用 CIFAR-10 子集进行训练,训练分辨率为 32px;随后,研究者将模型用于 THINGS-fMRI 刺激,并在 32px、不同中间尺寸直到 224px 的 6 档分辨率上进行评测。

THINGS-fMRI 是一组用于研究人类视觉表征的神经影像数据。研究者通常会让人类受试者观看大量物体图像,再记录视觉皮层区域的 fMRI 活动,以此建立图像刺激与脑区响应之间的对应关系。

表征相似性分析 RSA 是一种比较模型内部激活结构与大脑神经活动结构的方法,而不是直接要求模型某个神经元对应人脑某个神经元。研究者通常会计算不同刺激在模型中的距离关系,再与同一批刺激在人脑 V1 中形成的距离关系进行比较。

这种方法的优势是允许模型和大脑拥有完全不同的神经元数量与拓扑结构。模型不需要在结构上复制皮层,只需要在面对相同视觉刺激时,呈现相似的表征几何结构。

但 RSA 也因此对刺激尺度、预处理、层级选择和映射方式非常敏感。输入图像分辨率变化,不只是让画面变清晰,它还会重新分配图像中的空间频率、边缘信息和局部纹理,最终改变模型激活之间的距离关系。

为什么分辨率会改变“类脑”排名

分辨率会改变卷积网络在输入阶段保留的视觉信息类型。

在 32px 输入下,图像细节被强烈压缩,模型更容易依赖粗粒度轮廓、低频形状和局部对比度。随着分辨率提高,纹理、边缘方向、物体局部结构以及更细的空间关系逐渐进入模型的有效感受范围。

V1 并不是一个只处理单一尺度的视觉滤镜。人类初级视觉皮层包含大量对不同空间频率、方向、位置和视野区域敏感的神经元。模型输入分辨率变化后,模型激活与这些视觉属性的对应关系也会变化,因此 RSA 得分自然可能发生变化。

更重要的是,模型权重是在 32px 分辨率下学到的。将同一组卷积核直接应用到 224px 图像上,并不等于让模型以 224px 的方式重新学习。卷积核尺寸、步幅、池化结构和归一化统计量仍然来自原来的训练设置,模型面对的是一种分布发生变化的输入。

这会产生类似实验室显微镜换倍率的效果:研究者以为只是把图像放大,实际上看到的是另一套局部结构组合。对于某些学习规则,这种变化可能让模型激活更接近 V1;对于另一些学习规则,则可能扩大模型与 V1 的差异。

随机初始化模型尤其容易制造误导。随机卷积核本身能够提取某些方向、频率和局部纹理特征,这些特征在低层视觉系统中也很常见。当评测指标主要关注低层表征时,一个没有经过任务训练的模型可能获得不低的脑相似性分数。

但这不意味着随机权重学会了视觉,也不意味着随机网络拥有比反向传播更好的生物学习机制。它更可能说明,低层视觉表征中存在一部分通用结构,而 RSA 在特定分辨率和特定数据集上的得分,可能放大了这部分结构。

“随机网络更像大脑”为什么一直有吸引力

随机网络能够在低层视觉基准上取得不错的相似性,是因为卷积结构本身已经编码了平移局部性和空间共享等归纳偏置。

卷积核在局部窗口内扫描图像,相当于预先假设视觉系统更关心局部邻域中的边缘、纹理和方向,而不是一开始就对整张图像建立全局连接。这些先验与 V1 中大量局部感受野现象存在表面上的相似性。

此外,反向传播训练优化的是任务目标,而不是大脑相似性。一个在 CIFAR-10 上追求分类准确率的模型,可能逐步形成更有利于类别区分的特征;这些特征未必保留人类 V1 中的全部低层视觉结构。

因此,在某些条件下,训练反而可能让模型偏离 V1。随机网络没有经历这种任务驱动的表征重组,于是可能在特定低层指标上保持更高的相似性。

新研究的价值在于,它没有直接否定这一现象,而是追问这个现象是否稳定。答案目前看并不乐观:一旦改变输入分辨率,训练模型和未训练模型之间的差距就可能发生明显变化。

这里需要区分两个命题。第一个命题是,随机初始化网络在某个 V1 RSA 设置下得分更高;第二个命题是,随机初始化网络的学习规则更接近人脑。第一个命题可能在部分实验条件下成立,但它远远不足以推出第二个命题。

对模型—大脑比较研究的直接影响

这项工作首先说明,单一分辨率评测不足以支撑稳定的类脑结论。

如果一篇论文只报告某个固定输入尺寸上的 RSA 得分,却没有说明模型训练分辨率、评测分辨率、插值方法和归一化方式,那么读者很难判断结果来自模型机制,还是来自输入尺度与预处理的偶然匹配。

未来的研究至少应该把评测分辨率视为一个需要系统扫描的实验因素,而不是写在实现细节里的默认参数。研究者需要报告不同分辨率下的完整曲线,而不是只挑选一个最高分。

其次,模型排序应该关注稳定性,而不是单点冠军。一个学习规则如果只在 32px 下胜出、在 64px 和 128px 下迅速落后,那么它更像是对某种评测设置的适配,而不是具有跨尺度稳定性的脑机制候选。

再次,模型—大脑相似性需要与任务能力、行为数据和跨数据集泛化结合起来。V1 RSA 只能说明模型低层表征与某类神经数据之间存在结构相似,不能单独证明模型的学习过程、内部因果机制或行为策略与人类一致。

| 评测层级 | 可以回答的问题 | 不能单独回答的问题 | |---|---|---| | V1 RSA | 模型低层表征几何是否接近人类 V1 | 模型是否采用了人脑式学习规则 | | 更高视觉皮层,如 V2、V4、IT | 模型是否在多个视觉层级保持相似性 | 模型是否具备人类视觉行为 | | 行为基准 | 模型输出是否接近人类选择和判断 | 模型内部机制是否与大脑相同 | | 跨分辨率评测 | 结论是否对输入尺度稳定 | 模型是否具备真正的生物可解释性 | | 跨数据集泛化 | 相似性是否依赖单一刺激集 | 是否已经排除所有数据偏差 |

开发者应该怎样复现实验

开发者如果想复现这项研究,第一步不是更换模型,而是严格固定实验协议。

需要固定的内容包括模型权重、层选择、激活提取方式、输入归一化、图像插值算法、刺激顺序、训练测试划分、脑数据预处理和 RSA 度量。否则,分辨率带来的效应很容易与其他变量混在一起。

第二步是同时报告绝对分数和相对差值。只给出某个模型的 RSA 得分,无法说明它是否真的优于其他学习规则;只给出随机网络与 BP 网络的差距,也无法看出这种差距是否在不同分辨率下稳定。

第三步是进行多种稳健性检查。至少可以考虑以下实验:

  1. 在 32px 到 224px 之间使用更多分辨率,而不是只选择 6 个点。
  2. 更换最近邻、双线性和双三次插值,观察排名是否改变。
  3. 对模型输入和脑数据分别进行空间频率分解,判断差异究竟来自形状、纹理还是频率成分。
  4. 比较不同卷积层,而不是只挑选最接近 V1 的一个层级。
  5. 使用多个随机种子,报告均值、标准差和置信区间。
  6. 在 THINGS-fMRI 之外加入其他视觉神经数据或行为数据。
  7. 检查模型是否在训练分辨率与非训练分辨率之间出现输入分布偏移。
  8. 对 RSA 结果进行噪声上限归一化,避免把神经数据本身的可靠性差异误判为模型差异。

噪声上限归一化是指用人类受试者之间或重复测量之间的一致性,估计当前神经数据最多能支持多高的相似性分数。没有噪声上限时,模型得分的绝对大小很难解释,尤其是在不同脑区和不同数据集之间比较时。

在统计分析上,研究者还应避免把多个分辨率当作独立证据后直接挑选最优结果。更合理的做法是把分辨率作为重复测量因素,分析学习规则与分辨率之间是否存在交互效应。

这项研究并不是对反向传播的“翻案”

这项研究没有证明 STDP、预测编码或反馈对齐已经优于反向传播,也没有证明随机网络在真实视觉任务中比训练网络更强。

研究的实验规模相对有限:模型是小型 CNN,训练数据来自 CIFAR-10 子集,神经数据主要聚焦 THINGS-fMRI 刺激和 V1 表征。它更像是一项方法学压力测试,用来检验既有结论在改变评测尺度后是否仍然成立。

同样,V1 也只是视觉系统的早期阶段。人类视觉能力还涉及更高层级的物体识别、场景理解、注意、记忆和行为决策。一个模型在 V1 上得分较高,不代表它在 V4、IT 或视觉行为任务上也更像人类。

但这并不削弱研究的重要性。恰恰因为模型很小、变量控制得比较清楚,实验把一个通常被忽略的问题放到了台面上:评测协议本身可能参与塑造研究结论。

对于类脑 AI,这个提醒尤其重要。研究者往往希望用一组神经数据证明某种架构或学习规则更接近大脑,但如果输入尺度、层级选择和相似性指标没有被系统审计,所谓机制发现就可能只是指标发现。

更大的启示:类脑评测需要从单点分数转向实验谱系

类脑评测是用神经数据和行为数据系统比较人工模型与人类认知系统的方法;它的可信度取决于数据、映射、指标和泛化协议是否透明可复现。

过去很多论文习惯报告一个漂亮的最高分:某层模型与 V1 的相关性最高,某种学习规则超过标准 BP,或者某个架构在脑相似性指标上领先。但真正有价值的问题应该是,这个结果是否跨分辨率、跨刺激、跨脑区、跨随机种子仍然成立。

一个更可靠的评测报告,应该像模型性能曲线一样,展示完整的条件空间。至少需要包含训练分辨率与评测分辨率的关系、模型层级、神经脑区、数据集、随机种子和统计不确定性。

GitHub 上提供的复现实验代码,也让这类方法学问题更容易被独立研究者检查。对开发者来说,代码开放的意义不只是复现一个分数,更是复现数据预处理、分辨率扫描和统计流程,确认排名是否真的来自学习规则。

从这个角度看,这项研究的核心贡献不是宣布哪种学习规则最像大脑,而是指出“最像大脑”这个问题必须带上测量尺度。没有分辨率维度的类脑结论,信息是不完整的。

OpenAI Hub 观点

这项研究最值得开发者记住的一句话是:模型评测分辨率会改变模型排名,因此单一分辨率下的类脑结论不应被当作机制证据。

如果研究目标是解释学习规则,而不是寻找一个漂亮分数,那么评测分辨率必须进入实验设计的主表,而不是隐藏在配置文件里。对于低层视觉模型,32px 和 224px 不是同一张图的两个显示尺寸,而是两种不同的信息输入条件。

“随机 CNN 比反向传播 CNN 更类脑”这个说法目前不能被简单接受,也不能被简单否定。更准确的表述是:在特定 V1 RSA 设置下,随机初始化模型可能获得较高相似性;但这一优势对评测分辨率敏感,且不足以证明随机学习规则更接近人脑。

对模型开发者而言,最实用的做法是把分辨率敏感性测试加入标准评测模板。对研究者而言,更重要的工作是把 V1 相似性扩展到多脑区、多任务、多数据集和行为层面。只有当一个结论在这些条件下仍然稳定,才值得被称为学习机制层面的发现。

截至 2026 年 8 月 22 日,这项研究仍是一篇预印本,结论还需要更多模型规模、更丰富神经数据和独立复现实验来验证。但它已经足以改变一个常见的研究习惯:在讨论模型是否类脑之前,先问清楚模型是以什么分辨率被评测的。

参考来源

相关推荐

查看全部