❶ 应该先做什么实验?
科学的进展,不是从测试最戏剧性的主张开始,而是从测试最脆弱的主张开始——那些最接近既有知识的主张,失败代价最低、却最能提供信息的主张。一个从最安全的预测开始、逐步向外推进的框架,才有资格尝试其非凡的主张。一个跳过基础、直接跳到非凡主张的框架,不是大胆,而是回避。
本页是测试 ECI 协调本体论(coordination ontology)的操作蓝图。它规定了一个第 0 阶段前置条件加上八个设有闸门的研究阶段(第 1-8 阶段),每个阶段都是下一个阶段的前置闸门。「闸门」的意思是:在第 N 阶段产生可重复、经同行审查的结果之前,不得进入第 N+1 阶段。如果第 1 阶段失败,第 2 到第 8 阶段将失去基础。如果第 6 阶段产出零结果(null results),第 7 和第 8 阶段便不具正当性。这个闸门结构是路线图最重要的特征,因为这正是伪科学所省略的。伪科学从最戏剧性的主张开始——心电感应、预知、神奇疗法——然后回头建构正当化理由。真正的科学从可以低成本失败的地方开始,向前推进,让数据决定框架能延伸多远。
本路线图也体现了第二个原则:先操作化,后实验(operationalization before experimentation)。在你能测试 V 是否预测弱信号回应之前,你必须定义 V 在你研究的系统中是什么、你将如何测量它、以及它带有什么单位。这就是第 0 阶段,没有它,其他一切都无法测试。一个变量无法被测量的框架是哲学,不是科学。哲学本身没有什么不好,但它不应被包装成实验预测的语言。
页面状态:本页被分类为「方法论(methodological)」,因为它指定的是如何测试框架,而不是框架对世界的主张为何。可测试性标记为「n/a」,因为本页本身就是一个测试方案(testing protocol),而非一个可测试的主张。被测试的主张在其他页面上发展(C1、C2、C4、E1、E2),并在 F2 和 F3 上被汇整。
所需专业知识:实验方法学家、生物统计学家、复杂系统建模者、比较认知研究者、理论生物学家。
❷ 「最安全测试优先」原则
为什么顺序很重要
ECI 框架是一个具有不同证据状态的主张网络。某些主张直接建立在已确立的科学之上——Shannon 熵(Shannon entropy)、数据处理不等式(data processing inequality)、具有相关性扩展的方差公式(variance formula with correlation extension)。另一些是新颖的提案——V-kappa 框架、粗粒化函数(coarse-graining function)G、持续性筛选形式论(persistence filtering formalism)。还有一些则坦率地说是推测性的——跨通道存取(cross-Channel access)、时间性信息存取(temporal information access)、灵魂假说(soul hypothesis)。
面对这个框架的研究者面临一个选择:先测试哪些主张。错误的答案是「最有趣的那些」。正确的答案是「最接近已确立科学的那些,在那里框架的预测可以最清晰地与背景知识区分开来」。
这样的排序有三个原因。
原因一:低成本失败。 如果 ECI 框架最常规的预测失败了——如果 V 在受控模拟中未能预测弱信号覆盖,或者如果方差公式中的相关项未能改善对宏观稳定性的预测——那么框架就有根本性的问题。推测性的延伸始终以核心机制运作为前提。在已确立方法提供清晰基线的系统中尽早发现这一点,可以节省多年在更奇特测试上的浪费。
原因二:校准(calibration)。 即使早期阶段的测试成功了,它们也为后期阶段提供了不可或缺的东西:经过校准的预期。如果第 1 阶段确立了 V 在电子电路中以效果量(effect size)d = 0.4 预测弱信号回应,那就校准了在神经系统中测试同一预测时应该预期什么。没有早期阶段的校准,后期阶段的结果将无法解读——你不知道一个给定的效果量是大是小、是预期之中还是出人意料。
原因三:可信度。 一个在已确立领域展现了预测价值的框架,已经赢得了在推测性领域提出测试的可信度。一个跳过核心数学验证就直接进行预知测试的框架,将被——理所当然地——科学界忽视。闸门结构不仅在认识论上是正确的,在策略上也是必要的。
闸门逻辑
路线图中的每个阶段都有三个定义好的结果:
- 通过(Pass):该阶段的预测由预先注册(preregistered)、独立重复的实验所确认。下一个阶段解锁。
- 失败(Fail):该阶段的预测被清楚且可重复地证伪。依赖它的阶段失去正当性。框架必须在失败点修正,或在该分支上放弃。
- 无定论(Inconclusive):结果模糊不清——统计检定力(power)不足、未被重复、或在方法论上有争议。该阶段保持开放。下一个阶段不会解锁。
这种不对称性是刻意的:通过需要正向的、重复的证据;失败需要清楚的负面证据;介于两者之间的任何情况都被视为「尚未通过」。这种不对称性防止了推测性框架的常见失败模式,即把无定论的结果视为软性确认然后继续推进。
❸ 已确立的实验方法论
在描述路线图的各阶段之前,有必要陈述统一适用于所有阶段的实验标准。这些标准不是 ECI 的创新——它们是实验科学累积的最佳实践,经过数十年的方法论危机和改革而艰难得来。
随机化设计
所有实验必须使用随机化(randomization)来分配条件。在第 1-3 阶段(实验涉及物理或计算系统),这意味着随机化的参数分配、随机化的条件排序,以及适当的平衡设计(counterbalanced designs)。在第 4-6 阶段(实验涉及生物受试者),这意味着随机化的分组、随机化的刺激序列,以及在可行的情况下采用双盲方案(double-blind protocols)。随机化的目的是打破混淆变量(confounds):处理变量与干扰变量之间的任何系统性关联都是因果推论的威胁。
预先注册(preregistration)
每个验证性实验都必须在数据收集开始之前,在公开的注册平台(例如 OSF、AsPredicted、ClinicalTrials.gov 或适当的领域等效平台)上预先注册。预先注册必须指定:
- 被测试的假设,以可证伪的预测形式陈述。
- 样本量(sample size),由前瞻性检定力分析(power analysis)决定(见下文)。
- 停止规则(stopping rule):何时结束数据收集,不允许选择性停止(optional stopping)。
- 主要结果变量和将要使用的统计测试。
- 显著性阈值(significance threshold),以及在适用的情况下,Bayes 因子阈值。
- 排除、离群值和遗漏数据的处理方式。
探索性分析(exploratory analyses)受到欢迎和鼓励,但它们必须被标记为探索性分析,不能替代预先注册的验证性测试。探索与验证之间的区分是不可协商的。
重复验证(replication)
没有任何单一实验——无论设计多好——足以确立一项科学发现。重复验证的要求依阶段而异:
- 第 0-2 阶段:内部重复验证(同一实验室、不同数据集或系统)足以支持初步主张。独立重复验证(不同实验室)在下一阶段解锁前为必要条件。
- 第 3-5 阶段:至少由一个其他实验室进行独立重复验证,结果才被视为已确立。
- 第 6-8 阶段:至少由两个其他实验室进行独立重复验证,并采用对抗性合作方案(adversarial collaboration protocols)。(主张足够非凡,重复验证的标准必须相应地提高。)
贝叶斯分析与频率主义测试并行
所有实验都应同时报告频率主义结果(p 值、置信区间、附带置信区间的效果量)和贝叶斯结果(Bayes 因子,比较 ECI 预测与虚无假设以及相关替代假设)。双重报告的原因是频率主义方法和贝叶斯方法回答不同的问题:频率主义方法评估在虚无假设下观察到该数据的概率;贝叶斯方法评估在竞争假设下观察到该数据的相对概率。对于非凡的主张(第 6-8 阶段),贝叶斯框架尤其重要,因为它自然地纳入了假设的低先验概率(low prior probability)。
效果量估计(effect size estimation)
统计显著性本身是不够的。每个实验都必须报告效果量(Cohen's d、eta-squared 或领域适当的等效指标)及其置信区间。一个统计显著但效果量微不足道(例如 d = 0.01)的结果在统计意义上是「真实的」,但在实际意义上是无意义的。框架必须为每个阶段指定什么样的效果量构成有意义的支持。如果预测的效果很微小,则检测它所需的样本量必须相应地大——研究者必须诚实地说明这样的样本量是否可行。
前瞻性检定力分析(power analysis)
在数据收集之前,每个实验都必须包含一个检定力分析(power analysis),指定在指定的 alpha 水准下,以至少 80% 的检定力(power)(对于非凡主张理想上为 90% 或更高)检测预测效果所需的最小样本量。检定力不足的研究比没有研究更糟糕:它们产生模糊的结果,浪费资源并堵塞文献。
❹ 九阶段路线图详述(第 0 阶段前置 + 第 1-8 阶段)
这是本页的核心。每个阶段都指定了:它测试什么、它从前面的阶段需要什么、成功是什么样子、以及失败意味着什么。
第 0 阶段 —— 可操作化
测试什么:什么都不测试。第 0 阶段是实验前置阶段。它为特定目标系统将 V、kappa、K、Q 和 Gamma 定义为可测量的量。没有这个阶段,其他一切都无法被测试。
前置要求:来自 F2 的正式定义,以及来自 C1、B5 和 C2 的概念发展。
任务:对于每个关键变量,产出一份操作化方案(operationalization protocol),指定:
- 什么系统将被用来测量该变量(例如,耦合电子振荡器、递归神经网络、蚁群、皮质微回路)。
- 什么物理量在该系统中对应于该变量(例如,V = 电压时间序列的 Shannon 熵;kappa = 振荡器对之间的平均相位相干性(mean phase coherence);K = 系统每单位时间访问的可区分状态数;Q = 信息模式与载体状态之间的互信息(mutual information);Gamma = 两个耦合子系统之间的转移熵(transfer entropy))。
- 什么测量方案将被使用(仪器、采样率、观测窗口、噪声处理)。
- 什么单位被测量的量所携带。
- 如何以实验方式操控该变量的值——不只是观察,而是控制。这对于后续阶段至关重要,在那些阶段中,自变量(independent variable)必须在其他因素保持不变的情况下被变动。
操作化必须在至少两个独立系统中完成——理想情况下是来自不同领域的系统(例如,一个电子/计算系统、一个生物系统)——以测试同一形式变量是否有意义地对应到不同的物理基底(physical substrates)。
成功是什么样子:在至少两个系统中,发表 V、kappa、K、Q 和 Gamma 的操作化方案,并展示测量的信度(inter-rater reliability、重测信度(test-retest reliability)或测量-再测量一致性,视情况而定)。方案必须详细到一个独立实验室仅凭出版物就能重复这些测量。
失败是什么样子:如果某个关键变量无法被操作化——如果在持续的努力之后,在任何特定系统中都无法识别出对应于 V 或 kappa 或 Q 的可测量量——那么框架在经验上是不可测试的,并且仍停留在哲学的领域。这是一个严肃但诚实的结果。它不意味着框架是错的;它意味着框架尚未成为科学。
关键交付物:
- 每个变量在每个目标系统中的操作化手册
- 信度评估数据
- 展示变量可以被实验操控(而非仅被观察)
第 1 阶段 —— 常规验证
测试什么:V 和 kappa 是否在特性已被充分了解的物理和计算系统中预测弱信号回应。这完全在已确立的科学范围内。没有高维度主张、没有生物复杂性、没有活体系统。如果 ECI 框架在基本真值(ground truth)完全已知的系统中无法做出正确预测,它就没有资格对大脑、生态系统或其他任何事物做出预测。
前置要求:在目标系统中完成 V 和 kappa 的第 0 阶段操作化。
核心实验:取一个弱信号检测已被充分表征的系统(例如,耦合电子振荡器阵列、传感器网络、信号处理电路)。系统性地变动 V(元件属性的多样性——例如,自然频率、耦合强度、噪声水准)和 kappa(协调结构——例如,耦合拓扑、反馈架构)。测量系统检测嵌入噪声中的已知弱信号的能力。
ECI 预测:系统的弱信号检测表现在中等 V 值时被优化(不太低、不太高),且非单调地取决于 V 和 kappa 的交互作用。具体而言:
- 低 V、任意 kappa:检测不佳。系统缺乏找到信号的状态空间覆盖。
- 高 V、低 kappa:检测不佳。系统有覆盖但没有相干性——元件独立回应,信号在不协调变异的噪声中丢失。
- 高 V、高 kappa:协调多样性(Coordinated Diversity)区域。当系统拥有多样化的元件,且这些元件协调程度足以通过合作动态放大弱信号时,检测表现应被最大化。
- 关系应为非单调的:在 V-kappa 空间中存在一个最佳区域,而非任一变量的单调「越多越好」关系。
此预测与已确立的随机共振(stochastic resonance)文献(Gammaitoni et al., 1998)一致,但更为具体。ECI 的新颖贡献在于声称 V-kappa 交互作用比单独的 V 或 kappa 更具信息量,且最佳区域可以从系统的架构预测。
成功是什么样子:预先注册的实验展示 V-kappa 交互作用比单独的 V、单独的 kappa 或现有基线模型(例如,仅使用噪声强度作为唯一控制参数的标准随机共振预测)更好地预测弱信号检测表现。改进必须以效果量量化并独立重复验证。
失败是什么样子:如果使用第 0 阶段方案测量的 V 和 kappa 未能预测弱信号检测表现——或预测能力不优于更简单的现有模型——那么 V-kappa 框架在其最简单的测试案例中未增加经验价值。这是第 1 阶段的失败。它不一定使整个 ECI 框架无效(操作化可能有误,或特定系统可能不是正确的测试案例),但它确实意味着框架尚未通过其第一个经验测试,在失败被理解和解决之前,后续阶段都不具正当性。
预估时程:从第 0 阶段操作化完成后 1-3 年。
关键测试变量:V、kappa,及其交互作用。
第 2 阶段 —— 模拟与人工系统
测试什么:ECI 的形式预测是否在受控的人工系统中成立——在这些系统中,每个参数都是已知的,每个变量都可以被精确操控。目标系统是基于代理人的模型(agent-based models)、耦合振荡器和递归神经网络——这些系统足够复杂以展现涌现行为(emergent behavior),但又足够简单以让基本真值完全可及。
前置要求:成功的第 1 阶段(V-kappa 交互作用在物理系统中预测弱信号回应)。
核心实验:
实验 2a —— 基于代理人的模型。 建构具有可调 V(代理人规则或参数的多样性)和可调 kappa(互动结构、通讯拓扑、耦合强度)的基于代理人模型。测试 V-kappa 框架是否预测宏观层级行为——集体决策品质、适应速度、对扰动的韧性——在这些模型中。因为所有参数都受控,这提供了框架数学预测最干净的测试。
实验 2b —— 耦合振荡器网络。 将第 1 阶段从简单的振荡器阵列扩展到具有异质拓扑的网络。在保持 V 和 kappa 不变的情况下系统性地变动网络结构(随机、小世界、无标度、模块化),反之亦然。测试来自 C4 的尺度递归方程 X^{(L+1)} = G_L(X^{(L)}) 是否对微观层级振荡器行为如何对应到宏观层级网络行为做出正确预测。
实验 2c —— 递归神经网络(人工)。 在需要弱信号检测、模式完成或预测的任务上训练递归神经网络。变动网络的内部多样性(V:单元属性的异质性)和协调结构(kappa:连结模式、正则化方案)。测试 V-kappa 动态是否预测任务表现、学习速度和泛化能力。这在保持完全受控领域的同时,为生物神经系统(第 3 阶段)搭建桥梁。
ECI 预测:在所有三种系统类型中,V-kappa 交互作用应比单独任一变量更好地预测涌现的宏观行为。粗粒化函数 G,如果针对每个系统适当操作化,应以可测量的预测准确度捕捉微观到宏观的映射。持续性筛选方程(来自 F2 的 Eq. 8)应正确预测哪些配置在演化式基于代理人模型中的竞争中存活下来。
成功是什么样子:发表的、预先注册的模拟研究展示 ECI 的形式预测在人工系统中定量地成立。至关重要的是,预测必须在模拟运行之前被指定,而非事后拟合。事后的曲线拟合若能重现模拟输出,那不是框架的证据,而是非线性拟合弹性的证据。
失败是什么样子:如果 ECI 的预测在所有参数都已知的系统中,准确度不优于通用的复杂系统模型(例如,标准平均场近似、随机矩阵预测,或简单的幂律标度),那么框架相较于现有工具不增加价值。这将是一个重大失败,因为人工系统是最容易的测试案例:如果框架在这里无法超越基线,它在混乱的生物或生态系统中肯定也做不到。
预估时程:2-4 年,与第 1 阶段后期重叠。
关键测试变量:V、kappa、G、持续性筛选(S 分解)。
第 3 阶段 —— 活体系统与非活体系统配对比较
测试什么:在大小、能量通量、连结性和噪声特性方面进行配对的情况下,活体系统是否展现出超越 V-kappa 框架应用于非活体系统所预测的额外适应性耦合、保留或回应光谱。
前置要求:成功的第 1 和第 2 阶段(V-kappa 框架已在人工系统中展现预测价值)。
核心实验:这是首次直接比较活体和非活体系统的阶段,因此需要仔细的配对。设计如下:
- 选择一个行为已被充分表征的活体系统(例如,细菌菌落、黏菌网络、神经类器官(neural organoid),或小型无脊椎动物神经系统)。
- 建构一个非活体系统——电子或计算类比物——在以下维度上与活体系统配对:元件数(N)、能量通量(瓦特)、连结架构(度分布和拓扑)、噪声特性(频谱轮廓和振幅),以及时间常数(特征回应时间)。
- 对两个系统呈现相同的测试信号集:强度各异的已知信号嵌入配对的噪声背景中。
- 测量:(a) 弱信号检测准确度,(b) 信号保留持续时间,(c) 回应光谱(系统能检测的信号类型和强度范围),(d) 适应性改善(重复暴露后表现是否改善?)。
ECI 预测:如果 ECI 框架在核心层级是正确的(V-kappa 动态解释了系统表现的大部分),那么在适当配对后,活体和非活体系统在 V-kappa 预测的指标上应展现相似的基线表现。有趣的问题是活体系统是否展现出超越 V-kappa 基线的额外能力——具体而言,它们是否展现出适应性耦合调整(根据信号统计特性主动调校其协调结构)、增强的信号保留(比被动系统维持信号表征更久),或更宽的回应光谱(检测到配对的非活体系统遗漏的信号类型)。
如果活体系统在配对后展现额外能力,问题就变成:这些额外能力能否被已知的生物机制(可塑性、恒定性、代谢调节)解释,还是需要超出目前框架的东西?
成功是什么样子:两种结果都具有科学价值:
- 结果 A:配对后,活体和非活体系统展现等效表现。这支持了 V-kappa 动态是基底无关(substrate-independent)的主张,且框架无论元件是否为生物性的,都捕捉了本质动态。这是核心框架的强结果。
- 结果 B:活体系统展现出超越配对非活体系统的可测量额外能力。这支持了 ECI 假说,即生物系统具有不完全被简单 V-kappa 框架捕捉的协调特征(可能与载体容量 K、相容性 Q 或耦合 Gamma 相关)。这开启了一个识别那些额外特征为何的研究计划。
失败是什么样子:如果配对程序不充分——如果非活体系统无法在指定维度上与活体系统相比较——实验是无定论的,不是失败的。失败模式是具体的:如果活体和非活体系统展现相同表现,且 ECI 框架预测它们应有差异,该预测就被证伪。如果它们展现相同表现,且框架预测了等效性,那就是确认。
预估时程:从第 2 阶段完成后 3-5 年。需要复杂系统建模者、电生理学家和生物工程师的合作。
关键测试变量:V、kappa、K、Q、Gamma——完整集合,以活体/非活体比较探测是否所有五个都是必要的,还是 V 和 kappa 就已足够。
第 4 阶段 —— 种内集体操控
测试什么:仅协调复杂度本身——独立于个体生物体能力——是否增强常规预测、弱信号检测和集体预期。这通过保持 N(生物体数量)不变、仅操控协调结构来测试。
前置要求:成功的第 1-3 阶段(V-kappa 框架在人工和活体系统中皆可运作)。
核心实验:社会性昆虫提供了理想的模式系统,因为它们的集体行为已被深入研究、其协调可以被实验操控,且个体生物体相对简单(减少个体层级认知造成的混淆)。
实验设计(以蚂蚁为例):
- 条件 A —— 隔离:100 只蚂蚁,每只在单独的容器中。无通讯。每只蚂蚁独立地遭遇测试环境(例如,一个覆盖复杂化学景观、嵌有微弱食物信号的觅食竞技场)。测量:个体检测率、反应时间、准确度。
- 条件 B —— 有限通讯:100 只蚂蚁在一个具有缩减通讯通道的连通环境中(例如,限制费洛蒙(pheromone)扩散的狭窄通道、限制直接接触的物理障碍)。部分协调可能但受限。测量与条件 A 相同的变量,加上集体层级的量测(群体准确度、回应协调、信息扩散速率)。
- 条件 C —— 完整蚁群网络:100 只蚂蚁在标准蚁群环境中,通讯不受限制(完整的费洛蒙景观、自由的直接接触、正常的蚁群架构)。完全协调。测量条件 A 和 B 的所有变量。
关键控制:N 在各条件之间保持不变。个体蚂蚁从同一蚁群、同一年龄群、同一阶级中抽取。唯一的系统性差异是协调架构。因此,集体表现的任何差异可归因于协调,而非个体能力或群体大小。
ECI 预测:表现应随协调复杂度而提升,而非仅随 N 提升。具体而言:
- 条件 A(隔离):表现应等于个体能力的总和(或平均值)。没有集体优势。
- 条件 B(有限协调):表现应超过个体能力的总和,但仅适度超过。V-kappa 乘积受限于受约束的 kappa。
- 条件 C(完全协调):表现应展现质的增强——不仅是更快或更准确的检测,而是检测到任何单只蚂蚁和任何隔离蚂蚁群都无法检测到的信号。这是来自 C4 的涌现预测:协调系统的宏观层级能力超越了仅从微观层级能力所能预测的。
延伸到其他物种:相同的实验逻辑可以应用于鱼群(变动群聚凝聚力)、鸟群(变动群集密度),甚至细菌菌落(变动群体感应(quorum-sensing)密度)。跨物种的重复验证强化了任何发现的普遍性。
成功是什么样子:预先注册的实验展示集体表现随协调复杂度(而非仅群体大小)而提升,且 V-kappa 框架正确预测了条件间差异的排序和大致幅度。在至少两个物种中重复验证。
失败是什么样子:如果集体表现在各协调条件之间没有差异——如果 100 只隔离蚂蚁的表现和 100 只完全联网的蚂蚁一样好——那么在这些系统中协调不增加集体价值,涌现框架未通过经验测试。或者,如果表现差异存在但完全被更简单的模型(例如,简单平均、多数决)解释,无需参考 V-kappa 动态,那么框架相较于现有解释不增加价值。
预估时程:从第 3 阶段完成后 3-5 年。需要行为生态学家、复杂系统建模者和实验生物学家的合作。
关键测试变量:V、kappa、集体层级 K、G 函数(微观到宏观映射)。
第 5 阶段 —— 跨物种比较
测试什么:检测和回应能力的分布是否在具有不同协调复杂度 C_N 的物种之间系统性地变动。关键预测:随着协调复杂度增加,表现分布的尾部应延伸——不仅是平均值,而是极端表现的概率。
前置要求:成功的第 4 阶段(协调复杂度增强了物种内的集体能力)。
一个关键的概念澄清:协调复杂度 C_N 不仅仅是神经元数量。一个拥有 1000 亿个神经元但连结不良的大脑,其协调复杂度低于一个拥有 10 亿个神经元但具有丰富的递归连结、模块化和层级整合的大脑。C_N 必须被操作化为一个复合度量,包括:
- 递归性(recurrence):形成回路的连结比例,使反馈和持续活动成为可能。
- 模块化(modularity):系统被组织成半自主模块的程度,这些模块可以独立处理信息然后整合结果。
- 整合性(integration):来自不同模块的信息被合并为统一表征的程度(例如,以整合信息度量(integrated information metrics)或类似度量测量)。
- 行为库(behavioral repertoire):生物体能产出的不同行为模式的数量和多样性(系统有效状态空间覆盖的代理指标)。
- 可塑性(plasticity):系统因应经验而修改其协调结构的能力。
神经元数量是 C_N 的一个贡献因子,但既非必要也非充分。一只章鱼拥有大约 5 亿个神经元,分布在具有非凡行为弹性的去中心化神经系统中,其有效 C_N 可能高于一只具有更多神经元但架构精密程度较低的脊椎动物。
核心实验:在具有系统性不同 C_N 的物种之间比较弱信号检测、常规预测准确度和适应性回应。比较必须控制:
- 体型:较大的身体具有更多的感觉表面积,这可以在不诉诸协调的情况下解释更好的检测。
- 感觉敏锐度(sensory acuity):感觉更灵敏的物种无论协调如何都会检测到更弱的信号。测试必须使用针对每个物种感觉阈值校准的信号。
- 生态相关性:测试信号必须对每个物种具有生态意义(觅食物种的食物气味、猎物物种的掠食者线索等)。
- 动机:所有物种必须有足够的动机来执行检测任务。
ECI 预测:对于检测阈值 theta,极端表现的概率 P(H > theta | C_N) 应随 C_N 增加——不是因为高 C_N 物种在某种一般意义上「更聪明」,而是因为其协调架构使它们能存取更广的信号空间区域。预测是关于分布的,不仅是平均值:高 C_N 物种应展现更厚的分布尾部(相对于自身平均值,有更多极端表现者),因为其协调动态通过合作处理创造了更多放大弱信号的机会。
成功是什么样子:在控制了体型、感觉敏锐度和生态相关性之后,独立测量的 C_N 与检测表现分布之间存在统计显著的、预先注册的关系。由至少两个独立研究团队使用重叠但不完全相同的物种集进行重复验证。
失败是什么样子:如果检测表现完全被感觉敏锐度和体型预测,C_N 无残余贡献,则协调增强能力的预测被证伪。如果 V-kappa 框架相较于更简单的比较度量(例如,脑体质量比、脑化指数(encephalization quotient))不增加预测力,它未能正当化其额外的复杂性。
预估时程:从第 4 阶段完成后 5-8 年。需要跨多物种的大规模比较行为测试,采用标准化方案和多个独立实验室。
关键测试变量:C_N(协调复杂度)、V、kappa、分布形态(尾部行为)。
第 6 阶段 —— 未来目标实验(预知测试)
测试什么:系统是否能存取尚未被因果决定的信息。这是在 E2 上详细描述的测试。
前置要求:成功的第 1-5 阶段,且在更早的阶段中有可重复的异常现象。具体而言,此阶段仅在以下情况下才具正当性:
- V-kappa 框架已被验证(第 1-2 阶段)。
- 活体系统已被证明展现出超越配对非活体系统的额外能力(第 3 阶段,结果 B)。
- 协调复杂度已被证明增强了集体能力(第 4 阶段)。
- 跨物种比较展现了预测的 C_N 依赖性分布偏移(第 5 阶段)。
- 在更早的阶段中有一些抗拒常规解释的异常结果——可重复但无法被已确立的感觉、统计或物理机制解释的结果。
如果这五个条件并非全部满足,无论任何人对测试预知有多大热情,第 6 阶段都是不成熟的。闸门严格正是因为主张是非凡的。
方案(摘要自 E2):
- 量子随机数产生器(QRNG) 在受试者的回应被锁定之后才产生目标。
- 不可变的、加密的时间戳记用于回应和目标两者。
- 物理隔离——受试者与 QRNG 之间的隔离。
- 自动化、实验者盲操作——从回应到目标产生之间没有人类介入。
- 强制分离发现阶段和验证阶段——在发现阶段被识别的受试者必须在独立的验证阶段以预先注册的方案进行重新测试。
- 采用适当怀疑先验的贝叶斯分析——鉴于主张的非凡性质,假设的先验概率应非常低,且证据必须相应地强(例如,支持预知假设相对于虚无假设的
BF > 100)。
成功是什么样子:在验证阶段(非发现阶段)中高于概率的表现,效果量置信区间排除零,Bayes 因子强烈支持替代假设,且由至少两个其他实验室使用不同的 QRNG 硬件和不同的实验者团队进行独立重复验证。所有数据公开可用。
失败是什么样子:在统计检定力充足、预先注册的验证阶段测试中,表现与概率无法区分。鉴于目前的证据(见 E2 第 3 节关于超心理学重复验证纪录),这是预期的结果。第 6 阶段的零结果不会使第 0-5 阶段无效——核心框架的价值独立于预知是否存在。但它确实关闭了第 7 和第 8 阶段的大门。
零结果对框架意味着什么:ECI 明确允许第 6 阶段返回零结果的可能性。框架的推测性前沿(丛集 E)被设计为可修剪的。如果预知在可检测的水准上不发生,框架就修剪时间存取边(temporal-access edge)并继续使用其已验证的核心。一个在证据要求时能失去边的框架正在做科学。一个不能失去边的框架正在做神学。
预估时程:仅在更早的阶段完成之后。从第 0 阶段开始算起,如果所有更早的阶段成功,实际上为 8-15 年。
关键测试变量:时间存取(是/否)、H_i(个体检测表现)、C_N(协调复杂度)、基于 QRNG 的随机化。
第 7 阶段 —— 人类极端表型
测试什么:具有可测量的高协调指标(H_i,通过行为测试确立的)的个体是否展现出独特的感觉、发育、代谢、认知或适应度特征。
前置要求:成功的第 6 阶段——在未来目标实验中有可重复的、预先注册的高于概率表现的证据。如果第 6 阶段产出零结果,第 7 阶段不具正当性。
关键方法论约束:第 7 阶段必须以正确的顺序进行。错误的顺序是:从具有不寻常特征的族群(例如,盲人、具有神经差异的人、冥想者)开始,然后测试他们是否在预知任务中展现高于概率的表现。这是倒退的,因为它引入了关于「谁应该有天赋」的文化假设,并制造了巨大的多重比较问题(测试许多群体直到其中一个显示正面结果)。
正确的顺序是:
-
首先通过行为测试确立 H_i。 使用第 6 阶段方案,测试一个大型、未经筛选的群体。识别验证阶段表现可重复地高于概率的个体。这些个体具有高 H_i,由唯一重要的标准确立:行为证据。
-
然后表征表型。 对于已确认高 H_i 的个体,系统性地测量:
- 感觉特征:跨模态的标准心理物理测试(视觉、听觉、触觉、嗅觉、本体感觉)。高 H_i 个体在感觉上是典型的还是非典型的?
- 发育表型:发育史,包括任何感觉剥夺、神经事件或不寻常的发育轨迹。
- 代谢特征:静息代谢率、脑葡萄糖消耗(通过 PET 或类似方法)、睡眠架构、昼夜节律特征。
- 认知量测:标准认知测验组(智商、工作记忆、注意力、执行功能),加上领域特定量测(模式辨识、统计学习、时间处理)。
- 协调指标:使用第 0 阶段开发的方案,从神经数据(EEG、fMRI)测量的 V 和 kappa。神经协调复杂度是否预测 H_i?
- 适应度代理指标(fitness proxies):一般健康状况、压力反应、社会连结度、生殖适应度(如适用且合乎伦理)。
-
比较表型特征——高 H_i 与配对控制组(同年龄、同性别、同教育程度、同社经地位,但第 6 阶段表现在概率水准的个体)。
为什么顺序很重要:如果你从「盲人」开始并测试预知,你测试的是一个文化假说(盲先知原型),而不是科学假说。如果盲人个体在预知任务中得分处于概率水准,你对感觉特征与 H_i 之间的关系什么都没学到。如果他们的得分高于概率,你无法将预知效应与增强的常规感知(跨模态可塑性,cross-modal plasticity)区分开来,后者是一个已确立的常规现象(见 E1 第 2 节)。从行为表现开始、向表型表征推进可以避免这两个问题。
成功是什么样子:与高 H_i 相关联的可重复表型特征——一个区分高 H_i 个体与配对控制组的感觉、认知、代谢或神经特征模式。该特征必须是预先注册的,并通过独立重复验证。
失败是什么样子:高 H_i 与配对控制组个体之间没有可检测的表型差异。这意味着无论高于概率表现背后的机制是什么(如果第 6 阶段成功了),都不反映在任何被测量的表型变量中——一个令人困惑但诚实的结果。或者,如果在第 7 阶段的群体中没有个体展现可重复的高 H_i(即第 6 阶段的结果无法推广),那么第 6 阶段的结论必须被重新审视。
预估时程:仅在第 6 阶段成功之后。从第 0 阶段开始算起实际上为 10-20 年,且仅在整个路线图在每个先前阶段都产出正面结果的情况下。
关键测试变量:H_i(已验证的行为量测)、感觉特征、神经 V 和 kappa、表型表征。
第 8 阶段 —— 量子观察者
测试什么:ECI 框架是否产出一个明确不同于标准量子力学(standard quantum mechanics)的预测,关于观察者复杂度与测量结果之间的关系。
前置要求:成功的第 1-7 阶段,且有一个来自 ECI 的具体、定量的预测,不同于标准量子力学。目前,这样的预测不存在。
目前状况:标准量子力学预测测量结果取决于量子态和测量仪器,而非谁(或什么)在进行测量(见 Eq. 13,观察者零假设(observer null hypothesis),来自 F2)。一个光子不在乎它是被一个简单的光电二极体检测,还是被连接到 Nobel 奖得主大脑的人类视网膜检测。Born 定则给出 P(outcome) = |<psi|phi>|^2,与观察者复杂度无关。
ECI 的推测性前沿允许观察者复杂度可能影响测量统计量的可能性(观察者经验页面,D3),但它目前并未做出与标准量子力学不同的具体预测。观察者零假设(H_0:测量统计量与观察者无关)在 F2 上被列为标准量子力学的已确立预测,且 ECI 不予质疑。
什么会解锁第 8 阶段:从 ECI 框架出发的一个形式推导,产出一个关于观察者依赖测量统计量的具体、定量预测,该预测 (a) 与 Born 定则预测不同,(b) 指定在什么条件下偏差是可检测的,(c) 指定偏差的幅度,(d) 可以用当前或近未来的实验技术测试。
没有这样的推导,第 8 阶段就没有内容。你无法测试一个未被指定的预测。对「也许观察者复杂度影响量子测量」的适当科学回应是:推导预测、指定测试,然后进行测试。在第一步完成之前,第二步和第三步是不可能的。
成功会是什么样子:一个预先注册的实验展示,在物理设置被控制为完全相同的情况下,测量结果分布系统性地取决于观察者复杂度——拒绝 Eq. 13 中的 H_0。这将是物理学史上最非凡的实验结果之一,其重要性可与量子力学本身的发现相比。证据标准将相应地极端:多个独立实验室、多种测量类型、对抗性合作,以及达到数千或更高的 Bayes 因子。
失败是什么样子:确认 H_0——测量统计量与观察者无关,如标准量子力学所预测。这是迄今最可能的结果,且具有科学价值:它修剪了 ECI 网络的观察者复杂度影响物理的边,约束了框架的推测性前沿,并强化了它与已确立物理学的连结。
预估时程:不确定。第 8 阶段目前没有指定的预测,因此也没有指定的测试。它被列出是为了完整性,并为了明确表示 ECI 框架目前不质疑标准量子力学。如果一个具体预测最终被推导出来,时程将取决于所需的实验精度。
关键测试变量:观察者复杂度(操作化为 C_N 或类似指标)、测量结果统计量、Born 定则预测。
❺ 如果路线图成功:渐进式支持
如果路线图在每个阶段都产出正面结果,ECI 框架将获得渐进增强的支持——但随着阶段推进,支持的性质会发生质的变化。
第 0-2 阶段:概念验证。 此处的成功意味着 V-kappa 框架是复杂系统的有用分析工具。它对人工系统和特性完善的物理系统中的弱信号检测、涌现和持续性做出了正确预测。这是最小可行产品。即使后续阶段全都未能成功,一个经验证的、带有可操作粗粒化工具的 V-kappa 框架也将是对复杂系统科学的真正贡献。
第 3-4 阶段:生物相关性。 此处的成功意味着框架捕捉到了活体系统的某些真实特性——要么活体和非活体系统遵循相同的 V-kappa 动态(基底无关性),要么活体系统展现出框架可以表征的额外协调特征(生物特异性)。任一结果都显著地扩展了框架的范畴。
第 5 阶段:比较预测。 此处的成功意味着框架可以跨物种做出并确认预测——这是一个强测试,因为比较预测要求框架的变量(特别是 C_N)正在测量生物协调的某些真实面向,而非仅仅拟合系统内数据。
第 6 阶段:非凡延伸。 此处的成功——真正可重复的预知——对框架和更广泛的科学都是变革性的。但请注意:框架在第 0-5 阶段的价值独立于第 6 阶段。第 6 阶段的零结果不会追溯性地使核心框架无效。它修剪推测性前沿,这正是一个健康的理论所做的。
第 7-8 阶段:深层意涵。 这些阶段的成功将产生远超 ECI 框架的意涵,触及关于意识、时间和物理定律本质的基础问题。但这些阶段距离当前证据太远,推测其意涵为时过早。诚实的评估是:这些阶段可能永远无法到达,而这是完全可接受的结果。
关键洞察是路线图被设计为部分成功也有价值。如果框架在第 0-3 阶段验证成功但在第 4 阶段失败,它仍然是分析复杂系统的有用工具。如果它通过第 5 阶段验证但在第 6 阶段失败,它仍然是一个强大的比较框架。闸门结构意味着失败是信息性的,而非灾难性的——每次失败都准确地告诉你框架的预测力在哪里终止。
❻ 各阶段实验设计草案
本节为最初几个阶段提供更具体的实验设计概要,在这些阶段中实验可以被合理精确地指定。后续阶段则以框架而非详细设计的形式呈现,因为它们的具体内容取决于更早阶段的结果。
第 0 阶段草案:在耦合振荡器阵列中操作化 V
系统:一个由 N = 50 个耦合电子振荡器组成的阵列(例如,具有可调自然频率和耦合电阻的 Wien 电桥振荡器(Wien bridge oscillators))。
V 的操作化:V = 各振荡器自然频率分布的 Shannon 熵。H = -Sigma_i (p_i log p_i),其中 p_i 是自然频率落在第 i 个箱的振荡器比例。当所有振荡器具有相同频率时,V = 0(最小值)。当频率均匀分布在整个范围时,V = log(n_bins)(最大值)。
操控:通过调整设定每个振荡器自然频率的元件值来控制 V。低 V = 所有振荡器调校至几乎相同的频率。高 V = 频率均匀分布在宽广范围上。
kappa 的操作化:kappa = 平均相位相干性 = (1/N^2) Sigma_{i,j} |< e^{i(theta_i(t) - theta_j(t))} >_t|,其中 theta_i(t) 是振荡器 i 在时间 t 的相位,<...>_t 表示时间平均。当所有振荡器相位锁定时,kappa = 1(最大值)。当相位为随机时,kappa 趋近 1/sqrt(N)(有限 N 的最小值)。
操控:通过调整耦合电阻值来控制 kappa。低 kappa = 弱耦合(振荡器几乎独立)。高 kappa = 强耦合(振荡器倾向同步)。
信度评估:对相同物理配置测量 V 和 kappa 十次。报告变异系数(coefficient of variation)。可接受的信度:两个量测的 CV < 0.05。
第 1 阶段草案:V-kappa 交互作用预测弱信号检测
系统:与第 0 阶段相同的振荡器阵列。
任务:在所有振荡器的共同驱动中嵌入一个弱周期信号(振幅远低于振荡器的噪声基底)。信号具有已知频率 f_s 和振幅 A_s。运作 T 秒后,对集体输出(所有振荡器电压的总和)应用匹配滤波器(matched filter)以估计信号是否存在。
设计:完全因子设计:V 五个水准(极低、低、中、高、极高)x kappa 五个水准(极低、低、中、高、极高)= 25 个条件。每个条件 100 次试验(50 次信号存在、50 次信号不存在,随机化)。预先注册的主要分析:5x5 方差分析(ANOVA)对检测准确度(d-prime),测试 V x kappa 交互作用。
检定力分析(power analysis):基于先导数据或对效果量的合理估计。如果预期交互作用效果为 eta-squared = 0.06(中等),那么 N = 25 个条件 x 100 次试验 = 2500 次总试验,在 alpha = 0.05 时对交互作用测试提供 power > 0.99。
预先注册的预测:
- V 的主效果:显著,非单调(倒 U 形)。
- kappa 的主效果:显著,非单调(倒 U 形)。
- V x kappa 交互作用:显著,峰值在高 V、高 kappa 象限。
- 与随机共振基线的比较:最佳 V-kappa 条件下的 d-prime 超过仅使用噪声强度作为控制变量的标准随机共振模型所预测的 d-prime。
第 4 阶段草案:蚂蚁蚁群协调操控
系统:来自单一 Lasius niger(黑花园蚁)蚁群的工蚁,一个已被深入研究的模式物种。
任务:在具有多个混淆气味源(放置在随机位置的非营养性化学物质)的觅食竞技场中定位一个食物源(一小滴稀释蔗糖溶液)。食物信号很弱:蔗糖浓度稀释至接近该物种的检测阈值。
设计:三个条件(A、B、C 如上述第 4 阶段所描述),在试验间进行平衡。每个条件 N = 100 只蚂蚁,从同一蚁群抽取。每个条件进行 20 次独立试验,使用新的蚂蚁(以防止跨试验的学习混淆)。竞技场配置(食物位置、混淆物位置)在每次试验中随机化。
量测:
- 首次接触食物源的时间(分钟)。
- 在 60 分钟内找到食物的蚂蚁比例。
- 集体准确度:导向食物源 vs. 混淆物的觅食努力比例。
- 信息扩散速率(仅条件 B 和 C):从首次发现到 50% 蚁群知晓(以定向觅食衡量)的时间。
预先注册的预测:
- 条件 C(完整蚁群)比条件 A(隔离)更快且更可靠地找到食物,
p < 0.01。 - 条件 B(有限通讯)介于中间。
- 条件 C 的集体准确度量测超过条件 A 中个体准确度的总和——即集体大于其各部分之和。
❼ 连结到其他节点
-> 应用与未来(F1):F1 描述了如果 ECI 框架得到验证,它可以实现什么。F4 指定了验证序列。F1 中的三层应用结构直接对应到路线图阶段:第一层应用(已确立科学的延伸)对应第 0-2 阶段;第二层应用(以核心框架验证为前提)对应第 3-5 阶段;第三层应用(以丛集 E 验证为前提)对应第 6-8 阶段。一个应用只有在其对应的路线图阶段已被通过时,才具科学上的辩护力。
-> 可证伪性(F3):F3 建立了评估 ECI 主张的标准——五个陷阱、逐边的证伪表、证据层级。F4 将这些标准操作化为一个具体的实验序列。当 F3 说「如果 V 未能预测弱信号覆盖,修剪该边」时,F4 精确指定了如何测试 V 的预测:哪个系统、哪个方案、哪个统计测试、什么效果量构成『预测』。F3 提供了测试的哲学;F4 提供了测试的工程。
❽ 总结表:全部九个阶段(0-8)
| Stage | Name | What it tests | Key variables | Dependencies | What success looks like | What failure means | Status | |---|---|---|---|---|---|---|---| | 0 | 可操作化 | V、kappa、K、Q、Gamma 能否被测量? | V, kappa, K, Q, Gamma | 正式定义(F2) | 在 >= 2 个系统中发表可靠的测量方案 | 框架尚未可被经验测试 | 尚未开始 | | 1 | 常规验证 | V、kappa -> 弱信号回应 | V, kappa | 第 0 阶段 | V x kappa 交互作用预测检测优于基线,已重复验证 | 核心预测失败;框架失去经验基础 | 尚未开始 | | 2 | 模拟 / 人工系统 | ECI 预测在 ABM、振荡器网络、RNN 中成立 | V, kappa, G, S decomposition | 第 1 阶段 | 预先注册的预测在 >= 3 种人工系统中确认 | 框架相较于标准复杂系统模型不增加价值 | 尚未开始 | | 3 | 活体 vs. 非活体配对 | 活体系统是否展现额外的协调特征? | V, kappa, K, Q, Gamma | 第 1-2 阶段 | 基底无关性被确认,或生物特异性被表征 | 配对失败或结果无定论 | 尚未开始 | | 4 | 种内集体 | 协调(而非仅 N)是否增强集体能力? | V, kappa, collective K, G | 第 1-3 阶段 | 协调复杂度预测集体表现,N 保持不变 | 协调不增加超越聚合的集体价值 | 尚未开始 | | 5 | 跨物种比较 | C_N 是否预测跨物种的分布尾部? | C_N, V, kappa, distribution shape | 第 4 阶段 | P(H > theta | C_N) 在控制体型和感觉敏锐度后随 C_N 增加 | C_N 相较于更简单的比较度量不增加预测力 | 尚未开始 | | 6 | 未来目标实验 | 尚未被因果决定的信息能否被存取? | QRNG target, H_i, C_N | 第 1-5 阶段 + 可重复的异常 | 验证阶段高于概率的表现,BF > 100,独立重复验证 x2 | 零结果;推测性前沿被修剪;第 7-8 阶段不具正当性 | 尚未开始 | | 7 | 人类极端表型 | 高 H_i 个体有何特征? | H_i, sensory profile, neural V/kappa, phenotype | 第 6 阶段 | 高 H_i 的可重复表型特征 | 无可检测的表型差异;机制仍然未知 | 尚未开始 | | 8 | 量子观察者 | 观察者复杂度是否影响测量统计量? | Observer C_N, Born rule predictions | 第 1-7 阶段 + ECI 的具体量子力学预测 | H_0 被拒绝:观察者依赖的测量统计量 | H_0 被确认:标准量子力学成立;观察者边被修剪 | 尚未开始;目前无预测存在 |
如何阅读此表:每行的「Dependencies」栏显示在此阶段具正当性之前必须通过哪些更早的阶段。「Status」栏反映研究计划的当前状态:截至撰写本文时,尚无任何阶段已启动。整个路线图是前瞻性的——是一份计划,不是一份报告。
最重要的栏位是「What failure means」(失败意味着什么)。 一个无法事先指定什么算失败的框架,不是在做科学主张。ECI 可以。在每个阶段,失败都是被定义的、有信息量的,且具有后果的。