ECI
◇ 超越通道·E2

预知测试

○推测性v1.0

❶ 核心问题

未来的信息能否在正常因果可及之前被取得?

本页探讨一个科学框架所能提出的最非凡主张之一:在时间 t_1 才确定其内容的信息,是否有可能在更早的时间 t_0 被某系统以统计显著的方式取得。此主张之所以非凡,是因为它直接违反了标准因果箭头——这项原则深植于物理学和生物学的每一个既有分支:因先于果,信息沿时间向前流动。

在正式讨论此主张之前,必须先厘清一个关键区分。「预测未来」可以有两种截然不同的含义:

**一般预测(ordinary prediction)**利用当前数据建立模型并产生预测。气象学家将目前的大气观测值输入流体力学方程式来预报明天的天气。西洋棋引擎评估当前棋盘局面并计算未来可能的盘面。羚羊从微妙的视觉和嗅觉线索侦测到潜行的捕食者,在攻击发生前便奔逃。在每一个案例中,用以产生预测的信息在当下已经可得——它是现有数据,而非未来数据。这种预测固然令人印象深刻,但不需要违反因果律。

非凡预测(extraordinary prediction)——本页所探讨的类型——则牵涉到取得尚未由任何现有原因所决定的信息。目标事件尚未发生。指定目标的信息尚不存在于任何物理系统中。无论多么精密的模型,都无法从现有数据中提取答案,因为答案尚未编码于宇宙的当前状态。若某系统在这些条件下能可靠地表现出高于概率的水准,标准的时间因果论述便需要修正。

本页探讨的是第二种预测是否曾被证实。截至撰文时,简短的答案是:否——尚未达到此主张所要求的证据标准。

范畴区分——E2 与 E4:本页(E2)问的是:「未来的信息能否在正常因果可及之前被取得?」这是一个关于特定现象是否发生的经验问题。时间架构(E4)问的是不同的问题:「在通道内,时间的结构是什么?」E4 探讨的是 ECI 框架中时间排序的理论本质。E2 设计行为测试;E4 检视时间本身的存有论地位。两页相互关联但处理的是不同的问题。

页面状态:本页归类为「推测性」,因为核心主张——真正的预知(precognition)确实发生——并无经过严格审视后仍存续的已确认经验支持。可测试性为「直接」,因为此主张可透过直观的行为实验来检验:呈现一个在受试者锁定回应之后才产生的目标,并测量回应准确率是否超过概率水准。挑战不在于设计测试,而在于达到此非凡主张所要求的严谨程度。

❷ 具体案例

一般预测:令人印象深刻但并不神秘

人类和其他动物都是预测机器。大脑的预测编码(predictive coding)架构(Rao & Ballard, 1999; Clark, 2013)持续产生关于即将到来之感觉输入的预测,而大量神经处理都致力于侦测这些预测何时出错。这不是比喻,而是对皮质层级如何处理信息的计算描述。

一些看似不可思议的一般预测案例:

  • 天气预报利用物理模型从当前观测值中提取未来大气状态。现代的 5 天预报与 1980 年的 1 天预报一样准确(Bauer et al., 2015)。这是基于现有数据的预测,而非取得未来数据。

  • 专家的模式辨识。 西洋棋特级大师在数秒内评估的棋盘局面,新手花数分钟也无法评估。经验丰富的医师从学生遗漏的微妙症状模式中做出诊断。消防员回报「就是知道」地板即将塌陷。在每个案例中,大量训练建立了精密的内部模型,从现有线索中提取预测性信息(Klein, 1998)。这些预测快速且有时是无意识的,但都植基于透过学习模型处理的现有数据。

  • 动物预警。 在许多文化中,动物在地震前行为异常的报告广为流传。所提出的机制完全是寻常的:动物可能侦测到 P 波(其传播速度比具破坏性的 S 波更快)、次声波、地下水化学变化,或微妙的电磁前兆(Wikelski et al., 2020)。这些都是现在式的物理信号,而非未来信息。

  • 无意识线索侦测。 Iowa 赌博作业(Iowa Gambling Task)(Bechara et al., 1997)显示,受试者在能有意识地说出哪些牌堆不利之前,便已对「坏」牌堆产生皮肤电反应。这看起来像是对未来的直觉,但实际上是自主神经系统侦测到近期经验中的统计模式——现有数据,在意识觉察阈值之下被处理。

以上每一个案例都是基于现有信息的预测。 预测可能是快速的、无意识的、且准确得令人印象深刻,但用以产生预测的信息在预测当时就已经可得。这些案例中没有任何一个需要或提供了取得尚未确定之信息的证据。

「算命师」主张:一个假说,而非证据

在各种文化和历史中,某些人声称——或被归因为——能预见尚未发生的事件。神谕、先知、算命师和占卜者几乎出现在每一个人类文明中。这些文化叙事是关于人类信念和实践的真实资料。但它们不是所描述能力为真的证据。

预知主张的文化普遍性告诉我们一些关于人类认知的重要讯息:我们觉得预见未来这个想法极为引人注目。认知科学(cognitive science)提供了充分支持的解释(Kahneman, 2011):

  • **确认偏误(confirmation bias)**确保准确的预测被记住,而不准确的预测被遗忘。一位做出 100 个预测、其中 5 个成真的算命师,会因那 5 次命中而被记住。
  • 巴纳姆效应(Barnum effect)(Forer, 1949)证明,人们会接受模糊、笼统的人格描述,认为它们独特地适用于自己。大多数算命都依赖足够笼统以适用于几乎任何人的陈述。
  • **后见之明偏误(hindsight bias)**导致人们事后调整对预测的记忆,使其更符合结果。「我早就知道会那样」是一种常见且充分记录的认知扭曲(Fischhoff, 1975)。
  • **基率忽略(base rate neglect)**导致人们过度看重某个正确预测的惊人程度,而不考虑做了多少错误预测或该结果纯凭概率发生的可能性有多高。

文化中的预知主张是待检验的假说,而非待解释的证据。对「每个文化都有算命师」的正确科学回应不是「预知是怎么运作的?」而是「在控制条件下,预知究竟会不会发生?」这是非常不同的问题,混淆它们是确认偏误的温床。

❸ 已确立的科学

三组既有知识与评估预知主张直接相关:统计检定方法论、超心理学的重复验证纪录,以及异常信念的认知科学。

统计检定方法论(已确立)

评估任何声称的预测未来事件能力都需要严格的统计检定。核心原则是已确立且无争议的:

虚无假设检定(null hypothesis testing)。 任何预知测试的虚无假设是受试者表现处于概率水准。对于二元强迫选择作业(例如:「目标会在左边还是右边?」),虚无假设指定命中率为 0.5。检定问的是:观察到的命中率是否与 0.5 足够远,以至于我们可以拒绝虚无假设?

多重比较校正(multiple comparison corrections)。 如果你测试许多受试者、许多试次或许多结果指标,有些会纯粹因概率而产生极端结果。在 N 个独立检定中,至少有一个产生极端结果(达到 p_extreme 阈值)的概率为:

P(at least one extreme result) = 1 - (1 - p_extreme)^N

这就是多重检定陷阱。如果你以 p_extreme = 0.05 测试 1,000 人,预期约有 50 人纯粹因概率而达到或超过 p < 0.05 的阈值。如果你接着公布这 50 个「命中」而不提 950 个「未命中」,结果看起来令人印象深刻,但完全符合虚无假设。每当进行多重检定时,多重比较校正——Bonferroni、Benjamini-Hochberg 或类似程序——是强制性的(Benjamini & Hochberg, 1995)。

效果量与统计检力(effect size and power)。 统计显著性本身并不足够。一个效果量极小的统计显著结果(例如命中率 = 0.501 而非 0.500)在统计意义上可能是「真的」,但在实务意义上毫无意义。相反地,统计检力不足的研究可能无法侦测到真正的效果。适当的实验设计需要事前的检力分析(prospective power analysis):在收集数据之前,计算需要多少受试者和试次才能以足够的概率侦测到指定大小的效果(Cohen, 1988)。

预先注册(preregistration)。 探索性研究与验证性研究的区分至关重要。探索性分析——在数据中搜寻有趣的模式——对于产生假说很有价值。但探索性发现必须接着在独立的、预先注册的验证性研究中进行检验。在预先注册的研究中,假说、样本数、停止规则和分析计划在数据收集开始之前便已指定并公开纪录。这防止了 p 值操弄(p-hacking)、可选停止(optional stopping)和事后假说选择——这些都会膨胀伪阳性率。

超心理学的重复验证纪录(已确立:重复验证失败)

最著名的现代预知研究计划是 Daryl Bem 的「感知未来」(Feeling the Future)(Bem, 2011),报告了九项实验,其中受试者似乎在刺激呈现之前便对刺激做出反应。该论文发表于 Journal of Personality and Social Psychology,引起了巨大关注。

随后的重复验证纪录才是评估此主张的关键:

  • Ritchie, Wiseman, & French (2012) 对 Bem 最稳健的实验(逆向促发)进行了三次预先注册的重复验证。均未重现原始效果。
  • Galak, LeBoeuf, Nelson, & Simmons (2012) 进行了七项实验(总 N > 3,000),尝试重现 Bem 的结果。在所有实验中均未发现预知的证据。他们的后设分析效果量估计值与零无法区分。
  • Wagenmakers, Wetzels, Borsboom, & van der Maas (2011) 使用贝氏方法(Bayesian methods)重新分析 Bem 的原始数据,发现在套用适当先验概率后,证据压倒性地支持无预知的虚无假设。
  • 一项大规模、透明的重复验证计划(N > 26,000 名参与者、> 420,000 试次)在预先注册的验证性测试中未能重现 Bem 原始预测的预知效果。初步发现似乎与弹性分析实务和发表偏误的结合一致,而非真正的现象。

更广泛的模式。 Bem(2011)是最著名的近期案例,但它符合超心理学研究长达数十年的模式。Rhine 在 1930 至 1960 年代的猜卡实验、Honorton 在 1970 至 1980 年代的超感官剥夺研究(ganzfeld studies),以及各种其他典范,都遵循了类似的轨迹:在宽松控制下的初始正面结果,随后在控制收紧和独立重复验证尝试中效果递减或归零(Alcock, 2003; Hyman, 1985; Hansel, 1980)。

这告诉我们什么。 重复验证纪录并未证明预知不可能。它证明了没有任何预知效果能经受住此主张所要求的审视水准。 这是一个关键区分。证据的缺席不是缺席的证明——但当多次统计检力充足、预先注册的寻找证据尝试都得到空结果时,理性的回应是对此主张赋予极低的概率,同时对未来的证据保持开放。

异常信念的认知科学(已确立)

认知心理学(cognitive psychology)的研究解释了为什么即使缺乏预知的证据,人们仍然相信预知:

  • 虚幻相关(apophenia)——在随机数据中感知有意义模式的倾向——是人类认知中充分记录的特征(Brugger, 2001)。当人们遇到随机序列时,他们系统性地低估巧合的概率,并高估丛集和模式的意义性。
  • 连结谬误(conjunction fallacy)(Tversky & Kahneman, 1983)证明,人们会判断具体、生动的情境比一般情境更可能发生,即使这违反了基本概率理论。一个关于特定事件的生动预知梦感觉比模糊的不安更重要。
  • **选择性记忆(selective memory)**确保预感「成真」的少数几次被生动地记住,而预感失败的多次被遗忘。经过一生的时间,这在大量预测样本上产生确认偏误的作用,创造出强烈的主观预知能力印象,而这完全可被确认偏误所解释。

状态:充分确立。产生预知信念的认知机制已被彻底记录和实验确认。它们不能证明预知为假,但提供了一个完整的解释,说明为什么即使预知不存在,预知信念仍然普遍。

❹ ECI 框架诠释

SPECULATIVE —— 本节的所有内容都超出了当前科学证据的范围。此处不应被解读为关于世界如何运作的主张。这是对 ECI 框架在其推测性前提为正确的情况下会预测什么的形式化阐述。

一般预测与非凡预测:ECI 划线的位置

ECI 框架明确区分两种预测类型,且主要关注第二种:

Type O(一般型)。 现有数据 -> 模型 -> 预测。信息在预测时已可得。模型可以是显式的(天气模拟)或隐式的(由经验训练的神经网络)。预测可以是有意识的(书面天气预报)或无意识的(基于模式辨识的直觉)。在每个案例中,用以产生预测的信息在预测时因果上已可得。ECI 对 Type O 预测没有新颖的见解——既有科学已充分解释。

Type X(非凡型)。 在 t_1 > t_0 才确定的信息在 t_0 以统计方式可及。目标尚未产生。宇宙中没有任何物理系统在回应时编码了目标。若某系统在这些条件下能可靠地表现出高于概率的水准,标准因果论述便需要修正。

ECI 的推测性立场是:此框架容许 Type X 预测的可能性,但并未主张它确实发生。具体而言:

如果 ECI 的通道(Channel)模型是正确的(参见通道,B1),且如果通道内的时间排序是该通道维度架构的涌现属性(emergent property),而非现实的基本特征,那么严格的因果箭头(因先于果、信息仅向前流动)可能是我们特定通道的属性,而非普遍定律。在此诠释下,Type X 预测不会违反因果律本身——它会违反某个特定通道的因果结构,暗示从时间排序结构不同的领域发生了泄漏。

这纯属推测。 没有支持它的证据。之所以在此呈现,是为了明确说明 ECI 框架若被推到其逻辑极端会预测什么,以便该预测可以被检验,且极有可能被证伪。

多重检定公式:为什么概率本身就会产生「预知」

要理解为什么即使没有预知,预知主张仍然会出现,考虑一个简单的玩具模型。

假设你让 N 个人进行一项二元预测作业(例如:「预测下一张图片会是愉快的还是不愉快的」),每人 k 次试次。在虚无假设(无预知)下,每个人的命中率遵循概率 p = 0.5 的二项分布(binomial distribution)。

单一个人的命中率纯因概率而达到或超过某阈值 h_extreme 的概率为:

p_extreme = P(hits >= k * h_extreme | p = 0.5) = sum from j = ceil(k * h_extreme) to k of C(k, j) * 0.5^k

N 人中至少一人纯因概率而达到此极端命中率的概率为:

P(at least one extreme) = 1 - (1 - p_extreme)^N

具体数字:若 k = 100 次试次且 h_extreme = 0.60(60% 准确率),则 p_extreme 约为 0.028。若你测试 N = 100 人,P(at least one extreme) = 1 - (1 - 0.028)^100 = 约 0.94。你的 100 位受试者中,至少有一人纯因概率而达到 60% 或更高准确率的机会为 94%。测试 1,000 人,你几乎可以保证找到几位看起来具有预知能力的人。

这不是一个次要的统计注脚。它是预知研究中的核心方法论挑战。 任何从初始筛选中辨识「天赋」受试者、然后报告其分数而未校正筛选过程的研究,在方法论上都是无效的,无论个别分数看起来多么令人印象深刻。

ECI 的推测性延伸

如果 ECI 的通道架构及其关于非固定时间排序的推测性概念是正确的,该框架会对预知做出什么预测?

诚实的答案是:非常少具体的预测。ECI 最多能说的是:

  1. 如果时间取得是可能的,它将是一个极其微弱的统计效果——回应分布中的轻微偏移,而非戏剧性的能力。
  2. 此效果(若存在)可能受被测试系统的协调复杂度所调节(在 ECI 的记号中为较高的 V 和中等的 kappa,见 C1)。
  3. 个体差异会产生一个分布,其中某些人得分较高、某些人较低——这恰好也是概率本身会产生的模式(见上述多重检定公式)。

第 3 点至关重要。 「某些个体会得分较高」的预测不是有意义的科学预测,因为这也是虚无假设的预测。ECI 若没有极大的样本、预先注册的方案以及分离的发现/验证阶段,便无法区分其预测的信号与概率变异的杂讯。该框架对此限制是诚实的。

❺ 如果这是真的……

如果真正的 Type X 预测曾被证实——如果在 t_1 才确定的信息被证明在 t_0 以统计方式可及,且条件严格排除了所有替代解释——其后果将是科学史上最深远的之一。

因果律将需要改写。 标准因果框架假设结果在时间上跟随原因。此假设深植于物理学的每一个分支(热力学、电动力学、广义相对论、量子场论)以及实验科学的哲学基础(Pearl、Woodward 等人的介入式因果理论)。证实真正的时间信息取得不仅仅是为物理学添加一个注脚,而是需要修正因果推理的基础结构。

记忆与预知之间的区分将会崩解。 如果信息能逆时间流动,过去与未来之间的不对称性便成为我们特定物理情境的局部特征,而非普遍定律。记忆(取得过去信息)和预知(取得未来信息)都将是时间信息取得的实例,仅在方向上有所不同。记忆与预见之间深刻的主观不对称性——一个感觉自然、另一个感觉不可能——将是我们神经架构的特征,而非现实的特征。

实验科学本身将受到影响。 控制实验的逻辑假设未来结果尚未确定且不能影响当前状态。如果此假设是错误的,假设检定、随机对照试验和因果推论的整个框架都需要重新审视——不一定是抛弃,但肯定需要对关于时间排序的隐藏假设进行仔细审查。

这些后果都未被触发,因为该现象尚未被证实。 本节的存在是为了明确说明什么是利害攸关的,以便读者理解为什么接受预知主张的证据门槛必须相应地高。关于因果律的非凡主张需要非凡的证据——不是因为科学家天性保守,而是因为接受伪阳性的推论和实务后果将会极其巨大。

❻ 如何测试?

关于预知主张的好消息是它们可以直接测试。坏消息是这类测试的历史充斥着产生模棱两可结果的不充分方案。本节描述一个旨在避免最常见陷阱的方案。

核心方案:具有时间隔离的独立随机强迫选择

设计严谨预知测试的关键洞察是:目标必须在受试者回应时确实是未确定的。 这意味着:

  1. 受试者的回应先被记录并锁定。 受试者做出预测(例如「左」或「右」),且回应在任何目标产生之前被写入不可变的、带时间戳的日志。

  2. 量子随机数产生器(QRNG)或独立种子的硬件/密码学随机化系统在之后产生目标,仅在回应锁定后才产生。 目标由量子随机数产生器(QRNG)产生,或者在 QRNG 不可用时,由独立种子的硬件或密码学随机化系统产生——核心要求是回应锁定后的独立目标产生且无信息泄漏,而非特指量子随机性。QRNG 是首选,因为伪随机数产生器(PRNG)是确定性演算法:其输出完全由种子状态决定,而种子状态在试次开始前已存在。使用 PRNG 意味着目标信息在技术上先于受试者的回应而存在,造成使测试无效的漏洞。根据量子力学,QRNG 的输出在量子测量发生前是真正未确定的。独立种子的硬件随机数产生器(例如基于热杂讯的),其种子仅在回应锁定后才产生,在 QRNG 硬件不可用时提供较弱但可接受的替代方案。

  3. 受试者与 QRNG 之间的物理隔离。 QRNG 必须与受试者物理隔离——理想情况下在不同的房间或建筑中,在回应锁定之前受试者环境与 QRNG 环境之间没有电子通讯。这防止了任何可设想的现时信息泄漏。

  4. 不可变的带时间戳日志。 受试者的回应和 QRNG 的目标都必须以密码学时间戳记录(例如区块链锚定或可信第三方时间戳),使事后无法更改任何纪录。这防止了对 QRNG 输出的「目标在技术上先已存在」论点,也防止了对回应纪录的任何追溯修改。

  5. 自动化、实验者盲操作。 实验者在试次期间不得知道目标。理想情况下,整个试次序列是自动化的,在受试者的回应和目标产生之间没有人类介入。

发现与验证:强制分离

这是预知研究中最重要的单一方法论要求,也是最一贯被违反的要求。

发现(探索性)和验证(验证性)阶段必须严格分离:

  • 发现阶段:测试一大样本的受试者。辨识那些得分超过指定阈值的人。此阶段产生假说(「247 号受试者可能具有高于概率的表现」),但什么也不能证明,因为多重检定公式保证某些受试者会纯因概率而得高分。

  • 验证阶段:仅取发现阶段中辨识出的受试者。在新的场次中、以新的试次集、使用预先注册的方案(假说、样本数、停止规则和分析计划在数据收集前指定)再次测试他们。只有验证阶段的表现才算作支持或反对预知的证据。

此分离必须是密不透风的。发现阶段的数据不能与验证阶段的数据在主要分析中合并。验证阶段的假说必须在验证数据收集开始前注册。在这一点上没有弹性:合并发现和验证数据,或在看到验证结果后调整验证假说,会使整个程序无效。

由独立实验室进行的预先注册重复验证

即使单一实验室在验证阶段获得正面结果,在独立重复验证之前也不应接受该结果。「独立」意味着:

  • 不同的实验室、不同的实验者、不同的 QRNG 硬件。
  • 在数据收集前商定的预先注册重复验证方案。
  • 基于原始效果量估计的检力分析来决定重复验证样本数。
  • 所有数据无论结果如何都公开可得。

心理学的重复验证危机(Open Science Collaboration, 2015)已证明,在单一实验室中报告的效果经常无法在其他地方重现。对于像预知这样非凡的主张,重复验证要求是不可谈判的。

所需专业

任何严肃的预知研究计划至少应涉及:

  • 实验心理学家:设计行为方案、控制需求特性、感觉泄漏和反应偏误。
  • 生物统计学家:指定统计分析计划、进行检力分析、实施多重比较校正,并使用频率主义和贝氏方法评估证据。
  • 后设科学/重复验证专家:确保预先注册完整、发现/验证分离得以维持、方案符合当前可重复性的最佳实践,以及研究在数据收集前已在公开试验登录中注册。
  • 比较认知研究者:如果方案扩展到非人类动物(这可以提供较少受需求特性和文化期望污染的证据),动物行为测试的专业知识是必需的。

正面结果会是什么样子

真正的正面结果需要:

  1. 验证阶段(而非发现阶段)中高于概率的表现。
  2. 效果量的置信区间排除零。
  3. 贝氏分析(Bayesian analysis)产生的贝氏因子(Bayes factor)强烈支持预知假说而非虚无假设(例如 BF > 100)。
  4. 至少由两个实验室独立重复验证。
  5. 在对抗性审查后未发现方法论人为结果。

负面结果会是什么样子——以及它意味着什么。 如果统计检力充足、预先注册的测试一致发现表现与概率水准无法区分,理性的结论是所声称的效果在可侦测的水准上不存在。这不能证明预知在原则上不可能,但它意味着如果预知存在,它太微弱而无法在科学上有用,甚至无法用当前方法在科学上被侦测到。

❼ 连结到其他节点

-> 观察者压缩(D4):D4 确立了每个观察者都会压缩现实——投影 Pi_O 是有损的。如果时间信息是观察者投影所压缩的维度之一,那么时间的表面上单向性(我们记得过去但不记得未来)可能是我们压缩方案的特征,而非现实本身的特征。D4 提供了形式化框架(观察作为压缩);E2 问的是时间压缩具体而言是否可能不完整或有泄漏。D4 的核心主张有充分支持;E2 的延伸是推测性的。

-> 跨通道取得(E1):E1 检视信息是否能跨越通道边界的一般问题。E2 是一个特定案例:如果时间排序是特定通道的特征,那么取得未来信息便是一种跨通道取得的形式——触及在当前通道的时间结构中因果上不可及的信息。E1 提供了评估非凡信息取得主张的一般四层框架;E2 将该框架应用于时间案例。两者都是推测性的。如果 E1 的结论是跨通道取得不会发生,那么 E2 的时间版本也不会发生。

-> 灵魂假说(E3):E3 问的是信息向量是否能独立于其物理载体而持续存在。如果时间取得是可能的,它可能涉及不受限于当前时刻物理基质的信息结构——与 E3 关于基质独立性问题的连结。两个主张都是推测性的。连结在于 E2 和 E3 挑战了标准物理论述的不同面向:E2 挑战时间排序,E3 挑战基质依赖性。两者都没有经验支持。

-> 时间架构(E4):E4 问的是「在通道内,时间的结构是什么?」——一个关于时间排序之存有论地位的理论问题。E2 问的是「未来的信息能否被取得?」——一个关于特定现象是否发生的经验问题。此区分很重要:E2 可以在不解决 E4 的情况下被回答(否定地),而 E4 可以在没有任何正面 E2 结果的情况下在理论上被探索。E4 提供了理论脉络,在此脉络中正面的 E2 结果(如果曾经出现)需要被诠释。E2 为 E4 的理论分析提供了潜在的经验输入。

❽ 数学细节

二元强迫选择预知测试的虚无假设(已确立的统计学)

在二元强迫选择作业(两个等概率结果)中,虚无假设为:

H_0: p = 0.5

其中 p 是受试者在任何给定试次中回应与目标匹配的概率。

在 H_0 下,k 次试次中的命中数遵循二项分布:

P(X = j | H_0) = C(k, j) * 0.5^k

其中 C(k, j) = k! / (j!(k-j)!) 为二项系数(binomial coefficient)。

对于大的 k,二项分布可以用平均数 mu = k/2、标准差 sigma = sqrt(k)/2 的常态分布良好近似。受试者的 z 分数为:

z = (observed hits - k/2) / (sqrt(k)/2)

标准显著性检定问的是 |z| 是否大到足以在指定的 alpha 水准下拒绝 H_0(例如 alpha = 0.05,对应于双尾检定的 |z| > 1.96)。

状态:标准频率主义统计学。此处无新颖或有争议之处。

多重检定校正(已确立的统计学)

当进行 N 个独立检定时,至少有一个纯因概率而超过显著性阈值的结果之概率为:

P(at least one false positive) = 1 - (1 - alpha)^N

对于 alpha = 0.05 和 N = 20:P = 1 - 0.95^20 = 约 0.64。在 alpha = 0.05 下进行 20 个独立检定,至少有一个伪阳性的概率为 64%。

Bonferroni 校正将每次检定的显著性水准调整为 alpha/N,确保族群错误率(family-wise error rate)维持在 alpha。对于 N = 20 和 alpha = 0.05,每个个别检定必须达到 p < 0.0025 才能被宣告为显著。这是保守的(它控制的是即使一个伪阳性的概率),但被广泛使用。

Benjamini-Hochberg 程序(Benjamini & Hochberg, 1995)控制的是伪发现率(false discovery rate, FDR)而非族群错误率。它较不保守且更有检力,适合在某些伪阳性可接受、只要伪发现的整体比例受到控制的情况下使用。

应用于预知筛选:如果一项研究筛选了 1,000 名受试者并辨识出前 50 名表现者进行进一步测试,发现阶段的结果完全符合虚无假设,除非随后的验证阶段(使用预先注册的方案和独立数据)确认高于概率的表现。筛选本身不能证明任何关于预知的事情,无论前几名的发现阶段表现看起来多么令人印象深刻。

贝氏分析:贝氏因子(已确立的统计学)

贝氏分析提供了虚无假设显著性检定的替代方案,直接比较两个竞争假说的证据:

BF_10 = P(data | H_1) / P(data | H_0)

其中 H_0 是虚无假设(p = 0.5),H_1 是替代假说(p 在指定方向上偏离 0.5)。贝氏因子 BF_10 = 100 意味着数据在 H_1 下的概率是在 H_0 下的 100 倍。

Wagenmakers et al.(2011)将此方法应用于 Bem(2011)的原始数据,发现贝氏因子接近 1(H_0 和 H_1 的证据大致相等)或偏向 H_0,取决于 H_1 的先验概率选择。这说明了一个关键要点:在套用合理先验概率的贝氏分析下,Bem 结果在频率主义检定下的表面统计显著性大致消失了。

为什么贝氏分析在此很重要:对于非凡主张,H_1 的先验概率非常低。贝氏分析自然地纳入了这一点,要求数据必须相应地强大才能克服低先验。频率主义显著性检定不纳入先验概率,这就是为什么预知研究中「显著」的 p 值所承载的证据份量低于同一 p 值用于一般假说时的份量。

关键引用文献

| Reference | Result | Relevance to E2 | |---|---|---| | Bem (2011) | 报告了九项暗示预知效果的实验 | 著名的正面主张;随后的重复验证未能重现 | | Ritchie, Wiseman, & French (2012) | 对 Bem 的逆向促发进行三次预先注册的重复验证;虚无结果 | 直接未能重现 Bem 最稳健的实验 | | Galak et al. (2012) | 七项实验(N > 3,000)尝试重现 Bem;虚无结果 | 大规模重复验证失败;后设分析效果量与零无法区分 | | Wagenmakers et al. (2011) | 对 Bem 数据的贝氏重新分析;贝氏因子偏向虚无假设 | 证明表面显著性在贝氏分析下消失 | | Open Science Collaboration (2015) | 大规模重复验证计划;许多已发表的心理学效果未能重现 | 与非凡主张相关的重复验证危机的更广泛脉络 | | Benjamini & Hochberg (1995) | 伪发现率控制程序 | 筛选研究中多重检定的必要统计校正 | | Cohen (1988) | 检力分析方法论 | 决定预知测试中适当样本数的基础 | | Rao & Ballard (1999); Clark (2013) | 预测编码:大脑作为预测引擎 | 解释一般预测而不需要取得未来信息 | | Bechara et al. (1997) | Iowa 赌博作业:在有意识觉察之前的无意识风险选择学习 | 证明无意识模式辨识(一般预测)而非预知 | | Klein (1998) | 专家中的辨识引导决策 | 解释专家「直觉」为对现有数据的快速模式匹配 | | Kahneman (2011) | 认知偏误:确认偏误、后见之明偏误、基率忽略 | 解释为什么即使预知不为真,预知信念仍然持续 | | Forer (1949) | 巴纳姆效应:接受模糊人格描述为个人准确的 | 解释算命的有效性而不需要预知能力 | | Fischhoff (1975) | 后见之明偏误:对已记忆预测的追溯调整 | 解释为什么过去的「预测」看起来比实际更准确 | | Brugger (2001) | 虚幻相关:在随机数据中感知模式的倾向 | 解释在随机事件中的主观预知体验 | | Alcock (2003); Hyman (1985); Hansel (1980) | 超心理学回顾:控制收紧时效果递减 | 预知主张在审视下失败的历史模式 |

→

连结到其他节点

讨论

v1.0

以下留言对应本页的 v1.0 版本。当内容更新时,会建立新的讨论串,确保留言始终对应您所看到的版本。

预知测试 | 协调存在论