天赐范式第121天(第二篇):干预实验的前置条件审查——施工图上的四个缺口
摘要:第121天第一篇给出了RBM干预实验的技术规范草案——结构干预、稀疏扰动、硬阈值判定。但草案不是蓝图,蓝图上的每一个参数都需要前置条件支撑。121-2审计四个关键缺口:①
S_source真值代理的构造合法性(PGO波密度+皮层激活梯度的文献依据);②稀疏边选择策略的方法论对比(随机vs频率匹配vs协方差驱动);③含U的RBM训练收敛性(均值场迭代在稀疏同层连接下的可行性);④样本量与统计功效(20名受试者能否检出Δr>0.3的效应)。审计结论:四个坑中两个可立即填平(样本量、稀疏边策略),一个需敏感性分析(S_sourceα参数),一个存在工程风险(含U的RBM收敛性)。121-1的实验设计在补完这三项审查后可进入预实验阶段。
关键词:天赐范式 | 前置条件审查 | S_source真值 | 稀疏边策略 | 均值场收敛 | 统计功效
系列索引:第121天第一篇《RBM干预实验怎么干》v1.1 →本文(第121天第二篇)
免责声明:本文为理论推演与工程审查,不构成实际实验方案。文中涉及的文献引用、统计功效计算、收敛性分析均为基于公开文献和理论模型的初步审查,实际实验需经领域专家论证和预实验校准。
版本:v1.1
日期:2026-07-31
关联:第121天第一篇、第120天双篇
新公式:0个(本文不引入新算子/新公式,是对121-1工程草案的前置条件审计)
δ领域计数:N=51,δ≈0.77(1-e⁻⁵¹/³⁵)
来源说明:本文是对121-1中四个工程前置条件的合法性审计。Cohen’s q效应量基于Fisher z变换标准定义(Cohen, 1988);统计功效计算使用G*Power 3.1配对t检验模型;稀疏图收敛理论参考Ravikumar et al. (2006)Annals of Statistics。
一句话:121-1画了施工图。121-2审施工图上的四个缺口——审完才知道哪些能立即开工,哪些还得再画一圈。
原则声明:本文基于v7.0弹药库(129算子/42+公式),不引入新算子/新公式。本文是对121-1中四个工程前置条件的合法性审计——用算子流的监察框架(Con/ρ/δ/λ/C²)审视每一个坑位的填充质量。
算子层映射:
| 算子流层级 | 算子/机制 | 本文角色 |
|---|---|---|
| 锚定层 | Ξ(#1) | 锚定四个坑位的审查标准 |
| 判定层 | Σ(#12)/Λ(#10)/τ(#11) | Σ度量每个坑位的偏差;Λ预警风险等级;τ判定坑位处置 |
| 监察层 | Con/ρ/δ/λ/C² | Con审查K1~K4的一致性;δ(N=51, δ≈0.77)审查覆盖领域计数 |
| 调节层 | R(#59) | 调节α扫描区间、策略选择、样本量调整 |
〇、引言:图纸画完了,但图纸上有问号
121-1给出了RBM干预实验的完整草案:
- 干预对象:同层稀疏连接(ε=10%),结构干预而非参数干预
- 对照组:标准RBM(
[Θ,Γ]=0) - 实验组:稀疏同层连接RBM(
[Θ,Γ+Γ']≠0) - 判定阈值:
r_ctrl > 0.5,Δr > 0.3(p < 0.01)为因果证实
但草案里有四个未填的坑:
| 坑位编号 | 坑位内容 | 121-1状态 | 风险等级 |
|---|---|---|---|
| K1 | S_source真值代理:PGO密度+皮层梯度的α=0.6有无文献依据? | 暂定 | 高 |
| K2 | 稀疏边选择策略:频率匹配vs随机选择,哪个更合法? | 建议做交叉验证 | 中 |
| K3 | 含U的RBM训练:均值场迭代在稀疏U下是否收敛? | 伪代码示意 | 高 |
| K4 | 样本量:20名受试者能否检出Δr>0.3? | 未论证 | 中 |
121-2的任务:把四个问号变成句号,或至少变成"已知风险"。
算子流不说"图纸上有问号也能开工"。算子流说:“问号不填平,开工后塌的就是自己。”
一、坑位K1:S_source真值代理的构造合法性
1.1 121-1的提案回顾
121-1提议用PGO波密度 + 皮层激活梯度的归一化加权和构造S_source:
Ssource(t)=α⋅PGO_density(t)+(1−α)⋅Cortical_gradient(t) \mathcal{S}_{\text{source}}(t) = \alpha \cdot \text{PGO\_density}(t) + (1-\alpha) \cdot \text{Cortical\_gradient}(t)Ssource(t)=α⋅PGO_density(t)+(1−α)⋅Cortical_gradient(t)
其中α暂定0.6。
1.2 文献依据审查
PGO波(Ponto-Geniculo-Occipital waves):
- PGO波是REM睡眠的标志性生理信号,起源于脑桥(pons),经外侧膝状体(LGN)投射到枕叶皮层。
- 文献支撑:Datta & MacLean (2007)Progress in Brain Research证实PGO波密度与REM期的意识状态转换(如梦境叙事结构的复杂度)存在正相关。
- 结论:PGO_density作为
S_source的一个分量有神经生理学依据。
皮层激活梯度(Cortical gradient):
- 皮层激活梯度可通过EEG微状态(microstates)序列的变化率或fMRI的BOLD信号空间梯度计算。
- 文献支撑:Lehmann et al. (1998)Electroencephalography and Clinical Neurophysiology提出EEG微状态作为"意识状态的原子单元";Van de Ville et al. (2010)PNAS用fMRI梯度分析皮层激活的空间模式。
- 结论:Cortical_gradient作为
S_source的另一个分量有神经影像学依据。
α=0.6的合法性:
- 问题:α=0.6是121-1的暂定值,但PGO波和皮层激活梯度对"源切换"(source switching)的相对贡献尚无直接文献支持。
- 审查结论:α不能设为固定值,必须做敏感性分析——扫描α∈[0, 1]区间,观察
r_ctrl和Δr对α的稳健性。若结果在α∈[0.3, 0.8]内均保持r_ctrl > 0.5且Δr > 0.3,则α的选择不构成系统性偏差;若结果对α高度敏感,则S_source的构造本身需要重新理论化。
1.3 K1审查结论
| 审查项 | 结果 | 后续动作 |
|---|---|---|
| PGO_density分量 | 有文献支撑 | 采用 |
| Cortical_gradient分量 | 有文献支撑 | 采用 |
| α=0.6固定值 | 不合法 | 改为敏感性分析,扫描α∈[0,1] |
S_source整体构造 | 理论假设,需稳健性检验 | 预实验中增加α敏感性分析 |
K1风险等级:中高 → 可控(通过敏感性分析降级)。
二、坑位K2:稀疏边选择策略的方法论对比
2.1 121-1的两条策略
- 策略A(随机选择):以概率ε从所有h-h对中均匀采样
- 策略B(频率匹配):选取激活频率相近的隐藏单元对加边
2.2 因果推断视角的审查
策略A(随机)的优劣:
- 优:最干净,无先验偏见,符合"随机对照试验"(RCT)的精神。
- 劣:可能选中低频/无关单元对,导致干预信号被噪声淹没,假阴性风险高。
策略B(频率匹配)的优劣:
- 优:因果逻辑更清晰——“激活模式相似的单元之间的同层边,最可能破坏解耦结构”。这对应算子流中的"Γ’扰动注入到高耦合区域"。
- 劣:引入了数据驱动的先验(激活频率需从训练数据估计),可能产生"双重 dipping"——用同一批数据既选边又评估效应。
策略C(协方差驱动,补充提案):
- 选取隐藏单元激活协方差最高的对加边。
- 逻辑:协方差高的单元对在标准RBM中已被"隐式耦合"(通过可见层间接耦合),直接加边会最大化破坏解耦条件。
- 风险:与策略B类似,存在双重 dipping。
2.3 方法论裁决
| 策略 | 因果纯度 | 效应强度 | 双重dipping风险 | 推荐角色 |
|---|---|---|---|---|
| A(随机) | 高 | 中 | 无 | 主实验 |
| B(频率匹配) | 中 | 高 | 有 | 交叉验证 |
| C(协方差驱动) | 中 | 最高 | 有 | 敏感性分析 |
裁决:
- 主实验用策略A——因果纯度最高,无双重dipping。
- 策略B和C作为交叉验证——若三种策略均显示
Δr > 0.3,因果结论极坚固;若仅策略C显著而策略A不显著,则效应可能来自"选边偏差"而非"解耦破坏"。 - 121-1的"建议先做策略A再用策略B交叉验证"是正确的,但需补充策略C作为第三臂。
2.4 K2审查结论
K2风险等级:中 → 低(通过三臂设计可控)。
三、坑位K3:含U的RBM训练收敛性
3.1 121-1的伪代码回顾
121-1的SparseInterventionRBM类中,训练函数使用了_mean_field_inference(v0)来处理含U的隐藏层条件概率。但均值场(Mean-Field, MF)迭代在一般BM中不保证收敛。
3.2 理论分析
一般BM的推理难题:
- 标准RBM中,
P(h|v)是因子化的——每个h_j独立服从sigmoid分布,采样并行。 - 含U的BM中,
P(h|v)不再因子化:
P(hj=1∣v,h−j)=σ(∑iWijvi+cj+∑k≠jUjkhk) P(h_j = 1 | \mathbf{v}, \mathbf{h}_{-j}) = \sigma\left(\sum_i W_{ij} v_i + c_j + \sum_{k \neq j} U_{jk} h_k\right)P(hj=1∣v,h−j)=σi∑Wijvi+cj+k=j∑Ujkhk
- 最后一项
∑U_jk h_k使得隐藏单元之间产生直接依赖,Gibbs采样需要逐单元迭代,配分函数计算从O(n²)变为O(2^n)。
稀疏U的救赎:
- 121-1的U是稀疏的(ε=10%),每个h_j只与~0.1×n_h个其他单元直接耦合。
- 稀疏图上的均值场迭代有收敛理论支撑:
- 文献:Ravikumar et al. (2006)Annals of Statistics证明,当图结构的最大度数d满足
d × tanh(θ_max) < 1(θ_max为最大边权重)时,均值场迭代指数收敛。 - 映射到121-1:
d ≈ 0.1 × n_h(n_h=50100时,d=510)。若U的初始化权重θ_max ≈ 0.01,则d × tanh(0.01) ≈ 0.05~0.1 < 1,收敛条件满足。
- 文献:Ravikumar et al. (2006)Annals of Statistics证明,当图结构的最大度数d满足
持久对比散度(PCD)的可行性:
- PCD在稀疏BM上的工作:Salakhutdinov et al. (2010)ICML在稀疏主题模型(可视为稀疏BM的变体)上成功应用了PCD。
- 结论:稀疏U下,PCD+均值场近似是可行的,但需监控收敛指标(如MF迭代的L2残差)。
3.3 工程建议
| 检查点 | 标准 | 失败处理 |
|---|---|---|
| MF迭代残差 | < 1e-4(10步内) | 改用Gibbs采样(慢但精确) |
| PCD链混合 | 自相关时间< 5 | 增加持久链数量或降温 |
| 训练稳定性 | 损失函数单调下降 | 减小学习率或增大batch size |
3.4 K3审查结论
K3风险等级:高 → 中(稀疏性保证了理论收敛,但工程实现需监控)。
关键输出:121-1的伪代码中_mean_field_inference在理论上是可行的,但需在实现中增加收敛监控。若MF迭代不收敛,回退到Gibbs采样(训练速度下降但结果可靠)。
四、坑位K4:样本量与统计功效估计
4.1 121-1的样本提案
20名健康受试者,各一晚PSG记录。
4.2 统计功效分析
效应量估计:
- 121-1的判定阈值:
Δr > 0.3(对照组r≈0.5,实验组r≈0.2)。 - 效应量Cohen’s q(相关系数差异的效应量,基于Fisher z变换):
q=zctrl−zexp=12ln1+rctrl1−rctrl−12ln1+rexp1−rexp q = z_{\text{ctrl}} - z_{\text{exp}} = \frac{1}{2}\ln\frac{1+r_{\text{ctrl}}}{1-r_{\text{ctrl}}} - \frac{1}{2}\ln\frac{1+r_{\text{exp}}}{1-r_{\text{exp}}}q=zctrl−zexp=21ln1−rctrl1+rctrl−21ln1−rexp1+rexp
代入r_ctrl=0.5, r_exp=0.2:
q=0.5493−0.2027≈0.35 q = 0.5493 - 0.2027 \approx 0.35q=0.5493−0.2027≈0.35
- Cohen’s q = 0.35属于中等效应(Cohen判定标准:0.1=小, 0.3=中, 0.5=大)。
样本量需求(配对设计,α=0.01,power=0.80):
- 使用G*Power 3.1,配对t检验,效应量d=0.5(保守估计,因为q≈0.35对应d≈0.5~0.6)。
- 结果:每组需要n ≈ 50个独立样本(α=0.01, power=0.80, d=0.5,配对双侧t检验)。
- 若放宽至α=0.05(探索性研究),则n≈34即可达到power=0.80。
但121-1的"20名受试者"不是20个独立样本:
- 每名受试者一晚PSG约8小时,4秒窗口无重叠 → 每名受试者约7200个样本点。
- 但同一受试者的样本点高度自相关(时间序列),有效样本量(effective sample size, ESS)远低于7200。
- 假设自相关时间τ≈10个窗口(40秒),则ESS ≈ 7200/10 = 720 per subject。
- 20名受试者的总ESS ≈ 14,400,远大于50的需求。
但是:
- 跨受试者的个体差异是主要方差来源。若某受试者的
r_ctrl特别高(如0.8),另一受试者特别低(如0.2),组内方差会淹没Δr。 - 更保守的估计:以受试者为单位(n=20),每名受试者计算一个
r_ctrl和一个r_exp,然后做配对t检验。 - 此时效应量d=0.5,n=20,α=0.01,power≈0.30——严重不足。
4.3 样本量裁决
| 方案 | 样本量 | 预期功效 | 推荐度 |
|---|---|---|---|
| 保守方案(以人为单位) | 20名 | ~0.30 | 严重不足 |
| 推荐方案 | ~50名 | ~0.80 | 推荐 |
| 稳健方案 | 60名+ | ~0.90+ | 理想但成本高 |
裁决:
- 121-1的"20名"严重不足。推荐增加到**~50名**(α=0.01,power=0.80,d=0.5,配对双侧t检验)。
- 若受试者招募困难,可放宽α到0.05(探索性研究),此时n≈34即可达到power=0.80。
- 预实验:先招募10名,估算实际效应量和组内方差,再调整正式实验样本量。
4.4 K4审查结论
K4风险等级:中 → 低(通过增加样本量或放宽α可控)。
五、四坑综合审查矩阵
| 坑位 | 内容 | 121-1风险 | 121-2审查结果 | 处置方案 | 处置后风险 |
|---|---|---|---|---|---|
| K1 | S_source真值代理 | 高 | α固定值不合法,但分量有文献依据 | α敏感性分析(扫描[0,1]) | 中 |
| K2 | 稀疏边选择策略 | 中 | 策略A最干净,B/C可作交叉验证 | 主实验用A,三臂交叉验证 | 低 |
| K3 | 含U的RBM收敛性 | 高 | 稀疏U下MF理论收敛,但需工程监控 | 实现收敛监控,失败回退Gibbs | 中 |
| K4 | 样本量 | 中 | 20名功效严重不足(power≈0.30),需~50名 | 增加样本或放宽α,先做预实验 | 低 |
综合结论:
- 两个坑可立即填平:K2(策略明确)、K4(样本量调整)。
- 一个坑需敏感性分析:K1(α扫描)。
- 一个坑存在工程风险:K3(收敛监控),但回退方案明确。
121-1的实验设计在补完上述四项审查后,其中K2(稀疏边策略)和K4(样本量调整)可立即填平,K1(S_source构造)需增加α敏感性分析,K3(含U收敛性)需在实现中增加收敛监控并有Gibbs回退方案。补完后可进入预实验阶段。
六、与系列闭环
| 天数 | 核心输出 |
|---|---|
| 120-1 | 可验证性追踪(可行性判定) |
| 120-2 | 因果效力审计(解释力判定) |
| 121-1 | RBM干预实验的技术规范草案(工程落地) |
| 121-2 | 干预实验的前置条件审查(四坑填平) |
121天双篇完成了天赐范式从方法论审计到工程落地再到前置条件审查的完整闭环:
120天说"RBM能打且能解释" → 121-1说"这是施工图" → 121-2说"施工图上的四个缺口已审查完毕,可以开工"
七、结论
第121天第二篇的四个核心产出:
S_source真值代理:PGO密度和皮层梯度有文献依据,但α不能固定为0.6,必须做敏感性分析。K1从高风险降级为中风险。- 稀疏边选择策略:策略A(随机)因果纯度最高,作为主实验;策略B(频率匹配)和策略C(协方差驱动)作为交叉验证臂。K2从中风险降级为低风险。
- 含U的RBM收敛性:稀疏U(ε=10%)满足MF收敛理论条件,但工程实现需监控迭代残差,失败回退Gibbs采样。K3从高风险降级为中风险。
- 样本量:20名功效严重不足(power≈0.30),推荐~50名(α=0.01, power=0.80, d=0.5),或放宽α=0.05时n≈34,或先做10名预实验估算效应量。K4从中风险降级为低风险。
第121天双篇的综合判决:
| 阶段 | 状态 |
|---|---|
| 方法论审计(120天) | 完成 |
| 工程草案(121-1) | 完成 |
| 前置条件审查(121-2) | 完成 |
| 预实验 | 可启动 |
| 正式实验 | 待预实验后调整参数 |
算子流不说"审完四个坑就能发Nature"。算子流说:“审完四个坑,才知道地基哪里还软。软的地方补了硬板,才能放仪器。预实验就是踩一脚试试——踩实了,正式实验才能跑。”
121-1画了施工图。121-2审了施工图上的四个缺口。现在图纸上的问号变成了已知风险,已知风险变成了处置方案。处置方案变成了预实验的入场券。
这就是第121天的意义:从"能不能验"到"怎么验"到"验之前还要补什么"——每一步都不跳过,每一步都留下审计痕迹。
v1.1 | 天赐范式第121天(第二篇)| 2026-07-31
121-1说:这是施工图。
121-2说:施工图上有四个缺口,审完了——两个能立即填平,一个要扫描,一个要监控。样本量从20名修到~50名。
算子流不说"开工"。算子流说:“缺口补完了,预实验可以启动了。正式实验等预实验踩完那一脚再说。”