[NIPS'23] Does Invariant Graph Learning via Environment Augmentation Learn Invariance?
1. 问题定义
给定完整图 $G$ 及其标签 $Y$,希望从 $G$ 中识别跨环境稳定的子图 $G_c$,删除随环境变化但可能与标签高度相关的伪相关子图 $G_s$,并仅根据 $G_c$ 预测 $Y$。
理想情况下,希望学习:
$$ \hat G_c \leftarrow g(G) $$
使得:
$$ I(\hat G_c;Y) $$
尽可能大,同时:
$$ \hat G_c\perp E $$
其中 $E$ 是引起图分布偏移的环境因素。
GALA 指出:仅凭混合训练分布 $P(G,Y)$,上述策略不一定能够提供忠实的环境信息;在缺少额外假设时,真实稳定子图甚至可能在信息论意义上不可识别。
论文因此解决两个问题:
- 在什么条件下,无环境标签的图不变学习是可行的;
- 如何在不知道稳定相关与伪相关谁更强时,统一识别 $G_c$。
2. 符号
- $E$:环境或域
- $C$:潜在稳定因果因素
- $S$:潜在伪相关因素
- $Y$:图标签
- $G=(A,X)$:实际观察到的完整图
- $A\in\{0,1\}^{n\times n}$:邻接矩阵
- $X\in\mathbb R^{n\times d}$:节点特征矩阵
- $G_c$:由 $C$ 控制的真实稳定子图
- $G_s$:由 $S$ 控制的真实伪相关子图
- $g$:从完整图中选择稳定子图的 selector
- $\hat G_c=g(G)$:模型估计出的稳定子图
- $f_c$:根据 $\hat G_c$ 预测标签的分类器
- $A_{\mathrm{asst}}$:环境助手模型,避免与邻接矩阵 $A$ 混淆
- $\hat Y^e=A_{\mathrm{asst}}(G)$:助手的代理预测
- $\mathcal G^p$:助手预测正确的图集合
- $\mathcal G^n$:助手预测错误的图集合
- $G^p,G^n$:分别从 $\mathcal G^p,\mathcal G^n$ 中采样的图
- $G_c^p,G_c^n$:$G^p,G^n$ 中的真实稳定子图
- $G_s^p,G_s^n$:$G^p,G^n$ 中的真实伪相关子图
- $\hat G_c^p,\hat G_c^n$:selector 从 $G^p,G^n$ 中提取的稳定子图
- $Z\in\mathbb R^{n\times d_h}$:selector GNN 输出的节点表示
- $M\in\mathbb R^{n\times n}$:可学习边分数或边掩码矩阵
- $h_{\hat G_c}\in\mathbb R^{d_z}$:估计稳定子图的图级表示
- $I(A;B\mid Y)$:给定标签 $Y$ 后 $A,B$ 的条件互信息
3. 图生成假设
论文沿用 CIGA 中的结构因果生成过程:
$$ G_c \leftarrow f_{\mathrm{gen}}^{G_c}(C) $$
$$ G_s \leftarrow f_{\mathrm{gen}}^{G_s}(S) $$
$$ G \leftarrow f_{\mathrm{gen}}^G(G_c,G_s) $$
环境 $E$ 通过改变 $S$ 改变 $G_s$ 与标签之间的相关关系,而 $G_c$ 与标签的关系保持稳定。
因此希望:
$$ P^{e_1}(Y\mid G_c) = P^{e_2}(Y\mid G_c) $$
但允许:
$$ P^{e_1}(Y\mid G_s) \ne P^{e_2}(Y\mid G_s). $$
论文重点讨论更困难的 PIIF 情形。此时 $G_s$ 本身可以包含很强的标签预测信息,所以:
$$ I(G_s;Y)>0 $$
甚至可能强于:
$$ I(G_c;Y). $$
因此,“能够很好预测标签”不等于“具有跨环境不变性”。
4. Two-piece graph 与不可识别性
4.1 Two-piece graph
论文使用 two-piece graph 对问题进行理论化简。每张图由两个部分组成:
$$ G \leftarrow f_{\mathrm{gen}}^G(G_c,G_s). $$
环境 $e$ 由两个参数 $(\alpha,\beta_e)$ 控制:
$$ G_c \leftarrow f_{\mathrm{gen}}^{G_c} \left(Y\cdot\operatorname{Rad}(\alpha)\right) $$
$$ G_s \leftarrow f_{\mathrm{gen}}^{G_s} \left(Y\cdot\operatorname{Rad}(\beta_e)\right). $$
其中 $\operatorname{Rad}(p)$ 以概率 $p$ 取 $-1$,以概率 $1-p$ 取 $+1$。
- $\alpha$ 在不同环境中保持不变;
- $\beta_e$ 随环境变化;
- 因而 $G_c$ 的标签相关关系稳定,$G_s$ 的标签相关关系可变。
4.2 环境生成可能失败
环境生成方法先估计:
$$ \hat G_c, \qquad \hat G_s, $$
然后从不同图中重组:
$$ G_{i,j} \leftarrow f_{\mathrm{gen}}^G (\hat G_{c,i},\hat G_{s,j}) $$
并继承第 $i$ 张图的标签:
$$ Y_{i,j} \leftarrow Y_i. $$
如果中间估计恰好反了:
$$ \hat G_c=G_s, \qquad \hat G_s=G_c, $$
那么重组过程会保留甚至加强伪相关关系,并破坏真实稳定关系。
因此,环境生成的可靠性依赖于最初的子图估计;它不能凭空创造训练数据中从未出现过的伪相关变化。
4.3 环境推断也可能失败
假设存在两个不同的数据生成机制:
$$ \mathcal E_{\mathrm{tr}} $$
和:
$$ \mathcal E_{\mathrm{tr}}'. $$
它们混合后具有完全相同的训练联合分布:
$$ P_{\mathcal E_{\mathrm{tr}}}(G,Y) = P_{\mathcal E_{\mathrm{tr}}'}(G,Y), $$
但二者的真实稳定子图不同。
任何算法只能观察 $P(G,Y)$,无法判断当前数据来自哪一种机制。因此,它至少会在其中一个机制下识别错误。
该困难来自观测信息不足,而不是模型容量、优化器或环境推断算法不够强。
5. 可行不变学习的两个假设
5.1 Variation sufficiency
对于任意伪相关子图 $G_s$,训练数据中应至少存在两个环境,使得:
$$ P^{e_1}(Y\mid G_s) \ne P^{e_2}(Y\mid G_s), $$
而稳定子图保持:
$$ P^{e_1}(Y\mid G_c) = P^{e_2}(Y\mid G_c). $$
直觉上,训练数据必须至少让每一种伪相关“失效”一次。
如果某个 $G_s$ 在所有训练环境中都与标签保持完全相同的关系,那么即使给出环境标签,也无法仅凭训练数据把它与 $G_c$ 区分开。
5.2 Variation consistency
论文要求稳定因素与伪相关因素对标签的相关强度不能处于完全不可区分的对称状态:
$$ H(C\mid Y) \ne H(S\mid Y). $$
条件熵越小,表示给定标签后该因素越容易确定,即它与标签的相关性越强。
该假设排除交换 $C,S$ 后仍然产生相同混合训练分布的不可识别情形。
5.3 No Free Graph OOD Lunch
缺少 variation sufficiency 或 variation consistency,又没有额外环境信息或归纳偏置时,不存在能够对所有 two-piece graph 环境都正确识别不变性的学习算法。
因此,环境增强不是无条件有效的解决办法。它只能利用训练数据中已经存在、并且可被某种机制暴露出来的变化。
6. 环境助手模型
6.1 助手的作用
首先单独训练环境助手:
$$ A_{\mathrm{asst}} \leftarrow \operatorname{ERM}(D_{\mathrm{tr}}). $$
助手产生代理预测:
$$ \hat Y_i^e \leftarrow A_{\mathrm{asst}}(G_i). $$
助手不负责输出真实环境标签,也不是最终用于测试的模型。它只需要对训练分布中的主导模式敏感。
当伪相关是最容易学习的主导模式时,ERM 助手倾向于使用 $G_s$ 预测标签。伪相关在某些样本中失效时,助手便容易犯错。因此:
$$ \text{助手是否预测正确} $$
可以作为伪相关是否成立的代理信号。
6.2 按照助手正确性划分数据
定义助手预测正确的集合:
$$ \mathcal G^p \leftarrow \{G_i\mid A_{\mathrm{asst}}(G_i)=Y_i\}. $$
定义助手预测错误的集合:
$$ \mathcal G^n \leftarrow \{G_i\mid A_{\mathrm{asst}}(G_i)\ne Y_i\}. $$
如果助手主要依赖伪相关:
- $\mathcal G^p$ 中伪相关规则通常成立;
- $\mathcal G^n$ 中伪相关规则更可能反转或失效;
- 真正的 $G_c$ 与标签关系在两组中保持稳定。
6.3 助手与最终模型是两个模型
训练关系为:
$$ \boxed{A_{\mathrm{asst}}} \quad\longrightarrow\quad \text{产生代理预测与配对规则} \quad\longrightarrow\quad \boxed{f_c\circ g}. $$
- $A_{\mathrm{asst}}$:先通过 ERM 训练,用于产生代理预测;
- $g$:新的稳定子图 selector;
- $f_c$:新的稳定子图分类器;
- 最终预测使用 $f_c\circ g$,不使用助手。
GALA 对比损失更新的是 $g,f_c$,不是原来的助手。
实际实现还可以使用:
- vanilla GNN 或 interpretable GNN 作为助手;
- 助手的标签预测作为代理;
- 对助手隐藏表示进行 k-means 聚类,将聚类结果作为代理。
7. GALA 的理论目标
GALA 希望从助手正确组和错误组中提取同标签的稳定子图:
$$ \hat G_c^p \leftarrow g(G^p), \qquad G^p\in\mathcal G^p $$
$$ \hat G_c^n \leftarrow g(G^n), \qquad G^n\in\mathcal G^n. $$
理论目标为:
$$ \max_{f_c,g} I(\hat G_c;Y) $$
满足:
$$ g \in \arg\max_{ \substack{\hat g\\|\hat G_c^p|\le s_c} } I(\hat G_c^p;\hat G_c^n\mid Y). $$
其中:
- $I(\hat G_c;Y)$:保证提取子图能够预测标签;
- $I(\hat G_c^p;\hat G_c^n\mid Y)$:寻找助手正确组和错误组之间的同类稳定共性;
- $|\hat G_c^p|\le s_c$:排除直接选择完整图的平凡解。
直觉上:
$$ G^p = G_c+G_s^p $$
$$ G^n = G_c+G_s^n. $$
当两个子集中的伪相关部分差异足够大时:
$$ G_s^p\not\approx G_s^n, $$
而稳定部分保持:
$$ G_c^p\approx G_c^n. $$
因此,跨两个子集最大化同标签子图互信息会倾向于保留 $G_c$。
8. 网络:子图选择与预测
8.1 节点编码
输入图为:
$$ G=(A,X). $$
selector 首先用 GNN 计算节点表示:
$$ Z \leftarrow \operatorname{GNN}_{g,\theta}(A,X), $$
其中:
$$ Z\in\mathbb R^{n\times d_h}. $$
第 $i$ 行 $z_i$ 是节点 $i$ 的上下文表示。
8.2 产生边分数
对原图中的每条边 $(i,j)\in E$,拼接两个端点的节点表示:
$$ r_{ij} \leftarrow [z_i\Vert z_j]. $$
然后通过 MLP 计算边分数:
$$ s_{ij} \leftarrow \operatorname{MLP}_{\mathrm{edge},\theta}(r_{ij}). $$
再得到连续边掩码:
$$ m_{ij} \leftarrow \sigma(s_{ij}). $$
合并写为:
$$ m_{ij} \leftarrow \sigma\left( \operatorname{MLP}_{\mathrm{edge},\theta} ([z_i\Vert z_j]) \right). $$
所有边分数组成:
$$ M\in[0,1]^{n\times n}. $$
8.3 由边分数得到稳定子图
软掩码实现直接重新加权邻接矩阵:
$$ \hat A_c \leftarrow A\odot M. $$
于是:
$$ \hat G_c \leftarrow (\hat A_c,X). $$
此时 $\hat G_c$ 是连续加权图:
- $m_{ij}\approx1$:边 $(i,j)$ 基本保留;
- $m_{ij}\approx0$:边 $(i,j)$ 的消息传递基本被删除。
也可以按照边分数采样或选择固定比例的边,得到二值掩码:
$$ B_{ij}\in\{0,1\} $$
和离散子图:
$$ \hat A_c \leftarrow A\odot B. $$
8.4 稳定子图表示
将估计稳定子图输入分类器 GNN:
$$ H_c \leftarrow \operatorname{GNN}_{c,\theta}(\hat A_c,X). $$
再进行图级池化:
$$ h_{\hat G_c} \leftarrow \operatorname{Readout}(H_c). $$
例如 mean pooling:
$$ h_{\hat G_c} \leftarrow \frac1n \sum_{i=1}^{n}H_{c,i}. $$
8.5 标签预测
$$ \hat Y \leftarrow f_{c,\theta}(h_{\hat G_c}). $$
分类损失为:
$$ \mathcal L_{\mathrm{cls}} \leftarrow \frac1B \sum_{i=1}^{B} \operatorname{CE}(\hat Y_i,Y_i). $$
它近似实现:
$$ \max I(\hat G_c;Y), $$
因为:
$$ I(\hat G_c;Y) = H(Y)-H(Y\mid\hat G_c), $$
而 $H(Y)$ 对训练数据而言是常数。
主网络的关键赋值关系为:
$$ Z \leftarrow \operatorname{GNN}_{g}(G) $$
$$ m_{ij} \leftarrow \sigma\left( \operatorname{MLP}_{\mathrm{edge}}([z_i\Vert z_j]) \right) $$
$$ \hat G_c \leftarrow (A\odot M,X) $$
$$ h_{\hat G_c} \leftarrow \operatorname{Readout} \left( \operatorname{GNN}_{c}(\hat G_c) \right) $$
$$ \hat Y \leftarrow f_c(h_{\hat G_c}). $$
9. 基于助手预测的对比配对
9.1 对比正样本
对于 anchor $G_i$,选择满足以下条件的图 $G_j$:
$$ Y_j=Y_i $$
且:
$$ A_{\mathrm{asst}}(G_j) \ne A_{\mathrm{asst}}(G_i). $$
即:
$$ P(i) \leftarrow \left\{ j\ne i \mid Y_j=Y_i, \hat Y_j^e\ne\hat Y_i^e \right\}. $$
这些图真实标签相同,但助手依据的主导模式不同,因此其稳定子图表示应该被拉近。
9.2 对比负样本
选择满足:
$$ Y_k\ne Y_i $$
但:
$$ A_{\mathrm{asst}}(G_k) = A_{\mathrm{asst}}(G_i) $$
的图作为负样本:
$$ N(i) \leftarrow \left\{ k \mid Y_k\ne Y_i, \hat Y_k^e=\hat Y_i^e \right\}. $$
这些图可能包含相同的助手捷径,但真实标签不同,因此其稳定子图表示应该被拉远。
9.3 与正确组/错误组的关系
若 anchor 的助手预测正确:
$$ \hat Y_i^e=Y_i, $$
那么同标签、不同助手预测的正样本必然满足:
$$ \hat Y_j^e\ne Y_j, $$
即正样本来自助手错误组。
因此,该配对策略实际构造了:
$$ G^p \leftrightarrow G^n $$
之间的同标签对比。
9.4 House/Cycle 示例
假设训练数据中的捷径为:
$$ \mathrm{Grid} \Rightarrow \mathrm{House} $$
$$ \mathrm{Hexagon} \Rightarrow \mathrm{Cycle}. $$
助手可能得到:
| 输入图 | 真实标签 | 助手预测 |
|---|---|---|
| House + Grid | House | House |
| House + Hexagon | House | Cycle |
| Cycle + Grid | Cycle | House |
| Cycle + Hexagon | Cycle | Cycle |
对 anchor:
$$ G_i=\mathrm{House+Grid}, $$
正样本可以选择:
$$ G_j=\mathrm{House+Hexagon}. $$
二者标签相同、助手预测不同,因此:
$$ \operatorname{sim} (h_{\hat G_{c,i}},h_{\hat G_{c,j}}) \uparrow. $$
二者稳定的共同部分是 House,而 Grid/Hexagon 不同。
负样本可以选择:
$$ G_k=\mathrm{Cycle+Grid}. $$
它与 anchor 的助手预测相同,但真实标签不同,因此:
$$ \operatorname{sim} (h_{\hat G_{c,i}},h_{\hat G_{c,k}}) \downarrow. $$
如果 selector 保留共同的 Grid,两张不同标签图会变得相似,与对比目标冲突。因此梯度会降低 Grid 相关边的分数。
11. GALA 对比损失
直接估计条件互信息代价较高,因此论文使用对比学习近似:
$$ I(\hat G_c^p;\hat G_c^n\mid Y). $$
对 anchor $G_i$,选择正样本 $G_j\in P(i)$,以及 $M$ 个负样本 $G_k\in N(i)$。定义:
$$ z_i \leftarrow h_{\hat G_{c,i}} $$
$$ z_j^+ \leftarrow h_{\hat G_{c,j}} $$
$$ z_k^- \leftarrow h_{\hat G_{c,k}}. $$
相似度为:
$$ s(z_i,z_j) \leftarrow \frac{\phi(z_i,z_j)}{\tau}, $$
其中 $\phi$ 是相似度函数,$\tau$ 是 temperature。
单个 anchor 的对比损失可以写为:
$$ \mathcal L_{\mathrm{GALA},i} \leftarrow -\log \frac{ \exp(s(z_i,z_j^+)) }{ \exp(s(z_i,z_j^+)) + \sum_{k\in N(i)} \exp(s(z_i,z_k^-)) }. $$
batch 损失为:
$$ \mathcal L_{\mathrm{GALA}} \leftarrow \frac1{|\mathcal I|} \sum_{i\in\mathcal I} \mathcal L_{\mathrm{GALA},i}, $$
其中 $\mathcal I$ 只包含当前 batch 中能够找到有效正样本和负样本的 anchor。
总损失可概括为:
$$ \mathcal L_{\mathrm{total}} \leftarrow \mathcal L_{\mathrm{cls}} + \lambda \mathcal L_{\mathrm{GALA}}. $$
- $\mathcal L_{\mathrm{cls}}$:保证所选子图能够预测 $Y$;
- $\mathcal L_{\mathrm{GALA}}$:保证所选子图跨助手代理变化仍然稳定;
- $\lambda$:对比正则权重。
如果助手正确组与错误组严重不平衡,论文会对少数组进行上采样,避免无法形成足够的跨组正样本对。
12. 梯度如何训练 selector
对比损失不直接监督某条边是否属于真实 $G_c$。它通过子图表示间接更新边分数。
梯度路径为:
$$ \mathcal L_{\mathrm{cls}}, \mathcal L_{\mathrm{GALA}} \Rightarrow h_{\hat G_c},\hat Y \Rightarrow \operatorname{GNN}_c \Rightarrow \hat A_c \Rightarrow M \Rightarrow \operatorname{MLP}_{\mathrm{edge}} \Rightarrow \operatorname{GNN}_g. $$
由于:
$$ \hat A_c=A\odot M, $$
所以:
$$ \frac{\partial\mathcal L} {\partial m_{ij}} \ne0. $$
训练会逐渐形成以下分工:
- 跨代理分组稳定并且有助于预测标签的边:$m_{ij}$ 增大;
- 只对应助手捷径、跨分组不稳定的边:$m_{ij}$ 减小。
这里被 optimizer 更新的是产生边分数和图表示的网络参数,而不是 $M,Z,h_{\hat G_c}$ 这些中间张量本身。
13. 完整训练过程
13.1 阶段一:训练环境助手
使用完整训练图训练 ERM 助手:
$$ \hat Y_i^e \leftarrow A_{\mathrm{asst}}(G_i) $$
$$ \mathcal L_{\mathrm{asst}} \leftarrow \frac1B \sum_i \operatorname{CE}(\hat Y_i^e,Y_i). $$
更新:
$$ \theta_A \leftarrow \theta_A - \eta_A \nabla_{\theta_A} \mathcal L_{\mathrm{asst}}. $$
训练完成后,使用助手预测或助手表示的聚类结果作为固定代理信息。
13.2 阶段二:初始化 GALA 主模型
重新初始化新的 selector 与分类器:
$$ g_{\theta}, \qquad f_{c,\theta}. $$
先使用 ERM 分类目标预训练主模型一段时间:
$$ \mathcal L \leftarrow \mathcal L_{\mathrm{cls}}. $$
这一步用于先获得基本图表示,避免训练初期的强对比约束阻碍收敛。
13.3 阶段三:构造对比图对
对于 batch 中的 anchor $G_i$,根据固定的助手代理预测:
$$ P(i) \leftarrow \{j\mid Y_j=Y_i,\hat Y_j^e\ne\hat Y_i^e\} $$
$$ N(i) \leftarrow \{k\mid Y_k\ne Y_i,\hat Y_k^e=\hat Y_i^e\}. $$
13.4 阶段四:提取子图并预测
$$ Z_i \leftarrow \operatorname{GNN}_g(G_i) $$
$$ M_i \leftarrow \operatorname{EdgeScore}(Z_i,A_i) $$
$$ \hat G_{c,i} \leftarrow (A_i\odot M_i,X_i) $$
$$ h_{\hat G_{c,i}} \leftarrow \operatorname{Readout} \left( \operatorname{GNN}_c(\hat G_{c,i}) \right) $$
$$ \hat Y_i \leftarrow f_c(h_{\hat G_{c,i}}). $$
13.5 阶段五:联合优化主模型
$$ \mathcal L_{\mathrm{total}} \leftarrow \mathcal L_{\mathrm{cls}} + \lambda\mathcal L_{\mathrm{GALA}}. $$
更新:
$$ \theta \leftarrow \theta - \eta \nabla_{\theta} \mathcal L_{\mathrm{total}}. $$
该步骤更新:
- selector GNN;
- edge-scoring MLP;
- 稳定子图分类器 GNN;
- 标签预测头。
不更新已经训练完成的环境助手。
13.6 测试阶段
测试时只使用:
$$ G \xrightarrow{g} \hat G_c \xrightarrow{f_c} \hat Y. $$
环境助手和代理分组不参与最终预测。
14. 为什么两种相关强弱下都可能有效
14.1 伪相关更强
当:
$$ H(S\mid Y) < H(C\mid Y), $$
ERM 助手倾向于优先学习 $G_s$。
- 助手正确组:伪相关规则通常成立;
- 助手错误组:伪相关规则被打破;
- 跨组稳定部分为 $G_c$。
因此,最大化:
$$ I(\hat G_c^p;\hat G_c^n\mid Y) $$
可以排除主导伪相关。
14.2 稳定相关更强
当:
$$ H(C\mid Y) < H(S\mid Y), $$
助手会主要学习稳定相关,也可能同时学习部分伪相关。助手错误组更可能暴露相关结构异常或伪相关占主导的样本。
条件互信息满足交换对称性:
$$ I(\hat G_c^p;\hat G_c^n\mid Y) = I(\hat G_c^n;\hat G_c^p\mid Y). $$
因此,交换哪一组是稳定相关主导、哪一组是伪相关主导,不改变理论目标。真正跨组稳定的 $G_c$ 仍可作为最大化解。
15. Theorem 4.1 的关键条件
论文定理并非说明任意 ERM 助手都必然成功。除了图生成假设、variation sufficiency 和 variation consistency,还要求两个子集中的主导伪相关部分满足:
$$ I(G_s^p;G_s^n\mid Y) = 0. $$
这表示给定标签后,助手正确组与错误组中的主导伪相关信息已被充分分离。
在该条件以及真实稳定子图大小为 $s_c$ 的条件下,求解:
$$ \max_{f_c,g} I(\hat G_c;Y) $$
满足:
$$ g \in \arg\max_{ \substack{\hat g\\|\hat G_c^p|\le s_c} } I(\hat G_c^p;\hat G_c^n\mid Y) $$
能够识别真实 $G_c$。
理论成立链条应理解为:
$$ \text{变化充分} + \text{变化一致} + \text{助手产生有效分组} + \text{子图大小约束} $$
$$ \Longrightarrow \text{不变子图可识别}. $$
不能简化为:
$$ \text{训练一个 ERM 助手} \Longrightarrow \text{必然识别不变子图}. $$
16. 与 CIGA 的关系
CIGA 与 GALA 使用相似的 interpretable GNN backbone 和类内对比目标,主要差别在对比采样。
CIGA
正样本只要求:
$$ Y_j=Y_i. $$
因此同标签图中的最强共同信息可能来自 $G_c$,也可能来自更强的 $G_s$。
GALA
正样本额外要求:
$$ \hat Y_j^e\ne\hat Y_i^e. $$
负样本额外要求:
$$ \hat Y_k^e=\hat Y_i^e. $$
因此,GALA 主动控制助手所捕获的主导模式:
- 正样本:标签相同,但代理模式不同;
- 负样本:标签不同,但代理模式相同。
可以概括为:
$$ \text{GALA} = \text{CIGA-style selector} + \text{assistant-guided sampling}. $$
GALA 主要修改 CIGAv1 的对比采样,也可以与 CIGAv2 的图大小和补图约束结合。
17. 局限与阅读注意点
17.1 “最小假设”具有模型范围
论文所说的 minimal assumptions 是相对于 two-piece graph 和采用的结构因果生成模型而言,不应直接理解为对所有图 OOD 问题的普遍最小条件。
17.2 理论分组条件强于实践代理
理论要求:
$$ I(G_s^p;G_s^n\mid Y)=0, $$
但实践中的“助手预测正确/错误”只能启发式地近似这种分离,并不能自动保证条件成立。
17.3 助手可能学习不到预期偏差
ERM 助手可能:
- 学到真实稳定特征;
- 同时学习多种稳定和伪相关特征;
- 直接记忆训练数据;
- 在训练集上几乎不犯错,导致 $\mathcal G^n$ 太小。
这会削弱代理分组提供的变化信号。
17.4 依赖验证集选择超参数
助手类型、代理类型、对比权重、边保留比例和上采样倍数均可能根据验证集表现选择。如果验证环境不能代表测试偏移,实际 OOD 效果可能下降。
17.5 “子图”可能是软加权图
在部分实验中:
$$ \hat G_c=(A\odot M,X) $$
仍保留所有原始边,只是使用不同连续权重。因此,它在工程上更接近可解释的软 rationale,而不一定是严格离散、连通的真实子图。
