【Bug已解决】CoRDA initialization lacks support for Conv1D layers in older models like GPT-2 解决方案.md
【Bug已解决】CoRDA initialization lacks support for Conv1D layers in older models like GPT-2 解决方案.md
一、现象长什么样
CoRDA(Correlation Difference Adaptation)是一种 LoRA 初始化方法:它先用一批校准数据跑前向,统计每个目标层激活的协方差/相关性,再用“基座权重与激活相关性之差”来初始化 LoRA 的A、B矩阵,使 LoRA 起点就贴合数据分布,收敛更快。
但把它用在GPT-2(以及很多旧模型)上时,会发现:
- GPT-2 的注意力/MLP 大量使用
Conv1D(不是nn.Linear)——这是一种“kernel_size=1 的卷积层”,但数学上等价于线性层y = x @ weight.T + bias; - CoRDA 的初始化逻辑只识别
nn.Linear,对Conv1D视而不见,于是 GPT-2 里这些层根本没被 CoRDA 初始化,退化成随机初始化(或默认 LoRA 初始化),收敛优势丢失; - 更严重:CoRDA 在收集激活统计时按
nn.Linear的钩子挂forward_hook,Conv1D没有走这条路径,激活统计为空,初始化时直接NaN或shape mismatch; - 报错如
AttributeError: 'Conv1D' object has no attribute 'in_features'——因为 CoRDA 读linear.in_features,而Conv1D用的是weight.shape[1](输入维)而非in_features属性; - 训练 GPT-2 时 LoRA 部分层有效、部分层(Conv1D 那些)无效,整体效果打折却找不到原因。
根因:CoRDA 初始化只处理nn.Linear,不识别 GPT-2 等旧模型中普遍的Conv1D层,导致这些层的激活统计缺失、初始化被跳过或报错。
二、背景
GPT-2 的Conv1D定义大致是:
class Conv1D(nn.Module): def __init__(self, nf, nx): super().__init__() self.nf = nf self.weight = nn.Parameter(torch.empty(nx, nf)) self.bias = nn.Parameter(torch.zeros(nf)) def forward(self, x): # x: [..., nx]; y = x @ weight + bias return x @ self.weight + self.bias注意它的weight形状是[nx, nf](即[in, out]),而nn.Linear的weight是[out, in]——两者转置关系相反!这是 CoRDA 适配时最容易踩的坑:若直接把nn.Linear的初始化代码套到Conv1D上,维度会反。
CoRDA 的核心步骤:
- 对目标层挂 hook,收集输入激活
X(形状[N, in]); - 计算激活相关性/协方差
C = XᵀX(或其变体); - 用
C与基座权重W推导A、B的初始值,使BA ≈ f(W, C)。
对nn.Linear,W是[out, in];对Conv1D,W是[in, out]。CoRDA 必须按各层的实际weight形状处理,且要能识别Conv1D类型、正确读取in/out维(从weight.shape读,而非in_features属性)。
下面用最小可运行代码演示“CoRDA 跳过 Conv1D”与“正确支持 Conv1D(含权重转置)”。
三、根因
根因一句话:CoRDA 初始化只识别nn.Linear、且从in_features/out_features属性读维度,而 GPT-2 的Conv1D既不在nn.Linear类型里、又没有in_features属性(维度藏在weight.shape且顺序与 Linear 相反),导致激活统计缺失、初始化被跳过或维度报错。
展开:
- 类型不匹配:
isinstance(m, nn.Linear)对Conv1D为 False,被跳过。 - 维度属性缺失:CoRDA 读
m.in_features,Conv1D没有该属性 →AttributeError。 - 权重形状相反:
nn.Linear是[out, in],Conv1D是[in, out],套用同段代码维度反。 - 激活统计丢失:hook 只挂在
nn.Linear,Conv1D的激活没被收集。
修复方向:让 CoRDA 同时识别Conv1D与nn.Linear;维度统一从weight.shape读取(in = weight.shape[1]for Linear /weight.shape[0]for Conv1D);按各层实际weight形状推导 A/B;hook 对两种类型都挂。
四、最小可运行复现
下面构造一个含Conv1D的迷你 GPT-2 风格模型,演示 CoRDA 初始化“只处理 Linear 跳过 Conv1D”的 bug,以及“同时支持两种类型”的修复。
import torch import torch.nn as nn class Conv1D(nn.Module): """GPT-2 风格的 Conv1D:y = x @ weight + bias,weight 形状 [in, out]。""" def __init__(self, nf, nx): super().__init__() self.weight = nn.Parameter(torch.empty(nx, nf)) self.bias = nn.Parameter(torch.zeros(nf)) nn.init.normal_(self.weight, std=0.02) def forward(self, x): return x @ self.weight + self.bias class MiniGPT2(nn.Module): def __init__(self): super().__init__() self.attn = Conv1D(16, 16) # GPT-2 用 Conv1D self.mlp = nn.Linear(16, 16) # 混用一个普通 Linear def dims_of(self, m): # 错误实现:只认 nn.Linear 的 in_features if isinstance(m, nn.Linear): return m.in_features, m.out_features raise AttributeError("只支持 nn.Linear") def corda_init_broken(model): """错误:只对 nn.Linear 初始化,Conv1D 抛错。""" for name, m in model.named_modules(): if isinstance(m, nn.Linear): in_f, out_f = m.in_features, m.out_features # 用激活统计推导 A/B(示意) A = torch.randn(4, in_f) * 0.01 B = torch.zeros(out_f, 4) elif isinstance(m, Conv1D): # 没处理 -> 跳过(或抛错) pass return "只初始化了 Linear,Conv1D 被跳过" def dims_of_fixed(m): """正确:从 weight.shape 读维度,兼容 Conv1D 与 Linear。""" if isinstance(m, nn.Linear): return m.in_features, m.out_features # weight [out, in] if isinstance(m, Conv1D): return m.weight.shape[0], m.weight.shape[1] # weight [in, out] raise TypeError(type(m)) def corda_init_fixed(model): for name, m in model.named_modules(): if isinstance(m, (nn.Linear, Conv1D)): in_f, out_f = dims_of_fixed(m) A = torch.randn(4, in_f) * 0.01 # [r, in] B = torch.zeros(out_f, 4) # [out, r] # 注意:Conv1D 的 weight 是 [in, out],若用 W 推导需转置 if isinstance(m, Conv1D): W = m.weight.T # -> [out, in],与 Linear 对齐 else: W = m.weight assert W.shape == (out_f, in_f) return "Linear 和 Conv1D 都已正确初始化" torch.manual_seed(0) model = MiniGPT2() print("错误初始化:", corda_init_broken(model)) print("正确初始化:", corda_init_fixed(model))运行后:错误版跳过 Conv1D(GPT-2 的注意力层就没被 CoRDA 初始化),正确版两种类型都处理,且对 Conv1D 的weight做了转置对齐,维度一致。
五、解决方案(第一层:最小直接修复)
修复 1:同时识别 Conv1D 与 nn.Linear
TARGET_TYPES = (nn.Linear, Conv1D) for name, m in model.named_modules(): if isinstance(m, TARGET_TYPES): ... # 两种都处理修复 2:维度从 weight.shape 读,别依赖 in_features
def dims_of(m): if isinstance(m, nn.Linear): return m.in_features, m.out_features # [out, in] if isinstance(m, Conv1D): return m.weight.shape[0], m.weight.shape[1] # [in, out]修复 3:Conv1D 的 weight 转置对齐 Linear
CoRDA 推导A/B时通常假设W是[out, in]。对Conv1D取W = m.weight.T再参与推导,保证数学一致:
W = m.weight.T if isinstance(m, Conv1D) else m.weight # 后续用 W[in_f, out_f] 的转置参与 CoRDA 公式六、解决方案(第二层):结构性改进
改进 1:封装激活收集 hook,兼容两种类型
def register_act_hook(module, storage): def hook(_mod, inp, out): x = inp[0].detach().reshape(-1, inp[0].shape[-1]) storage.append(x) return module.register_forward_hook(hook) # 对 Linear 和 Conv1D 都挂 for m in model.modules(): if isinstance(m, (nn.Linear, Conv1D)): register_act_hook(m, stats[m])改进 2:统一“线性层抽象”,屏蔽 Conv1D/Linear 差异
class LinearLike: @staticmethod def weight(m): return m.weight.T if isinstance(m, Conv1D) else m.weight @staticmethod def in_out(m): if isinstance(m, nn.Linear): return m.in_features, m.out_features return m.weight.shape[0], m.weight.shape[1] # CoRDA 全程用 LinearLike,不关心具体类型改进 3:在 GPT-2 上自动探测 Conv1D
def find_linear_like(model): return [(n, m) for n, m in model.named_modules() if isinstance(m, (nn.Linear, Conv1D))] # 注入前先打印,确认 Conv1D 也被纳入 print([n for n, _ in find_linear_like(model)]) # 应包含 attn(Conv1D)七、解决方案(第三层):断言 / CI 守护
import torch import torch.nn as nn import pytest class Conv1D(nn.Module): def __init__(self, nf, nx): super().__init__() self.weight = nn.Parameter(torch.empty(nx, nf)) self.bias = nn.Parameter(torch.zeros(nf)) def dims_of(m): if isinstance(m, nn.Linear): return m.in_features, m.out_features if isinstance(m, Conv1D): return m.weight.shape[0], m.weight.shape[1] raise TypeError(type(m)) def test_conv1d_dims_read_from_weight(): m = Conv1D(16, 32) # in=32, out=16 assert dims_of(m) == (32, 16) def test_linear_dims_unchanged(): m = nn.Linear(16, 32) assert dims_of(m) == (16, 32) def test_conv1d_weight_transpose_aligns(): m = Conv1D(16, 16) W = m.weight.T assert W.shape == (16, 16) # 与 Linear 的 [out, in] 对齐 def test_corda_init_covers_conv1d(): class M(nn.Module): def __init__(self): super().__init__() self.attn = Conv1D(16, 16) self.mlp = nn.Linear(16, 16) model = M() covered = [n for n, m in model.named_modules() if isinstance(m, (nn.Linear, Conv1D))] assert "attn" in covered and "mlp" in covered这四个测试守护“Conv1D 维度从 weight 读、Linear 维度不变、Conv1D 权重转置对齐、CoRDA 覆盖 Conv1D”。
八、排查清单
CoRDA 在 GPT-2 上初始化失败时按序查:
- 确认是否有 Conv1D:GPT-2 注意力/MLP 用
Conv1D,不是nn.Linear。 - 检查类型识别:CoRDA 是否只
isinstance(m, nn.Linear),漏了Conv1D。 - 维度读 weight.shape:别用
in_features属性,Conv1D没有。 - 权重转置对齐:
Conv1D的weight是[in, out],需.T转成[out, in]再参与 CoRDA 公式。 - 激活 hook 要挂两种类型:
Conv1D的激活也必须收集,否则统计为空 → NaN。 - 打印纳入的层:注入前打印
find_linear_like,确认 Conv1D 在列。 - 测试守护:维度读取、转置对齐、覆盖率必须有测试。
- 统一抽象:用
LinearLike屏蔽 Conv1D/Linear 差异,避免散落判断。
九、小结
CoRDA initialization lacks support for Conv1D layers in older models like GPT-2的根因是:CoRDA 初始化只识别nn.Linear、从in_features属性读维度,而 GPT-2 的Conv1D既不在该类型里、又没有in_features(维度藏在weight.shape且顺序为[in, out]与 Linear 的[out, in]相反),导致 Conv1D 层的激活统计缺失、初始化被跳过或维度报错。
最小修复是让 CoRDA 同时识别Conv1D与nn.Linear、维度从weight.shape读取、对Conv1D的weight转置对齐[out, in]、激活 hook 两种类型都挂;结构性改进是封装兼容两种类型的激活收集 hook、用LinearLike抽象屏蔽差异、自动探测 GPT-2 的 Conv1D;最后用测试守护“维度读取正确、转置对齐、覆盖率完整”。这样 CoRDA 才能在 GPT-2 等旧模型上完整生效。
