当前位置: 首页 > news >正文

从CVE到CWE:基于系统调用的主机入侵检测系统泛化研究

大家读完觉得有帮助记得关注和点赞!!!

摘要

基于系统调用追踪的主机入侵检测系统(HIDS)通常在单个通用漏洞披露(CVE)实例上进行训练和评估。然而在实际运行环境中,防御者需要识别出已知弱点类型的新型攻击利用。我们通过实证研究检验了一个核心问题:在一个共享通用弱点枚举(CWE)类别的CVE集合的正常行为上训练的单类异常检测器,能否泛化到同一类别内未见过的不同CVE上。我们从LID-DS-2021数据集中选取了六个场景,归入三个CWE家族(CWE-307 身份验证绕过、CWE-89 SQL注入、CWE-434 无限制文件上传),为每个滑动窗口提取了66维Peng-Guo风格的特征向量,并训练了孤立森林(Isolation Forest)和随机梯度下降单类支持向量机(SGD One-Class SVM)检测器,其仅基于正常样本的阈值针对固定的目标误报率进行校准。我们定义并回答了四个研究问题,涵盖自检测、非对称跨CVE迁移、组合CWE级正常轮廓的价值以及特征过滤对可迁移性的影响。组合CWE-307检测器在目标误报率 FPR=0.05下达到了 F1=0.6976(精确率 =0.8994,召回率 =0.5698),而CWE-89和CWE-434在相同协议下F1 ≤0.21。跨CVE迁移被发现具有强烈的方向依赖性,且由源正常轮廓的广度主导,而非由CWE标签本身决定。我们得出结论:使用当前的系统调用特征,HIDS中的CWE级泛化在某些弱点家族中是可以实现的,但并非所有家族都能实现;我们认为,在校准的FPR下进行报告是此场景下诚实评估的方法论前提。

关键词:主机入侵检测、系统调用、异常检测、通用弱点枚举、单类学习、校准、容器安全、LID-DS-2021

1 引言

Linux容器上的主机入侵检测目前主要由将每个已知漏洞视为独立检测目标的方法主导。Forrest关于短系统调用序列的开创性工作[1]开启了一系列分类器的研究,现代形式下通常为每个场景或应用程序学习一个模型[3, 6, 7, 8]。然而在实践中,两个运行现实阻碍了这种设计。首先,新CVE条目[30]的涌现速度快于生产模型重新训练的速度[28, 29]。其次,安全运营分析师很少需要知道具体是哪个CVE被利用;他们需要知道触发了哪类弱点,因为适当的缓解措施——输入净化、文件上传验证、身份验证尝试节流——是由CWE类别而非CVE标识符决定的。

本文研究容器化应用程序的运行时行为是否在系统调用追踪中暴露出足够强的CWE级不变量,以支持覆盖同一类别多个CVE的单一检测器。这个问题的动机源于SecQuant[18]中的一个实证观察:共享缺陷类型的不同CVE往往在系统调用上产生视觉上相同的风险权重向量。作者使用该观察来量化暴露程度,但并未构建检测器。北卡罗来纳州立大学(NCSU)的密切相关工作[14, 15, 16, 17]根据影响(如“任意代码执行”、“凭证泄露”)对攻击利用进行分组,而非根据底层缺陷的CWE类别。

我们将问题构建为基于Peng Guo的HIDS流水线[11]改编的每窗口特征上的单类异常检测,然后询问所得模型在跨CVE和组合CWE协议下的表现。至关重要的是,阈值不是在标记的攻击利用数据上选择的;它们是在仅包含正常样本的验证分割上,针对固定的目标误报率进行校准的[10, 9, 26]。这种校准使得方向依赖的迁移效应变得可见,否则这些效应会被标签调优的阈值所掩盖。

本文的贡献如下:

  • 一种用于CWE级HIDS的评估协议,其中阈值选择与攻击利用标签解耦,并在报告精确率、召回率和F1的同时报告实际达到的FPR。

  • 在三个CWE家族(CWE-307、CWE-89、CWE-434)和六个场景(第5节)上的实证证据,表明跨CVE的可迁移性具有强烈的不对称性,并且由源正常轮廓的广度主导,而非由共享的CWE标签主导。

  • 关于特征过滤的定量结果,与直觉“选择稳定特征以获得更好的迁移”相矛盾:最激进的正常域稳定性过滤器破坏了我们观察到的最强迁移方向。

  • 三个伪代码算法(第4-5节),完整指定了研究中使用的校准检测、跨CVE迁移和特征选择流程。

本文其余部分组织如下:第2节综述相关文献。第3节陈述假设和研究问题。第4节描述数据集、特征表示、单类模型和校准协议。第5节报告实验结果。第6节讨论为什么CWE-307泛化良好而CWE-89和CWE-434不能,第7节总结。

2 相关工作

基于系统调用的HIDS。​ 作为行为信号的系统调用序列可追溯至STIDE[1, 2],并已通过n-gram和语言模型[3, 4]发展到语义和基于图的表示[6, 5]。LID-DS-2019和LID-DS-2021数据集[7, 8]标准化了在容器化应用程序上对HIDS的评估,也是本文的实证基础。Peng Guo的最新工作[11]用参数、返回值和资源统计丰富了序列特征,我们将其采纳为特征主干。Khairi等人[12](CHIDS)以及Sommer和Paxson的经典评述[13]阐述了我们尝试避免的方法论陷阱:隐藏的标签泄露和在测试数据上调优阈值。

容器攻击利用检测。​ NCSU系列工作[14, 15, 16, 17]根据影响类别对容器攻击利用进行分类。CDL[15]根据正常行为对应用程序聚类,SHIL[16]增加了自监督混合学习,最新框架[17]覆盖了46个CVE。这些工作均未根据CWE对攻击利用进行分组;本文恰好为此类运行时检测贡献了这种分组。

静态和文本CVE到CWE映射。​ ThreatZoom[19]、V2W-BERT[20]、TREE-VUL[21]和VulANalyzeR[22]从文本、补丁或二进制文件中预测CWE。Atiiq等人[23]表明,CWE专用分类器优于单一二元分类器。这些工作确认了CWE粒度的重要性,但它们在设计时运行,而非运行时。

异常检测方法学。​ 孤立森林[9]和单类SVM[10]是我们使用的两类模型。在固定误报率下校准阈值是生物识别和入侵检测工作中的长期标准[26, 27]。网络入侵的分层分类[24]、多通道对比学习[31]和基于原型的对比学习[25]为未来的CWE感知模型提供了方法论模板,但尚未有应用于带有CWE标签的容器系统调用追踪。此类工作中二元分类指标的选择和报告遵循Canbek等人[32]综述的惯例。

本工作的定位。​ 与[17]相比,我们按原因(CWE)分类,而非按影响;与[19, 21, 22]相比,我们在运行时追踪上运行,而非源代码或二进制文件;与[11]相比,我们重用特征空间,但提出了不同的评估问题——相同的特征空间是否能在共享CWE类别的CVE之间进行迁移?

3 问题表述与假设

令 T为容器化应用程序的滑动窗口系统调用追踪,ϕ:T→Rd为特征提取器。令 C为一个CWE类别,{v1​,…,vk​}⊂C为共享类别 C的一组CVE。C类别的检测器是一个函数 hC​:Rd→{0,1},它从 C中任意子集 V⊂C的追踪中训练,使得对于任何新的 v⋆∈C∖V以及任何包含 v⋆攻击利用的追踪 T⋆,都有 hC​(ϕ(T⋆))=1的概率很高,同时 C中任何应用程序的正常行为上的误报率保持在用户指定的目标 α以下。

这个表述明确了两个假设。第一,检测器是单类的:它仅基于正常追踪训练。第二,正常轮廓本身是应用程序的属性,而非CWE的属性,因此CWE级检测器必须组合或以其他方式调和多个应用程序特定的正常轮廓。

假设(操作形式)。​ 如果两个CVE va​,vb​∈C共享相同的CWE类别,那么在 α≤0.05的校准误报率下,在 {va​,vb​}的正常窗口并集上训练的单类检测器,应用于 {va​,vb​}的测试帧并集时,实现的F1严格优于在相同 α下评估的两个按场景自检测器中最好的那个,同时将实际达到的FPR保持在 α的一个数量级内。如果两个条件都成立,则该假设对 C成立;如果任一条件失败(实际FPR过大或无F1增益),则被证伪。这是一个可直接检验的标准,避免了模糊的“与自检测相当”的表述:组合CWE-307满足它(第5节);CWE-89和CWE-434不满足。

研究问题。​ 我们将假设分解为四个研究问题。

  • RQ1.​ 在单个CVE场景上进行仅正常训练,能否在校准的FPR下产生可用的自检测器?——这是下限;没有它,CWE级扩展毫无希望。

  • RQ2.​ 在CVE va​的正常轮廓上训练的异常模型,能否迁移到同一CWE类别中未见过的CVE vb​上?迁移是对称的吗?

  • RQ3.​ 将 {va​,vb​}的正常轮廓池化为一个单一的CWE级检测器,在固定的目标FPR下,是否优于自检测和跨CVE检测器?

  • RQ4.​ 最大化 {va​,vb​}之间正常域稳定性的特征过滤器,能否改善跨CVE的可迁移性?

4 方法学

4.1 数据集与特征空间

表1总结了六个场景。它们取自LID-DS-2021[8],该数据集已附带CWE标签的场景名称,并归入三个CWE类别。

表1:特征提取后每场景的行数。train normal仅包含正常窗口;test混合了正常和攻击利用窗口。

CWE

场景

训练正常

测试正常

测试攻击利用

特征数

CWE-307

Bruteforce_CWE-307

26,857

103,278

4,528

66

CWE-307

CVE-2012-2122

29,473

112,723

233,425

66

CWE-89

CWE-89-SQL-injection

30,741

115,279

9,599

66

CWE-89

Juice-Shop

26,135

34,936

3,777

66

CWE-434

EPS_CWE-434

26,820

37,628

1,530

66

CWE-434

PHP_CWE-434

30,703

114,328

4,296

66

特征提取器 ϕ产生每窗口66维向量。遵循Peng Guo[11]和LID-DS-2021的报告惯例[8],窗口长度为1秒,步长为300毫秒。我们在本研究中有意不改变这些窗口参数:目的是将CWE级泛化问题与特征工程选择隔离开来,因此窗口大小固定为参考HIDS流水线在LID-DS-2021上使用的数值。跨CVE迁移对窗口大小的敏感性是一个已知的开放性问题,留待未来工作。66个特征分为六组:(i) 未见参数和未见系统调用影响(UAI, USI);(ii) 返回值为负的系统调用计数;(iii) 每窗口系统调用频率(FI);(iv) 资源相关系统调用的最大数据量特征(SRF);(v) PID/TID统计;(vi) 事件间时间间隔直方图。

4.2 模型与校准

我们使用两种具有正交归纳偏置的单类模型。孤立森林[9]依赖随机划分,对缩放和高维具有鲁棒性。SGD单类SVM[10]通过Rahimi和Recht[33]的随机特征展开近似RBF核,并使用随机梯度下降在类铰链的单类损失上训练。两种模型均与StandardScaler或RobustScaler预处理配对,每个场景产生六个候选模型。

校准步骤在不接触标记攻击利用的情况下将异常分数转化为二元决策。算法1阐述了该协议;它是本文核心的方法论工具,也是唯一应用于组合CWE检测器(第4.4节)的协议。

算法1 仅正常样本的校准单类检测

1: 正常训练帧 Dn​,混合测试帧 Dt​,候选模型 M,目标误报率 α,随机数种子 s

2: 阈值 τ,决策函数 h,指标 M

3: Dn_fit​,Dn_cal​←TrainTestSplit(Dn​,0.3,s)

4: Σ←FitScaler(Dn_fit​)

5: M←FitModel(Σ(Dn_fit​),s)

6: Sc​←AnomalyScores(M,Σ(Dn_cal​))

7: τ←Quantile(Sc​,1−α)// 分数越高越异常

8: St​←AnomalyScores(M,Σ(Dt​))

9: y^​←[s≥τ:s∈St​]

10: M←Metrics(y^​,yt​)// 精确率、召回率、F1、实际FPR

11: return​ τ,h:x↦[AnomalyScore(M,Σ(x))≥τ],M

对于每个场景,我们在三个目标FPR α∈{0.001,0.01,0.05}下为每个候选运行算法1,并报告在每个 α下,对应测试帧上F1最大的候选模型。最佳候选模型的选择因此基于测试帧,但该候选模型的阈值是算法1在仅包含正常样本的校准分割上设定的,从未接触攻击利用标签。我们注意到,该协议对于自检测和组合CWE检测器仍然允许一种温和的形式选择偏差,因为架构/缩放器是在我们报告结果的同一标记测试帧上挑选的。在当前设定下,这种偏差是有限的——候选池仅有六个成员(两个模型 × 两个缩放器加上孤立森林的一个超参数变体),且同一个候选(sgd_ocsvm_rbf)在所有三个 α值下赢得了所有组合检测器的胜利,因此选择是鲁棒的。在第4.3节的跨CVE迁移协议中,这种偏差在设计上是不存在的,因为最佳候选是在源测试帧上选择的,然后不加改变地应用到目标帧。因此,表4中的跨CVE F1数值是更保守的测量,也是我们讨论的主要锚点。

4.3 跨CVE迁移协议

迁移协议如算法2所示。校准集始终是源场景的仅正常分割,因此阈值从未暴露于目标正常分布。在目标测试帧上的实际FPR独立于目标FPR进行报告:它直接衡量了迁移阈值在新正常轮廓上付出的误报代价。

算法2 跨CVE迁移评估

1: 源场景 s,目标场景 t,目标FPR α

2: 迁移指标 Mt​

3: τ,h,⋅←Algorithm 1(Dn​(s),Dt​(s),M⋆,α)// M⋆是 s的最佳候选

4: y(t)←labels of Dt​(t)

5: y^​(t)←h(Dt​(t))

6: Mt​←Metrics(y^​(t),y(t))

7: return​ Mt​

4.4 组合CWE检测器

组合检测器将CWE类别视为单一的训练分布。其拟合、校准和测试帧是该类别中所有CVE对应帧的并集。模型、缩放器和阈值通过算法1在合并后的数据上选择。这是对第3节所述假设在操作上最有利的实现。

4.5 特征选择

为了回答RQ4,我们构建了六个特征集,列于表2。算法3计算了最重要的构造:带有可调偏移惩罚的联合稳定性/重要性分数。

表2:用于CWE-307的特征集(见第4.5节)。

名称

大小

构造

all

66

每个数值特征

clean

53

移除低方差和相关特征

stable

26

两个CVE正常样本上的双样本KS距离 <0.2

stable_imp

20

stable 与重要性前20的交集

score_l0p0_top20

20

仅按重要性排名前20 (λ=0)

score_lλ_top20

20

按重要性排名前20,带KS偏移惩罚 λ∈{0.25,0.5,1}

算法3 重要性-稳定性特征评分

1: 源正常样本 Ns​,目标正常样本 Nt​,源标记样本 Ls​,前k个,惩罚系数 λ

2: 排序特征列表 F

3: I←PermutationImportance(Ls​)// 归一化到 [0,1]

4: for each​ feature fdo

5: df​←KSDist(Ns​[f],Nt​[f])

6: end for

7: for each​ feature fdo

8: rf​←If​−λ⋅df​

9: end for

10: F←特征按 rf​降序排序,取前k个

11: return​ F

算法3表达了RQ4的方法论问题:一个在正常域有较大偏移的特征应该因为无法迁移而被丢弃,还是因为它携带攻击信号而被保留?设置 λ=0保留所有重要特征,无论偏移如何;λ→∞强制选择仅与稳定集重合。

5 实验结果

图1展示了校准检测流水线。所有实验使用种子42和requirements.txt中列出的python包版本;完整报告存储为CSV文件,以便任何报告的指标都可以追溯到模型、缩放器、阈值分位数和种子。

图1:校准的单类CWE检测流水线。左侧为仅正常训练与校准;目标FPR设定阈值;右侧为窗口级的二元决策,支持自检测、跨CVE和组合评估。

图2对比了我们比较的两种HIDS模式:左侧是每个CVE一个单独的检测器,右侧是CWE级检测器。RQ2和RQ3量化了右侧模式在实证上是否可达。

图2:按CVE检测(左)与本论文研究的CWE级检测器(右)。右侧面板将共享一个CWE类别的几个CVE的正常轮廓汇集到一个组合检测器中。

5.1 RQ1:校准FPR下的自检测

表3报告了三个目标FPR下每个场景的最佳自检测候选。自检测始终较弱:即使是最宽松的操作点(α=0.05),所有六个场景的F1 ≤0.31。当实际FPR较低时,CWE-307场景达到更高的精确率(例如在 α=0.01下,CVE-2012-2122为0.9301),但代价是召回率低于7%。这幅图景与先前关于LID-DS[8]的报告一致:当阈值不在标签上调整时,按场景的单类HIDS仅能恢复一小部分攻击利用窗口。

解读F1数值。​ 两个设计因素压低了表3的F1,必须牢记于心。首先,阈值分位数仅由 α在正常样本上固定,因此操作点在构造上并非F1最优;这是在阈值选择期间不看攻击利用标签所付出的代价。其次,几个测试帧严重不平衡(例如表1中CVE-2012-2122在112,723个正常窗口中有233,425个攻击利用窗口),因此即使完美校准的 FPR=0.01在低召回率下也只产生 ∼1,000个假阳性,而假阴性数以万计。因此,较低的F1数值衡量的是通过这个固定操作点,单个CVE的正常样本能看到多少攻击信号,而非底层检测器的上限;我们将其视为RQ2和RQ3比较的方法论基线。

表3:三个校准目标FPR下的自检测(每行的最佳候选)。

CWE

场景

α

实际FPR

精确率

召回率

F1

CWE-307

Bruteforce_CWE-307

0.01

0.0315

0.1870

0.1652

0.1754

CWE-307

Bruteforce_CWE-307

0.05

0.0834

0.1222

0.2646

0.1671

CWE-307

CVE-2012-2122

0.01

0.0099

0.9301

0.0637

0.1192

CWE-307

CVE-2012-2122

0.05

0.0498

0.8443

0.1304

0.2259

CWE-89

CWE-89-SQL-injection

0.05

0.0512

0.3546

0.2197

0.2713

CWE-89

Juice-Shop

0.05

0.0518

0.1809

0.1059

0.1336

CWE-434

EPS_CWE-434

0.05

0.0899

0.0665

0.1575

0.0935

CWE-434

PHP_CWE-434

0.05

0.0487

0.1202

0.1769

0.1431

5.2 RQ2:跨CVE迁移具有方向依赖性

图3可视化了每个CWE家族内部的迁移F1。对角线条目是自检测(未校准基线),非对角线条目是使用源调优候选的跨CVE迁移。CWE-307的不对称性非常显著:Bruteforce_CWE-307 →CVE-2012-2122 产生 F1 =0.8054,而反向则崩溃至 0.0782。

图3:每个CWE家族内部的跨CVE迁移F1。对角线显示自检测(未校准)。非对角线单元格显示拟合在源CVE上并应用于目标CVE的异常模型的F1。

由此得出两点观察。首先,迁移可以非常强:暴力破解尝试的并集包含了CVE-2012-2122暴力破解场景的行为足迹,因此源正常轮廓是目标正常轮廓的超集。其次,反之则不成立:CVE-2012-2122的正常轮廓要窄得多,将其应用于Bruteforce的正常样本基本上会将所有东西都置于阈值之上,这解释了表4中高召回率但极低精确率的原因。

表4:CWE-307的校准跨CVE迁移。实际FPR是目标正常窗口中高于源集阈值的份额。标†的行在操作上不可用(目标正常上的实际FPR ≥0.6);这些行的F1值仅报告为使不对称性可见,不应解读为检测器性能。

源 →目标

模型

α

实际FPR

精确率

召回率

F1

Brute →CVE-2012-2122

IF

0.001

0.9831†

0.6426

0.8534

0.7331

Brute →CVE-2012-2122

SGD-OCSVM

0.01

0.6331†

0.7379

0.8608

0.7946

Brute →CVE-2012-2122

SGD-OCSVM

0.05

0.7814†

0.7137

0.9405

0.8115

CVE-2012-2122 →Brute

SGD-OCSVM

0.001

0.0228

0.0400

0.0216

0.0281

CVE-2012-2122 →Brute

IF

0.01

0.6510†

0.0467

0.7277

0.0878

CVE-2012-2122 →Brute

IF

0.05

0.9257†

0.0413

0.9092

0.0790

5.3 RQ3:组合CWE-307检测器带来回报

将两个CWE-307的正常样本合并为一个拟合/校准/测试池,得到了整个研究中最强的检测器。在 α=0.01下,组合检测器达到精确率 =0.9642,召回率 =0.4368,F1 =0.6013,实际FPR为 0.0179。将 α提高到 0.05,则以实际FPR 0.0702换取 F1 =0.6976。

表5对比了相同目标FPR下三个CWE家族的表现。CWE-307以数量级优势占据主导。CWE-89和CWE-434崩溃至F1 ≤0.21,在 α=0.05下精确率分别降至 0.28和 0.12。因此,组合检测器证实了CWE-307的假设,但(使用当前特征)否定了CWE-89和CWE-434的假设。

表5:三个校准目标FPR下的组合CWE级检测器。

CWE

α

实际FPR

精确率

召回率

F1

假阳性

假阴性

CWE-307

0.001

0.0017

0.9902

0.1589

0.2739

376

200,142

CWE-307

0.01

0.0179

0.9642

0.4368

0.6013

3,859

134,010

CWE-307

0.05

0.0702

0.8994

0.5698

0.6976

15,163

102,369

CWE-89

0.001

0.0010

0.6930

0.0243

0.0469

144

13,051

CWE-89

0.01

0.0079

0.5002

0.0893

0.1516

1,194

12,181

CWE-89

0.05

0.0381

0.2810

0.1674

0.2098

5,728

11,137

CWE-434

0.001

0.0026

0.3021

0.0299

0.0544

402

5,652

CWE-434

0.01

0.0159

0.2023

0.1054

0.1386

2,421

5,212

CWE-434

0.05

0.0560

0.1168

0.1933

0.1456

8,517

4,700

图4:跨协议和CWE家族的F1。“最佳迁移”取自表2的七个特征集;“组合,未校准”是通过在联合测试帧上扫描异常分数分位数可达到的最高F1(标签调优上限,仅供参考);“组合,校准”是算法1下最佳目标FPR处的值。

图5:三个目标FPR下的组合CWE-307检测器。实际FPR紧密跟踪目标FPR,这是算法1的期望行为。召回率和F1随 α增长,而精确率平稳下降。

5.4 RQ4:稳定性过滤器可能损害迁移

图6按两个CWE-307场景正常窗口分布的双样本KS距离对66个特征中的16个进行了排名。稳定组主要由在两个场景中基本恒定的资源特征(lseek、pread、sendto的sc_size计数器)和事件间时间间隔直方图的箱组成。偏移组主要由数据量特征(pwrite、writev、read、brk的sc_size计数器)和PID切换频率主导。

图6:两个CWE-307场景正常窗口分布之间的双样本KS距离。资源大小和PID切换特征主导了偏移组;lseek和pread字节计数器在两个正常样本中基本相同。

如果RQ4是肯定的,将模型限制在稳定集应改善迁移。图7显示了相反的情况。稳定集将强方向上的迁移F1从 0.8054(使用全部特征)崩溃至 0.0348;stable_important子集恢复了一些信号,但仅在弱方向上(F1 0.1357vs. 使用全部特征时的 0.0782)。带有 λ=0的分数族(算法3)——仅重要性,无偏移惩罚——给出了20维特征集中的最佳表现,保留了大部分强方向信号。

图7:特征过滤器对CWE-307内部跨CVE迁移F1的影响。最激进的正常域稳定性过滤器(stable)破坏了强方向;仅重要性的前20(score_l0p0)保留了大部分信号。

解释是:具有最大正常域偏移的特征也可能携带攻击信号:数据量特征在两个正常工作负载之间发生变化,但在任一工作负载的正常和攻击利用窗口之间也会发生变化。因此,稳定性过滤器同时移除了讨厌的偏移和有用的信号,对迁移F1的净效应是负的。

6 讨论

为什么CWE-307能泛化。​ 两个CWE-307场景共享一个强烈重复的行为足迹:在身份验证端口上的短连接-读取-写入-关闭循环。暴力破解流量在Bruteforce场景的正常轮廓中占据主导地位,以至于模型在正常训练期间有效地看到了攻击信号。CVE-2012-2122重用该行为类别,只是进程名称和参数不同,因此在缩放器平滑掉应用层面的表面差异后,源拟合检测器仍能识别攻击模式。

量化不对称性。​ 审稿人驱动的后续问题是,“Bruteforce正常样本是CVE-2012-2122正常样本的超集”能否得到定量支持。我们计算了每个CWE家族在66个特征的每一个上,两个场景正常窗口分布的双样本KS距离,然后总结该分布。表6报告了最小、平均和中位数KS距离以及稳定特征(KS <0.2)的数量。对比非常鲜明:CWE-307有18个这样的特征,最小KS为 6×10−4,而CWE-89仅有2个(最小KS 0.149),CWE-434有5个(最小KS 0.139)。两个CWE-307正常样本共享一个几乎相同的子空间;而CWE-89和CWE-434的正常样本则不然。因此,“超集”解释与KS偏移轮廓一致,而CWE-89和CWE-434中有限的正常轮廓重叠本身就足以预测其较弱的组合检测器性能。

表6:每个CWE家族两个正常窗口分布之间的双样本KS距离摘要,取自清理后过滤器特征集(CWE-307/89为 d=53,CWE-434为 d=54)。“稳定”计数KS <0.2的特征。

CWE

场景配对

最小KS

平均KS

中位数KS

#稳定

CWE-307

Bruteforce vs. CVE-2012-2122

0.0006

0.457

0.477

18

CWE-89

SQL-injection vs. Juice-Shop

0.1492

0.595

0.560

2

CWE-434

EPS vs. PHP

0.1390

0.587

0.605

5

为什么CWE-89和CWE-434不能。​ 对于CWE-89(SQL注入),每窗口特征空间由HTTP请求量特征主导,这些特征在Juice-Shop和独立SQL注入场景之间变化剧烈;对于CWE-434,EPS和PHP场景共享逻辑模式(上传然后执行),但在哪些系统调用承载该模式上存在分歧(例如PHP中不同的execve链)。表6中的KS分析证实了这些定性解释:CWE-89偏移最大的特征是tid_count(KS 0.999)、pid_switch_frequency(0.983)和pid_count(0.974);这些是应用身份代理,而非CWE特定信号。对于CWE-434,领导者是munmap、mmap、brk和pread的sc_size字节计数器,所有这些都编码了运行时(PHP vs. EPS)特定的内存管理模式,而非上传-执行主题。特征提取器未能揭示单一的上传-执行时间模式,因此相对于应用级偏移,残留的CWE不变量信号很小。

校准很重要。​ 表4表明,未校准的跨CVE迁移可能显得欺骗性地强:仅源模型几乎将每个目标正常窗口标记为异常,这夸大了召回率但在操作上无用。实际FPR是首先要检查的数字:如果它比目标FPR高出一个数量级,即使召回率看起来很高,迁移也已经失败。我们建议在CWE级评估中,始终在实际FPR旁边报告精确率/召回率/F1。

稳定性不等于可迁移性。​ RQ4与“特征在两个正常样本间越稳定,其迁移性越好”的直觉相矛盾。如第5.4节所述,有用的信号可能存在于特征分布的偏移尾部。因此,CWE级HIDS的一个合理的特征选择标准必须结合跨CVE攻击重要性和受控的偏移惩罚,算法3是其最简单的形式。

局限性。​ 本研究涵盖三个CWE家族,每个家族两个CVE;需要更广泛的CWE覆盖才能声称普遍的经验结论。我们总共使用了LID-DS-2021的六个场景;LID-DS-2021还提供了标有额外CWE类别的其他场景(如CWE-22路径遍历、CWE-94代码注入),此处尚未覆盖。我们的特征提取器遵循Peng Guo[11];更丰富的表示——进程系统调用序列的图模型(PSSG)、进程间图或对比嵌入[25, 31]——很可能是使CWE-89和CWE-434起效所必需的。阈值校准假设校准正常样本代表了运行时的正常情况;在生产中,必须定期重新审视这一假设。当前草稿中作者身份已被隐去(标题页使用占位符名称);最终正式版本将恢复真实的作者元数据。

7 结论

在基于系统调用的HIDS中,从CVE级检测到CWE级检测的过渡在实证上是可行的,但在弱点类别上并不均匀。使用Peng-Guo风格的66维特征向量、校准的单类学习和仅正常样本的阈值协议,CWE-307的单一组合检测器在实际FPR =0.0702下实现了F1 =0.6976,可与强大的按场景基线相媲美。相同的协议在CWE-89和CWE-434上失败(最佳F1 ≤0.21)。跨CVE迁移具有强烈的方向依赖性,并由源正常轮廓的广度主导,而非由共享的CWE标签主导。最大化两个CVE间正常域稳定性的特征过滤器可能会破坏可迁移的信号;带有受控偏移惩罚的重要性驱动选择更为可取。

由此得出两项方法学建议。首先,阈值校准必须与攻击利用标签解耦:任何在真实FPR报告下消失的明显CWE级迁移都是标签调优阈值的产物。其次,未来的CWE级HIDS应要么用对应用身份不变的结构模式来丰富特征空间——基于图的系统调用模型[11]和对比原型嵌入[25]是具体的候选方案——要么采用显式的多任务公式[22, 24],在标记数据上训练表示使其具有CWE判别性。这两个方向都为未来工作敞开。

http://www.jsqmd.com/news/1237647/

相关文章:

  • SLA树脂手板精度与交期实测
  • 2026重庆宠物美容培训优质机构实力盘点 - 谁都没有我好看
  • 2026生产级RAG检索怎么调优?4种方案对比,零代码提31%召回率附选型表 - 曌选科技官方账号
  • Spring Security CSRF防护机制详解与实战配置
  • 2026 年现阶段,台前比较好的亚克力盒子优质厂家找哪家,揭秘!这个透明盒子如何帮你省下高昂的包装成本? - 企业推荐官【认证】
  • 【2019-05-30】蓝牙特定术语简单介绍
  • 2026滁州GEO优化公司新**丨生成式引擎优化服务商头部**与本地选型参考 - 小随科技
  • AM65x硬件设计实战:从接口配置到PCB布局的嵌入式系统开发指南
  • 哪款标签打印软件好用?从入门到专业,一篇深度对比告诉你答案
  • [人工智能]生成式AI:模型、应用与流程
  • 2026京津冀图书代理商与教辅稿件供货厂家的秘密大揭秘! - 米諾
  • 48路无纸记录仪:工业自动化数据采集的核心设备
  • 时序感知文档切片与指令微调:构建工业级知识协同系统
  • MassTransit消息总线在.NET微服务中的实践与优化
  • 2026衡水碳钢法兰不锈钢法兰厂家推荐避坑指南:6个挑选要点,帮你绕开90%的坑 - mobible
  • 宝鸡老牌驾校有哪些?2026 本地办学 20 年以上靠谱驾校盘点 - 米諾
  • 湖南新鲜零食供应链|平江酱干、臭豆腐,魔芋干,牙签牛肉,无骨凤爪厂家批发!源头工厂一站式服务 - 米諾
  • 融资性能调优_finta-performance-tuning
  • 企业AI知识库:八大行业如何落地?
  • 用 AI 导出鸭高效处理:腾讯元宝数学公式如何正确粘贴
  • 2026绍兴汽车贴膜门店实测测评:5家正规门店横向对比,星空汽车贴膜综合领先 - 米諾
  • 自主AI智能体开发指南:从原理到实践
  • 解释器模式前置:文法、BNF与AST
  • C#与YOLO结合的工业视觉检测系统开发指南
  • 如何彻底解决腾讯游戏ACE-Guard卡顿:免费开源性能优化工具完全指南
  • 【React】Immer.js 在现代 Redux 生态中的角色:不可变性保障的工程化实现与开发体验优化
  • 亲身探访广州天梭**售后服务中心|维修地址及售后服务热线(2026年7月最新) - 天梭服务中心
  • Unity毕业设计架构指南:单例与事件总线构建可维护项目
  • 2026重庆宠物美容培训行业:靠谱机构优选指南 - 谁都没有我好看
  • 2026泸州靠谱装修怎么选,看完这篇不踩装修陷阱-蓝本分析四星装饰:新房整装、老房改造、商业工装、自建房等八大装修场景 - 米諾