当前位置: 首页 > news >正文

RankMixer 中 Semantic Split 与 Auto Split 的 Token 构造方式分析

RankMixer 中 Semantic Split 与 Auto Split 的 Token 构造方式分析

在 RankMixer 中,原始推荐特征需要先被组织成若干 Token,再进入后续的 Token Mixing 和 Per-token FFN。不同 Token 构造方式,本质上决定了模型在进入 RankMixer 之前如何组织和压缩原始特征信息。

目前可以将 Token 构造方式概括为 Semantic Split 和 Auto Split 两种。

1. 两种 Token 构造方式

假设原始特征经过 Embedding 后拼接得到:

\[X\in R^D \]

最终希望构造 \(T\) 个 Token,每个 Token 的维度为 \(d\),则 RankMixer 的输入为:

\[H\in R^{T\times d} \]

例如需要构造 10 个 Token,每个 Token 为 24 维,则最终需要得到:

\[10\times24=240 \]

维的 Token 表示。

Semantic Split

Semantic Split 首先根据特征语义,将原始特征划分为 \(T\) 个组:

\[X=[X_1,X_2,\cdots,X_T] \]

其中第 \(i\) 组特征维度为 \(D_i\),并满足:

\[\sum_{i=1}^{T}D_i=D \]

每一组使用独立的投影矩阵:

\[Token_i=X_iW_i \]

其中:

\[W_i\in R^{D_i\times d} \]

最终得到:

\[[Token_1,Token_2,\cdots,Token_T] \]

因此,Semantic Split 的特点是先按照语义划分特征,再分别完成组内投影。

Auto Split

Auto Split 不提前划分语义组,而是将所有特征统一拼接后,直接进行一次全局投影:

\[Y=XW \]

其中:

\[W\in R^{D\times Td} \]

随后将输出的 \(Td\) 维向量 reshape 为:

\[T\times d \]

例如:

\[D\rightarrow240\rightarrow10\times24 \]

因此,Auto Split 实际上是先完成一次全局特征投影,再将投影结果切分为不同 Token。


2. 参数量差异

Semantic Split 中,每个特征组都有自己的投影矩阵 \(W_i\),总参数量为:

\[P_{Semantic} = \sum_{i=1}^{T}D_i d = Dd \]

Auto Split 使用一个统一的大权重矩阵:

\[W\in R^{D\times Td} \]

因此参数量为:

\[P_{Auto}=DTd \]

二者的比例为:

\[\frac{P_{Auto}}{P_{Semantic}}=T \]

也就是说,在最终 Token 数量相同的情况下,Auto Split 的 Tokenization 投影参数量约为 Semantic Split 的 \(T\) 倍。

例如最终划分为 7 个 Token,则 Auto Split 在这一层的参数量约为 Semantic Split 的 7 倍。


3. 信息交互范围不同

两种方案另一个重要区别,是 Tokenization 阶段能够看到的特征范围不同。

Semantic Split 中:

\[Token_i=X_iW_i \]

因此第 \(i\) 个 Token 只能由第 \(i\) 组特征生成。

例如:

\[X_1\rightarrow Token_1 \]

\[X_2\rightarrow Token_2 \]

不同语义组之间在 Tokenization 阶段没有直接的信息混合,跨 Token 的信息交互主要交给后续 Token Mixing 完成。

因此 Semantic Split 本质上首先完成的是组内特征压缩。

Auto Split 中:

\[[Token_1,\cdots,Token_T]=XW \]

由于 \(X\) 中包含全部原始特征,所以每一个输出 Token 都可以由全部输入特征共同决定。

因此 Auto Split 在完成 Token 构造的同时,已经进行了一次全局特征线性组合。


4. 更本质的区别:权重矩阵结构不同

image

两种方法最核心的差异,可以统一从权重矩阵的角度理解。

Semantic Split 看起来是多个独立的 Linear:

\[X_1W_1,\quad X_2W_2,\quad \cdots,\quad X_TW_T \]

但实际上可以统一写成:

\[[X_1,X_2,\cdots,X_T] \begin{bmatrix} W_1&0&\cdots&0\\ 0&W_2&\cdots&0\\ \vdots&\vdots&\ddots&\vdots\\ 0&0&\cdots&W_T \end{bmatrix} \]

也就是说,Semantic Split 等价于使用一个具有明显块对角结构的权重矩阵。

其中大量跨语义组的连接被直接限制为 0。

例如,第一个 Token 对应的权重只作用于 \(X_1\),而不会直接读取 \(X_2\)\(X_3\) 等其他语义组。

Auto Split 则使用一个完整的权重矩阵:

\[W= \begin{bmatrix} *&*&\cdots&*\\ *&*&\cdots&*\\ \vdots&\vdots&\ddots&\vdots\\ *&*&\cdots&* \end{bmatrix} \]

不同输入特征都可以连接到不同输出 Token。

因此,两种方式最终都可以理解为学习一个从原始特征空间到 Token 空间的权重矩阵,区别在于权重矩阵受到的结构约束不同。

Semantic Split 中,人工语义分组提前规定了哪些连接可以存在,模型实际学习的是多个局部权重矩阵:

\[W_1,W_2,\cdots,W_T \]

Auto Split 中,则直接学习一个完整的大权重矩阵 \(W\),由模型自行决定不同原始特征应该如何组合到不同 Token 中。

从这一角度看:

Semantic Split 是带人工语义结构约束的 Block-Diagonal Projection。

Auto Split 是没有显式语义约束的 Global Dense Projection。


5. 两种方式的能力差异

Semantic Split 引入了较强的人工先验。

人工提前规定哪些特征属于同一语义空间,可以减少模型需要学习的自由度,同时显著降低参数量。

它的主要特点是:

  • 参数量更小;
  • Token 语义更加明确;
  • 特征组织结构更加稳定;
  • 参数利用效率较高;
  • 更适合受到模型大小和线上计算成本约束的工业推荐场景。

Auto Split 则将 Token 划分本身也交给模型学习。

由于每个输出 Token 都可以读取全部输入特征,因此模型具有更大的表示自由度,也能够学习人工分组之外的跨特征组合。

同时,这种自由度的代价是更大的参数量。

因此 Auto Split 的能力主要来自两个方面:

一是更大的 Tokenization 参数规模;

二是从 Token 构造阶段开始就具备全局特征组合能力。

这也意味着,Token 不再需要严格对应某一个人工定义的业务语义,而可以形成模型自行学习得到的 latent feature space。


6. 工业场景下的选择

从工业推荐模型的角度来看,两种方法并不存在绝对优劣,更重要的是模型容量、计算成本和表达能力之间的权衡。

对比维度 Semantic Split Auto Split
Token 构造 按语义分组后独立投影 全局投影后切分
投影矩阵 多个 \(W_i\) 单个大矩阵 \(W\)
权重结构 Block-Diagonal Dense
参数量 \(Dd\) \(TDd\)
Tokenization 信息范围 组内 全局
人工先验
表达自由度 较低 较高
参数效率 较高 较低
Token 可解释性 较强 较弱

在参数规模、计算量和线上延迟受到约束的情况下,Semantic Split 通常更加适合工业实践。人工语义先验可以有效减少无必要的跨组连接,以更少的参数完成 Token 表征。

当模型容量充足,并且更关注模型表达能力而非参数效率时,Auto Split 则提供了更大的学习空间,使模型能够自行完成特征组合和 Token 空间划分。

因此,两种 Token 构造方式的核心区别可以概括为:

Semantic Split 利用人工语义先验换取更高的参数效率,Auto Split 利用更大的参数规模和更高的建模自由度换取更强的全局特征组合能力。

http://www.jsqmd.com/news/1359037/

相关文章:

  • GBT32960 消息介绍
  • MinIO最新稳定版功能解析与部署实践
  • 2026年封边机选购指南:源头工厂如何选 - 天下观知
  • OptiStruct在新能源电池包壳体尺寸优化中的应用
  • 调了6年推荐公式,2026年我第一次接不住:召回排序被大模型掀了一遍
  • 盘点业内认可度较高的医院固定资产管理系统热门优质实用榜单推荐
  • Git cherry-pick详解:精准合并提交的实用指南
  • 镇江防水补漏怎么选?业主实测分享,卫生间阳台渗水维修干货(2026 新) - 昵19226106854
  • 抖音内容管理终极方案:douyin-downloader让你的数字收藏永不丢失
  • 2026年8月上海闵行区债务纠纷律所推荐:6家律所科创企业债权债务特点与应对策略 - 品牌深度评测
  • 南审新生四年规划:审创天成陪跑指南 - 天下观知
  • 酒店管理系统首选:天馨PMS让管理更轻、更快
  • 强亲密 / 强绑定关系沟通:去情绪化、把人格攻击转回事件本身
  • SpringBoot2+Vue3医院信息管理系统技术解析
  • Gitea自建代码托管平台:从Docker部署到安全优化
  • 淘宝淘金币自动化脚本实战指南:解放双手的Auto.js深度解析
  • AI工程化实战:从FastAPI模型部署到生产级服务构建
  • AWK文本处理:从基础语法到实战应用
  • AI智能体安全:从能力溢出到防御策略的工程实践
  • 2026更新:华容县CMA甲醛检测室内甲醛治理四家实测新房/家装/工装 - 专注室内空气检测治理
  • RabbitMQ在实时ETL中的管道模式实践与优化
  • 如何安全使用GTA5游戏增强工具:从零到精通的完整指南
  • YARN架构解析与Hadoop资源调度优化实践
  • 2026阜阳不锈钢回收工厂推荐,废金属回收,空调回收,机械回收,旧家电回收,电线电缆回收工厂优选指南! - 品牌商讯
  • 长号协奏曲《Colors》演奏与排练全攻略:从技术难点到乐队合排
  • 2026临沂新中式家具厂家推荐,全屋定制家具,宋氏美学家具,原木家具,北美黑胡桃家具厂家优选指南! - 品牌商讯
  • 南财周边CPA培训测评:审创天成模式解析 - 天下观知
  • 风储联合系统功率分配策略优化与实践
  • 视觉伺服系统精度优化:从算法到工程的90%性能提升实践
  • 物流管理系统源码 Java+SpringBoot+Vue 万字文档+PPT 前后分离