特征交叉系列模型

FM 因子分解机

相比 Logistic回归模型 只考虑单个特征对 y 的影响, FM 因子分解机考虑了二阶组合特征:

y^(x)=w0+∑i=1nwixi+∑i=1n∑j=i+1nwi,jxixj.

在推荐系统中, 特征值非常稀疏, 因此会对每一类特征学习一个隐变量, 也即 xi→vi, 进而替换 wi,j=⟨vi,vj⟩.
事实上我们可以进一步降低复杂度: 从 O(kn2) 到 O(kn), 这里 k 是 ⟨vi,vj⟩ 的复杂度. ∑i=1n∑j=i+1n⟨vi,vj⟩xixj=12∑f=1k[(∑i=1nvi,fxi)2−∑i=1nvi,f2xi2].

回代一下得到:

.

FFM

多的 F 是 域 (Field). 它会对特征进行分组, 例如性别 one-hot encoding 之后分成 x_female, x_male, 它们都属于性别.
定义域映射函数 f, fi 为 xi 对应的域编号, 它是一个额外的特征.

y=w0+∑i=1nwixi+∑i=1n−1∑j=i+1n⟨Vi,fj,Vj,fi⟩xixj.

如果共有 F 个域, 每个 xi 拥有 F 个隐向量, 当他们两两交叉, 二阶交叉项参数共有 nkF.