Tag: machine-learning
All the articles with the tag "machine-learning".
-
冷启动:程序化栈每一层都在解同一个问题
从新广告、缺特征模型、拉起中的 serverless 到未回的 SKAN postback,AdTech 每层都在解同一问题——信息不全时就要决策。本篇把冷启动四副面孔(广告、模型、系统、归因)收进同一框架:先验从哪来、怎么熬过空窗期、怎么判断结束。
-
推荐排序精排:账本只记了「喜欢」,最反直觉的坑是负样本得自己造
推荐系统系列(漏斗第二段·精排):用「录像带店老板打分」比喻讲透排序——召回看「召没召回」、排序看「排第几」,最反直觉的坑「负样本得自己造」、防穿越铁律、LightGBM 先打概率再排队、AUC vs GAUC 与 SSB 铁律。
-
特征选择:只留好料——过滤、包装、嵌入三大流派
「数据与特征工程系列」第 6 篇:特征选择的两条原则(高类别相关、低特征间冗余)与三大流派——过滤法(方差/皮尔逊/VIF/互信息/MIC/卡方)、包装法(前向/后向/RFE)、嵌入法(L1/L2 正则、树模型重要性)。
-
特征提取与降维:吊高汤——把一大堆料浓缩成精华
「数据与特征工程系列」第 5 篇:特征提取(造新维度)和特征选择(挑原维度)的区别,稀疏表示与特征哈希(adtech 高基数救星),以及 PCA / ICA / LDA 三种降维法各自在最大化什么——无监督最大方差、有监督最大可分、解混最大独立。
-
特征构建:切配、换角度、片下部位——把原始料做出新味道
「数据与特征工程系列」第 4 篇:特征构建的三条路——特征组合(GBDT+LR 叶子编码、特征搜索、CTR 交叉特征内积)、映射到新空间(FFT / 小波 / 数据熵)、衍生变量(泰坦尼克号 Name/Cabin/Ticket 拆解)。附多重共线性的坑与规避。