Posts
All the articles I've posted.
-
特征编码:把文字菜谱翻译成秤上的克数
「数据与特征工程」编码篇:类别特征必须编码成数字。讲清 One-Hot / Label / Count / Frequency / Target 五种编码的场景与坑、按基数选编码的决策图,以及 Target Encoding 的数据泄漏与 K 折交叉解法。
-
特征选择:只留好料——过滤、包装、嵌入三大流派
「数据与特征工程系列」第 6 篇:特征选择的两条原则(高类别相关、低特征间冗余)与三大流派——过滤法(方差/皮尔逊/VIF/互信息/MIC/卡方)、包装法(前向/后向/RFE)、嵌入法(L1/L2 正则、树模型重要性)。
-
特征提取与降维:吊高汤——把一大堆料浓缩成精华
「数据与特征工程系列」第 5 篇:特征提取(造新维度)和特征选择(挑原维度)的区别,稀疏表示与特征哈希(adtech 高基数救星),以及 PCA / ICA / LDA 三种降维法各自在最大化什么——无监督最大方差、有监督最大可分、解混最大独立。
-
实时数仓 · 分层设计与 Lambda/Kappa 架构
实时数仓分层:ODS/DWD/DWS/ADS 各层职责、Lambda 与 Kappa 的取舍、流批一体如何落地,以及 Flink + Kafka + OLAP 的端到端实时仓,落到速度层与批层口径统一。
-
OLAP(开篇)· 列式存储原理与 ClickHouse/Doris
OLAP 开篇:行存 vs 列存为何在宽表聚合上差出数量级、字典/RLE/压缩与向量化执行、MPP 分布式查询心智,再对比 ClickHouse 与 Doris 的架构与选型,落到广告明细查询的性能路径。