Posts
All the articles I've posted.
-
广告多维报表与漏斗分析实战
广告报表的极致体验,取决于正确的指标语义、可命中的预聚合及可承受的去重成本。本文聚焦多维报表实战,解析 CUBE 组合爆炸的应对策略与物化视图加速路径。详细阐述漏斗分析的有序递减语义与留存 cohort 的集合运算,对比 Bitmap 精确去重与 HLL 近似去重在计费场景下的严格边界。最终通过报表 API 缓存策略,将高频看板查询的 P99 延迟压制在秒级以内,实现指标闭环。
-
特征编码:把文字菜谱翻译成秤上的克数
「数据与特征工程」编码篇:类别特征必须编码成数字。讲清 One-Hot / Label / Count / Frequency / Target 五种编码的场景与坑、按基数选编码的决策图,以及 Target Encoding 的数据泄漏与 K 折交叉解法。
-
特征选择:只留好料——过滤、包装、嵌入三大流派
「数据与特征工程系列」第 6 篇:特征选择的两条原则(高类别相关、低特征间冗余)与三大流派——过滤法(方差/皮尔逊/VIF/互信息/MIC/卡方)、包装法(前向/后向/RFE)、嵌入法(L1/L2 正则、树模型重要性)。
-
特征提取与降维:吊高汤——把一大堆料浓缩成精华
「数据与特征工程系列」第 5 篇:特征提取(造新维度)和特征选择(挑原维度)的区别,稀疏表示与特征哈希(adtech 高基数救星),以及 PCA / ICA / LDA 三种降维法各自在最大化什么——无监督最大方差、有监督最大可分、解混最大独立。
-
实时数仓 · 分层设计与 Lambda/Kappa 架构
实时数仓并非简单地将批处理换成流处理,而是要用同一套分层语义让流式增量与可重放回刷共享口径。本文详细拆解 ODS、DWD、DWS 到 ADS 各层的核心职责,深入探讨 Lambda 双链路架构与 Kappa 单逻辑重放的取舍,以及流批一体的落地实践。结合 Flink 与 OLAP 引擎构建端到端实时管线,彻底解决速度层与批层结果不一致的痛点,确保指标定义始终保持唯一。