Posts
All the articles I've posted.
-
Flink 深挖(开篇)· 流处理模型与运行时架构
Flink 深挖开篇:为何广告实时链路选 Flink 而非微批、DataStream 流处理心智、JobManager/TaskManager/Slot 运行时、StreamGraph→JobGraph→ExecutionGraph 转换与算子链、部署模式。
-
Apache Flume:从 Source·Channel·Sink 到广告日志不丢链路与选型
Apache Flume 讲透:Agent 的 Source/Channel/Sink 三段式与 at-least-once、Memory/File/Kafka Channel 取舍、TailDir→Kafka 配置,广告不丢链路与真实 DSP 案例脱敏拆解。
-
为什么 AdTech 偏爱 Kafka:广告事件中枢的五大典型场景与架构设计
广告的曝光/点击/转化是高吞吐、需重放、被多方消费的事件洪流,正是 Kafka 的主场。本篇讲透 AdTech 五大场景——采集削峰、计费对账、实时特征、预算反作弊、入湖入仓——与 Netty+Kafka+Redis+Flink 的分工。
-
Kafka 可靠性与 Exactly-Once 深挖:acks、ISR、min.insync.replicas 与事务,把『不丢不重』讲到底
计费对账的底线是绝不丢、不算重。本篇讲透 Kafka 可靠性:不丢是 acks × 副本复制 × 消费提交的三方合约,深挖 acks 取舍、min.insync.replicas、unclean 选举、幂等生产者与事务,讲清 Exactly-Once 的边界。
-
Kafka 性能内核:磁盘系统凭什么跑出内存级吞吐
Kafka 用最普通的磁盘却能跑出百万级吞吐,甚至快过内存系统。本篇逐一拆开性能内核四板斧:顺序写、页缓存(内存交给 OS 而非 JVM 堆)、零拷贝 sendfile、日志分段与稀疏索引,再叠加批量与压缩,最后讲清冷读、SSL、段过多等变慢场景与调优取舍。