Posts
All the articles I've posted.
-
Flink 深挖 · 时间语义、窗口与 Watermark
Flink 时间语义与乱序处理:processing/ingestion/event time 取舍、Watermark 生成与多输入取 min、withIdleness 排除空闲分区、Tumbling/Sliding/Session 窗口、allowedLateness 与侧输出兜底、增量与全量聚合,落到实时 CTR 与归因 join。
-
Flink 深挖(开篇)· 流处理模型与运行时架构
Flink 深挖开篇:为何广告实时链路选 Flink 而非微批、流批一体与 DataStream 心智、JobManager/TaskManager/Slot 运行时、StreamGraph→JobGraph→ExecutionGraph 三次图变换、算子链与 Slot 共享、四种分区策略、部署模式与作业提交全流程。
-
Apache Flume:从 Source·Channel·Sink 到广告日志不丢链路与选型
Apache Flume 讲透:Agent 的 Source/Channel/Sink 三段式与 at-least-once、Memory/File/Kafka Channel 取舍、TailDir→Kafka 配置,广告不丢链路与真实 DSP 案例脱敏拆解。
-
为什么 AdTech 偏爱 Kafka:广告事件中枢的五大典型场景与架构设计
广告的曝光、点击与转化本质上是一场高吞吐、需重放且被多方消费的事件洪流,这恰好是 Kafka 的绝对主场。本文将深入剖析 AdTech 领域的五大核心场景——采集削峰、计费对账、实时特征、预算反作弊及入湖入仓,并详解 Netty、Kafka、Redis 与 Flink 在其中的精妙分工与架构演进。
-
Kafka 可靠性与 Exactly-Once 深挖:acks、ISR、min.insync.replicas 与事务,把『不丢不重』讲到底
在广告计费与对账等核心链路中,数据的底线是绝不丢失、不算重。本文将深入剖析 Kafka 的高可靠性架构,揭示“不丢”背后由 acks、副本复制与位移提交共同构筑的三方合约。我们将从底层机制出发,深挖 acks 取舍、min.insync.replicas 策略、unclean 选举机制,并全面解析幂等生产者与事务机制,为你讲清 Exactly-Once 语义的真实边界与工程实践。