Kafka 系列
P6 中间件与运行时 · 共 7 篇 · 按阅读顺序倒叙排列
-
Apache Flume:从 Source·Channel·Sink 到广告日志不丢链路与选型
Apache Flume 讲透:Agent 的 Source/Channel/Sink 三段式与 at-least-once、Memory/File/Kafka Channel 取舍、TailDir→Kafka 配置,广告不丢链路与真实 DSP 案例脱敏拆解。
-
为什么 AdTech 偏爱 Kafka:广告事件中枢的五大典型场景与架构设计
广告的曝光/点击/转化是高吞吐、需重放、被多方消费的事件洪流,正是 Kafka 的主场。本篇讲透 AdTech 五大场景——采集削峰、计费对账、实时特征、预算反作弊、入湖入仓——与 Netty+Kafka+Redis+Flink 的分工。
-
Kafka 可靠性与 Exactly-Once 深挖:acks、ISR、min.insync.replicas 与事务,把『不丢不重』讲到底
计费对账的底线是绝不丢、不算重。本篇讲透 Kafka 可靠性:不丢是 acks × 副本复制 × 消费提交的三方合约,深挖 acks 取舍、min.insync.replicas、unclean 选举、幂等生产者与事务,讲清 Exactly-Once 的边界。
-
Kafka 性能内核:磁盘系统凭什么跑出内存级吞吐
Kafka 用最普通的磁盘却能跑出百万级吞吐,甚至快过内存系统。本篇逐一拆开性能内核四板斧:顺序写、页缓存(内存交给 OS 而非 JVM 堆)、零拷贝 sendfile、日志分段与稀疏索引,再叠加批量与压缩,最后讲清冷读、SSL、段过多等变慢场景与调优取舍。
-
Kafka Consumer 深挖:poll 循环、offset 提交与 rebalance,怎么做到不丢不重不卡顿
生产者篇讲了消息怎么写进去,这篇补齐另一半:怎么可靠高效地读出来。拆 poll 单线程循环与心跳、offset 提交四姿势与不丢不重时机、三个 poll 生死参数、分区分配 assignor、rebalance 生命周期与 Consumer Lag 诊断。
-
Kafka Producer 深挖:分区策略与 Sticky Partitioner 是怎么把延迟砍半的
一条消息进哪个分区,直接决定 Kafka 的吞吐、延迟与顺序性。本篇从发送攒批讲起,拆四种分区策略,讲透 Sticky Partitioner 为何把无 key 的 p99 延迟砍半,再谈 key 路由、扩分区陷阱、顺序性与热点隔离。
-
Kafka 核心原理精讲:从一条日志到分布式流平台,把关键机制与取舍讲透
Kafka 原理精讲:以『分布式提交日志』为主线,讲透 Partition、Offset、ISR、HW、分区容量决策、pull 模型取舍、交付语义与 dumb-broker 设计哲学,附 KRaft + Java 上手 demo、反模式清单与 7 张原理图。