Tag: kafka
All the articles with the tag "kafka".
-
实时数仓 · 分层设计与 Lambda/Kappa 架构
实时数仓并非简单地将批处理换成流处理,而是要用同一套分层语义让流式增量与可重放回刷共享口径。本文详细拆解 ODS、DWD、DWS 到 ADS 各层的核心职责,深入探讨 Lambda 双链路架构与 Kappa 单逻辑重放的取舍,以及流批一体的落地实践。结合 Flink 与 OLAP 引擎构建端到端实时管线,彻底解决速度层与批层结果不一致的痛点,确保指标定义始终保持唯一。
-
Flink 深挖 · 端到端 Exactly-Once 与两阶段提交
深挖 Flink 端到端 Exactly-Once:厘清 at-most/at-least/exactly-once 与 effectively-once 的含义、内部靠 checkpoint 一致性快照回滚重放、端到端需要可重放 source 与幂等或事务 sink,及 Kafka 事务两阶段提交与 transaction.timeout.ms 的坑。
-
为什么 AdTech 偏爱 Kafka:广告事件中枢的五大典型场景与架构设计
广告的曝光、点击与转化本质上是一场高吞吐、需重放且被多方消费的事件洪流,这恰好是 Kafka 的绝对主场。本文将深入剖析 AdTech 领域的五大核心场景——采集削峰、计费对账、实时特征、预算反作弊及入湖入仓,并详解 Netty、Kafka、Redis 与 Flink 在其中的精妙分工与架构演进。
-
Kafka 可靠性与 Exactly-Once 深挖:acks、ISR、min.insync.replicas 与事务,把『不丢不重』讲到底
在广告计费与对账等核心链路中,数据的底线是绝不丢失、不算重。本文将深入剖析 Kafka 的高可靠性架构,揭示“不丢”背后由 acks、副本复制与位移提交共同构筑的三方合约。我们将从底层机制出发,深挖 acks 取舍、min.insync.replicas 策略、unclean 选举机制,并全面解析幂等生产者与事务机制,为你讲清 Exactly-Once 语义的真实边界与工程实践。
-
Kafka 性能内核:磁盘系统凭什么跑出内存级吞吐
为什么基于普通物理磁盘构建的 Kafka,能在高并发场景下跑出百万级吞吐,甚至在性能上碾压部分内存级系统?本篇我们将深度剖析 Kafka 底层性能架构的核心四板斧:顺序追加写、页缓存机制、零拷贝 (Zero-copy) 以及日志分段与稀疏索引。同时结合批量压缩与实战调优经验,带你彻底看透高吞吐背后的流转逻辑与架构取舍。