第 1 篇Kafka 为什么能实现高吞吐?顺序写、批处理、页缓存与零拷贝2025/12/09从分区日志、顺序追加、批量压缩、操作系统页缓存、sendfile、消费者拉取和横向扩展解释 Kafka 高吞吐的完整机制。阅读 Kafka 为什么能实现高吞吐?顺序写、批处理、页缓存与零拷贝
第 2 篇Kafka 消息为什么仍可能重复或丢失?生产、Broker、消费三段治理2025/12/12沿生产者、Broker 副本和消费者三个环节分析 Kafka 消息丢失与重复的故障窗口,给出幂等生产、acks、ISR、手动提交和业务幂等方案。阅读 Kafka 消息为什么仍可能重复或丢失?生产、Broker、消费三段治理
第 3 篇消息消费失败后如何设计重试与死信机制?2026/01/30从错误分类、退避策略、重试 Topic、死信队列、幂等和人工补偿设计一套不会阻塞主链路、不会制造重试风暴的消息失败治理方案。阅读 消息消费失败后如何设计重试与死信机制?
第 4 篇消息顺序性到底应该如何保证?从 Kafka 分区到业务状态机2026/02/03区分全局有序、分区有序与业务实体有序,分析生产并发、分区映射、消费者并行、失败重试和扩分区导致的乱序,并给出工程方案。阅读 消息顺序性到底应该如何保证?从 Kafka 分区到业务状态机
第 5 篇Exactly Once 是真实能力还是营销概念?先定义处理边界2026/03/24区分投递一次、处理一次与业务效果一次,分析 Kafka 幂等生产者、事务、read-process-write 链路及外部数据库边界,说明 Exactly Once 的真实适用范围。阅读 Exactly Once 是真实能力还是营销概念?先定义处理边界
第 6 篇分布式事务的本质:2PC、TCC、Saga 与最终一致性如何选择2026/03/27从跨服务双写问题出发,对比 XA/2PC、TCC、Saga、事务消息与 Outbox 的一致性、可用性、侵入性和故障恢复方式。阅读 分布式事务的本质:2PC、TCC、Saga 与最终一致性如何选择
第 7 篇接口幂等不是加一个 Redis 锁那么简单:生产级设计指南2026/05/15从幂等键、请求指纹、数据库唯一约束、状态机、处理中状态、结果复用和过期策略,设计可应对超时重试与并发重复的接口幂等方案。阅读 接口幂等不是加一个 Redis 锁那么简单:生产级设计指南
第 8 篇雪花算法在时钟回拨时会发生什么?分布式 ID 的边界与治理2026/05/19拆解 Snowflake 64 位 ID 结构,分析同毫秒序列、机器号冲突、时钟回拨和纪元耗尽风险,并比较等待、拒绝、备用位与集中发号方案。阅读 雪花算法在时钟回拨时会发生什么?分布式 ID 的边界与治理