Tag: service-infra
All the articles with the tag "service-infra".
-
数据中心选型:全球枢纽、云区域与广告流量部署
从全球网络枢纽、云区域与广告流量分布出发,给出新加坡 + 弗吉尼亚双活选型,并覆盖延迟→竞价 tmax 预算、跨区成本模型、数据驻留合规与故障切换等生产实践。
-
混沌工程:故障注入、稳态假设与演练常态化
所有高可用手段都需要被验证。讲清混沌工程的五原则(稳态假设、最小爆炸半径)、四类故障注入与演练闭环、稳态如何用业务指标定义,以及从灰度到生产受控再到自动化平台的常态化路径,把'假设能恢复'变成'已经验证能恢复'。
-
发布与变更安全:灰度、蓝绿、金丝雀与回滚
变更是线上故障第一大根因。本篇梳理爆炸半径分类、滚动/灰度/蓝绿/金丝雀四种发布策略对比、Feature Flag 开关降级、config-only 与制品回滚双轨、数据库 expand-contract 模式、回滚条件清单。
-
幂等与一致性:重试安全、分布式事务与最终一致
重试、异步与多副本都要求操作幂等、数据一致。讲清幂等的实现(幂等键/去重表/状态机)、分布式事务(2PC/TCC/Saga/本地消息表 outbox)与最终一致的取舍。
-
依赖韧性:超时重试、熔断降级与舱壁隔离
把远程依赖防护讲成一条防线:超时预算与幂等重试、熔断三态与降级预案、Failover 与舱壁隔离,以及限流→超时→熔断→隔离→降级的叠加顺序。