
Phần 4: Thực Tiễn SRE — Kỹ Thuật Hỗn Loạn Chaos Mesh & Khả Năng Chống Chịu Sự Cố Đa Vùng
Phiên bản đa ngôn ngữ: Bài viết này có phiên bản tiếng Anh chuẩn quốc tế tại Part 4: SRE Practices — Chaos Engineering with Chaos Mesh & Multi-Region Resilience (tanhdev.com). Bài trước: Phần 3 — Tầng Dữ Liệu: Chuyển Dịch Từ Aurora Sang TiDB Multi-Raft | Danh mục Series | Bài tiếp: Phần 5 — Cỗ Máy Chiến Dịch: Sống Sót Qua Cơn Bão 10 Tỷ Yên Nguyên tắc cốt lõi (Answer-First): Việc bảo đảm chuẩn sẵn sàng “năm số 9” (99,999%) cho hạ tầng thanh toán quốc gia đòi hỏi sự chuyển dịch từ phòng ngự bị động sang Kỹ thuật Hỗn loạn (Chaos Engineering) tự động liên tục ngay trên môi trường Production. PayPay tích hợp Chaos Mesh trực tiếp vào cụm Kubernetes EKS, chủ động cấy lỗi bắn hạ pod ngẫu nhiên, tạo độ trễ mạng và cô lập phân vùng giữa các Availability Zone trong giờ làm việc để chứng minh khả năng tự phục hồi. Nhằm ngăn chặn sập dây chuyền (cascading failure) khi gặp sự cố, PayPay áp dụng mạng lưới ngắt mạch Sentinel, cơ chế retry có giãn cách ngẫu nhiên (full jitter) và nghiêm ngặt lan truyền thời hạn thực thi gRPC deadline, bảo đảm lỗi cục bộ không bao giờ làm gián đoạn luồng thanh toán cốt lõi. ...
