Danh mục sản phẩm
RTO và RPO là gì? Khái niệm cần biết khi muốn triển khai Backup
Trước khi triển khai backup cho máy tính hay hệ thống của doanh nghiệp, bạn cần xác định hai chỉ số: RPO và RTO. RPO cho biết doanh nghiệp chấp nhận mất tối đa bao nhiêu dữ liệu, còn RTO cho biết hệ thống được phép gián đoạn tối đa bao lâu. Hai chỉ số này quyết định giải pháp bạn chọn và chi phí bạn phải bỏ ra.
⚡ Điểm nhanh
- RPO (Recovery Point Objective): điểm thời gian mà dữ liệu cần được khôi phục về. Khoảng cách từ bản sao dùng được cuối cùng đến lúc sự cố chính là lượng dữ liệu có thể mất, tính bằng thời gian.
- RTO (Recovery Time Objective): thời gian gián đoạn tối đa chấp nhận được, tính từ lúc dịch vụ bắt đầu gián đoạn đến khi dịch vụ hoạt động trở lại.
- Khác biệt cốt lõi: RPO đo lượng dữ liệu có thể mất, RTO đo thời gian gián đoạn. Cả hai đều bắt đầu tính từ thời điểm sự cố.
- Nguồn gốc chỉ số: RPO và RTO xuất phát từ yêu cầu kinh doanh, không phải sở thích kỹ thuật.
- Chi phí: đặt chỉ số chặt hơn nhu cầu thực tế sẽ làm chi phí và độ phức tạp tăng lên.
- Giải pháp theo RPO: nhân bản đồng bộ cho RPO gần bằng 0, nhân bản không đồng bộ thường cho RPO từ khoảng 15 phút đến vài giờ, sao lưu định kỳ cho RPO bằng chu kỳ sao lưu.
RPO nằm trước sự cố, RTO nằm sau sự cố.
1. RPO là gì?
RPO là viết tắt của Recovery Point Objective, dịch là mục tiêu điểm phục hồi. Theo định nghĩa của NIST trong SP 800-34 Rev. 1, đây là thời điểm mà dữ liệu phải được khôi phục về sau sự cố, và mức dữ liệu chấp nhận mất là khoảng thời gian giữa bản sao dùng được cuối cùng với lúc gián đoạn xảy ra. AWS mô tả tương tự: RPO được đo ngược từ lúc sự cố về bản dữ liệu khôi phục được gần nhất.
Thời điểm này rất cụ thể, ví dụ 1 phút trước, 1 ngày trước, tuần trước hay tháng trước. Doanh nghiệp muốn khôi phục dữ liệu về đúng thời điểm đó.
Ví dụ: Microsoft nêu trường hợp backup mỗi giờ và không nhân bản dữ liệu thì có thể mất tối đa dữ liệu của 1 giờ. Theo cùng cách tính, backup mỗi đêm tương ứng RPO khoảng 1 ngày.
2. RTO là gì? Vai trò khi triển khai hệ thống khôi phục dữ liệu
RTO là viết tắt của Recovery Time Objective, dịch là mục tiêu thời gian phục hồi. AWS định nghĩa RTO là độ trễ tối đa chấp nhận được giữa lúc dịch vụ bắt đầu bị gián đoạn và lúc dịch vụ được khôi phục. NIST nhìn từ góc hệ thống: đó là thời gian tối đa các thành phần hệ thống có thể ở giai đoạn khôi phục trước khi ảnh hưởng xấu đến hoạt động nghiệp vụ.
Ví dụ: phòng nhân sự bị mất file tính lương và yêu cầu phục hồi xong trong 1 giờ kể từ lúc sự cố. Khi đó RTO là 1 giờ. Theo ví dụ của Microsoft, RTO 90 phút nghĩa là ứng dụng phải chạy lại trong vòng 90 phút sau khi sự cố bắt đầu.
RTO càng ngắn thì càng cần hạ tầng sẵn sàng. Microsoft lưu ý RTO rất chặt có thể cần một bản triển khai dự phòng ở khu vực thứ hai (active/passive), thậm chí chạy song song (active/active).
3. Bảng so sánh RPO và RTO
| Tiêu chí | RPO | RTO |
|---|---|---|
| Tên đầy đủ | Recovery Point Objective | Recovery Time Objective |
| Trả lời câu hỏi | Chấp nhận mất tối đa bao nhiêu dữ liệu? | Chấp nhận gián đoạn tối đa bao lâu? |
| Đơn vị | Thời gian | Thời gian |
| Cách tính | Ngược từ lúc sự cố về bản khôi phục gần nhất | Từ lúc sự cố bắt đầu đến khi dịch vụ chạy lại |
| Vị trí trên trục thời gian | Trước sự cố | Sau sự cố |
| Ví dụ | Backup mỗi giờ, mất tối đa 1 giờ dữ liệu | Khôi phục file lương trong 1 giờ |
| Ảnh hưởng đến chi phí | Đặt càng chặt, chi phí càng tăng | Đặt càng chặt, chi phí càng tăng |
4. Chọn giải pháp theo RPO và RTO
RTO và RPO luôn đi cùng nhau và quyết định giá trị của hệ thống khôi phục dữ liệu cũng như các giải pháp đi kèm.
RPO càng chặt, giải pháp càng đắt và phức tạp.
| Giải pháp | RPO điển hình | Đặc điểm |
|---|---|---|
| Nhân bản đồng bộ (Synchronous Replication) | Gần bằng 0 | Thao tác ghi chỉ hoàn tất khi cả hai site xác nhận. Độ trễ và khoảng cách ảnh hưởng hiệu năng nên phù hợp với các site ở gần nhau. Chi phí cao hơn. |
| Nhân bản không đồng bộ (Asynchronous Replication) | Thường từ khoảng 15 phút đến vài giờ | Dữ liệu sao chép theo chu kỳ, ứng dụng không phải chờ site đích. Chịu được độ trễ và khoảng cách xa, chi phí thấp hơn, nhưng có thể mất các thay đổi gần nhất. |
| Sao lưu định kỳ, gồm cả lưu ra tape | Bằng chu kỳ sao lưu | Với RPO từ vài ngày đến 1 tuần, dữ liệu thường được lưu vào tape và cất ở khu vực xa công ty. |
Lưu ý: AWS khuyên tránh đặt RTO hoặc RPO bằng 0 vì thường không thực tế. Cụm "gần bằng 0" ở trên mô tả kết quả của nhân bản đồng bộ, không phải mục tiêu nên đặt cho mọi hệ thống.
Hot site là một trung tâm dữ liệu thứ hai được trang bị đầy đủ, có bản sao dữ liệu cập nhật và có thể tiếp quản trong vài phút. Hạ tầng gồm máy chủ, lưu trữ và mạng đã bật sẵn, đủ sức chạy tải sản xuất. Để so sánh, warm site cần từ vài giờ đến vài ngày để phục hồi, còn cold site có thể mất từ vài ngày đến vài tuần. Hot site nhanh nhất nhưng cũng đắt nhất.
Nhân bản sao chép cả dữ liệu bị hỏng hoặc bị mã hóa nhanh như dữ liệu hợp lệ, nên hot site không tự bảo vệ trước ransomware. Nên kết hợp thêm bản backup bất biến, tách biệt khỏi đường nhân bản và dùng thông tin đăng nhập riêng.
5. Cách xác định RPO và RTO cho doanh nghiệp
Theo hướng dẫn của AWS:
- Lập ma trận phân tầng theo mức tác động kinh doanh, ví dụ quan trọng, cao, trung bình, thấp. Mỗi tầng có một cặp RTO và RPO riêng.
- Đánh giá tác động của từng hệ thống: thiệt hại tài chính, uy tín, gián đoạn vận hành (chẳng hạn trễ lương, giảm năng suất) và rủi ro pháp lý.
- Xếp hệ thống vào tầng phù hợp. Cân nhắc dữ liệu mất có dựng lại được từ nguồn khác không, và các hệ thống phụ thuộc có đạt được mục tiêu đó không.
- Thống nhất với các bên liên quan. Bộ phận nghiệp vụ thường muốn chỉ số chặt hơn, bộ phận kỹ thuật điều chỉnh theo thiết kế và ngân sách khả thi.
Những lỗi cần tránh: đặt giá trị tùy tiện, đặt chỉ số quá lỏng so với nhu cầu, đặt chỉ số bằng 0, hoặc đặt chặt hơn nhu cầu thực tế khiến chi phí tăng không cần thiết. Sau khi triển khai, Microsoft khuyên đo lường và theo dõi hiệu quả khôi phục.
Câu hỏi thường gặp
RPO và RTO khác nhau như thế nào?
RPO đo lượng dữ liệu có thể mất, tính ngược từ lúc sự cố về bản khôi phục gần nhất. RTO đo thời gian dịch vụ gián đoạn, tính từ lúc sự cố đến khi dịch vụ chạy lại. RPO nằm trước sự cố, RTO nằm sau sự cố.
Có nên đặt RPO và RTO bằng 0 không?
AWS xếp việc đặt RTO hoặc RPO bằng 0 vào nhóm mục tiêu thường không thực tế. Nhân bản đồng bộ có thể đưa RPO về gần bằng 0 nhưng đổi lại là chi phí cao và bị giới hạn bởi độ trễ, khoảng cách.
Backup mỗi đêm thì RPO là bao nhiêu?
Khoảng 1 ngày. Microsoft nêu ví dụ backup mỗi giờ và không nhân bản thì có thể mất tối đa 1 giờ dữ liệu. Với backup mỗi đêm, nếu sự cố xảy ra vào buổi chiều, dữ liệu phát sinh từ lần backup đêm trước sẽ bị mất.
Hot site khác warm site và cold site như thế nào?
Hot site là site thứ hai chạy sẵn với dữ liệu cập nhật, có thể tiếp quản trong vài phút. Warm site cần từ vài giờ đến vài ngày để phục hồi. Cold site gần như chỉ là cơ sở trống và có thể mất từ vài ngày đến vài tuần mới vận hành được.
Nguồn tham khảo
- AWS Well-Architected Framework, REL13-BP01: Define recovery objectives for downtime and data loss
- NIST CSRC Glossary: Recovery Time Objective (RTO), theo NIST SP 800-34 Rev. 1
- NIST CSRC Glossary: Recovery Point Objective (RPO), theo NIST SP 800-34 Rev. 1
- Microsoft Azure Proactive Resiliency Library: Define
- NAKIVO: Synchronous vs. Asynchronous Replication Strategy
- Scality Glossary: Hot site
