CP
cloudpuz
Yakında — Bu içerik hazırlanıyor.

SRE

Uptime garantisi, hata bütçesi ve otomasyon odaklı operasyon

Site Reliability Engineering rotası, production sistemlerinin güvenilirliğini mühendislik disipliniyle yönetmeyi öğretir. SLO tanımlama, incident management, chaos engineering ve kapasiteler planlamayı gerçek senaryolarla uygularsın.

~10 hafta
22 Lab

Öğrenme Adımları

01

SLO & Hata Bütçesi

SLI, SLO ve SLA tanımla. Hata bütçeni hesapla ve geliştirme ekibiyle dengele.

SLO dashboard kurulumu
Hata bütçesi tüketim alarmı
SLA raporlama otomasyonu
02

Gözlemlenebilirlik

Metrics, logs ve trace üçgenini kur. Distributed tracing ile hata kökünü tespit et.

OpenTelemetry entegrasyonu
Loki ile log aggregation
Jaeger ile distributed tracing
03

Incident Management

On-call rotasyonu, runbook yazımı ve post-mortem kültürü oluştur.

PagerDuty alert routing
Runbook otomasyonu
Blameless post-mortem şablonu
04

Chaos Engineering

Sistemin zayıf noktalarını kontrollü kaos testleriyle bul ve güçlendir.

Chaos Monkey ile pod kill testi
Network latency injection
Disk failure simülasyonu
05

Kapasite Planlaması

Trafik tahminleri ve load test sonuçlarıyla proaktif kapasite yönet.

k6 ile load testing
Prometheus ile kapasite modelleme
Auto-scaling limitlerini ayarlama

Bu rotaya erken erişim al

Lab'lar hazırlandığında seni ilk bilgilendireceğiz.

Erken Erişime Katıl