Yakında — Bu içerik hazırlanıyor.

SRE
Uptime garantisi, hata bütçesi ve otomasyon odaklı operasyon
Site Reliability Engineering rotası, production sistemlerinin güvenilirliğini mühendislik disipliniyle yönetmeyi öğretir. SLO tanımlama, incident management, chaos engineering ve kapasiteler planlamayı gerçek senaryolarla uygularsın.
~10 hafta
22 Lab
Öğrenme Adımları
01
SLO & Hata Bütçesi
SLI, SLO ve SLA tanımla. Hata bütçeni hesapla ve geliştirme ekibiyle dengele.
SLO dashboard kurulumu
Hata bütçesi tüketim alarmı
SLA raporlama otomasyonu
02
Gözlemlenebilirlik
Metrics, logs ve trace üçgenini kur. Distributed tracing ile hata kökünü tespit et.
OpenTelemetry entegrasyonu
Loki ile log aggregation
Jaeger ile distributed tracing
03
Incident Management
On-call rotasyonu, runbook yazımı ve post-mortem kültürü oluştur.
PagerDuty alert routing
Runbook otomasyonu
Blameless post-mortem şablonu
04
Chaos Engineering
Sistemin zayıf noktalarını kontrollü kaos testleriyle bul ve güçlendir.
Chaos Monkey ile pod kill testi
Network latency injection
Disk failure simülasyonu
05
Kapasite Planlaması
Trafik tahminleri ve load test sonuçlarıyla proaktif kapasite yönet.
k6 ile load testing
Prometheus ile kapasite modelleme
Auto-scaling limitlerini ayarlama