Yakında

Reinforcement Learning ve AI Agents

Ödül temelli öğrenme: Q-learning, policy gradient, PPO ve RLHF ile karar veren agent'lar.

Seviye

İleri

Süre

30 saat

Tahmini yayın

2028 Q2

Kategori

Machine Learning ve Deep Learning

Deneme-yanılmayla öğrenen agent'lar tasarlamayı öğreten ileri kurs. Markov karar süreçlerinden Q-learning'e, policy gradient ve PPO'dan LLM'leri hizalayan RLHF'e; ödül tasarımı ve keşif-sömürü dengesini kurarak karar veren sistemler geliştirirsin.

Öğrenilecek teknolojiler

RLQ-learningPolicy gradientPPORLHFGymnasium

Ne öğreneceksin

  • MDP ve ödül tasarımını kavrama
  • Q-learning ve policy gradient uygulama
  • PPO ile modern RL
  • RLHF ile model hizalama

Kimler için

  • RL'e derinleşmek isteyen ML mühendisleri
  • Karar veren agent'lar tasarlayanlar
  • RLHF ve model hizalama ile ilgilenenler

Müfredat özeti

  1. 01RL temelleri ve MDP
  2. 02Q-learning ve değer yöntemleri
  3. 03Policy gradient
  4. 04PPO ve modern RL
  5. 05RLHF ve hizalama
  6. 06Ödül tasarımı ve pratik
İlk talep eden sen olFiyat yakında

Ön talep oluştur

Birkaç soru daha yanıtla; kursu önceliklendirmemize ve sana uygun formatı seçmemize yardımcı ol.