Yakında

Multimodal AI: Metin, Görüntü, Ses ve Video

Görüntü anlama, OCR, konuşma/ses, video ve multimodal RAG ile metin ötesi AI uygulamaları.

Seviye

Orta

Süre

22 saat

Tahmini yayın

2027 Q4

Kategori

AI Engineering

AI'ı yalnızca metnin ötesine taşıyıp görüntü, ses ve videoyla çalışan uygulamalar geliştirmeyi öğreten kurs. Görüntü anlama ve OCR'dan konuşmadan-metne ve ses üretimine, video analizinden multimodal RAG'e; farklı modaliteleri tek bir akıllı üründe birleştirmeyi öğrenirsin.

Öğrenilecek teknolojiler

VisionAudioSpeech-to-textOCRMultimodal RAGVideo

Ne öğreneceksin

  • Görüntü anlama ve OCR entegrasyonu
  • Konuşma-metin ve ses üretimi kullanımı
  • Video analizi ve işleme
  • Multimodal RAG ve birleşik uygulamalar

Kimler için

  • Metin ötesi AI ürünleri kuran mühendisler
  • Görüntü/ses/video ile çalışan ekipler
  • Multimodal uygulama geliştirenler

Müfredat özeti

  1. 01Multimodal AI'a genel bakış
  2. 02Görüntü anlama ve OCR
  3. 03Konuşma ve ses işleme
  4. 04Video analizi
  5. 05Multimodal RAG
  6. 06Üretim ve maliyet
İlk talep eden sen olFiyat yakında

Ön talep oluştur

Birkaç soru daha yanıtla; kursu önceliklendirmemize ve sana uygun formatı seçmemize yardımcı ol.