
Azure Databricks'e Giriş — Microsoft Azure üzerinde Apache Spark ile Güçlendirilen Büyük Veri Analizi
Hızlı Navigasyon
Etiketler
Slaytları paylaş
Azure Databricks'e Giriş — Microsoft Azure üzerinde Apache Spark ile Güçlendirilen Büyük Veri Analizi
Her slayt sayfasının detaylı görünümü, düzen, temel içerik ve görsel öğeler dahil.
Başlık slaytı: James Serra, Microsoft'ta Big Data Evangelisti
Sol tarafta başlık, sağ tarafta şehir gece fotoğrafı, altın ok vurgusu
James Serra özgeçmişi — Microsoft Big Data Evangelisti, 30 yıllık BT deneyimi, MCSE sertifikaları, PASS sunucusu, eski SQL Server MVP'si, yazar
Portre fotoğrafı ve MVP rozeti içeren madde işaretli liste
Konular: Big Data Mimarileri, Neden data lake'ler, Yukarıdan Aşağıya vs Aşağıdan Yukarıya, Data lake tanımı, Hadoop data lake olarak, Modern Data Warehouse, Federated Querying, Bulutta çözüm, SMP vs MPP
Basit madde işaretli liste
Hibrit mimari: şirket içi (bina ikonu) ve bulut (bulut ikonu), her ikisi de operasyonel veritabanlarını, data warehouse'ları ve data lake'leri destekliyor. Veri türleri: LOB, CRM, Graph, Image, Social, IoT
Şirket içi ve bulut arasında hibrit ok bulunan iki sütunlu düzen
SQL Server (şirket içi) ↔ Hibrit ↔ Azure Data Services. SQL Server: sektör lideri, #1 TPC-H, herhangi bir veri üzerinde T-SQL. Azure: Aurora'dan %70 daha hızlı, Redshift'e kıyasla 2 kat küresel erişim, No Limits Analytics %99.9 SLA
Rekabetçi metriklerin vurgulandığı aynı hibrit düzen
Azure big data bölümü için bölüm ayırıcı
Mavi arka plan üzerinde beyaz metin
Kontrolden Kullanım Kolaylığına Spektrum: Azure Marketplace (IaaS, herhangi bir Hadoop) → Azure HDInsight (yönetilen kümeler) → Azure Databricks (kolay Spark) → Azure Data Lake Analytics (iş-hizmeti olarak). Depolama: Azure Data Lake Store ve Azure Storage
Kontrol ve kullanım kolaylığı eksenleri olan matris diyagramı
Uçtan uca pipeline: Ingest (Data Factory, Kafka, Event Hub/IoT Hub) → Store (Blobs, Data Lake) → Prep & Train (Databricks, HDInsight, ML) → Model & Serve (Cosmos DB, SQL Database, SQL DW, Analysis Services) → Intelligence (Tahmini uygulamalar, Raporlar, Panolar)
Azure servis ikonları olan beş aşamalı yatay pipeline
Azure Databricks derinlemesine incelemesi için bölüm ayırıcı
Mavi arka plan üzerinde beyaz metin
Hız, kullanım kolaylığı, gelişmiş analizler için oluşturulmuş açık kaynak motoru. Bellekte Hadoop'tan 100 kat daha hızlı. 1000'den fazla katılımcıyla en büyük OSS projesi. Genişletilebilir: Scala, Java, Python, Spark SQL, GraphX, Streaming, MLlib
Apache Spark logosu olan madde işaretli liste
Azure için optimize edilmiş, hızlı, kolay, işbirlikçi Spark tabanlı analizler. Databricks'in en iyisi + Microsoft'un en iyisi. Beş temel özellik: Apache Spark kurucularının işbirliği, tek tıklamayla kurulum, etkileşimli çalışma alanı, yerel Azure entegrasyonu (Power BI, SQL DW, Cosmos DB), kurumsal düzeyde güvenlik (AD, uyumluluk, SLA'lar)
Formüllü başlık (Databricks + Microsoft) ve simge etiketli beş özellik
Birleşik çerçeve: Spark SQL (Etkileşimli Sorgular), Spark MLLib (Makine Öğrenimi), Spark Streaming (Akış İşleme), GraphX (Grafik Hesaplama) — hepsi Yarn, Mesos veya Bağımsız Zamanlayıcı ile Spark Core Engine üzerinde
Çekirdek motorun üzerinde dört modül bulunan yığılmış mimari diyagramı
Kıyaslama karşılaştırmaları: AWS'de vanilla Spark'tan 5 kat daha hızlı (11.674'e karşı 53.783 sn), AWS'de Presto'dan 8 kat daha hızlı (35,3'e karşı 293 sn), Cloudera aracılığıyla şirket içi Impala'dan 3 kat daha hızlı (1.149.264'e karşı 3.331.440 sn)
Yan yana üç yatay çubuk grafik
Tek tutarlı API (RDD'ler), karıştır ve eşleştir işleme türleri, motorlar arasında veri hareketini ortadan kaldırır. İşlem Hattı: Girdi Akışları → Spark Streaming → Spark ML → Spark SQL → NoSQL DB
Solda madde işaretli liste, sağda dikey işlem hattı diyagramı
Üç temel unsur: Üretkenliği Artırın (tek tıklamayla başlatma, Power BI, işbirliği, yerel Azure entegrasyonu), En Uyumlu Bulut Üzerine İnşa Edin (AD güvenliği, ayrıntılı erişim, uyumluluk), Sınırsız Ölçeklendirin (büyük ölçek, en hızlı Spark motoru)
Kalın başlıklarla üç sütunlu düzen
Tam platform şeması: Veri kaynakları (IoT, Bulut depolama, Hadoop, Veri ambarları) → Azure Databricks (İşbirliğine Dayalı Çalışma Alanı + Üretim İşlerini ve İş Akışlarını Dağıt + Optimize Edilmiş Çalışma Zamanı Motoru) → Çıktılar (ML modelleri, BI araçları, Veri dışa aktarımları, Veri ambarları)
Giriş/çıkışları olan üç katmanlı platform şeması
Saniyeler içinde başlayın (tek tıklama), etkileşimli keşif (R, Python, Scala, SQL not defterleri), revizyon geçmişiyle gerçek zamanlı işbirliği (GitHub, Bitbucket), yerleşik görselleştirmeler (matplotlib, ggplot, D3), PowerBI panoları
Solda özellik açıklamaları, sağda platform mimarisi şeması (çalışma alanı katmanı vurgulanmış)
İş zamanlayıcı, not defteri iş akışları (çok aşamalı ardışık düzenler), not defterlerini esnek Spark işleri olarak çalıştırma, bildirimler ve denetim günlükleri, Azure SQL DW, Cosmos DB, Data Lake Store, Blob Storage, Event Hub ile yerel entegrasyon
Solda özellik açıklamaları, sağda platform şeması (işler katmanı vurgulanmış)
Optimize edilmiş G/Ç performansı için DBIO modülü, Azure üzerinde tam olarak yönetilen platform karmaşıklığı ortadan kaldırır, sunucusuz ve elastik bulut hizmeti, küresel olarak büyük ölçekte çalışır
Solda özellik açıklamaları, sağda platform şeması (çalışma zamanı katmanı vurgulanmış)
Beş temel bileşen: Kümeler, Kitaplıklar, Çalışma Alanları, İşler, Not Defterleri — hepsi merkezi Azure Databricks merkezine bağlı
Azure Databricks merkezi ve beş mavi kutu içeren merkez ve çember diyagramı
Driver Programı (SparkContext) → Cluster Manager → Worker Nodes (Cache + Task) → Data Sources (HDFS, SQL, NoSQL). Driver ana fonksiyonu çalıştırır, worker node'lar veri okur/yazar, RDD'ler olarak önbelleğe alır, public cloud'lardaki VM'lerde çalışır
Sağda hiyerarşik mimari diyagramı, solda madde işaretleri
Azure Active Directory entegrasyonu: ayrı kullanıcı yönetimi yok, AAD kullanıcıları doğrudan Databricks'te çalışır, yetkilendirilmiş SSO kimlik doğrulaması, notebook'lar, cluster'lar, işler ve veriler için AAD tabanlı erişim kontrolü
Solda madde işareti listesi, sağda AAD kimlik doğrulama akış diyagramı
Otomatik Ölçeklendirme (min/maks worker, yükte otomatik ölçek) ve Otomatik Sonlandırma (boşta kalma zaman aşımı, otomatik kapanma). Faydaları: node sayısı tahmini yok, manuel ince ayar yok, kaynak israfı yok, yalnızca kullanıldığında ödeme
Solda açıklama metni, sağda Azure Portal Küme Oluştur ekran görüntüsü
Jobs, cluster'larda yürütme için Spark uygulama kodunu gönderir. Notebook'ları veya JAR'ları yürütün. Oluşturma, yönetim ve izleme için kapsamlı GUI araçları
Solda açıklama metni, sağda takvim/saat ikonu
Workspaces, Notebook'ları, Kütüphaneleri ve Panoları düzenler ve paylaşır. Hiyerarşik klasör yapısı, kullanıcı başına özel dizinler, güvenli işbirliği için ince ayarlı erişim kontrolü
Solda madde işareti listesi, sağda iki Azure Portal workspace ekran görüntüsü
Notebook'lar, Spark uygulamalarını doğrudan cluster'larda yazmak ve çalıştırmak içindir. İnce ayarlı izinleri destekler, prototipleme ve yinelemeli geliştirme için idealdir. Kod, veri, görselleştirmeler, yorumlar ve notlardan oluşur
Solda madde işareti listesi, sağda grafikli notebook ekran görüntüsü
Libraries, workspace'ler içinde Python, R, Java/Scala kütüphanelerini tutar. İçe aktarmadan sonra değiştirilemez. Init Scripts aracılığıyla özelleştirilebilir. Library API aracılığıyla yönetilebilir. PyPI, Maven, JAR, R CRAN kaynaklarını destekler
Solda madde işareti listesi, sağda üç Azure Portal Kütüphane Oluştur ekran görüntüsü
Yerleşik görselleştirme: Bar, Scatter, Map, Line, Area, Pie, Quantile, Histogram, Box plot, Q-Q plot, Pivot. Dilden bağımsız olarak tüm notebook'lar Databricks görselleştirmelerini destekler. Matplotlib görüntü olarak işler. ABD eyalet haritası görselleştirmesi ile PySpark SQL kod örneği
Solda madde işareti listesi, sağda PySpark kodu + harita görselleştirmesi, altta çizim türü menüsü
Azure Blob Storage üzerine katmanlanmış dağıtık dosya sistemi. Azure Storage bucket'larını bağlayın, yerel olarak SSD'de önbelleğe alın, Python/Scala/CLI/dbutils'te kullanılabilir, veriler cluster sonlandırmasından sonra kalıcı olur, Spark cluster'larına önceden yüklenmiştir
Solda madde işareti listesi, sağda DBFS mimari diyagramı
Yapılandırılmış veriler için dağıtık SQL sorgu motoru. Harici veritabanlarını, dosyaları, Hive tablolarını sorgulayın. SQL veya HiveQL. Python, Scala, Java'da bağlamalar. Yerleşik yapılandırılmış akış. Catalyst optimizer ve Tungsten execution kullanır
Solda madde işareti listesi, sağda Spark SQL mimari diyagramı
Veritabanları, GUI veya API'ler/Notebook'lar aracılığıyla tanımlanan tablo koleksiyonlarıdır. Databricks, Hive metastore kullanır. Performans için bölümlenmiş tabloları ve bölüm budamasını destekler
Solda madde işaretli liste, sağda Azure Portal veritabanları/tablolar kullanıcı arayüzü
Paralelleştirilmiş ML algoritmaları: MMLSpark, Spark ML, Derin Öğrenme, SparkR. Çapraz doğrulama yoluyla model seçimi. DataFrame tabanlı API (Spark 2.0+). MLlib önceden yüklenmiş. 3. taraf: H2O, SciKit-learn, XGBoost
Solda madde işaretli liste, sağda Spark ML pipeline diyagramı
Tam olarak bir kez durum bilgisi olan akış işleme için birleşik akış + toplu iş API'si. DataFrame API'si ile Spark SQL üzerinde çalışır. Artımlı, sürekli güncellemeler. Olay zamanı pencerelerini, akıştan toplu işe birleştirmeleri, tekilleştirmeyi destekler. Kaynaklar: Kafka, dosya (JSON, CSV, Parquet)
Solda madde işaretli liste, sağda iki diyagram (sınırsız tablo + artımlı yürütme)
Structured Streaming, HDInsight üzerinde Apache Kafka ile entegre olur. Kurumsal düzeyde akış alımı. Ek ağ geçitlerine gerek yoktur. Kafka ve Databricks kümeleri aynı Azure Sanal Ağında olmalıdır
Üstte metin, altta entegrasyon mimarisi diyagramı
Graf ve graf-paralel hesaplama için API'ler. ETL, keşif analizi ve yinelemeli graf hesaplamasını birleştirir. Algoritmalar: PageRank, Bağlantılı Bileşenler, Etiket Yayılımı, SVD++, Üçgen Sayısı. Yalnızca Scala ve RDD API'leri
Üç panelli düzen: özellikler, algoritmalar listesi, PageRank benchmark grafikleri
REST API üzerine kurulu, kullanımı kolay arayüz. İki alt-CLI: Workspace CLI ve DBFS CLI. DBFS API ve Workspace API'yi uygular
Hiyerarşi diyagramı: Databricks CLI → Workspace CLI + DBFS CLI
Yedi API: Cluster API (kümeler oluşturma/düzenleme/silme), DBFS API, Groups API, Instance Profile API, Job API, Library API, Workspace API (not defterlerini içe/dışa aktarma)
Solda huni diyagramı, sağda API tablosuna işaret ediyor
Kullanım senaryosu mimarileri için bölüm ayırıcı
Mavi arka plan üzerinde beyaz metin
Mimari: Yapılandırılmamış veri (günlükler, dosyalar, medya) → Data Factory → Azure Storage → Azure Databricks (Spark) → Azure SQL Data Warehouse. Yapılandırılmış veri (iş uygulamaları) → Data Factory → Polybase → SQL DW → Analitik panolar
İki veri kaynağı akışına sahip beş aşamalı ardışık düzen
Mimari: Yapılandırılmamış → Data Factory → Azure Storage → Azure Databricks (Spark MLlib, SparkR, SparklyR) → Azure Cosmos DB → Web ve mobil uygulamalar. Yapılandırılmış → Polybase → SQL DW → Analitik panolar
ML odaklı işlemeye ve Cosmos DB sunumuna sahip beş aşamalı ardışık düzen
Mimari: Yapılandırılmamış veri → Azure HDInsight (Kafka) → Azure Databricks (Spark) ↔ Azure Storage → Polybase → Azure SQL Data Warehouse → Analitik panolar
Kafka akış alımı ile beş aşamalı pipeline
Fiyatlandırma ve karşılaştırma bölümü için bölüm ayırıcı
Mavi arka plan üzerinde beyaz metin
Üç sütunlu karşılaştırma: Azure HDInsight (Hadoop/HDP, PaaS, Ranger güvenliği, AWS EMR'ye göre fiyatlandırılır), Azure Databricks (Spark, SaaS, AD güvenliği, AWS üzerinde Databricks'e göre fiyatlandırılır), 3. Taraf Teklifleri (Cloudera/MapR/Hortonworks, IaaS, satıcı fiyatlandırması)
Üç sütunlu karşılaştırma kartları
Ayrıntılı karşılaştırma: Azure HDInsight (Hortonworks, büyük veri motorları, VNET, Ranger, OMS, Data Factory orkestrasyonu, 27 bölge), Azure Databricks (Spark-first, tek motor, AAD OAuth, RBAC, otomatik ölçeklendirme, sunucusuz, SQL DW entegrasyonu), Azure ML (birinci taraf ML, Python/R, deneme, model yönetimi, IDE entegrasyonu)
Üç sütunlu ayrıntılı özellik karşılaştırması
Canlı demo için bölüm ayırıcı
Mavi arka plan üzerinde beyaz metin
Azure Portal ekran görüntüsü, Marketplace > Veri + Analiz bölümünde Azure Databricks (önizleme) hizmet sayfasını gösteriyor. Birleşik analitik platform açıklaması, Databricks çalışma alanı UI önizlemesi
Tam genişlikte Azure Portal ekran görüntüsü
Azure Portal: Çalışma alanı adı, abonelik, kaynak grubu ve konum (Batı ABD) alanları ile Azure Databricks Hizmeti oluşturma formu
Tam genişlikte Azure Portal oluşturma formu ekran görüntüsü
Azure Portal Panosu, VM'ler, App Service, Functions, SQL Database için Hızlı Başlangıç öğreticileri ile Databricks Hizmeti dahil olmak üzere dağıtılan kaynakları gösteriyor
Tam genişlikte Azure Panosu ekran görüntüsü
Çalışma Alanını Başlat düğmesi, yönetilen kaynak grubu ayrıntıları, abonelik bilgileri ve hızlı başlangıç kutucukları ile Azure Portal kaynak genel bakış sayfası: Belgeler, Başlarken, Veri İçe Aktar, Not Defteri, Yönetici Kılavuzu
Tam genişlikte kaynak ayrıntı sayfası ekran görüntüsü
Öne Çıkan Not Defterlerini (Apache Spark Tanıtımı, Veri Bilimcileri, Yapılandırılmış Akış), Yeni öğeleri (Not Defteri, İş, Küme, Tablo, Kitaplık), Belgeleme bağlantılarını, Son Açılanları gösteren Databricks çalışma alanı ana sayfası
Tam genişlikte Databricks çalışma alanı ekran görüntüsü
Başlangıç kılavuzu için bölüm ayırıcı
Mavi arka planda beyaz metin
Üç adım: Önizlemeye kaydolun, Microsoft uzmanlarıyla çalıştaylara katılın, azure.com/databricks adresinden daha fazla bilgi edinin
Solda simge etiketli üç adım, sağda iş toplantısı fotoğrafı
İletişim bilgileriyle kapanış Soru-Cevap slaytı: James Serra, Büyük Veri Savunucusu — e-posta, Twitter @JamesSerra, LinkedIn, JamesSerra.com adresindeki blog
Büyük Soru-Cevap metni ve turuncu soru işareti simgesi, altta iletişim bilgileri
Bu slayt ve temel sunum içeriği hakkında yaygın sorular.
Azure Databricks, Azure için optimize edilmiş, hızlı, kolay ve işbirliğine dayalı, Apache Spark tabanlı bir analiz platformudur ve bir SaaS deneyimi olarak tasarlanmıştır. HDInsight, birden çok motoru (Spark, Hive, Kafka, HBase) destekleyen yönetilen bir Hadoop (Hortonworks) dağıtımıdır. Databricks, not defterleri ve işbirliği ile Spark odaklı iş yükleri için en iyisidir; HDInsight ise Spark dışı Hadoop teknolojilerine ihtiyaç duyan müşteriler için uygundur.
Bu sunum, 30 yılı aşkın BT deneyimine, birden fazla Microsoft sertifikasına (MCSE) ve SQL Server 2012 raporlaması üzerine kitabın yazarı olan Microsoft'ta Büyük Veri Savunucusu James Serra tarafından oluşturulmuştur. Kendisi eski bir SQL Server MVP'si ve sık sık PASS konferansı konuşmacısıdır.
Sunum, tüm önemli Spark bileşenlerini kapsar: Spark SQL (dağıtılmış sorgu motoru), Spark MLlib (makine öğrenimi), Spark Structured Streaming (gerçek zamanlı işleme) ve GraphX (grafik hesaplama), ayrıca RDD'ler, Sürücü/Çalışan modeli ve küme yönetimi ile temel Spark mimarisi.
Evet, Databricks Spark'ın AWS'deki vanilla Apache Spark'tan 5 kat, AWS'deki Apache Presto'dan 8 kat ve Cloudera aracılığıyla şirket içi Impala'dan 3 kat daha hızlı olduğunu gösteren kıyaslama verilerini içerir ve kamuya açık kıyaslama çalışmalarından alıntılanan belirli çalışma zamanı sayıları içerir.
Üç eksiksiz Azure referans mimarisi sunulmaktadır: Modern Büyük Veri Ambarı (SQL DW ile toplu ETL), Büyük Veri Üzerinde Gelişmiş Analitik (web/mobil'e hizmet veren Cosmos DB ile ML) ve Büyük Veri Üzerinde Gerçek Zamanlı Analitik (Spark işleme ile Kafka akışı).
Evet, sunum Azure Databricks platform mimarisini, temel yapıları (kümeler, not defterleri, işler, çalışma alanları, kitaplıklar), AAD entegrasyonu ile güvenliği, DBFS, Spark SQL, MLlib, Streaming ve REST API'lerini kapsar - tümü Azure veri mühendisliği sertifikaları için önemli konulardır.
Evet, şunları gösteren adım adım Azure Portal ekran görüntülerini içerir: Marketplace'te Azure Databricks'i bulma, bir çalışma alanı oluşturma, kaynakları dağıtma, çalışma alanını başlatma ve Öne Çıkan Not Defterleri ile Databricks ana sayfasında gezinme.
Sunum şunları kapsayan 53 slayt içerir: Azure veri varlığına genel bakış, büyük veri çözümü karşılaştırması, Apache Spark temelleri, Azure Databricks platform ayrıntıları, çalışma alanı özellikleri, üç referans mimarisi, fiyatlandırma/ürün rehberliği, canlı demo kılavuzu ve başlangıç adımları.
Create Your Own Slides
Turn your ideas into professional presentations in seconds with 2slides AI.
Profesyonel tasarımları referans alın, stilinizi seçin ve mükemmel metin oluşturma ile slaytlar oluşturun. Nano Banana ile desteklenir—şimdi sunumunuzu oluşturmaya başlayın.
Your AI Agent for slides. Save time, shine faster with intelligent presentation creation.
All services online© 2026 2slides. All rights reserved.