
Pengantar Azure Databricks — Analitik Big Data yang Didukung oleh Apache Spark di Microsoft Azure
Navigasi Cepat
Tag
Bagikan slide
Pengantar Azure Databricks — Analitik Big Data yang Didukung oleh Apache Spark di Microsoft Azure
Tampilan detail setiap halaman slide, termasuk tata letak, konten utama dan elemen visual.
Slide judul oleh James Serra, Big Data Evangelist di Microsoft
Judul kiri dengan foto malam kota kanan, aksen panah emas
Bio James Serra — Microsoft Big Data Evangelist, 30 tahun pengalaman di bidang TI, sertifikasi MCSE, presenter PASS, mantan SQL Server MVP, penulis
Daftar poin dengan foto potret dan lencana MVP
Topik: Arsitektur Big Data, Mengapa data lake, Top-down vs Bottom-up, Definisi Data lake, Hadoop sebagai data lake, Modern Data Warehouse, Federated Querying, Solusi di cloud, SMP vs MPP
Daftar poin sederhana
Arsitektur hibrida: on-premises (ikon gedung) dan cloud (ikon cloud) keduanya mendukung database operasional, data warehouse, dan data lake. Tipe data: LOB, CRM, Graph, Image, Social, IoT
Dua kolom dengan panah hibrida antara on-prem dan cloud
SQL Server (on-prem) ↔ Hibrida ↔ Azure Data Services. SQL Server: pemimpin industri, #1 TPC-H, T-SQL di atas data apa pun. Azure: 70% lebih cepat dari Aurora, 2x jangkauan global vs Redshift, No Limits Analytics 99.9% SLA
Tata letak hibrida yang sama dengan metrik kompetitif yang disorot
Pembagi bagian untuk bab Azure big data
Teks putih di latar belakang biru
Spektrum dari Kontrol ke Kemudahan Penggunaan: Azure Marketplace (IaaS, Hadoop apa pun) → Azure HDInsight (kluster terkelola) → Azure Databricks (Spark tanpa gesekan) → Azure Data Lake Analytics (job-as-a-service). Penyimpanan: Azure Data Lake Store dan Azure Storage
Diagram matriks dengan sumbu kontrol vs kemudahan penggunaan
Pipeline end-to-end: Ingest (Data Factory, Kafka, Event Hub/IoT Hub) → Store (Blobs, Data Lake) → Prep & Train (Databricks, HDInsight, ML) → Model & Serve (Cosmos DB, SQL Database, SQL DW, Analysis Services) → Intelligence (Aplikasi prediktif, Laporan, Dasbor)
Pipeline horizontal lima fase dengan ikon layanan Azure
Pembagi bagian untuk deep dive Azure Databricks
Teks putih di latar belakang biru
Mesin open-source yang dibuat untuk kecepatan, kemudahan penggunaan, analitik canggih. 100x lebih cepat dari Hadoop in-memory. Proyek OSS terbesar dengan 1000+ kontributor. Extensible: Scala, Java, Python, Spark SQL, GraphX, Streaming, MLlib
Daftar poin dengan logo Apache Spark
Analitik berbasis Spark yang cepat, mudah, dan kolaboratif yang dioptimalkan untuk Azure. Terbaik dari Databricks + Terbaik dari Microsoft. Lima fitur utama: kolaborasi pendiri Apache Spark, pengaturan sekali klik, ruang kerja interaktif, integrasi Azure asli (Power BI, SQL DW, Cosmos DB), keamanan tingkat perusahaan (AD, kepatuhan, SLA)
Judul dengan formula (Databricks + Microsoft) dan lima fitur berlabel ikon
Kerangka kerja terpadu: Spark SQL (Kueri Interaktif), Spark MLLib (Machine Learning), Spark Streaming (Pemrosesan Aliran), GraphX (Komputasi Grafik) — semuanya pada Spark Core Engine dengan Yarn, Mesos, atau Standalone Scheduler
Diagram arsitektur bertumpuk dengan empat modul di atas core engine
Perbandingan tolok ukur: 5x lebih cepat dari vanilla Spark di AWS (11.674 vs 53.783 detik), 8x lebih cepat dari Presto di AWS (35,3 vs 293 detik), 3x lebih cepat dari Impala on-premises melalui Cloudera (1.149.264 vs 3.331.440 detik)
Tiga bagan batang horizontal berdampingan
API tunggal yang konsisten (RDDs), jenis pemrosesan mix-and-match, menghilangkan pergerakan data antar mesin. Pipeline: Input Streams → Spark Streaming → Spark ML → Spark SQL → NoSQL DB
Daftar poin di kiri, diagram pipeline vertikal di kanan
Tiga pilar: Tingkatkan Produktivitas (peluncuran sekali klik, Power BI, kolaborasi, integrasi Azure asli), Bangun di Cloud Paling Sesuai (keamanan AD, akses terperinci, kepatuhan), Skala Tanpa Batas (skala besar, mesin Spark tercepat)
Tata letak tiga kolom dengan tajuk tebal
Diagram platform lengkap: Sumber data (IoT, Cloud storage, Hadoop, Data warehouses) → Azure Databricks (Ruang Kerja Kolaboratif + Deploy Production Jobs & Workflows + Optimized Runtime Engine) → Output (Model ML, alat BI, Ekspor data, Data warehouses)
Diagram platform tiga lapis dengan input/output
Mulai dalam hitungan detik (sekali klik), eksplorasi interaktif (R, Python, Scala, SQL notebooks), kolaborasi waktu nyata dengan riwayat revisi (GitHub, Bitbucket), visualisasi bawaan (matplotlib, ggplot, D3), dasbor PowerBI
Deskripsi fitur di kiri, diagram arsitektur platform di kanan (lapisan ruang kerja disorot)
Jobs scheduler, alur kerja notebook (alur multi-tahap), jalankan notebooks sebagai pekerjaan Spark yang tangguh, notifikasi dan log audit, integrasi asli dengan Azure SQL DW, Cosmos DB, Data Lake Store, Blob Storage, Event Hub
Deskripsi fitur di kiri, diagram platform di kanan (lapisan pekerjaan disorot)
Modul DBIO untuk kinerja I/O yang dioptimalkan, platform terkelola penuh di Azure menghilangkan kompleksitas, layanan cloud tanpa server dan elastis, beroperasi dalam skala besar secara global
Deskripsi fitur di kiri, diagram platform di kanan (lapisan runtime disorot)
Lima komponen inti: Clusters, Libraries, Workspaces, Jobs, Notebooks — semuanya terhubung ke hub Azure Databricks pusat
Diagram hub-and-spoke dengan pusat Azure Databricks dan lima kotak biru
Driver Program (SparkContext) → Cluster Manager → Worker Nodes (Cache + Task) → Data Sources (HDFS, SQL, NoSQL). Driver menjalankan fungsi utama, worker nodes membaca/menulis data, cache sebagai RDD, mengeksekusi pada VM di cloud publik
Diagram arsitektur hierarkis di kanan, poin-poin di kiri
Integrasi Azure Active Directory: tidak ada manajemen pengguna terpisah, pengguna AAD bekerja langsung di Databricks, delegasi otentikasi SSO, kontrol akses berbasis AAD untuk notebooks, clusters, jobs, dan data
Daftar poin di kiri, diagram alur otentikasi AAD di kanan
Autoscaling (min/max workers, skala otomatis pada beban) dan Auto Termination (idle timeout, auto shutdown). Manfaat: tidak perlu menebak jumlah node, tidak ada penyesuaian manual, tidak ada pemborosan sumber daya, hanya bayar saat digunakan
Teks deskripsi di kiri, screenshot Azure Portal Create Cluster di kanan
Jobs mengirimkan kode aplikasi Spark untuk dieksekusi pada clusters. Mengeksekusi Notebooks atau JARs. Alat GUI komprehensif untuk pembuatan, manajemen, dan pemantauan
Teks deskripsi di kiri, ikon kalender/jam di kanan
Workspaces mengatur dan berbagi Notebooks, Libraries, dan Dashboards. Struktur folder hierarkis, direktori pribadi per pengguna, kontrol akses terperinci untuk kolaborasi yang aman
Daftar poin di kiri, dua screenshot workspace Azure Portal di kanan
Notebooks untuk menulis dan menjalankan aplikasi Spark langsung di clusters. Mendukung izin terperinci, ideal untuk prototyping dan pengembangan iteratif. Terdiri dari kode, data, visualisasi, komentar, dan catatan
Daftar poin di kiri, screenshot notebook dengan grafik di kanan
Libraries menyimpan pustaka Python, R, Java/Scala di dalam workspaces. Tidak dapat diubah setelah diimpor. Dapat disesuaikan melalui Init Scripts. Dapat dikelola melalui Library API. Mendukung sumber PyPI, Maven, JAR, R CRAN
Daftar poin di kiri, tiga screenshot Azure Portal Create Library di kanan
Visualisasi bawaan: Bar, Scatter, Map, Line, Area, Pie, Quantile, Histogram, Box plot, Q-Q plot, Pivot. Semua notebooks terlepas dari bahasa mendukung visualisasi Databricks. Matplotlib dirender sebagai gambar. Contoh kode PySpark SQL dengan visualisasi peta negara bagian AS
Daftar poin di kiri, kode PySpark + visualisasi peta di kanan, menu tipe plot di bawah
Sistem file terdistribusi yang dilapisi di atas Azure Blob Storage. Mount Azure Storage buckets, cache secara lokal di SSD, tersedia di Python/Scala/CLI/dbutils, data bertahan setelah cluster dihentikan, pra-instal pada Spark clusters
Daftar poin di kiri, diagram arsitektur DBFS di kanan
Mesin query SQL terdistribusi untuk data terstruktur. Query database eksternal, file, tabel Hive. SQL atau HiveQL. Bindings di Python, Scala, Java. Structured streaming bawaan. Menggunakan pengoptimal Catalyst dan eksekusi Tungsten
Daftar poin di kiri, diagram arsitektur Spark SQL di kanan
Database sebagai kumpulan tabel, didefinisikan melalui GUI atau API/Notebook. Databricks menggunakan Hive metastore. Mendukung tabel yang dipartisi dan pemangkasan partisi untuk kinerja
Daftar poin di kiri, UI database/tabel Azure Portal di kanan
Algoritma ML yang diparalelkan: MMLSpark, Spark ML, Deep Learning, SparkR. Pemilihan model melalui validasi silang. API berbasis DataFrame (Spark 2.0+). MLlib sudah terpasang. Pihak ke-3: H2O, SciKit-learn, XGBoost
Daftar poin di kiri, diagram pipeline Spark ML di kanan
API streaming + batch terpadu untuk pemrosesan stream stateful yang tepat sekali. Berjalan di Spark SQL dengan DataFrame API. Pembaruan inkremental dan berkelanjutan. Mendukung jendela waktu kejadian, penggabungan stream-ke-batch, deduplikasi. Sumber: Kafka, file (JSON, CSV, Parquet)
Daftar poin di kiri, dua diagram di kanan (tabel tak terbatas + eksekusi inkremental)
Structured Streaming terintegrasi dengan Apache Kafka di HDInsight. Ingesti streaming tingkat perusahaan. Tidak diperlukan gateway tambahan. Kluster Kafka dan Databricks harus berada di Azure Virtual Network yang sama
Teks di atas, diagram arsitektur integrasi di bawah
API untuk komputasi grafik dan paralel-grafik. Menyatukan ETL, analisis eksplorasi, dan komputasi grafik iteratif. Algoritma: PageRank, Connected Components, Label Propagation, SVD++, Triangle Count. Hanya API Scala dan RDD
Tata letak tiga panel: fitur, daftar algoritma, bagan benchmark PageRank
Antarmuka yang mudah digunakan dibangun di atas REST API. Dua sub-CLI: Workspace CLI dan DBFS CLI. Mengimplementasikan DBFS API dan Workspace API
Diagram hierarki: Databricks CLI → Workspace CLI + DBFS CLI
Tujuh API: Cluster API (membuat/mengedit/menghapus klaster), DBFS API, Groups API, Instance Profile API, Job API, Library API, Workspace API (mengimpor/mengekspor notebook)
Diagram corong di kiri menunjuk ke tabel API di kanan
Pembagi bagian untuk arsitektur kasus penggunaan
Teks putih dengan latar belakang biru
Arsitektur: Data tidak terstruktur (log, file, media) → Data Factory → Azure Storage → Azure Databricks (Spark) → Azure SQL Data Warehouse. Data terstruktur (aplikasi bisnis) → Data Factory → Polybase → SQL DW → Dasbor analitis
Pipeline lima fase dengan dua aliran sumber data
Arsitektur: Tidak terstruktur → Data Factory → Azure Storage → Azure Databricks (Spark MLlib, SparkR, SparklyR) → Azure Cosmos DB → Aplikasi web & seluler. Terstruktur → Polybase → SQL DW → Dasbor analitis
Pipeline lima fase dengan pemrosesan berfokus pada ML dan penyajian Cosmos DB
Arsitektur: Data tidak terstruktur → Azure HDInsight (Kafka) → Azure Databricks (Spark) ↔ Azure Storage → Polybase → Azure SQL Data Warehouse → Dasbor Analitis
Pipeline lima fase dengan ingesti streaming Kafka
Pembatas bagian untuk bab harga dan perbandingan
Teks putih dengan latar belakang biru
Perbandingan tiga kolom: Azure HDInsight (Hadoop/HDP, PaaS, keamanan Ranger, harga vs AWS EMR), Azure Databricks (Spark, SaaS, keamanan AD, harga vs Databricks di AWS), Penawaran Pihak Ketiga (Cloudera/MapR/Hortonworks, IaaS, harga vendor)
Kartu perbandingan tiga kolom
Perbandingan terperinci: Azure HDInsight (Hortonworks, mesin big data, VNET, Ranger, OMS, orkestrasi Data Factory, 27 wilayah), Azure Databricks (Spark-first, mesin tunggal, AAD OAuth, RBAC, auto-scaling, serverless, integrasi SQL DW), Azure ML (ML pihak pertama, Python/R, eksperimen, manajemen model, integrasi IDE)
Perbandingan fitur terperinci tiga kolom
Pembatas bagian untuk demo langsung
Teks putih dengan latar belakang biru
Tangkapan layar Azure Portal yang menampilkan halaman layanan Azure Databricks (pratinjau) di Marketplace > Data + Analytics. Deskripsi platform analitik terpadu, pratinjau UI ruang kerja Databricks
Tangkapan layar Azure Portal lebar penuh
Azure Portal: Formulir Buat Layanan Azure Databricks dengan bidang nama ruang kerja, langganan, grup sumber daya, dan lokasi (AS Barat)
Tangkapan layar formulir pembuatan Azure Portal lebar penuh
Dasbor Azure Portal yang menampilkan sumber daya yang di-deploy termasuk Layanan Databricks, dengan tutorial Mulai Cepat untuk VM, App Service, Functions, SQL Database
Tangkapan layar Dasbor Azure lebar penuh
Halaman tinjauan sumber daya Azure Portal dengan tombol Luncurkan Ruang Kerja, detail grup sumber daya terkelola, info langganan, dan tile mulai cepat: Dokumentasi, Memulai, Impor Data, Notebook, Panduan Admin
Tangkapan layar halaman detail sumber daya lebar penuh
Halaman beranda ruang kerja Databricks yang menampilkan Notebook Unggulan (Pengantar Apache Spark, Ilmuwan Data, Streaming Terstruktur), item Baru (Notebook, Job, Cluster, Table, Library), tautan Dokumentasi, Buka Terbaru
Tangkapan layar ruang kerja Databricks lebar penuh
Pembatas bagian untuk panduan memulai
Teks putih dengan latar belakang biru
Tiga langkah: Daftar untuk pratinjau, Libatkan pakar Microsoft untuk lokakarya, Pelajari lebih lanjut di azure.com/databricks
Tiga langkah berlabel ikon di kiri, foto pertemuan bisnis di kanan
Slide Tanya Jawab penutup dengan info kontak: James Serra, Big Data Evangelist — email, Twitter @JamesSerra, LinkedIn, blog di JamesSerra.com
Teks Tanya Jawab besar dengan ikon tanda tanya oranye, detail kontak di bagian bawah
Pertanyaan umum tentang slide ini dan konten presentasi yang mendasarinya.
Azure Databricks adalah platform analitik berbasis Apache Spark yang cepat, mudah, dan kolaboratif yang dioptimalkan untuk Azure, dirancang sebagai pengalaman SaaS. HDInsight adalah distribusi Hadoop (Hortonworks) terkelola yang mendukung banyak mesin (Spark, Hive, Kafka, HBase). Databricks paling cocok untuk beban kerja yang berfokus pada Spark dengan notebook dan kolaborasi, sementara HDInsight cocok untuk pelanggan yang membutuhkan teknologi Hadoop non-Spark.
Presentasi ini dibuat oleh James Serra, seorang Big Data Evangelist di Microsoft dengan pengalaman TI lebih dari 30 tahun, beberapa sertifikasi Microsoft (MCSE), dan penulis buku tentang pelaporan SQL Server 2012. Dia adalah mantan SQL Server MVP dan pembicara konferensi PASS yang sering.
Presentasi ini mencakup semua komponen Spark utama: Spark SQL (mesin kueri terdistribusi), Spark MLlib (machine learning), Spark Structured Streaming (pemrosesan real-time), dan GraphX (komputasi grafik), ditambah arsitektur Spark inti dengan RDD, model Driver/Worker, dan manajemen cluster.
Ya, ini mencakup data benchmark yang menunjukkan bahwa Databricks Spark 5x lebih cepat daripada Apache Spark biasa di AWS, 8x lebih cepat daripada Apache Presto di AWS, dan 3x lebih cepat daripada Impala on-premise melalui Cloudera, dengan angka runtime spesifik yang dikutip dari studi benchmark publik.
Tiga arsitektur referensi Azure lengkap disajikan: Gudang Big Data Modern (batch ETL dengan SQL DW), Analitik Tingkat Lanjut pada Big Data (ML dengan Cosmos DB yang melayani web/seluler), dan Analitik Real-time pada Big Data (streaming Kafka dengan pemrosesan Spark).
Ya, presentasi ini mencakup arsitektur platform Azure Databricks, artefak inti (cluster, notebook, pekerjaan, ruang kerja, pustaka), keamanan dengan integrasi AAD, DBFS, Spark SQL, MLlib, Streaming, dan REST API — semua topik utama untuk sertifikasi data engineering Azure.
Ya, ini mencakup screenshot Azure Portal langkah demi langkah yang menunjukkan: menemukan Azure Databricks di Marketplace, membuat ruang kerja, menerapkan sumber daya, meluncurkan ruang kerja, dan menavigasi beranda Databricks dengan Notebook Unggulan.
Presentasi ini berisi 53 slide yang mencakup: Ikhtisar lingkungan data Azure, perbandingan solusi big data, dasar-dasar Apache Spark, detail platform Azure Databricks, fitur ruang kerja, tiga arsitektur referensi, panduan harga/produk, panduan demo langsung, dan langkah-langkah memulai.
Create Your Own Slides
Turn your ideas into professional presentations in seconds with 2slides AI.
Referensikan desain profesional, pilih gaya Anda, dan hasilkan slide dengan rendering teks sempurna. Didukung oleh Nano Banana—mulai buat presentasi Anda sekarang.
Your AI Agent for slides. Save time, shine faster with intelligent presentation creation.
All services online© 2026 2slides. All rights reserved.