2Slides Logo
Preview

Pengantar Azure Databricks — Analitik Big Data yang Didukung oleh Apache Spark

53 slide

Pengantar Azure Databricks — Analitik Big Data yang Didukung oleh Apache Spark di Microsoft Azure

8 suka
0 unduhan

Navigasi Cepat

Tag

Azure Databricks
Apache Spark
Microsoft Azure
Big data
Cloud analytics

Bagikan slide

Deskripsi

Topik Utama

Pengantar Azure Databricks — Analitik Big Data yang Didukung oleh Apache Spark di Microsoft Azure

Manfaat Utama

  • Pengantar komprehensif 53 slide yang mencakup Azure Databricks dari dasar hingga demo langsung
  • Mencakup ekosistem big data Azure lengkap: SQL Server, Azure Data Services, HDInsight, Data Lake Analytics, dan penempatan Databricks
  • Pendalaman ke dalam arsitektur Apache Spark, Spark SQL, MLlib, Structured Streaming, dan komponen GraphX
  • Panduan praktis ruang kerja Azure Databricks: cluster, notebook, pekerjaan, ruang kerja, pustaka, DBFS, dan visualisasi
  • Mencakup arsitektur kasus penggunaan dunia nyata: Gudang Big Data Modern, Analitik Tingkat Lanjut, dan saluran Analitik Real-time

Target Audiens

  • Data engineer dan arsitek yang mengevaluasi solusi big data Azure
  • Profesional TI yang merencanakan migrasi dari Hadoop on-premise ke cloud Azure
  • Data scientist yang tertarik dengan analitik berbasis Spark di Azure
  • Pengambil keputusan teknis yang membandingkan Azure HDInsight, Azure Databricks, dan Azure ML
  • Profesional teknologi Microsoft yang mencari persiapan sertifikasi Azure Databricks

Kasus Penggunaan

  • Presentasi penjualan teknis yang memperkenalkan Azure Databricks kepada pelanggan Microsoft
  • Workshop arsitektur Azure yang membandingkan solusi big data
  • Sesi pelatihan internal tentang kemampuan platform Azure Databricks
  • Pembicaraan konferensi tentang Apache Spark di ekosistem Azure
  • Onboarding anggota tim baru ke layanan big data Azure

Proposisi Nilai Unik

  • Disajikan oleh Microsoft Big Data Evangelist James Serra dengan pengalaman TI 30+ tahun
  • Menempatkan Azure Databricks dalam lingkungan data Microsoft yang lebih luas (SQL Server + hybrid Azure)
  • Mencakup data benchmark: 5x lebih cepat dari Spark biasa, 8x lebih cepat dari Presto, 3x lebih cepat dari Impala
  • Screenshot demo Azure Portal langkah demi langkah untuk pembuatan dan penerapan ruang kerja
  • Tiga arsitektur referensi lengkap untuk pola big data umum di Azure

Halaman Slide (53)

Tampilan detail setiap halaman slide, termasuk tata letak, konten utama dan elemen visual.

Halaman 1
title slide

Pengantar Azure Databricks

Konten

Slide judul oleh James Serra, Big Data Evangelist di Microsoft

Struktur Tata Letak

Judul kiri dengan foto malam kota kanan, aksen panah emas

Elemen Visual Utama

  • Pemandangan malam kota dengan jejak cahaya
  • Elemen desain panah emas
  • Latar belakang biru tua
Halaman 2
speaker bio

Tentang Saya

Konten

Bio James Serra — Microsoft Big Data Evangelist, 30 tahun pengalaman di bidang TI, sertifikasi MCSE, presenter PASS, mantan SQL Server MVP, penulis

Struktur Tata Letak

Daftar poin dengan foto potret dan lencana MVP

Elemen Visual Utama

  • Foto potret
  • Lencana Microsoft MVP
Halaman 3
agenda

Agenda

Konten

Topik: Arsitektur Big Data, Mengapa data lake, Top-down vs Bottom-up, Definisi Data lake, Hadoop sebagai data lake, Modern Data Warehouse, Federated Querying, Solusi di cloud, SMP vs MPP

Struktur Tata Letak

Daftar poin sederhana

Elemen Visual Utama

  • Daftar teks abu-abu
Halaman 4
architecture diagram

Lingkungan Data Modern

Konten

Arsitektur hibrida: on-premises (ikon gedung) dan cloud (ikon cloud) keduanya mendukung database operasional, data warehouse, dan data lake. Tipe data: LOB, CRM, Graph, Image, Social, IoT

Struktur Tata Letak

Dua kolom dengan panah hibrida antara on-prem dan cloud

Elemen Visual Utama

  • Ikon gedung dan cloud
  • Enam ikon tipe data
  • Panah dua arah hibrida
Halaman 5
product positioning

Penawaran Microsoft

Konten

SQL Server (on-prem) ↔ Hibrida ↔ Azure Data Services. SQL Server: pemimpin industri, #1 TPC-H, T-SQL di atas data apa pun. Azure: 70% lebih cepat dari Aurora, 2x jangkauan global vs Redshift, No Limits Analytics 99.9% SLA

Struktur Tata Letak

Tata letak hibrida yang sama dengan metrik kompetitif yang disorot

Elemen Visual Utama

  • Ikon gedung SQL Server
  • Ikon cloud Azure
  • Teks metrik kompetitif biru
Halaman 6
section divider

Big Data & Analitik Tingkat Lanjut di Azure

Konten

Pembagi bagian untuk bab Azure big data

Struktur Tata Letak

Teks putih di latar belakang biru

Elemen Visual Utama

  • Latar belakang biru Microsoft
Halaman 7
comparison

Mengenal Berbagai Solusi Big Data

Konten

Spektrum dari Kontrol ke Kemudahan Penggunaan: Azure Marketplace (IaaS, Hadoop apa pun) → Azure HDInsight (kluster terkelola) → Azure Databricks (Spark tanpa gesekan) → Azure Data Lake Analytics (job-as-a-service). Penyimpanan: Azure Data Lake Store dan Azure Storage

Struktur Tata Letak

Diagram matriks dengan sumbu kontrol vs kemudahan penggunaan

Elemen Visual Utama

  • Empat kotak produk dengan logo
  • Spektrum Kontrol ↔ Kemudahan Penggunaan
  • Lapisan penyimpanan di bagian bawah
Halaman 8
architecture diagram

Big Data & Analitik Tingkat Lanjut Sekilas

Konten

Pipeline end-to-end: Ingest (Data Factory, Kafka, Event Hub/IoT Hub) → Store (Blobs, Data Lake) → Prep & Train (Databricks, HDInsight, ML) → Model & Serve (Cosmos DB, SQL Database, SQL DW, Analysis Services) → Intelligence (Aplikasi prediktif, Laporan, Dasbor)

Struktur Tata Letak

Pipeline horizontal lima fase dengan ikon layanan Azure

Elemen Visual Utama

  • Ikon layanan Azure
  • Panah aliran putus-putus
  • Tiga tipe sumber data: Aplikasi Bisnis, Aplikasi Kustom, Sensor
Halaman 9
section divider

Azure Databricks Didukung oleh Apache Spark

Konten

Pembagi bagian untuk deep dive Azure Databricks

Struktur Tata Letak

Teks putih di latar belakang biru

Elemen Visual Utama

  • Latar belakang biru Microsoft
Halaman 10
technology overview

Mengapa Spark?

Konten

Mesin open-source yang dibuat untuk kecepatan, kemudahan penggunaan, analitik canggih. 100x lebih cepat dari Hadoop in-memory. Proyek OSS terbesar dengan 1000+ kontributor. Extensible: Scala, Java, Python, Spark SQL, GraphX, Streaming, MLlib

Struktur Tata Letak

Daftar poin dengan logo Apache Spark

Elemen Visual Utama

  • Logo Apache Spark (bintang oranye)
  • Frasa kunci tebal
Halaman 11
product overview

Apa itu Azure Databricks?

Konten

Analitik berbasis Spark yang cepat, mudah, dan kolaboratif yang dioptimalkan untuk Azure. Terbaik dari Databricks + Terbaik dari Microsoft. Lima fitur utama: kolaborasi pendiri Apache Spark, pengaturan sekali klik, ruang kerja interaktif, integrasi Azure asli (Power BI, SQL DW, Cosmos DB), keamanan tingkat perusahaan (AD, kepatuhan, SLA)

Struktur Tata Letak

Judul dengan formula (Databricks + Microsoft) dan lima fitur berlabel ikon

Elemen Visual Utama

  • Logo Databricks + logo Microsoft
  • Lima ikon fitur
  • Teks aksen biru
Halaman 12
architecture diagram

Arsitektur Apache Spark

Konten

Kerangka kerja terpadu: Spark SQL (Kueri Interaktif), Spark MLLib (Machine Learning), Spark Streaming (Pemrosesan Aliran), GraphX (Komputasi Grafik) — semuanya pada Spark Core Engine dengan Yarn, Mesos, atau Standalone Scheduler

Struktur Tata Letak

Diagram arsitektur bertumpuk dengan empat modul di atas core engine

Elemen Visual Utama

  • Empat kotak modul biru
  • Lapisan Spark Core Engine
  • Tiga opsi scheduler
  • Menyatukan: Batch, SQL, Real-time, ML, Deep Learning, Graph
Halaman 13
data visualization

Databricks Spark Cepat

Konten

Perbandingan tolok ukur: 5x lebih cepat dari vanilla Spark di AWS (11.674 vs 53.783 detik), 8x lebih cepat dari Presto di AWS (35,3 vs 293 detik), 3x lebih cepat dari Impala on-premises melalui Cloudera (1.149.264 vs 3.331.440 detik)

Struktur Tata Letak

Tiga bagan batang horizontal berdampingan

Elemen Visual Utama

  • Tiga bagan batang tolok ukur
  • Bilah Databricks merah vs bilah pesaing abu-abu
  • Tautan sitasi sumber
Halaman 14
concept explanation

Keuntungan dari Platform Terpadu

Konten

API tunggal yang konsisten (RDDs), jenis pemrosesan mix-and-match, menghilangkan pergerakan data antar mesin. Pipeline: Input Streams → Spark Streaming → Spark ML → Spark SQL → NoSQL DB

Struktur Tata Letak

Daftar poin di kiri, diagram pipeline vertikal di kanan

Elemen Visual Utama

  • Diagram alur pipeline biru vertikal
  • Kotak biru untuk setiap komponen Spark
Halaman 15
value proposition

Pengalaman yang dibedakan di Azure

Konten

Tiga pilar: Tingkatkan Produktivitas (peluncuran sekali klik, Power BI, kolaborasi, integrasi Azure asli), Bangun di Cloud Paling Sesuai (keamanan AD, akses terperinci, kepatuhan), Skala Tanpa Batas (skala besar, mesin Spark tercepat)

Struktur Tata Letak

Tata letak tiga kolom dengan tajuk tebal

Elemen Visual Utama

  • Tiga tajuk kolom biru
  • Frasa kunci tebal
Halaman 16
architecture diagram

Arsitektur Platform Azure Databricks

Konten

Diagram platform lengkap: Sumber data (IoT, Cloud storage, Hadoop, Data warehouses) → Azure Databricks (Ruang Kerja Kolaboratif + Deploy Production Jobs & Workflows + Optimized Runtime Engine) → Output (Model ML, alat BI, Ekspor data, Data warehouses)

Struktur Tata Letak

Diagram platform tiga lapis dengan input/output

Elemen Visual Utama

  • Platform Azure Databricks tiga tingkat
  • Tiga ikon persona
  • Logo Spark di lapisan runtime
  • Ikon sumber data input/output
Halaman 17
feature detail

Ruang Kerja Kolaboratif

Konten

Mulai dalam hitungan detik (sekali klik), eksplorasi interaktif (R, Python, Scala, SQL notebooks), kolaborasi waktu nyata dengan riwayat revisi (GitHub, Bitbucket), visualisasi bawaan (matplotlib, ggplot, D3), dasbor PowerBI

Struktur Tata Letak

Deskripsi fitur di kiri, diagram arsitektur platform di kanan (lapisan ruang kerja disorot)

Elemen Visual Utama

  • Diagram platform dengan Ruang Kerja Kolaboratif disorot
  • Header bagian yang dicetak tebal
Halaman 18
feature detail

Terapkan Pekerjaan & Alur Kerja Produksi

Konten

Jobs scheduler, alur kerja notebook (alur multi-tahap), jalankan notebooks sebagai pekerjaan Spark yang tangguh, notifikasi dan log audit, integrasi asli dengan Azure SQL DW, Cosmos DB, Data Lake Store, Blob Storage, Event Hub

Struktur Tata Letak

Deskripsi fitur di kiri, diagram platform di kanan (lapisan pekerjaan disorot)

Elemen Visual Utama

  • Diagram platform dengan Jobs & Workflows disorot
Halaman 19
feature detail

Mesin Runtime Databricks yang Dioptimalkan

Konten

Modul DBIO untuk kinerja I/O yang dioptimalkan, platform terkelola penuh di Azure menghilangkan kompleksitas, layanan cloud tanpa server dan elastis, beroperasi dalam skala besar secara global

Struktur Tata Letak

Deskripsi fitur di kiri, diagram platform di kanan (lapisan runtime disorot)

Elemen Visual Utama

  • Diagram platform dengan Runtime Engine disorot
Halaman 20
concept diagram

Artefak Inti Azure Databricks

Konten

Lima komponen inti: Clusters, Libraries, Workspaces, Jobs, Notebooks — semuanya terhubung ke hub Azure Databricks pusat

Struktur Tata Letak

Diagram hub-and-spoke dengan pusat Azure Databricks dan lima kotak biru

Elemen Visual Utama

  • Elips hub oranye
  • Lima kotak komponen biru dengan ikon
  • Garis penghubung
Halaman 21
architecture diagram

Arsitektur Cluster Spark Umum

Konten

Driver Program (SparkContext) → Cluster Manager → Worker Nodes (Cache + Task) → Data Sources (HDFS, SQL, NoSQL). Driver menjalankan fungsi utama, worker nodes membaca/menulis data, cache sebagai RDD, mengeksekusi pada VM di cloud publik

Struktur Tata Letak

Diagram arsitektur hierarkis di kanan, poin-poin di kiri

Elemen Visual Utama

  • Hierarki Driver → Manager → Workers
  • Kotak Cache dan Task di worker nodes
  • Lapisan Data Sources di bawah
Halaman 22
security feature

Integrasi Azure Databricks dengan AAD

Konten

Integrasi Azure Active Directory: tidak ada manajemen pengguna terpisah, pengguna AAD bekerja langsung di Databricks, delegasi otentikasi SSO, kontrol akses berbasis AAD untuk notebooks, clusters, jobs, dan data

Struktur Tata Letak

Daftar poin di kiri, diagram alur otentikasi AAD di kanan

Elemen Visual Utama

  • Azure Databricks → Access Control → Azure AD → Alur otentikasi
  • Tiga ikon persona pengguna
  • Logo berlian Azure AD
Halaman 23
product demo

Cluster: Penskalaan Otomatis dan Penghentian Otomatis

Konten

Autoscaling (min/max workers, skala otomatis pada beban) dan Auto Termination (idle timeout, auto shutdown). Manfaat: tidak perlu menebak jumlah node, tidak ada penyesuaian manual, tidak ada pemborosan sumber daya, hanya bayar saat digunakan

Struktur Tata Letak

Teks deskripsi di kiri, screenshot Azure Portal Create Cluster di kanan

Elemen Visual Utama

  • UI pembuatan cluster Azure Portal
  • Pengaturan Autoscaling dan Auto Termination disorot dengan warna merah
Halaman 24
feature overview

Pekerjaan

Konten

Jobs mengirimkan kode aplikasi Spark untuk dieksekusi pada clusters. Mengeksekusi Notebooks atau JARs. Alat GUI komprehensif untuk pembuatan, manajemen, dan pemantauan

Struktur Tata Letak

Teks deskripsi di kiri, ikon kalender/jam di kanan

Elemen Visual Utama

  • Kalender abu-abu dengan ikon jam
Halaman 25
product demo

Ruang Kerja

Konten

Workspaces mengatur dan berbagi Notebooks, Libraries, dan Dashboards. Struktur folder hierarkis, direktori pribadi per pengguna, kontrol akses terperinci untuk kolaborasi yang aman

Struktur Tata Letak

Daftar poin di kiri, dua screenshot workspace Azure Portal di kanan

Elemen Visual Utama

  • Screenshot browser folder Workspace
  • Menu Import/Export/Permissions
Halaman 26
product demo

Ikhtisar Notebook Azure Databricks

Konten

Notebooks untuk menulis dan menjalankan aplikasi Spark langsung di clusters. Mendukung izin terperinci, ideal untuk prototyping dan pengembangan iteratif. Terdiri dari kode, data, visualisasi, komentar, dan catatan

Struktur Tata Letak

Daftar poin di kiri, screenshot notebook dengan grafik di kanan

Elemen Visual Utama

  • Notebook dengan visualisasi grafik batang
  • Grafik Population vs Price
  • Sidebar thread komentar
Halaman 27
product demo

Ikhtisar Pustaka

Konten

Libraries menyimpan pustaka Python, R, Java/Scala di dalam workspaces. Tidak dapat diubah setelah diimpor. Dapat disesuaikan melalui Init Scripts. Dapat dikelola melalui Library API. Mendukung sumber PyPI, Maven, JAR, R CRAN

Struktur Tata Letak

Daftar poin di kiri, tiga screenshot Azure Portal Create Library di kanan

Elemen Visual Utama

  • Tiga screenshot UI pembuatan pustaka
  • Opsi sumber pustaka PyPI, JAR, Maven, R
Halaman 28
product demo

Visualisasi

Konten

Visualisasi bawaan: Bar, Scatter, Map, Line, Area, Pie, Quantile, Histogram, Box plot, Q-Q plot, Pivot. Semua notebooks terlepas dari bahasa mendukung visualisasi Databricks. Matplotlib dirender sebagai gambar. Contoh kode PySpark SQL dengan visualisasi peta negara bagian AS

Struktur Tata Letak

Daftar poin di kiri, kode PySpark + visualisasi peta di kanan, menu tipe plot di bawah

Elemen Visual Utama

  • Visualisasi peta choropleth AS
  • Potongan kode PySpark
  • Menu pemilihan tipe plot
Halaman 29
architecture diagram

Sistem File Databricks (DBFS)

Konten

Sistem file terdistribusi yang dilapisi di atas Azure Blob Storage. Mount Azure Storage buckets, cache secara lokal di SSD, tersedia di Python/Scala/CLI/dbutils, data bertahan setelah cluster dihentikan, pra-instal pada Spark clusters

Struktur Tata Letak

Daftar poin di kiri, diagram arsitektur DBFS di kanan

Elemen Visual Utama

  • Diagram struktur pohon DBFS
  • Titik akses Python/Scala/CLI/dbutils
  • Azure Blob Storage di bawah
  • Konektor db.fs.mount()
Halaman 30
technology overview

Ikhtisar Spark SQL

Konten

Mesin query SQL terdistribusi untuk data terstruktur. Query database eksternal, file, tabel Hive. SQL atau HiveQL. Bindings di Python, Scala, Java. Structured streaming bawaan. Menggunakan pengoptimal Catalyst dan eksekusi Tungsten

Struktur Tata Letak

Daftar poin di kiri, diagram arsitektur Spark SQL di kanan

Elemen Visual Utama

  • Diagram arsitektur berlapis Spark SQL
  • Logo konektor sumber data: Parquet, JSON, Hive, JDBC, CSV, Cassandra, MongoDB, MySQL, dll.
Halaman 31
product demo

Ikhtisar Database dan Tabel

Konten

Database sebagai kumpulan tabel, didefinisikan melalui GUI atau API/Notebook. Databricks menggunakan Hive metastore. Mendukung tabel yang dipartisi dan pemangkasan partisi untuk kinerja

Struktur Tata Letak

Daftar poin di kiri, UI database/tabel Azure Portal di kanan

Elemen Visual Utama

  • UI browser database dan tabel
  • Contoh tabel film/peringkat/pengguna
Halaman 32
technology overview

Ikhtisar Spark Machine Learning (ML)

Konten

Algoritma ML yang diparalelkan: MMLSpark, Spark ML, Deep Learning, SparkR. Pemilihan model melalui validasi silang. API berbasis DataFrame (Spark 2.0+). MLlib sudah terpasang. Pihak ke-3: H2O, SciKit-learn, XGBoost

Struktur Tata Letak

Daftar poin di kiri, diagram pipeline Spark ML di kanan

Elemen Visual Utama

  • Logo Apache Spark ML
  • Alur pipeline ML: Data Ingestion → Cleaning → Training → Model Selection → Validation → Deployment
Halaman 33
technology overview

Ikhtisar Spark Structured Streaming

Konten

API streaming + batch terpadu untuk pemrosesan stream stateful yang tepat sekali. Berjalan di Spark SQL dengan DataFrame API. Pembaruan inkremental dan berkelanjutan. Mendukung jendela waktu kejadian, penggabungan stream-ke-batch, deduplikasi. Sumber: Kafka, file (JSON, CSV, Parquet)

Struktur Tata Letak

Daftar poin di kiri, dua diagram di kanan (tabel tak terbatas + eksekusi inkremental)

Elemen Visual Utama

  • Diagram aliran data → Tabel Tak Terbatas
  • Alur eksekusi inkremental dengan pemicu
Halaman 34
integration detail

Apache Kafka untuk Integrasi HDInsight

Konten

Structured Streaming terintegrasi dengan Apache Kafka di HDInsight. Ingesti streaming tingkat perusahaan. Tidak diperlukan gateway tambahan. Kluster Kafka dan Databricks harus berada di Azure Virtual Network yang sama

Struktur Tata Letak

Teks di atas, diagram arsitektur integrasi di bawah

Elemen Visual Utama

  • Diagram Kafka ↔ Spark Structured Streaming
  • Batas Azure Virtual Network
  • Logo Kafka dan Spark
Halaman 35
technology overview

Ikhtisar Spark GraphX

Konten

API untuk komputasi grafik dan paralel-grafik. Menyatukan ETL, analisis eksplorasi, dan komputasi grafik iteratif. Algoritma: PageRank, Connected Components, Label Propagation, SVD++, Triangle Count. Hanya API Scala dan RDD

Struktur Tata Letak

Tata letak tiga panel: fitur, daftar algoritma, bagan benchmark PageRank

Elemen Visual Utama

  • Kotak daftar algoritma
  • Bagan batang benchmark PageRank (Twitter + UK-Graph)
  • Perbandingan GraphX vs sistem pesaing
Halaman 36
feature overview

Databricks CLI

Konten

Antarmuka yang mudah digunakan dibangun di atas REST API. Dua sub-CLI: Workspace CLI dan DBFS CLI. Mengimplementasikan DBFS API dan Workspace API

Struktur Tata Letak

Diagram hierarki: Databricks CLI → Workspace CLI + DBFS CLI

Elemen Visual Utama

  • Tiga kotak berwarna (biru tua, ungu, hijau)
  • Struktur pohon hierarkis
Halaman 37
feature overview

Databricks REST API

Konten

Tujuh API: Cluster API (membuat/mengedit/menghapus klaster), DBFS API, Groups API, Instance Profile API, Job API, Library API, Workspace API (mengimpor/mengekspor notebook)

Struktur Tata Letak

Diagram corong di kiri menunjuk ke tabel API di kanan

Elemen Visual Utama

  • Ikon corong biru
  • Tabel referensi API tujuh baris
Halaman 38
section divider

Kasus Penggunaan

Konten

Pembagi bagian untuk arsitektur kasus penggunaan

Struktur Tata Letak

Teks putih dengan latar belakang biru

Elemen Visual Utama

  • Latar belakang biru Microsoft
Halaman 39
reference architecture

Gudang Big Data Modern

Konten

Arsitektur: Data tidak terstruktur (log, file, media) → Data Factory → Azure Storage → Azure Databricks (Spark) → Azure SQL Data Warehouse. Data terstruktur (aplikasi bisnis) → Data Factory → Polybase → SQL DW → Dasbor analitis

Struktur Tata Letak

Pipeline lima fase dengan dua aliran sumber data

Elemen Visual Utama

  • Ikon layanan Azure
  • Pipeline aliran ganda
  • Konektor Polybase
Halaman 40
reference architecture

Analitik Tingkat Lanjut pada Big Data

Konten

Arsitektur: Tidak terstruktur → Data Factory → Azure Storage → Azure Databricks (Spark MLlib, SparkR, SparklyR) → Azure Cosmos DB → Aplikasi web & seluler. Terstruktur → Polybase → SQL DW → Dasbor analitis

Struktur Tata Letak

Pipeline lima fase dengan pemrosesan berfokus pada ML dan penyajian Cosmos DB

Elemen Visual Utama

  • Azure Cosmos DB untuk penyajian model
  • Pustaka ML terdaftar
  • Output web & seluler
Halaman 41
reference architecture

Analitik real-time pada Big Data

Konten

Arsitektur: Data tidak terstruktur → Azure HDInsight (Kafka) → Azure Databricks (Spark) ↔ Azure Storage → Polybase → Azure SQL Data Warehouse → Dasbor Analitis

Struktur Tata Letak

Pipeline lima fase dengan ingesti streaming Kafka

Elemen Visual Utama

  • HDInsight Kafka untuk ingesti
  • Spark ↔ Storage dua arah
  • Fokus streaming waktu nyata
Halaman 42
section divider

Harga & Panduan Produk

Konten

Pembatas bagian untuk bab harga dan perbandingan

Struktur Tata Letak

Teks putih dengan latar belakang biru

Elemen Visual Utama

  • Latar belakang biru Microsoft
Halaman 43
comparison

OSS Big Data - Perbandingan

Konten

Perbandingan tiga kolom: Azure HDInsight (Hadoop/HDP, PaaS, keamanan Ranger, harga vs AWS EMR), Azure Databricks (Spark, SaaS, keamanan AD, harga vs Databricks di AWS), Penawaran Pihak Ketiga (Cloudera/MapR/Hortonworks, IaaS, harga vendor)

Struktur Tata Letak

Kartu perbandingan tiga kolom

Elemen Visual Utama

  • Tiga kartu produk dengan bagian Apa/Harga/Gunakan Kapan
Halaman 44
comparison

Melihat Lintas Penawaran

Konten

Perbandingan terperinci: Azure HDInsight (Hortonworks, mesin big data, VNET, Ranger, OMS, orkestrasi Data Factory, 27 wilayah), Azure Databricks (Spark-first, mesin tunggal, AAD OAuth, RBAC, auto-scaling, serverless, integrasi SQL DW), Azure ML (ML pihak pertama, Python/R, eksperimen, manajemen model, integrasi IDE)

Struktur Tata Letak

Perbandingan fitur terperinci tiga kolom

Elemen Visual Utama

  • Tiga kartu produk terperinci
  • Bagian Apa Itu, Fitur, Panduan
Halaman 45
section divider

Demo

Konten

Pembatas bagian untuk demo langsung

Struktur Tata Letak

Teks putih dengan latar belakang biru

Elemen Visual Utama

  • Latar belakang biru Microsoft
Halaman 46
product demo

Azure Databricks - beranda layanan

Konten

Tangkapan layar Azure Portal yang menampilkan halaman layanan Azure Databricks (pratinjau) di Marketplace > Data + Analytics. Deskripsi platform analitik terpadu, pratinjau UI ruang kerja Databricks

Struktur Tata Letak

Tangkapan layar Azure Portal lebar penuh

Elemen Visual Utama

  • Navigasi Azure Marketplace
  • Deskripsi layanan Databricks
  • Tangkapan layar pratinjau ruang kerja
Halaman 47
product demo

Azure Databricks - membuat ruang kerja

Konten

Azure Portal: Formulir Buat Layanan Azure Databricks dengan bidang nama ruang kerja, langganan, grup sumber daya, dan lokasi (AS Barat)

Struktur Tata Letak

Tangkapan layar formulir pembuatan Azure Portal lebar penuh

Elemen Visual Utama

  • Formulir pembuatan ruang kerja
  • Pemilihan grup sumber daya
  • Dropdown lokasi
Halaman 48
product demo

Azure Databricks - penerapan ruang kerja

Konten

Dasbor Azure Portal yang menampilkan sumber daya yang di-deploy termasuk Layanan Databricks, dengan tutorial Mulai Cepat untuk VM, App Service, Functions, SQL Database

Struktur Tata Letak

Tangkapan layar Dasbor Azure lebar penuh

Elemen Visual Utama

  • Dasbor dengan daftar sumber daya
  • Tile Deploying Azure Databricks
  • Tautan tutorial Mulai Cepat
Halaman 49
product demo

Azure Databricks - meluncurkan ruang kerja

Konten

Halaman tinjauan sumber daya Azure Portal dengan tombol Luncurkan Ruang Kerja, detail grup sumber daya terkelola, info langganan, dan tile mulai cepat: Dokumentasi, Memulai, Impor Data, Notebook, Panduan Admin

Struktur Tata Letak

Tangkapan layar halaman detail sumber daya lebar penuh

Elemen Visual Utama

  • Tombol Luncurkan Ruang Kerja
  • Tinjauan sumber daya dengan URL
  • Enam tile mulai cepat
Halaman 50
product demo

Azure Databricks - beranda ruang kerja

Konten

Halaman beranda ruang kerja Databricks yang menampilkan Notebook Unggulan (Pengantar Apache Spark, Ilmuwan Data, Streaming Terstruktur), item Baru (Notebook, Job, Cluster, Table, Library), tautan Dokumentasi, Buka Terbaru

Struktur Tata Letak

Tangkapan layar ruang kerja Databricks lebar penuh

Elemen Visual Utama

  • Logo dan sidebar Databricks
  • Notebook Unggulan dengan ikon Python/Spark
  • Menu pembuatan item baru
Halaman 51
section divider

Cara memulai

Konten

Pembatas bagian untuk panduan memulai

Struktur Tata Letak

Teks putih dengan latar belakang biru

Elemen Visual Utama

  • Latar belakang biru Microsoft
Halaman 52
call to action

Cara memulai

Konten

Tiga langkah: Daftar untuk pratinjau, Libatkan pakar Microsoft untuk lokakarya, Pelajari lebih lanjut di azure.com/databricks

Struktur Tata Letak

Tiga langkah berlabel ikon di kiri, foto pertemuan bisnis di kanan

Elemen Visual Utama

  • Tiga ikon lingkaran biru
  • Foto pertemuan bisnis
  • Tautan URL
Halaman 53
closing slide

T & J

Konten

Slide Tanya Jawab penutup dengan info kontak: James Serra, Big Data Evangelist — email, Twitter @JamesSerra, LinkedIn, blog di JamesSerra.com

Struktur Tata Letak

Teks Tanya Jawab besar dengan ikon tanda tanya oranye, detail kontak di bagian bawah

Elemen Visual Utama

  • Lingkaran tanda tanya oranye
  • Latar belakang teal gelap
  • Tautan informasi kontak

Pertanyaan yang Sering Diajukan

Pertanyaan umum tentang slide ini dan konten presentasi yang mendasarinya.

Apa itu Azure Databricks dan apa bedanya dengan HDInsight?

Azure Databricks adalah platform analitik berbasis Apache Spark yang cepat, mudah, dan kolaboratif yang dioptimalkan untuk Azure, dirancang sebagai pengalaman SaaS. HDInsight adalah distribusi Hadoop (Hortonworks) terkelola yang mendukung banyak mesin (Spark, Hive, Kafka, HBase). Databricks paling cocok untuk beban kerja yang berfokus pada Spark dengan notebook dan kolaborasi, sementara HDInsight cocok untuk pelanggan yang membutuhkan teknologi Hadoop non-Spark.

Siapa yang membuat presentasi ini?

Presentasi ini dibuat oleh James Serra, seorang Big Data Evangelist di Microsoft dengan pengalaman TI lebih dari 30 tahun, beberapa sertifikasi Microsoft (MCSE), dan penulis buku tentang pelaporan SQL Server 2012. Dia adalah mantan SQL Server MVP dan pembicara konferensi PASS yang sering.

Komponen Apache Spark apa saja yang dibahas?

Presentasi ini mencakup semua komponen Spark utama: Spark SQL (mesin kueri terdistribusi), Spark MLlib (machine learning), Spark Structured Streaming (pemrosesan real-time), dan GraphX (komputasi grafik), ditambah arsitektur Spark inti dengan RDD, model Driver/Worker, dan manajemen cluster.

Apakah presentasi ini menyertakan benchmark kinerja?

Ya, ini mencakup data benchmark yang menunjukkan bahwa Databricks Spark 5x lebih cepat daripada Apache Spark biasa di AWS, 8x lebih cepat daripada Apache Presto di AWS, dan 3x lebih cepat daripada Impala on-premise melalui Cloudera, dengan angka runtime spesifik yang dikutip dari studi benchmark publik.

Arsitektur kasus penggunaan apa saja yang disertakan?

Tiga arsitektur referensi Azure lengkap disajikan: Gudang Big Data Modern (batch ETL dengan SQL DW), Analitik Tingkat Lanjut pada Big Data (ML dengan Cosmos DB yang melayani web/seluler), dan Analitik Real-time pada Big Data (streaming Kafka dengan pemrosesan Spark).

Apakah template ini cocok untuk persiapan sertifikasi Azure?

Ya, presentasi ini mencakup arsitektur platform Azure Databricks, artefak inti (cluster, notebook, pekerjaan, ruang kerja, pustaka), keamanan dengan integrasi AAD, DBFS, Spark SQL, MLlib, Streaming, dan REST API — semua topik utama untuk sertifikasi data engineering Azure.

Apakah presentasi ini menyertakan konten demo langsung?

Ya, ini mencakup screenshot Azure Portal langkah demi langkah yang menunjukkan: menemukan Azure Databricks di Marketplace, membuat ruang kerja, menerapkan sumber daya, meluncurkan ruang kerja, dan menavigasi beranda Databricks dengan Notebook Unggulan.

Berapa banyak slide dalam presentasi ini?

Presentasi ini berisi 53 slide yang mencakup: Ikhtisar lingkungan data Azure, perbandingan solusi big data, dasar-dasar Apache Spark, detail platform Azure Databricks, fitur ruang kerja, tiga arsitektur referensi, panduan harga/produk, panduan demo langsung, dan langkah-langkah memulai.

2slides

Create Your Own Slides

Turn your ideas into professional presentations in seconds with 2slides AI.

Buat Slide Kelas Dunia dalam Hitungan Detik

Referensikan desain profesional, pilih gaya Anda, dan hasilkan slide dengan rendering teks sempurna. Didukung oleh Nano Banana—mulai buat presentasi Anda sekarang.

© 2026 2slides. All rights reserved.