2Slides Logo
Preview

Wprowadzenie do Azure Databricks — Analiza Big Data oparta na Apache Spark

53 slajdy

Wprowadzenie do Azure Databricks — Analiza Big Data oparta na Apache Spark na platformie Microsoft Azure

8 polubienia
0 pobrania

Szybka Nawigacja

Tagi

Azure Databricks
Apache Spark
Microsoft Azure
Big data
Cloud analytics

Udostępnij slajdy

Opis

Główny Temat

Wprowadzenie do Azure Databricks — Analiza Big Data oparta na Apache Spark na platformie Microsoft Azure

Kluczowe Korzyści

  • Kompleksowe wprowadzenie na 53 slajdach obejmujące Azure Databricks od podstaw po praktyczne demonstracje
  • Obejmuje pełny ekosystem Azure Big Data: SQL Server, Azure Data Services, HDInsight, Data Lake Analytics i pozycjonowanie Databricks
  • Dogłębne omówienie architektury Apache Spark, Spark SQL, MLlib, Structured Streaming i komponentów GraphX
  • Praktyczne przewodniki po obszarze roboczym Azure Databricks: klastry, notesy, zadania, obszary robocze, biblioteki, DBFS i wizualizacja
  • Zawiera rzeczywiste architektury przypadków użycia: nowoczesna hurtownia danych Big Data, zaawansowana analiza i potoki analizy w czasie rzeczywistym

Grupa Docelowa

  • Inżynierowie i architekci danych oceniający rozwiązania Azure Big Data
  • Specjaliści IT planujący migrację z lokalnego Hadoop do chmury Azure
  • Analitycy danych zainteresowani analizą opartą na Spark w Azure
  • Osoby podejmujące decyzje techniczne porównujące Azure HDInsight, Azure Databricks i Azure ML
  • Profesjonaliści w dziedzinie technologii Microsoft poszukujący przygotowania do certyfikacji Azure Databricks

Przypadki Użycia

  • Prezentacje techniczne dla działu sprzedaży wprowadzające klientów Microsoft w świat Azure Databricks
  • Warsztaty dotyczące architektury Azure porównujące rozwiązania Big Data
  • Wewnętrzne sesje szkoleniowe dotyczące możliwości platformy Azure Databricks
  • Prelekcje konferencyjne na temat Apache Spark w ekosystemie Azure
  • Wdrażanie nowych członków zespołu do usług Azure Big Data

Unikalne Propozycje Wartości

  • Prezentowane przez Jamesa Serra, Big Data Evangelist w Microsoft z ponad 30-letnim doświadczeniem w IT
  • Pozycjonuje Azure Databricks w szerszym środowisku danych Microsoft (SQL Server + hybryda Azure)
  • Zawiera dane porównawcze: 5x szybszy niż vanilla Spark, 8x szybszy niż Presto, 3x szybszy niż Impala
  • Szczegółowe zrzuty ekranu z Azure Portal przedstawiające tworzenie i wdrażanie obszaru roboczego
  • Trzy kompletne architektury referencyjne dla typowych wzorców Big Data w Azure

Strony Slajdów (53)

Szczegółowy widok każdej strony slajdu, w tym układu, kluczowej treści i elementów wizualnych.

Strona 1
title slide

Wprowadzenie do Azure Databricks

Treść

Slajd tytułowy autorstwa Jamesa Serra, Big Data Evangelist w Microsoft

Struktura Układu

Tytuł po lewej stronie ze zdjęciem nocnego miasta po prawej, złoty akcent w postaci strzałki

Kluczowe Elementy Wizualne

  • Nocny krajobraz miasta ze smugami świateł
  • Element graficzny w postaci złotej strzałki
  • Ciemnoniebieskie tło
Strona 2
speaker bio

O mnie

Treść

Biografia Jamesa Serra — Microsoft Big Data Evangelist, 30 lat doświadczenia w IT, certyfikaty MCSE, prezenter PASS, były SQL Server MVP, autor

Struktura Układu

Lista punktowana ze zdjęciem portretowym i odznaką MVP

Kluczowe Elementy Wizualne

  • Zdjęcie portretowe
  • Odznaka Microsoft MVP
Strona 3
agenda

Agenda

Treść

Tematy: Architektury Big Data, Dlaczego jeziora danych, Odgórne vs oddolne podejście, Definicja jeziora danych, Hadoop jako jezioro danych, Nowoczesna hurtownia danych, Federated Querying, Rozwiązanie w chmurze, SMP vs MPP

Struktura Układu

Prosta lista punktowana

Kluczowe Elementy Wizualne

  • Szara lista tekstowa
Strona 4
architecture diagram

Nowoczesne zasoby danych

Treść

Architektura hybrydowa: lokalnie (ikona budynku) i w chmurze (ikona chmury) obsługujące operacyjne bazy danych, hurtownie danych i jeziora danych. Typy danych: LOB, CRM, Graph, Image, Social, IoT

Struktura Układu

Dwie kolumny ze strzałką hybrydową między środowiskiem lokalnym a chmurą

Kluczowe Elementy Wizualne

  • Ikony budynku i chmury
  • Sześć ikon typów danych
  • Hybrydowa strzałka dwukierunkowa
Strona 5
product positioning

Oferta Microsoft

Treść

SQL Server (lokalnie) ↔ Hybryda ↔ Azure Data Services. SQL Server: lider branży, #1 TPC-H, T-SQL nad dowolnymi danymi. Azure: 70% szybszy niż Aurora, 2x globalny zasięg vs Redshift, No Limits Analytics 99.9% SLA

Struktura Układu

Ten sam układ hybrydowy z wyróżnionymi konkurencyjnymi metrykami

Kluczowe Elementy Wizualne

  • Ikona budynku SQL Server
  • Ikona chmury Azure
  • Niebieski tekst konkurencyjnych metryk
Strona 6
section divider

Big Data i zaawansowana analiza w Azure

Treść

Podział sekcji dla rozdziału o Azure big data

Struktura Układu

Biały tekst na niebieskim tle

Kluczowe Elementy Wizualne

  • Niebieskie tło Microsoft
Strona 7
comparison

Znajomość różnych rozwiązań Big Data

Treść

Spektrum od kontroli do łatwości użycia: Azure Marketplace (IaaS, dowolny Hadoop) → Azure HDInsight (zarządzane klastry) → Azure Databricks (Spark bezproblemowy) → Azure Data Lake Analytics (job-as-a-service). Przechowywanie: Azure Data Lake Store i Azure Storage

Struktura Układu

Diagram macierzowy z osiami kontroli i łatwości użycia

Kluczowe Elementy Wizualne

  • Cztery pola produktów z logo
  • Spektrum Kontrola ↔ Łatwość użycia
  • Warstwa przechowywania na dole
Strona 8
architecture diagram

Big Data i zaawansowana analiza w skrócie

Treść

Kompletny potok: Pozyskiwanie (Data Factory, Kafka, Event Hub/IoT Hub) → Przechowywanie (Blobs, Data Lake) → Przygotowanie i Trenowanie (Databricks, HDInsight, ML) → Modelowanie i Udostępnianie (Cosmos DB, SQL Database, SQL DW, Analysis Services) → Inteligencja (Aplikacje predykcyjne, Raporty, Pulpity nawigacyjne)

Struktura Układu

Pięciofazowy poziomy potok z ikonami usług Azure

Kluczowe Elementy Wizualne

  • Ikony usług Azure
  • Przerywane strzałki przepływu
  • Trzy typy źródeł danych: Aplikacje biznesowe, Aplikacje niestandardowe, Sensory
Strona 9
section divider

Azure Databricks oparty na Apache Spark

Treść

Podział sekcji dla szczegółowego omówienia Azure Databricks

Struktura Układu

Biały tekst na niebieskim tle

Kluczowe Elementy Wizualne

  • Niebieskie tło Microsoft
Strona 10
technology overview

Dlaczego Spark?

Treść

Silnik open-source stworzony z myślą o szybkości, łatwości użycia i zaawansowanej analityce. 100x szybszy niż Hadoop w pamięci. Największy projekt OSS z ponad 1000 współtwórców. Rozszerzalny: Scala, Java, Python, Spark SQL, GraphX, Streaming, MLlib

Struktura Układu

Lista punktowana z logo Apache Spark

Kluczowe Elementy Wizualne

  • Logo Apache Spark (pomarańczowa gwiazda)
  • Wytłuszczone kluczowe frazy
Strona 11
product overview

Co to jest Azure Databricks?

Treść

Szybka, łatwa, oparta na współpracy analityka Spark, zoptymalizowana dla Azure. To co najlepsze z Databricks + to co najlepsze z Microsoft. Pięć kluczowych cech: współpraca założycieli Apache Spark, konfiguracja jednym kliknięciem, interaktywna przestrzeń robocza, natywna integracja z Azure (Power BI, SQL DW, Cosmos DB), zabezpieczenia klasy korporacyjnej (AD, zgodność, SLA)

Struktura Układu

Tytuł z formułą (Databricks + Microsoft) i pięć funkcji oznaczonych ikonami

Kluczowe Elementy Wizualne

  • Logo Databricks + logo Microsoft
  • Pięć ikon funkcji
  • Niebieski akcent w tekście
Strona 12
architecture diagram

Architektura Apache Spark

Treść

Ujednolicona platforma: Spark SQL (Zapytania Interaktywne), Spark MLLib (Uczenie Maszynowe), Spark Streaming (Przetwarzanie Strumieniowe), GraphX (Obliczenia Grafowe) — wszystko na silniku Spark Core z Yarn, Mesos lub Standalone Scheduler

Struktura Układu

Ułożony diagram architektury z czterema modułami na górze silnika rdzeniowego

Kluczowe Elementy Wizualne

  • Cztery niebieskie pola modułów
  • Warstwa silnika Spark Core
  • Trzy opcje harmonogramu
  • Ujednolica: Przetwarzanie wsadowe, SQL, Czas rzeczywisty, ML, Deep Learning, Graf
Strona 13
data visualization

Databricks Spark jest szybki

Treść

Porównania benchmarków: 5x szybciej niż vanilla Spark na AWS (11 674 vs 53 783 sek), 8x szybciej niż Presto na AWS (35,3 vs 293 sek), 3x szybciej niż on-premises Impala przez Cloudera (1 149 264 vs 3 331 440 sek)

Struktura Układu

Trzy poziome wykresy słupkowe obok siebie

Kluczowe Elementy Wizualne

  • Trzy wykresy słupkowe benchmarków
  • Czerwone słupki Databricks vs szare słupki konkurencji
  • Link do cytowanego źródła
Strona 14
concept explanation

Zalety ujednoliconej platformy

Treść

Pojedyncze spójne API (RDDs), mieszanie typów przetwarzania, eliminuje przesyłanie danych między silnikami. Potok: Strumienie Wejściowe → Spark Streaming → Spark ML → Spark SQL → NoSQL DB

Struktura Układu

Lista punktowana po lewej, pionowy diagram potoku po prawej

Kluczowe Elementy Wizualne

  • Pionowy niebieski diagram przepływu potoku
  • Niebieskie pola dla każdego komponentu Spark
Strona 15
value proposition

Zróżnicowane doświadczenie w Azure

Treść

Trzy filary: Zwiększ produktywność (uruchamianie jednym kliknięciem, Power BI, współpraca, natywna integracja z Azure), Buduj na najbardziej zgodnej chmurze (zabezpieczenia AD, precyzyjny dostęp, zgodność), Skaluj bez ograniczeń (masowa skala, najszybszy silnik Spark)

Struktura Układu

Układ trzykolumnowy z pogrubionymi nagłówkami

Kluczowe Elementy Wizualne

  • Trzy niebieskie nagłówki kolumn
  • Pogrubione kluczowe frazy
Strona 16
architecture diagram

Architektura platformy Azure Databricks

Treść

Pełny diagram platformy: Źródła danych (IoT, Cloud storage, Hadoop, Hurtownie danych) → Azure Databricks (Wspólna przestrzeń robocza + Wdrażanie zadań produkcyjnych i przepływów pracy + Zoptymalizowany silnik uruchomieniowy) → Wyniki (Modele ML, narzędzia BI, Eksporty danych, Hurtownie danych)

Struktura Układu

Trójwarstwowy diagram platformy z wejściami/wyjściami

Kluczowe Elementy Wizualne

  • Trójwarstwowa platforma Azure Databricks
  • Trzy ikony person
  • Logo Spark w warstwie uruchomieniowej
  • Ikony źródła danych wejściowych/wyjściowych
Strona 17
feature detail

Obszar roboczy do współpracy

Treść

Rozpocznij w kilka sekund (jedno kliknięcie), interaktywna eksploracja (R, Python, Scala, SQL notebooks), współpraca w czasie rzeczywistym z historią zmian (GitHub, Bitbucket), wbudowane wizualizacje (matplotlib, ggplot, D3), pulpity nawigacyjne PowerBI

Struktura Układu

Opisy funkcji po lewej, diagram architektury platformy po prawej (podświetlona warstwa przestrzeni roboczej)

Kluczowe Elementy Wizualne

  • Diagram platformy z podświetloną Wspólną przestrzenią roboczą
  • Pogrubione nagłówki sekcji
Strona 18
feature detail

Wdrażaj zadania produkcyjne i przepływy pracy

Treść

Harmonogram zadań, przepływy pracy notebooków (wieloetapowe potoki), uruchamianie notebooków jako odpornych zadań Spark, powiadomienia i dzienniki audytu, natywna integracja z Azure SQL DW, Cosmos DB, Data Lake Store, Blob Storage, Event Hub

Struktura Układu

Opisy funkcji po lewej, diagram platformy po prawej (podświetlona warstwa zadań)

Kluczowe Elementy Wizualne

  • Diagram platformy z podświetlonymi Zadaniami i przepływami pracy
Strona 19
feature detail

Zoptymalizowany silnik Databricks Runtime

Treść

Moduł DBIO dla zoptymalizowanej wydajności I/O, w pełni zarządzana platforma na Azure usuwa złożoność, bezserwerowa i elastyczna usługa w chmurze, działanie na ogromną skalę globalnie

Struktura Układu

Opisy funkcji po lewej, diagram platformy po prawej (podświetlona warstwa uruchomieniowa)

Kluczowe Elementy Wizualne

  • Diagram platformy z podświetlonym Silnikiem uruchomieniowym
Strona 20
concept diagram

Podstawowe artefakty Azure Databricks

Treść

Pięć podstawowych komponentów: Klastry, Biblioteki, Przestrzenie robocze, Zadania, Notebooki — wszystkie połączone z centralnym hubem Azure Databricks

Struktura Układu

Diagram typu „gwiazda” z centrum Azure Databricks i pięcioma niebieskimi polami

Kluczowe Elementy Wizualne

  • Pomarańczowa elipsa hubu
  • Pięć niebieskich pól komponentów z ikonami
  • Linie łączące
Strona 21
architecture diagram

Ogólna architektura klastra Spark

Treść

Program sterujący (SparkContext) → Cluster Manager → Węzły robocze (Cache + Task) → Źródła danych (HDFS, SQL, NoSQL). Sterownik uruchamia funkcję main, węzły robocze odczytują/zapisują dane, buforują jako RDD, wykonują na maszynach wirtualnych w chmurach publicznych

Struktura Układu

Diagram hierarchicznej architektury po prawej, punkty wypunktowane po lewej

Kluczowe Elementy Wizualne

  • Hierarchia Driver → Manager → Workers
  • Pola Cache i Task w węzłach roboczych
  • Warstwa Źródeł danych na dole
Strona 22
security feature

Integracja Azure Databricks z AAD

Treść

Integracja z Azure Active Directory: brak oddzielnego zarządzania użytkownikami, użytkownicy AAD pracują bezpośrednio w Databricks, delegowane uwierzytelnianie SSO, kontrola dostępu oparta na AAD dla notebooków, klastrów, zadań i danych

Struktura Układu

Lista punktowana po lewej, diagram przepływu uwierzytelniania AAD po prawej

Kluczowe Elementy Wizualne

  • Azure Databricks → Kontrola dostępu → Azure AD → Przepływ uwierzytelniania
  • Trzy ikony person użytkowników
  • Logo Azure AD w kształcie diamentu
Strona 23
product demo

Klastry: automatyczne skalowanie i automatyczne zakończenie

Treść

Autoskalowanie (min/max liczba węzłów roboczych, automatyczne skalowanie przy obciążeniu) i Automatyczne zakończenie (limit czasu bezczynności, automatyczne wyłączanie). Korzyści: brak zgadywania liczby węzłów, brak ręcznego dostrajania, brak marnowania zasobów, płatność tylko za wykorzystanie

Struktura Układu

Tekst opisu po lewej, zrzut ekranu Azure Portal - Utwórz klaster po prawej

Kluczowe Elementy Wizualne

  • Interfejs użytkownika tworzenia klastra w Azure Portal
  • Ustawienia Autoskalowania i Automatycznego zakończenia wyróżnione na czerwono
Strona 24
feature overview

Zadania

Treść

Zadania przesyłają kod aplikacji Spark do wykonania na klastrach. Wykonuj Notebooki lub JAR-y. Kompleksowe narzędzia GUI do tworzenia, zarządzania i monitorowania

Struktura Układu

Tekst opisu po lewej, ikona kalendarza/zegara po prawej

Kluczowe Elementy Wizualne

  • Szary kalendarz z ikoną zegara
Strona 25
product demo

Obszary robocze

Treść

Obszary robocze organizują i udostępniają Notebooki, Biblioteki i Pulpity nawigacyjne. Hierarchiczna struktura folderów, prywatne katalogi dla każdego użytkownika, precyzyjna kontrola dostępu dla bezpiecznej współpracy

Struktura Układu

Lista punktowana po lewej, dwa zrzuty ekranu obszaru roboczego Azure Portal po prawej

Kluczowe Elementy Wizualne

  • Zrzuty ekranu przeglądarki folderów obszaru roboczego
  • Menu Import/Export/Permissions
Strona 26
product demo

Przegląd notesów Azure Databricks

Treść

Notebooki do tworzenia i uruchamiania aplikacji Spark bezpośrednio na klastrach. Obsługują precyzyjne uprawnienia, idealne do prototypowania i iteracyjnego rozwoju. Składają się z kodu, danych, wizualizacji, komentarzy i notatek

Struktura Układu

Lista punktowana po lewej, zrzut ekranu notebooka z wykresem po prawej

Kluczowe Elementy Wizualne

  • Notebook z wizualizacją wykresu słupkowego
  • Wykres Population vs Price
  • Pasek boczny wątku komentarzy
Strona 27
product demo

Przegląd bibliotek

Treść

Biblioteki przechowują biblioteki Python, R, Java/Scala w obszarach roboczych. Niezmienne po imporcie. Konfigurowalne za pomocą Init Scripts. Zarządzane za pomocą Library API. Obsługuje źródła PyPI, Maven, JAR, R CRAN

Struktura Układu

Lista punktowana po lewej, trzy zrzuty ekranu Azure Portal - Utwórz bibliotekę po prawej

Kluczowe Elementy Wizualne

  • Trzy zrzuty ekranu interfejsu użytkownika tworzenia biblioteki
  • Opcje źródła biblioteki PyPI, JAR, Maven, R
Strona 28
product demo

Wizualizacja

Treść

Wbudowana wizualizacja: Słupkowy, Punktowy, Mapa, Liniowy, Obszarowy, Kołowy, Kwantyl, Histogram, Wykres pudełkowy, Wykres Q-Q, Pivot. Wszystkie notebooki, niezależnie od języka, obsługują wizualizacje Databricks. Matplotlib renderuje jako obrazy. Przykład kodu PySpark SQL z wizualizacją mapy stanów USA

Struktura Układu

Lista punktowana po lewej, kod PySpark + wizualizacja mapy po prawej, menu typu wykresu poniżej

Kluczowe Elementy Wizualne

  • Wizualizacja mapy choropleth stanów USA
  • Fragment kodu PySpark
  • Menu wyboru typu wykresu
Strona 29
architecture diagram

System plików Databricks (DBFS)

Treść

Rozproszony system plików warstwowo nałożony na Azure Blob Storage. Montuj zasobniki Azure Storage, buforuj lokalnie na SSD, dostępne w Python/Scala/CLI/dbutils, dane są utrwalane po zakończeniu działania klastra, preinstalowane na klastrach Spark

Struktura Układu

Lista punktowana po lewej, diagram architektury DBFS po prawej

Kluczowe Elementy Wizualne

  • Diagram struktury drzewa DBFS
  • Punkty dostępu Python/Scala/CLI/dbutils
  • Azure Blob Storage na dole
  • Złącza db.fs.mount()
Strona 30
technology overview

Przegląd Spark SQL

Treść

Rozproszony silnik zapytań SQL dla danych strukturalnych. Wykonuj zapytania do zewnętrznych baz danych, plików, tabel Hive. SQL lub HiveQL. Powiązania w Python, Scala, Java. Wbudowane przesyłanie strumieniowe strukturalne. Wykorzystuje optymalizator Catalyst i wykonanie Tungsten

Struktura Układu

Lista punktowana po lewej, diagram architektury Spark SQL po prawej

Kluczowe Elementy Wizualne

  • Warstwowy diagram architektury Spark SQL
  • Logotypy łączników źródeł danych: Parquet, JSON, Hive, JDBC, CSV, Cassandra, MongoDB, MySQL, itp.
Strona 31
product demo

Przegląd baz danych i tabel

Treść

Bazy danych jako kolekcje tabel, zdefiniowane poprzez GUI lub API/Notebooki. Databricks używa Hive metastore. Obsługuje tabele partycjonowane i przycinanie partycji dla wydajności

Struktura Układu

Lista punktowana po lewej, interfejs użytkownika baz danych/tabel Azure Portal po prawej

Kluczowe Elementy Wizualne

  • Interfejs użytkownika przeglądarki baz danych i tabel
  • Przykładowe tabele Movies/ratings/users
Strona 32
technology overview

Przegląd Spark Machine Learning (ML)

Treść

Równoległe algorytmy ML: MMLSpark, Spark ML, Deep Learning, SparkR. Wybór modelu poprzez cross-validation. API oparte na DataFrame (Spark 2.0+). MLlib preinstalowany. Firmy trzecie: H2O, SciKit-learn, XGBoost

Struktura Układu

Lista punktowana po lewej, diagram potoku Spark ML po prawej

Kluczowe Elementy Wizualne

  • Logo Apache Spark ML
  • Przepływ potoku ML: Pozyskiwanie danych → Czyszczenie → Trenowanie → Wybór modelu → Walidacja → Wdrożenie
Strona 33
technology overview

Przegląd Spark Structured Streaming

Treść

Ujednolicone API strumieniowania + przetwarzania wsadowego dla dokładnie razowego przetwarzania strumieniowego ze stanem. Działa na Spark SQL z DataFrame API. Przyrostowe, ciągłe aktualizacje. Obsługuje okna czasowe zdarzeń, łączenie strumieni z partiami, deduplikację. Źródła: Kafka, plik (JSON, CSV, Parquet)

Struktura Układu

Lista punktowana po lewej, dwa diagramy po prawej (nieograniczona tabela + przyrostowe wykonanie)

Kluczowe Elementy Wizualne

  • Diagram strumienia danych → Nieograniczona tabela
  • Przepływ przyrostowego wykonania z wyzwalaczami
Strona 34
integration detail

Integracja Apache Kafka dla HDInsight

Treść

Structured Streaming integruje się z Apache Kafka na HDInsight. Pozyskiwanie strumieniowe klasy korporacyjnej. Nie są potrzebne żadne dodatkowe bramy. Klastry Kafka i Databricks muszą znajdować się w tej samej Azure Virtual Network

Struktura Układu

Tekst na górze, diagram architektury integracji na dole

Kluczowe Elementy Wizualne

  • Diagram Kafka ↔ Spark Structured Streaming
  • Granica Azure Virtual Network
  • Loga Kafka i Spark
Strona 35
technology overview

Przegląd Spark GraphX

Treść

API dla obliczeń grafowych i równoległych grafów. Ujednolica ETL, analizę eksploracyjną i iteracyjne obliczenia grafowe. Algorytmy: PageRank, Connected Components, Label Propagation, SVD++, Triangle Count. Tylko API Scala i RDD

Struktura Układu

Układ trzypanelowy: funkcje, lista algorytmów, wykresy benchmarkowe PageRank

Kluczowe Elementy Wizualne

  • Pole listy algorytmów
  • Wykresy słupkowe benchmarku PageRank (Twitter + UK-Graph)
  • Porównanie GraphX z konkurencyjnymi systemami
Strona 36
feature overview

Databricks CLI

Treść

Łatwy w użyciu interfejs zbudowany na REST API. Dwa sub-CLI: Workspace CLI i DBFS CLI. Implementuje DBFS API i Workspace API

Struktura Układu

Diagram hierarchiczny: Databricks CLI → Workspace CLI + DBFS CLI

Kluczowe Elementy Wizualne

  • Trzy kolorowe pola (ciemnoniebieski, fioletowy, zielony)
  • Hierarchiczna struktura drzewa
Strona 37
feature overview

Databricks REST API

Treść

Siedem API: Cluster API (tworzenie/edycja/usuwanie klastrów), DBFS API, Groups API, Instance Profile API, Job API, Library API, Workspace API (import/eksport notebooków)

Struktura Układu

Diagram lejkowy po lewej stronie wskazujący na tabelę API po prawej

Kluczowe Elementy Wizualne

  • Niebieska ikona lejka
  • Siedmiowierszowa tabela referencyjna API
Strona 38
section divider

Przypadki użycia

Treść

Podział sekcji dla architektur przypadków użycia

Struktura Układu

Biały tekst na niebieskim tle

Kluczowe Elementy Wizualne

  • Niebieskie tło Microsoft
Strona 39
reference architecture

Nowoczesna hurtownia danych Big Data

Treść

Architektura: Dane niestrukturalne (logi, pliki, media) → Data Factory → Azure Storage → Azure Databricks (Spark) → Azure SQL Data Warehouse. Dane strukturalne (aplikacje biznesowe) → Data Factory → Polybase → SQL DW → Analityczne pulpity nawigacyjne

Struktura Układu

Pięciofazowy potok z dwoma strumieniami źródeł danych

Kluczowe Elementy Wizualne

  • Ikony usług Azure
  • Dwustrumieniowy potok
  • Złącze Polybase
Strona 40
reference architecture

Zaawansowana analiza Big Data

Treść

Architektura: Dane niestrukturalne → Data Factory → Azure Storage → Azure Databricks (Spark MLlib, SparkR, SparklyR) → Azure Cosmos DB → Aplikacje webowe i mobilne. Dane strukturalne → Polybase → SQL DW → Analityczne pulpity nawigacyjne

Struktura Układu

Pięciofazowy potok z przetwarzaniem zorientowanym na ML i obsługą Cosmos DB

Kluczowe Elementy Wizualne

  • Azure Cosmos DB do obsługi modelu
  • Wymienione biblioteki ML
  • Wyjście webowe i mobilne
Strona 41
reference architecture

Analiza Big Data w czasie rzeczywistym

Treść

Architektura: Dane niestrukturalne → Azure HDInsight (Kafka) → Azure Databricks (Spark) ↔ Azure Storage → Polybase → Azure SQL Data Warehouse → Analityczne pulpity nawigacyjne

Struktura Układu

Potok pięciofazowy z pozyskiwaniem strumieniowym Kafka

Kluczowe Elementy Wizualne

  • HDInsight Kafka do pozyskiwania danych
  • Dwukierunkowy Spark ↔ Storage
  • Skupienie na strumieniowaniu w czasie rzeczywistym
Strona 42
section divider

Wskazówki dotyczące cen i produktów

Treść

Podział sekcji dla rozdziału o cenach i porównaniach

Struktura Układu

Biały tekst na niebieskim tle

Kluczowe Elementy Wizualne

  • Niebieskie tło Microsoft
Strona 43
comparison

Big Data OSS - Porównanie

Treść

Porównanie w trzech kolumnach: Azure HDInsight (Hadoop/HDP, PaaS, zabezpieczenia Ranger, cena vs AWS EMR), Azure Databricks (Spark, SaaS, zabezpieczenia AD, cena vs Databricks on AWS), Oferty firm trzecich (Cloudera/MapR/Hortonworks, IaaS, cennik dostawcy)

Struktura Układu

Karty porównawcze w trzech kolumnach

Kluczowe Elementy Wizualne

  • Trzy karty produktów z sekcjami Co/Cena/Kiedy używać
Strona 44
comparison

Spojrzenie na oferty

Treść

Szczegółowe porównanie: Azure HDInsight (Hortonworks, silniki big data, VNET, Ranger, OMS, orkiestracja Data Factory, 27 regionów), Azure Databricks (Spark na pierwszym miejscu, pojedynczy silnik, AAD OAuth, RBAC, autoskalowanie, serverless, integracja SQL DW), Azure ML (ML firmy Microsoft, Python/R, eksperymentowanie, zarządzanie modelami, integracja IDE)

Struktura Układu

Szczegółowe porównanie funkcji w trzech kolumnach

Kluczowe Elementy Wizualne

  • Trzy szczegółowe karty produktów
  • Sekcje Co to jest, Funkcje, Wskazówki
Strona 45
section divider

Demo

Treść

Podział sekcji dla prezentacji na żywo

Struktura Układu

Biały tekst na niebieskim tle

Kluczowe Elementy Wizualne

  • Niebieskie tło Microsoft
Strona 46
product demo

Azure Databricks - strona główna usługi

Treść

Zrzut ekranu Azure Portal przedstawiający stronę usługi Azure Databricks (wersja zapoznawcza) w Marketplace > Dane + Analiza. Opis ujednoliconej platformy analitycznej, podgląd interfejsu użytkownika obszaru roboczego Databricks

Struktura Układu

Zrzut ekranu Azure Portal o pełnej szerokości

Kluczowe Elementy Wizualne

  • Nawigacja Azure Marketplace
  • Opis usługi Databricks
  • Zrzut ekranu podglądu obszaru roboczego
Strona 47
product demo

Azure Databricks - tworzenie obszaru roboczego

Treść

Azure Portal: Formularz tworzenia usługi Azure Databricks z polami nazwy obszaru roboczego, subskrypcji, grupy zasobów i lokalizacji (Zachodnie USA)

Struktura Układu

Zrzut ekranu formularza tworzenia Azure Portal o pełnej szerokości

Kluczowe Elementy Wizualne

  • Formularz tworzenia obszaru roboczego
  • Wybór grupy zasobów
  • Lista rozwijana lokalizacji
Strona 48
product demo

Azure Databricks - wdrażanie obszaru roboczego

Treść

Pulpit nawigacyjny Azure Portal przedstawiający wdrożone zasoby, w tym usługę Databricks, z samouczkami szybkiego startu dla maszyn wirtualnych, App Service, Functions, SQL Database

Struktura Układu

Zrzut ekranu pulpitu nawigacyjnego Azure o pełnej szerokości

Kluczowe Elementy Wizualne

  • Pulpit nawigacyjny z listą zasobów
  • Kafelek wdrażania Azure Databricks
  • Linki do samouczków szybkiego startu
Strona 49
product demo

Azure Databricks - uruchamianie obszaru roboczego

Treść

Strona przeglądu zasobów Azure Portal z przyciskiem Uruchom obszar roboczy, szczegółami zarządzanej grupy zasobów, informacjami o subskrypcji i kafelkami szybkiego startu: Dokumentacja, Wprowadzenie, Importowanie danych, Notes, Przewodnik administratora

Struktura Układu

Zrzut ekranu strony szczegółów zasobu o pełnej szerokości

Kluczowe Elementy Wizualne

  • Przycisk Uruchom obszar roboczy
  • Przegląd zasobów z adresem URL
  • Sześć kafelków szybkiego startu
Strona 50
product demo

Azure Databricks - strona główna obszaru roboczego

Treść

Strona główna obszaru roboczego Databricks przedstawiająca polecane notesy (Wprowadzenie do Apache Spark, Analitycy danych, Ustrukturyzowane przesyłanie strumieniowe), Nowe elementy (Notes, Zadanie, Klaster, Tabela, Biblioteka), linki do dokumentacji, Otwórz ostatnie

Struktura Układu

Zrzut ekranu obszaru roboczego Databricks o pełnej szerokości

Kluczowe Elementy Wizualne

  • Logo Databricks i pasek boczny
  • Polecane notesy z ikonami Python/Spark
  • Menu tworzenia nowego elementu
Strona 51
section divider

Jak zacząć

Treść

Podział sekcji z wytycznymi dotyczącymi rozpoczęcia pracy

Struktura Układu

Biały tekst na niebieskim tle

Kluczowe Elementy Wizualne

  • Niebieskie tło Microsoft
Strona 52
call to action

Jak zacząć

Treść

Trzy kroki: Zarejestruj się do wersji Preview, Zaangażuj ekspertów Microsoft w warsztaty, Dowiedz się więcej na azure.com/databricks

Struktura Układu

Trzy kroki z ikonami po lewej, zdjęcie ze spotkania biznesowego po prawej

Kluczowe Elementy Wizualne

  • Trzy niebieskie ikony w kształcie okręgu
  • Zdjęcie ze spotkania biznesowego
  • Linki URL
Strona 53
closing slide

Pytania i odpowiedzi

Treść

Zamykający slajd z pytaniami i odpowiedziami oraz danymi kontaktowymi: James Serra, Big Data Evangelist — email, Twitter @JamesSerra, LinkedIn, blog na JamesSerra.com

Struktura Układu

Duży tekst Q&A z pomarańczową ikoną znaku zapytania, dane kontaktowe na dole

Kluczowe Elementy Wizualne

  • Pomarańczowe kółko ze znakiem zapytania
  • Ciemne turkusowe tło
  • Linki do informacji kontaktowych

Często Zadawane Pytania

Częste pytania dotyczące tego slajdu i podstawowej treści prezentacji.

Co to jest Azure Databricks i czym różni się od HDInsight?

Azure Databricks to szybka, łatwa i oparta na współpracy platforma analityczna oparta na Apache Spark, zoptymalizowana dla Azure, zaprojektowana jako usługa SaaS. HDInsight to zarządzana dystrybucja Hadoop (Hortonworks) obsługująca wiele silników (Spark, Hive, Kafka, HBase). Databricks jest najlepszy dla obciążeń skoncentrowanych na Spark z notesami i współpracą, podczas gdy HDInsight jest odpowiedni dla klientów, którzy potrzebują technologii Hadoop innych niż Spark.

Kto stworzył tę prezentację?

Ta prezentacja została stworzona przez Jamesa Serra, Big Data Evangelist w Microsoft z ponad 30-letnim doświadczeniem w IT, wieloma certyfikatami Microsoft (MCSE) i autora książki o raportowaniu w SQL Server 2012. Jest byłym SQL Server MVP i częstym prelegentem na konferencjach PASS.

Jakie komponenty Apache Spark są omówione?

Prezentacja obejmuje wszystkie główne komponenty Spark: Spark SQL (rozproszony silnik zapytań), Spark MLlib (machine learning), Spark Structured Streaming (przetwarzanie w czasie rzeczywistym) i GraphX (obliczenia grafowe), a także podstawową architekturę Spark z RDD, modelem Driver/Worker i zarządzaniem klastrem.

Czy ta prezentacja zawiera testy wydajności?

Tak, zawiera dane porównawcze pokazujące, że Databricks Spark jest 5x szybszy niż vanilla Apache Spark na AWS, 8x szybszy niż Apache Presto na AWS i 3x szybszy niż lokalny Impala za pośrednictwem Cloudera, z konkretnymi liczbami czasu wykonywania cytowanymi z publicznych badań porównawczych.

Jakie architektury przypadków użycia są zawarte?

Przedstawiono trzy kompletne architektury referencyjne Azure: nowoczesna hurtownia danych Big Data (batch ETL z SQL DW), zaawansowana analiza Big Data (ML z Cosmos DB obsługującym web/mobile) i analiza Big Data w czasie rzeczywistym (strumieniowanie Kafka z przetwarzaniem Spark).

Czy ten szablon nadaje się do przygotowania do certyfikacji Azure?

Tak, prezentacja obejmuje architekturę platformy Azure Databricks, podstawowe artefakty (klastry, notesy, zadania, obszary robocze, biblioteki), bezpieczeństwo z integracją AAD, DBFS, Spark SQL, MLlib, Streaming i REST API — wszystkie kluczowe tematy dla certyfikatów inżynierii danych Azure.

Czy prezentacja zawiera praktyczne treści demonstracyjne?

Tak, zawiera zrzuty ekranu z Azure Portal krok po kroku, demonstrujące: znajdowanie Azure Databricks w Marketplace, tworzenie obszaru roboczego, wdrażanie zasobów, uruchamianie obszaru roboczego i poruszanie się po stronie głównej Databricks z polecanymi notesami.

Ile slajdów zawiera ta prezentacja?

Prezentacja zawiera 53 slajdy obejmujące: przegląd zasobów danych Azure, porównanie rozwiązań Big Data, podstawy Apache Spark, szczegóły platformy Azure Databricks, funkcje obszaru roboczego, trzy architektury referencyjne, wskazówki dotyczące cen/produktów, demonstrację na żywo i kroki wprowadzające.

2slides

Create Your Own Slides

Turn your ideas into professional presentations in seconds with 2slides AI.

Twórz Slajdy Światowej Klasy w Sekundach

Odwołuj się do profesjonalnych projektów, wybierz swój styl i generuj slajdy z idealnym renderowaniem tekstu. Napędzane przez Nano Banana—zacznij tworzyć swoją prezentację teraz.

© 2026 2slides. All rights reserved.