
Wprowadzenie do Azure Databricks — Analiza Big Data oparta na Apache Spark na platformie Microsoft Azure
Szybka Nawigacja
Tagi
Udostępnij slajdy
Wprowadzenie do Azure Databricks — Analiza Big Data oparta na Apache Spark na platformie Microsoft Azure
Szczegółowy widok każdej strony slajdu, w tym układu, kluczowej treści i elementów wizualnych.
Slajd tytułowy autorstwa Jamesa Serra, Big Data Evangelist w Microsoft
Tytuł po lewej stronie ze zdjęciem nocnego miasta po prawej, złoty akcent w postaci strzałki
Biografia Jamesa Serra — Microsoft Big Data Evangelist, 30 lat doświadczenia w IT, certyfikaty MCSE, prezenter PASS, były SQL Server MVP, autor
Lista punktowana ze zdjęciem portretowym i odznaką MVP
Tematy: Architektury Big Data, Dlaczego jeziora danych, Odgórne vs oddolne podejście, Definicja jeziora danych, Hadoop jako jezioro danych, Nowoczesna hurtownia danych, Federated Querying, Rozwiązanie w chmurze, SMP vs MPP
Prosta lista punktowana
Architektura hybrydowa: lokalnie (ikona budynku) i w chmurze (ikona chmury) obsługujące operacyjne bazy danych, hurtownie danych i jeziora danych. Typy danych: LOB, CRM, Graph, Image, Social, IoT
Dwie kolumny ze strzałką hybrydową między środowiskiem lokalnym a chmurą
SQL Server (lokalnie) ↔ Hybryda ↔ Azure Data Services. SQL Server: lider branży, #1 TPC-H, T-SQL nad dowolnymi danymi. Azure: 70% szybszy niż Aurora, 2x globalny zasięg vs Redshift, No Limits Analytics 99.9% SLA
Ten sam układ hybrydowy z wyróżnionymi konkurencyjnymi metrykami
Podział sekcji dla rozdziału o Azure big data
Biały tekst na niebieskim tle
Spektrum od kontroli do łatwości użycia: Azure Marketplace (IaaS, dowolny Hadoop) → Azure HDInsight (zarządzane klastry) → Azure Databricks (Spark bezproblemowy) → Azure Data Lake Analytics (job-as-a-service). Przechowywanie: Azure Data Lake Store i Azure Storage
Diagram macierzowy z osiami kontroli i łatwości użycia
Kompletny potok: Pozyskiwanie (Data Factory, Kafka, Event Hub/IoT Hub) → Przechowywanie (Blobs, Data Lake) → Przygotowanie i Trenowanie (Databricks, HDInsight, ML) → Modelowanie i Udostępnianie (Cosmos DB, SQL Database, SQL DW, Analysis Services) → Inteligencja (Aplikacje predykcyjne, Raporty, Pulpity nawigacyjne)
Pięciofazowy poziomy potok z ikonami usług Azure
Podział sekcji dla szczegółowego omówienia Azure Databricks
Biały tekst na niebieskim tle
Silnik open-source stworzony z myślą o szybkości, łatwości użycia i zaawansowanej analityce. 100x szybszy niż Hadoop w pamięci. Największy projekt OSS z ponad 1000 współtwórców. Rozszerzalny: Scala, Java, Python, Spark SQL, GraphX, Streaming, MLlib
Lista punktowana z logo Apache Spark
Szybka, łatwa, oparta na współpracy analityka Spark, zoptymalizowana dla Azure. To co najlepsze z Databricks + to co najlepsze z Microsoft. Pięć kluczowych cech: współpraca założycieli Apache Spark, konfiguracja jednym kliknięciem, interaktywna przestrzeń robocza, natywna integracja z Azure (Power BI, SQL DW, Cosmos DB), zabezpieczenia klasy korporacyjnej (AD, zgodność, SLA)
Tytuł z formułą (Databricks + Microsoft) i pięć funkcji oznaczonych ikonami
Ujednolicona platforma: Spark SQL (Zapytania Interaktywne), Spark MLLib (Uczenie Maszynowe), Spark Streaming (Przetwarzanie Strumieniowe), GraphX (Obliczenia Grafowe) — wszystko na silniku Spark Core z Yarn, Mesos lub Standalone Scheduler
Ułożony diagram architektury z czterema modułami na górze silnika rdzeniowego
Porównania benchmarków: 5x szybciej niż vanilla Spark na AWS (11 674 vs 53 783 sek), 8x szybciej niż Presto na AWS (35,3 vs 293 sek), 3x szybciej niż on-premises Impala przez Cloudera (1 149 264 vs 3 331 440 sek)
Trzy poziome wykresy słupkowe obok siebie
Pojedyncze spójne API (RDDs), mieszanie typów przetwarzania, eliminuje przesyłanie danych między silnikami. Potok: Strumienie Wejściowe → Spark Streaming → Spark ML → Spark SQL → NoSQL DB
Lista punktowana po lewej, pionowy diagram potoku po prawej
Trzy filary: Zwiększ produktywność (uruchamianie jednym kliknięciem, Power BI, współpraca, natywna integracja z Azure), Buduj na najbardziej zgodnej chmurze (zabezpieczenia AD, precyzyjny dostęp, zgodność), Skaluj bez ograniczeń (masowa skala, najszybszy silnik Spark)
Układ trzykolumnowy z pogrubionymi nagłówkami
Pełny diagram platformy: Źródła danych (IoT, Cloud storage, Hadoop, Hurtownie danych) → Azure Databricks (Wspólna przestrzeń robocza + Wdrażanie zadań produkcyjnych i przepływów pracy + Zoptymalizowany silnik uruchomieniowy) → Wyniki (Modele ML, narzędzia BI, Eksporty danych, Hurtownie danych)
Trójwarstwowy diagram platformy z wejściami/wyjściami
Rozpocznij w kilka sekund (jedno kliknięcie), interaktywna eksploracja (R, Python, Scala, SQL notebooks), współpraca w czasie rzeczywistym z historią zmian (GitHub, Bitbucket), wbudowane wizualizacje (matplotlib, ggplot, D3), pulpity nawigacyjne PowerBI
Opisy funkcji po lewej, diagram architektury platformy po prawej (podświetlona warstwa przestrzeni roboczej)
Harmonogram zadań, przepływy pracy notebooków (wieloetapowe potoki), uruchamianie notebooków jako odpornych zadań Spark, powiadomienia i dzienniki audytu, natywna integracja z Azure SQL DW, Cosmos DB, Data Lake Store, Blob Storage, Event Hub
Opisy funkcji po lewej, diagram platformy po prawej (podświetlona warstwa zadań)
Moduł DBIO dla zoptymalizowanej wydajności I/O, w pełni zarządzana platforma na Azure usuwa złożoność, bezserwerowa i elastyczna usługa w chmurze, działanie na ogromną skalę globalnie
Opisy funkcji po lewej, diagram platformy po prawej (podświetlona warstwa uruchomieniowa)
Pięć podstawowych komponentów: Klastry, Biblioteki, Przestrzenie robocze, Zadania, Notebooki — wszystkie połączone z centralnym hubem Azure Databricks
Diagram typu „gwiazda” z centrum Azure Databricks i pięcioma niebieskimi polami
Program sterujący (SparkContext) → Cluster Manager → Węzły robocze (Cache + Task) → Źródła danych (HDFS, SQL, NoSQL). Sterownik uruchamia funkcję main, węzły robocze odczytują/zapisują dane, buforują jako RDD, wykonują na maszynach wirtualnych w chmurach publicznych
Diagram hierarchicznej architektury po prawej, punkty wypunktowane po lewej
Integracja z Azure Active Directory: brak oddzielnego zarządzania użytkownikami, użytkownicy AAD pracują bezpośrednio w Databricks, delegowane uwierzytelnianie SSO, kontrola dostępu oparta na AAD dla notebooków, klastrów, zadań i danych
Lista punktowana po lewej, diagram przepływu uwierzytelniania AAD po prawej
Autoskalowanie (min/max liczba węzłów roboczych, automatyczne skalowanie przy obciążeniu) i Automatyczne zakończenie (limit czasu bezczynności, automatyczne wyłączanie). Korzyści: brak zgadywania liczby węzłów, brak ręcznego dostrajania, brak marnowania zasobów, płatność tylko za wykorzystanie
Tekst opisu po lewej, zrzut ekranu Azure Portal - Utwórz klaster po prawej
Zadania przesyłają kod aplikacji Spark do wykonania na klastrach. Wykonuj Notebooki lub JAR-y. Kompleksowe narzędzia GUI do tworzenia, zarządzania i monitorowania
Tekst opisu po lewej, ikona kalendarza/zegara po prawej
Obszary robocze organizują i udostępniają Notebooki, Biblioteki i Pulpity nawigacyjne. Hierarchiczna struktura folderów, prywatne katalogi dla każdego użytkownika, precyzyjna kontrola dostępu dla bezpiecznej współpracy
Lista punktowana po lewej, dwa zrzuty ekranu obszaru roboczego Azure Portal po prawej
Notebooki do tworzenia i uruchamiania aplikacji Spark bezpośrednio na klastrach. Obsługują precyzyjne uprawnienia, idealne do prototypowania i iteracyjnego rozwoju. Składają się z kodu, danych, wizualizacji, komentarzy i notatek
Lista punktowana po lewej, zrzut ekranu notebooka z wykresem po prawej
Biblioteki przechowują biblioteki Python, R, Java/Scala w obszarach roboczych. Niezmienne po imporcie. Konfigurowalne za pomocą Init Scripts. Zarządzane za pomocą Library API. Obsługuje źródła PyPI, Maven, JAR, R CRAN
Lista punktowana po lewej, trzy zrzuty ekranu Azure Portal - Utwórz bibliotekę po prawej
Wbudowana wizualizacja: Słupkowy, Punktowy, Mapa, Liniowy, Obszarowy, Kołowy, Kwantyl, Histogram, Wykres pudełkowy, Wykres Q-Q, Pivot. Wszystkie notebooki, niezależnie od języka, obsługują wizualizacje Databricks. Matplotlib renderuje jako obrazy. Przykład kodu PySpark SQL z wizualizacją mapy stanów USA
Lista punktowana po lewej, kod PySpark + wizualizacja mapy po prawej, menu typu wykresu poniżej
Rozproszony system plików warstwowo nałożony na Azure Blob Storage. Montuj zasobniki Azure Storage, buforuj lokalnie na SSD, dostępne w Python/Scala/CLI/dbutils, dane są utrwalane po zakończeniu działania klastra, preinstalowane na klastrach Spark
Lista punktowana po lewej, diagram architektury DBFS po prawej
Rozproszony silnik zapytań SQL dla danych strukturalnych. Wykonuj zapytania do zewnętrznych baz danych, plików, tabel Hive. SQL lub HiveQL. Powiązania w Python, Scala, Java. Wbudowane przesyłanie strumieniowe strukturalne. Wykorzystuje optymalizator Catalyst i wykonanie Tungsten
Lista punktowana po lewej, diagram architektury Spark SQL po prawej
Bazy danych jako kolekcje tabel, zdefiniowane poprzez GUI lub API/Notebooki. Databricks używa Hive metastore. Obsługuje tabele partycjonowane i przycinanie partycji dla wydajności
Lista punktowana po lewej, interfejs użytkownika baz danych/tabel Azure Portal po prawej
Równoległe algorytmy ML: MMLSpark, Spark ML, Deep Learning, SparkR. Wybór modelu poprzez cross-validation. API oparte na DataFrame (Spark 2.0+). MLlib preinstalowany. Firmy trzecie: H2O, SciKit-learn, XGBoost
Lista punktowana po lewej, diagram potoku Spark ML po prawej
Ujednolicone API strumieniowania + przetwarzania wsadowego dla dokładnie razowego przetwarzania strumieniowego ze stanem. Działa na Spark SQL z DataFrame API. Przyrostowe, ciągłe aktualizacje. Obsługuje okna czasowe zdarzeń, łączenie strumieni z partiami, deduplikację. Źródła: Kafka, plik (JSON, CSV, Parquet)
Lista punktowana po lewej, dwa diagramy po prawej (nieograniczona tabela + przyrostowe wykonanie)
Structured Streaming integruje się z Apache Kafka na HDInsight. Pozyskiwanie strumieniowe klasy korporacyjnej. Nie są potrzebne żadne dodatkowe bramy. Klastry Kafka i Databricks muszą znajdować się w tej samej Azure Virtual Network
Tekst na górze, diagram architektury integracji na dole
API dla obliczeń grafowych i równoległych grafów. Ujednolica ETL, analizę eksploracyjną i iteracyjne obliczenia grafowe. Algorytmy: PageRank, Connected Components, Label Propagation, SVD++, Triangle Count. Tylko API Scala i RDD
Układ trzypanelowy: funkcje, lista algorytmów, wykresy benchmarkowe PageRank
Łatwy w użyciu interfejs zbudowany na REST API. Dwa sub-CLI: Workspace CLI i DBFS CLI. Implementuje DBFS API i Workspace API
Diagram hierarchiczny: Databricks CLI → Workspace CLI + DBFS CLI
Siedem API: Cluster API (tworzenie/edycja/usuwanie klastrów), DBFS API, Groups API, Instance Profile API, Job API, Library API, Workspace API (import/eksport notebooków)
Diagram lejkowy po lewej stronie wskazujący na tabelę API po prawej
Podział sekcji dla architektur przypadków użycia
Biały tekst na niebieskim tle
Architektura: Dane niestrukturalne (logi, pliki, media) → Data Factory → Azure Storage → Azure Databricks (Spark) → Azure SQL Data Warehouse. Dane strukturalne (aplikacje biznesowe) → Data Factory → Polybase → SQL DW → Analityczne pulpity nawigacyjne
Pięciofazowy potok z dwoma strumieniami źródeł danych
Architektura: Dane niestrukturalne → Data Factory → Azure Storage → Azure Databricks (Spark MLlib, SparkR, SparklyR) → Azure Cosmos DB → Aplikacje webowe i mobilne. Dane strukturalne → Polybase → SQL DW → Analityczne pulpity nawigacyjne
Pięciofazowy potok z przetwarzaniem zorientowanym na ML i obsługą Cosmos DB
Architektura: Dane niestrukturalne → Azure HDInsight (Kafka) → Azure Databricks (Spark) ↔ Azure Storage → Polybase → Azure SQL Data Warehouse → Analityczne pulpity nawigacyjne
Potok pięciofazowy z pozyskiwaniem strumieniowym Kafka
Podział sekcji dla rozdziału o cenach i porównaniach
Biały tekst na niebieskim tle
Porównanie w trzech kolumnach: Azure HDInsight (Hadoop/HDP, PaaS, zabezpieczenia Ranger, cena vs AWS EMR), Azure Databricks (Spark, SaaS, zabezpieczenia AD, cena vs Databricks on AWS), Oferty firm trzecich (Cloudera/MapR/Hortonworks, IaaS, cennik dostawcy)
Karty porównawcze w trzech kolumnach
Szczegółowe porównanie: Azure HDInsight (Hortonworks, silniki big data, VNET, Ranger, OMS, orkiestracja Data Factory, 27 regionów), Azure Databricks (Spark na pierwszym miejscu, pojedynczy silnik, AAD OAuth, RBAC, autoskalowanie, serverless, integracja SQL DW), Azure ML (ML firmy Microsoft, Python/R, eksperymentowanie, zarządzanie modelami, integracja IDE)
Szczegółowe porównanie funkcji w trzech kolumnach
Podział sekcji dla prezentacji na żywo
Biały tekst na niebieskim tle
Zrzut ekranu Azure Portal przedstawiający stronę usługi Azure Databricks (wersja zapoznawcza) w Marketplace > Dane + Analiza. Opis ujednoliconej platformy analitycznej, podgląd interfejsu użytkownika obszaru roboczego Databricks
Zrzut ekranu Azure Portal o pełnej szerokości
Azure Portal: Formularz tworzenia usługi Azure Databricks z polami nazwy obszaru roboczego, subskrypcji, grupy zasobów i lokalizacji (Zachodnie USA)
Zrzut ekranu formularza tworzenia Azure Portal o pełnej szerokości
Pulpit nawigacyjny Azure Portal przedstawiający wdrożone zasoby, w tym usługę Databricks, z samouczkami szybkiego startu dla maszyn wirtualnych, App Service, Functions, SQL Database
Zrzut ekranu pulpitu nawigacyjnego Azure o pełnej szerokości
Strona przeglądu zasobów Azure Portal z przyciskiem Uruchom obszar roboczy, szczegółami zarządzanej grupy zasobów, informacjami o subskrypcji i kafelkami szybkiego startu: Dokumentacja, Wprowadzenie, Importowanie danych, Notes, Przewodnik administratora
Zrzut ekranu strony szczegółów zasobu o pełnej szerokości
Strona główna obszaru roboczego Databricks przedstawiająca polecane notesy (Wprowadzenie do Apache Spark, Analitycy danych, Ustrukturyzowane przesyłanie strumieniowe), Nowe elementy (Notes, Zadanie, Klaster, Tabela, Biblioteka), linki do dokumentacji, Otwórz ostatnie
Zrzut ekranu obszaru roboczego Databricks o pełnej szerokości
Podział sekcji z wytycznymi dotyczącymi rozpoczęcia pracy
Biały tekst na niebieskim tle
Trzy kroki: Zarejestruj się do wersji Preview, Zaangażuj ekspertów Microsoft w warsztaty, Dowiedz się więcej na azure.com/databricks
Trzy kroki z ikonami po lewej, zdjęcie ze spotkania biznesowego po prawej
Zamykający slajd z pytaniami i odpowiedziami oraz danymi kontaktowymi: James Serra, Big Data Evangelist — email, Twitter @JamesSerra, LinkedIn, blog na JamesSerra.com
Duży tekst Q&A z pomarańczową ikoną znaku zapytania, dane kontaktowe na dole
Częste pytania dotyczące tego slajdu i podstawowej treści prezentacji.
Azure Databricks to szybka, łatwa i oparta na współpracy platforma analityczna oparta na Apache Spark, zoptymalizowana dla Azure, zaprojektowana jako usługa SaaS. HDInsight to zarządzana dystrybucja Hadoop (Hortonworks) obsługująca wiele silników (Spark, Hive, Kafka, HBase). Databricks jest najlepszy dla obciążeń skoncentrowanych na Spark z notesami i współpracą, podczas gdy HDInsight jest odpowiedni dla klientów, którzy potrzebują technologii Hadoop innych niż Spark.
Ta prezentacja została stworzona przez Jamesa Serra, Big Data Evangelist w Microsoft z ponad 30-letnim doświadczeniem w IT, wieloma certyfikatami Microsoft (MCSE) i autora książki o raportowaniu w SQL Server 2012. Jest byłym SQL Server MVP i częstym prelegentem na konferencjach PASS.
Prezentacja obejmuje wszystkie główne komponenty Spark: Spark SQL (rozproszony silnik zapytań), Spark MLlib (machine learning), Spark Structured Streaming (przetwarzanie w czasie rzeczywistym) i GraphX (obliczenia grafowe), a także podstawową architekturę Spark z RDD, modelem Driver/Worker i zarządzaniem klastrem.
Tak, zawiera dane porównawcze pokazujące, że Databricks Spark jest 5x szybszy niż vanilla Apache Spark na AWS, 8x szybszy niż Apache Presto na AWS i 3x szybszy niż lokalny Impala za pośrednictwem Cloudera, z konkretnymi liczbami czasu wykonywania cytowanymi z publicznych badań porównawczych.
Przedstawiono trzy kompletne architektury referencyjne Azure: nowoczesna hurtownia danych Big Data (batch ETL z SQL DW), zaawansowana analiza Big Data (ML z Cosmos DB obsługującym web/mobile) i analiza Big Data w czasie rzeczywistym (strumieniowanie Kafka z przetwarzaniem Spark).
Tak, prezentacja obejmuje architekturę platformy Azure Databricks, podstawowe artefakty (klastry, notesy, zadania, obszary robocze, biblioteki), bezpieczeństwo z integracją AAD, DBFS, Spark SQL, MLlib, Streaming i REST API — wszystkie kluczowe tematy dla certyfikatów inżynierii danych Azure.
Tak, zawiera zrzuty ekranu z Azure Portal krok po kroku, demonstrujące: znajdowanie Azure Databricks w Marketplace, tworzenie obszaru roboczego, wdrażanie zasobów, uruchamianie obszaru roboczego i poruszanie się po stronie głównej Databricks z polecanymi notesami.
Prezentacja zawiera 53 slajdy obejmujące: przegląd zasobów danych Azure, porównanie rozwiązań Big Data, podstawy Apache Spark, szczegóły platformy Azure Databricks, funkcje obszaru roboczego, trzy architektury referencyjne, wskazówki dotyczące cen/produktów, demonstrację na żywo i kroki wprowadzające.
Create Your Own Slides
Turn your ideas into professional presentations in seconds with 2slides AI.
Odwołuj się do profesjonalnych projektów, wybierz swój styl i generuj slajdy z idealnym renderowaniem tekstu. Napędzane przez Nano Banana—zacznij tworzyć swoją prezentację teraz.
Your AI Agent for slides. Save time, shine faster with intelligent presentation creation.
All services online© 2026 2slides. All rights reserved.