2Slides Logo
Preview

Введение в Azure Databricks — аналитика больших данных на базе Apache Spark

53 слайдов

Введение в Azure Databricks — аналитика больших данных на базе Apache Spark в Microsoft Azure

8 лайков
0 загрузок

Быстрая навигация

Теги

Azure Databricks
Apache Spark
Microsoft Azure
Big data
Большие данные

Поделиться слайдами

Описание

Основная тема

Введение в Azure Databricks — аналитика больших данных на базе Apache Spark в Microsoft Azure

Ключевые преимущества

  • Подробное введение из 53 слайдов, охватывающее Azure Databricks от основ до практических демонстраций
  • Охватывает всю экосистему больших данных Azure: SQL Server, Azure Data Services, HDInsight, Data Lake Analytics и позиционирование Databricks
  • Глубокое погружение в архитектуру Apache Spark, Spark SQL, MLlib, Structured Streaming и компоненты GraphX
  • Практические обзоры рабочей области Azure Databricks: кластеры, записные книжки, задания, рабочие области, библиотеки, DBFS и визуализация
  • Включает архитектуры реальных сценариев использования: современное хранилище больших данных, расширенная аналитика и конвейеры аналитики в реальном времени

Целевая аудитория

  • Инженеры и архитекторы данных, оценивающие решения Azure для больших данных
  • ИТ-специалисты, планирующие миграцию с локальной Hadoop в облако Azure
  • Специалисты по обработке и анализу данных, заинтересованные в аналитике на основе Spark в Azure
  • Лица, принимающие технические решения, сравнивающие Azure HDInsight, Azure Databricks и Azure ML
  • Профессионалы в области технологий Microsoft, стремящиеся подготовиться к сертификации Azure Databricks

Случаи использования

  • Технические презентации по продажам, представляющие Azure Databricks клиентам Microsoft
  • Семинары по архитектуре Azure, сравнивающие решения для больших данных
  • Внутренние учебные занятия по возможностям платформы Azure Databricks
  • Конференции об Apache Spark в экосистеме Azure
  • Адаптация новых членов команды к сервисам Azure для больших данных

Уникальные ценностные предложения

  • Представлено Джеймсом Серра, специалистом по большим данным Microsoft с более чем 30-летним опытом работы в ИТ
  • Позиционирует Azure Databricks в рамках более широкой среды данных Microsoft (SQL Server + гибридное решение Azure)
  • Включает данные эталонного тестирования: в 5 раз быстрее, чем vanilla Spark, в 8 раз быстрее, чем Presto, в 3 раза быстрее, чем Impala
  • Пошаговые скриншоты демонстрации портала Azure для создания и развертывания рабочей области
  • Три полные эталонные архитектуры для общих шаблонов больших данных в Azure

Страницы слайдов (53)

Подробный просмотр каждой страницы слайда, включая макет, ключевой контент и визуальные элементы.

Страница 1
title slide

Введение в Azure Databricks

Содержание

Титульный слайд от James Serra, Big Data Evangelist в Microsoft

Структура макета

Заголовок слева, фото ночного города справа, золотая стрелка для акцента

Ключевые визуальные элементы

  • Ночной городской пейзаж со световыми следами
  • Золотой элемент дизайна в виде стрелки
  • Темно-синий фон
Страница 2
speaker bio

Обо мне

Содержание

James Serra bio — Microsoft Big Data Evangelist, 30 лет опыта в IT, MCSE сертификации, докладчик PASS, бывший SQL Server MVP, автор

Структура макета

Список маркеров с портретным фото и значком MVP

Ключевые визуальные элементы

  • Портретное фото
  • Значок Microsoft MVP
Страница 3
agenda

Повестка дня

Содержание

Темы: Big Data Architectures, Зачем нужны озера данных, Top-down vs Bottom-up, Определение озера данных, Hadoop как озеро данных, Modern Data Warehouse, Federated Querying, Решение в облаке, SMP vs MPP

Структура макета

Простой список маркеров

Ключевые визуальные элементы

  • Список серым текстом
Страница 4
architecture diagram

Современная инфраструктура данных

Содержание

Гибридная архитектура: локально (значок здания) и облако (значок облака), поддерживающие операционные базы данных, хранилища данных и озера данных. Типы данных: LOB, CRM, Graph, Image, Social, IoT

Структура макета

Два столбца с гибридной стрелкой между on-prem и облаком

Ключевые визуальные элементы

  • Значки здания и облака
  • Шесть значков типов данных
  • Гибридная двунаправленная стрелка
Страница 5
product positioning

Предложение Microsoft

Содержание

SQL Server (on-prem) ↔ Hybrid ↔ Azure Data Services. SQL Server: лидер отрасли, #1 TPC-H, T-SQL поверх любых данных. Azure: на 70% быстрее, чем Aurora, 2x глобальный охват по сравнению с Redshift, No Limits Analytics 99.9% SLA

Структура макета

Тот же гибридный layout с выделенными конкурентными показателями

Ключевые визуальные элементы

  • Значок здания SQL Server
  • Значок облака Azure
  • Синий текст с конкурентными показателями
Страница 6
section divider

Big Data и Advanced Analytics в Azure

Содержание

Разделитель разделов для главы про Azure big data

Структура макета

Белый текст на синем фоне

Ключевые визуальные элементы

  • Синий фон Microsoft
Страница 7
comparison

Обзор различных решений для Big Data

Содержание

Спектр от Control до Ease of Use: Azure Marketplace (IaaS, любой Hadoop) → Azure HDInsight (управляемые кластеры) → Azure Databricks (frictionless Spark) → Azure Data Lake Analytics (job-as-a-service). Хранилище: Azure Data Lake Store и Azure Storage

Структура макета

Матричная диаграмма с осями control vs ease-of-use

Ключевые визуальные элементы

  • Четыре блока продуктов с логотипами
  • Спектр Control ↔ Ease of Use
  • Слой хранилища внизу
Страница 8
architecture diagram

Big Data и Advanced Analytics: краткий обзор

Содержание

Сквозной конвейер: Ingest (Data Factory, Kafka, Event Hub/IoT Hub) → Store (Blobs, Data Lake) → Prep & Train (Databricks, HDInsight, ML) → Model & Serve (Cosmos DB, SQL Database, SQL DW, Analysis Services) → Intelligence (Predictive apps, Reports, Dashboards)

Структура макета

Горизонтальный конвейер из пяти фаз со значками сервисов Azure

Ключевые визуальные элементы

  • Значки сервисов Azure
  • Пунктирные стрелки потока
  • Три типа источников данных: Бизнес-приложения, Пользовательские приложения, Датчики
Страница 9
section divider

Azure Databricks на базе Apache Spark

Содержание

Разделитель разделов для углубленного изучения Azure Databricks

Структура макета

Белый текст на синем фоне

Ключевые визуальные элементы

  • Синий фон Microsoft
Страница 10
technology overview

Почему Spark?

Содержание

Open-source движок, созданный для скорости, простоты использования, сложной аналитики. В 100 раз быстрее, чем Hadoop в памяти. Крупнейший OSS проект с 1000+ участниками. Расширяемый: Scala, Java, Python, Spark SQL, GraphX, Streaming, MLlib

Структура макета

Список маркеров с логотипом Apache Spark

Ключевые визуальные элементы

  • Логотип Apache Spark (оранжевая звезда)
  • Выделенные ключевые фразы
Страница 11
product overview

Что такое Azure Databricks?

Содержание

Быстрая, простая, совместная аналитика на основе Spark, оптимизированная для Azure. Лучшее от Databricks + Лучшее от Microsoft. Пять ключевых особенностей: сотрудничество с основателями Apache Spark, настройка в один клик, интерактивное рабочее пространство, встроенная интеграция с Azure (Power BI, SQL DW, Cosmos DB), безопасность корпоративного уровня (AD, соответствие требованиям, SLAs)

Структура макета

Заголовок с формулой (Databricks + Microsoft) и пятью функциями, обозначенными значками

Ключевые визуальные элементы

  • Логотип Databricks + логотип Microsoft
  • Пять значков функций
  • Синий акцентный текст
Страница 12
architecture diagram

Архитектура Apache Spark

Содержание

Унифицированный фреймворк: Spark SQL (интерактивные запросы), Spark MLLib (машинное обучение), Spark Streaming (потоковая обработка), GraphX (граф-вычисления) — все на Spark Core Engine с Yarn, Mesos или Standalone Scheduler

Структура макета

Многоуровневая архитектурная диаграмма с четырьмя модулями поверх основного движка

Ключевые визуальные элементы

  • Четыре синих блока модулей
  • Слой Spark Core Engine
  • Три варианта планировщика
  • Объединяет: пакетную обработку, SQL, обработку в реальном времени, ML, глубокое обучение, графы
Страница 13
data visualization

Databricks Spark работает быстро

Содержание

Сравнение результатов тестов: в 5 раз быстрее, чем vanilla Spark на AWS (11 674 против 53 783 сек), в 8 раз быстрее, чем Presto на AWS (35,3 против 293 сек), в 3 раза быстрее, чем Impala в локальной среде через Cloudera (1 149 264 против 3 331 440 сек)

Структура макета

Три горизонтальные гистограммы рядом друг с другом

Ключевые визуальные элементы

  • Три гистограммы с результатами тестов
  • Красные столбцы Databricks против серых столбцов конкурентов
  • Ссылка на источник цитирования
Страница 14
concept explanation

Преимущества унифицированной платформы

Содержание

Единый согласованный API (RDDs), сочетание типов обработки, исключает перемещение данных между движками. Конвейер: Input Streams → Spark Streaming → Spark ML → Spark SQL → NoSQL DB

Структура макета

Список с маркерами слева, вертикальная диаграмма конвейера справа

Ключевые визуальные элементы

  • Вертикальная синяя схема потока конвейера
  • Синие блоки для каждого компонента Spark
Страница 15
value proposition

Уникальный опыт в Azure

Содержание

Три столпа: повышение производительности (запуск в один клик, Power BI, совместная работа, встроенная интеграция с Azure), построение на самой совместимой облачной платформе (безопасность AD, детальный доступ, соответствие требованиям), масштабирование без ограничений (масштабирование, самый быстрый движок Spark)

Структура макета

Макет с тремя столбцами с заголовками, выделенными жирным шрифтом

Ключевые визуальные элементы

  • Три синих заголовка столбцов
  • Ключевые фразы, выделенные жирным шрифтом
Страница 16
architecture diagram

Azure Databricks Platform Architecture

Содержание

Полная схема платформы: Источники данных (IoT, Cloud storage, Hadoop, Data warehouses) → Azure Databricks (Совместная рабочая среда + Развертывание производственных заданий и рабочих процессов + Оптимизированная среда выполнения) → Выходные данные (ML models, BI tools, Экспорт данных, Data warehouses)

Структура макета

Трехслойная схема платформы с входами/выходами

Ключевые визуальные элементы

  • Трехуровневая платформа Azure Databricks
  • Три значка персонажей
  • Логотип Spark в слое среды выполнения
  • Значки источников входных/выходных данных
Страница 17
feature detail

Collaborative Workspace

Содержание

Начните работу за секунды (в один клик), интерактивное исследование (R, Python, Scala, SQL notebooks), совместная работа в режиме реального времени с историей изменений (GitHub, Bitbucket), встроенные визуализации (matplotlib, ggplot, D3), панели мониторинга PowerBI

Структура макета

Описание функций слева, схема архитектуры платформы справа (выделен слой рабочей среды)

Ключевые визуальные элементы

  • Схема платформы с выделенной Collaborative Workspace
  • Заголовки разделов, выделенные жирным шрифтом
Страница 18
feature detail

Deploy Production Jobs & Workflows

Содержание

Планировщик заданий, рабочие процессы notebook (многоэтапные конвейеры), запуск notebooks в качестве отказоустойчивых заданий Spark, уведомления и журналы аудита, встроенная интеграция с Azure SQL DW, Cosmos DB, Data Lake Store, Blob Storage, Event Hub

Структура макета

Описание функций слева, схема платформы справа (выделен слой заданий)

Ключевые визуальные элементы

  • Схема платформы с выделенными Jobs & Workflows
Страница 19
feature detail

Optimized Databricks Runtime Engine

Содержание

Модуль DBIO для оптимизированной производительности ввода-вывода, полностью управляемая платформа на Azure устраняет сложность, бессерверная и эластичная облачная служба, работа в глобальном масштабе

Структура макета

Описание функций слева, схема платформы справа (выделен слой среды выполнения)

Ключевые визуальные элементы

  • Схема платформы с выделенным Runtime Engine
Страница 20
concept diagram

Azure Databricks Core Artifacts

Содержание

Пять основных компонентов: Clusters, Libraries, Workspaces, Jobs, Notebooks — все подключено к центральному хабу Azure Databricks

Структура макета

Схема типа «звезда» с центром Azure Databricks и пятью синими блоками

Ключевые визуальные элементы

  • Оранжевый эллипс хаба
  • Пять синих блоков компонентов со значками
  • Соединительные линии
Страница 21
architecture diagram

General Spark Cluster Architecture

Содержание

Driver Program (SparkContext) → Cluster Manager → Worker Nodes (Cache + Task) → Data Sources (HDFS, SQL, NoSQL). Driver запускает основную функцию, worker nodes читают/записывают данные, кэшируют как RDDs, выполняются на VMs в публичных облаках

Структура макета

Иерархическая архитектурная диаграмма справа, маркированный список слева

Ключевые визуальные элементы

  • Иерархия Driver → Manager → Workers
  • Блоки Cache и Task в worker nodes
  • Слой Data Sources внизу
Страница 22
security feature

Azure Databricks Integration with AAD

Содержание

Интеграция с Azure Active Directory: нет отдельного управления пользователями, пользователи AAD работают непосредственно в Databricks, делегированная SSO-аутентификация, контроль доступа на основе AAD для notebooks, clusters, jobs и данных

Структура макета

Маркированный список слева, диаграмма потока аутентификации AAD справа

Ключевые визуальные элементы

  • Azure Databricks → Access Control → Azure AD → Поток аутентификации
  • Три значка пользовательских персонажей
  • Логотип Azure AD в виде ромба
Страница 23
product demo

Clusters: Auto Scaling and Auto Termination

Содержание

Autoscaling (min/max workers, автоматическое масштабирование при нагрузке) и Auto Termination (таймаут простоя, автоматическое выключение). Преимущества: не нужно гадать количество узлов, не нужно ручное изменение параметров, нет пустой траты ресурсов, оплата только за использование

Структура макета

Описание текста слева, скриншот Azure Portal Create Cluster справа

Ключевые визуальные элементы

  • Пользовательский интерфейс создания кластера Azure Portal
  • Настройки Autoscaling и Auto Termination выделены красным
Страница 24
feature overview

Jobs

Содержание

Jobs отправляют код приложения Spark для выполнения на clusters. Выполняйте Notebooks или JARs. Комплексные GUI инструменты для создания, управления и мониторинга

Структура макета

Описание текста слева, значок календаря/часов справа

Ключевые визуальные элементы

  • Серый календарь со значком часов
Страница 25
product demo

Workspaces

Содержание

Workspaces организуют и совместно используют Notebooks, Libraries и Dashboards. Иерархическая структура папок, личные каталоги для каждого пользователя, детальный контроль доступа для безопасной совместной работы

Структура макета

Маркированный список слева, два скриншота рабочей области Azure Portal справа

Ключевые визуальные элементы

  • Скриншоты браузера папок рабочей области
  • Меню Import/Export/Permissions
Страница 26
product demo

Azure Databricks Notebooks Overview

Содержание

Notebooks для разработки и запуска приложений Spark непосредственно на clusters. Поддержка детальных разрешений, идеально подходит для прототипирования и итеративной разработки. Состоят из кода, данных, визуализаций, комментариев и заметок

Структура макета

Маркированный список слева, скриншот notebook с диаграммой справа

Ключевые визуальные элементы

  • Notebook с визуализацией столбчатой диаграммы
  • Диаграмма Population vs Price
  • Боковая панель с веткой комментариев
Страница 27
product demo

Libraries Overview

Содержание

Libraries содержат библиотеки Python, R, Java/Scala в workspaces. Неизменяемы после импорта. Настраиваются с помощью Init Scripts. Управляются через Library API. Поддерживают источники PyPI, Maven, JAR, R CRAN

Структура макета

Маркированный список слева, три скриншота Azure Portal Create Library справа

Ключевые визуальные элементы

  • Три скриншота пользовательского интерфейса создания библиотеки
  • Варианты источников библиотеки PyPI, JAR, Maven, R
Страница 28
product demo

Visualization

Содержание

Встроенная визуализация: Bar, Scatter, Map, Line, Area, Pie, Quantile, Histogram, Box plot, Q-Q plot, Pivot. Все notebooks, независимо от языка, поддерживают визуализации Databricks. Matplotlib отображается как изображения. Пример кода PySpark SQL с визуализацией карты штатов США

Структура макета

Маркированный список слева, код PySpark + визуализация карты справа, меню типов графиков ниже

Ключевые визуальные элементы

  • Визуализация хороплетической карты США
  • Фрагмент кода PySpark
  • Меню выбора типа графика
Страница 29
architecture diagram

Databricks File System (DBFS)

Содержание

Распределенная файловая система, расположенная поверх Azure Blob Storage. Монтируйте корзины Azure Storage, кэшируйте локально на SSD, доступно в Python/Scala/CLI/dbutils, данные сохраняются после завершения работы cluster, предустановлены на Spark clusters

Структура макета

Маркированный список слева, архитектурная диаграмма DBFS справа

Ключевые визуальные элементы

  • Диаграмма древовидной структуры DBFS
  • Точки доступа Python/Scala/CLI/dbutils
  • Azure Blob Storage внизу
  • Соединители db.fs.mount()
Страница 30
technology overview

Spark SQL Overview

Содержание

Распределенный механизм SQL-запросов для структурированных данных. Запрашивайте внешние базы данных, файлы, таблицы Hive. SQL или HiveQL. Привязки в Python, Scala, Java. Встроенная структурированная потоковая передача. Использует оптимизатор Catalyst и выполнение Tungsten

Структура макета

Маркированный список слева, архитектурная диаграмма Spark SQL справа

Ключевые визуальные элементы

  • Многоуровневая архитектурная диаграмма Spark SQL
  • Логотипы соединителей источников данных: Parquet, JSON, Hive, JDBC, CSV, Cassandra, MongoDB, MySQL и т. д.
Страница 31
product demo

Обзор баз данных и таблиц

Содержание

Базы данных как коллекции таблиц, определяемые через GUI или APIs/Notebooks. Databricks использует Hive metastore. Поддерживает секционированные таблицы и отсечение секций для повышения производительности

Структура макета

Список маркеров слева, пользовательский интерфейс баз данных/таблиц Azure Portal справа

Ключевые визуальные элементы

  • Пользовательский интерфейс браузера баз данных и таблиц
  • Пример таблиц Movies/ratings/users
Страница 32
technology overview

Обзор Spark Machine Learning (ML)

Содержание

Параллелизованные ML-алгоритмы: MMLSpark, Spark ML, Deep Learning, SparkR. Выбор модели с помощью перекрестной проверки. DataFrame-based API (Spark 2.0+). MLlib предустановлен. Сторонние библиотеки: H2O, SciKit-learn, XGBoost

Структура макета

Список маркеров слева, диаграмма конвейера Spark ML справа

Ключевые визуальные элементы

  • Логотип Apache Spark ML
  • Схема конвейера ML: Data Ingestion → Cleaning → Training → Model Selection → Validation → Deployment
Страница 33
technology overview

Обзор Spark Structured Streaming

Содержание

Унифицированный API потоковой и пакетной обработки для ровно-один-раз обработки потоков с сохранением состояния. Работает на Spark SQL с DataFrame API. Инкрементные, непрерывные обновления. Поддерживает окна времени событий, объединения потока с пакетом, дедупликацию. Источники: Kafka, файл (JSON, CSV, Parquet)

Структура макета

Список маркеров слева, две диаграммы справа (неограниченная таблица + инкрементное выполнение)

Ключевые визуальные элементы

  • Диаграмма Data stream → Unbounded Table
  • Схема инкрементного выполнения с триггерами
Страница 34
integration detail

Интеграция Apache Kafka для HDInsight

Содержание

Structured Streaming интегрируется с Apache Kafka на HDInsight. Потоковая передача корпоративного уровня. Дополнительные шлюзы не требуются. Кластеры Kafka и Databricks должны находиться в одной виртуальной сети Azure Virtual Network

Структура макета

Текст вверху, схема архитектуры интеграции внизу

Ключевые визуальные элементы

  • Диаграмма Kafka ↔ Spark Structured Streaming
  • Граница Azure Virtual Network
  • Логотипы Kafka и Spark
Страница 35
technology overview

Обзор Spark GraphX

Содержание

APIs для графов и графо-параллельных вычислений. Объединяет ETL, разведочный анализ и итеративные графовые вычисления. Алгоритмы: PageRank, Connected Components, Label Propagation, SVD++, Triangle Count. Только Scala и RDD APIs

Структура макета

Макет с тремя панелями: функции, список алгоритмов, графики производительности PageRank

Ключевые визуальные элементы

  • Список алгоритмов
  • Столбчатые диаграммы производительности PageRank (Twitter + UK-Graph)
  • Сравнение GraphX с конкурирующими системами
Страница 36
feature overview

Databricks CLI

Содержание

Простой в использовании интерфейс, построенный на REST API. Два под-CLI: Workspace CLI и DBFS CLI. Реализует DBFS API и Workspace API

Структура макета

Иерархическая диаграмма: Databricks CLI → Workspace CLI + DBFS CLI

Ключевые визуальные элементы

  • Три цветных блока (темно-синий, фиолетовый, зеленый)
  • Иерархическая древовидная структура
Страница 37
feature overview

Databricks REST API

Содержание

Семь API: Cluster API (создание/редактирование/удаление кластеров), DBFS API, Groups API, Instance Profile API, Job API, Library API, Workspace API (импорт/экспорт notebooks)

Структура макета

Воронкообразная диаграмма слева, указывающая на таблицу API справа

Ключевые визуальные элементы

  • Синий значок воронки
  • Таблица справочника API из семи строк
Страница 38
section divider

Примеры использования

Содержание

Разделитель разделов для архитектур вариантов использования

Структура макета

Белый текст на синем фоне

Ключевые визуальные элементы

  • Синий фон Microsoft
Страница 39
reference architecture

Современное хранилище больших данных

Содержание

Архитектура: Неструктурированные данные (логи, файлы, медиа) → Data Factory → Azure Storage → Azure Databricks (Spark) → Azure SQL Data Warehouse. Структурированные данные (бизнес-приложения) → Data Factory → Polybase → SQL DW → Аналитические панели мониторинга

Структура макета

Пятиэтапный конвейер с двумя потоками источников данных

Ключевые визуальные элементы

  • Значки служб Azure
  • Двухпоточный конвейер
  • Коннектор Polybase
Страница 40
reference architecture

Расширенная аналитика больших данных

Содержание

Архитектура: Неструктурированные → Data Factory → Azure Storage → Azure Databricks (Spark MLlib, SparkR, SparklyR) → Azure Cosmos DB → Веб- и мобильные приложения. Структурированные → Polybase → SQL DW → Аналитические панели мониторинга

Структура макета

Пятиэтапный конвейер с обработкой, ориентированной на ML, и обслуживанием Cosmos DB

Ключевые визуальные элементы

  • Azure Cosmos DB для обслуживания моделей
  • Перечислены библиотеки ML
  • Веб- и мобильный вывод
Страница 41
reference architecture

Аналитика больших данных в реальном времени

Содержание

Архитектура: Неструктурированные данные → Azure HDInsight (Kafka) → Azure Databricks (Spark) ↔ Azure Storage → Polybase → Azure SQL Data Warehouse → Аналитические панели мониторинга

Структура макета

Пятифазный конвейер с потоковой передачей Kafka

Ключевые визуальные элементы

  • HDInsight Kafka для приема данных
  • Двунаправленный Spark ↔ Storage
  • Акцент на потоковую передачу в реальном времени
Страница 42
section divider

Цены и рекомендации по продукту

Содержание

Разделитель раздела для главы о ценах и сравнении

Структура макета

Белый текст на синем фоне

Ключевые визуальные элементы

  • Синий фон Microsoft
Страница 43
comparison

Сравнение Big Data OSS

Содержание

Сравнение в трех столбцах: Azure HDInsight (Hadoop/HDP, PaaS, безопасность Ranger, сравнение цен с AWS EMR), Azure Databricks (Spark, SaaS, безопасность AD, сравнение цен с Databricks на AWS), Сторонние предложения (Cloudera/MapR/Hortonworks, IaaS, цены поставщика)

Структура макета

Карточки сравнения в три столбца

Ключевые визуальные элементы

  • Три карточки продукта с разделами Что/Цены/Когда использовать
Страница 44
comparison

Обзор предложений

Содержание

Подробное сравнение: Azure HDInsight (Hortonworks, движки больших данных, VNET, Ranger, OMS, оркестрация Data Factory, 27 регионов), Azure Databricks (Spark в первую очередь, единый движок, AAD OAuth, RBAC, автомасштабирование, serverless, интеграция с SQL DW), Azure ML (собственный ML, Python/R, эксперименты, управление моделями, интеграция IDE)

Структура макета

Подробное сравнение функций в три столбца

Ключевые визуальные элементы

  • Три подробные карточки продукта
  • Разделы Что это, Функции, Руководство
Страница 45
section divider

Демо

Содержание

Разделитель раздела для демонстрации в реальном времени

Структура макета

Белый текст на синем фоне

Ключевые визуальные элементы

  • Синий фон Microsoft
Страница 46
product demo

Azure Databricks - service home page

Содержание

Скриншот портала Azure, показывающий страницу службы Azure Databricks (предварительная версия) в Marketplace > Data + Analytics. Описание унифицированной аналитической платформы, предварительный просмотр пользовательского интерфейса рабочей области Databricks

Структура макета

Полноэкранный скриншот портала Azure

Ключевые визуальные элементы

  • Навигация по Azure Marketplace
  • Описание службы Databricks
  • Скриншот предварительного просмотра рабочей области
Страница 47
product demo

Azure Databricks - creating a workspace

Содержание

Портал Azure: форма создания службы Azure Databricks с полями имени рабочей области, подписки, группы ресурсов и расположения (Западная часть США)

Структура макета

Полноэкранный скриншот формы создания портала Azure

Ключевые визуальные элементы

  • Форма создания рабочей области
  • Выбор группы ресурсов
  • Раскрывающийся список местоположений
Страница 48
product demo

Azure Databricks - workspace deployment

Содержание

Панель мониторинга портала Azure, показывающая развернутые ресурсы, включая службу Databricks, с краткими руководствами для виртуальных машин, App Service, Functions, SQL Database

Структура макета

Полноэкранный скриншот панели мониторинга Azure

Ключевые визуальные элементы

  • Панель мониторинга со списком ресурсов
  • Плитка развертывания Azure Databricks
  • Ссылки на краткие руководства
Страница 49
product demo

Azure Databricks - launching the workspace

Содержание

Страница обзора ресурсов портала Azure с кнопкой Launch Workspace, сведениями об управляемой группе ресурсов, информацией о подписке и плитками быстрого запуска: Документация, Начало работы, Импорт данных, Notebook, Руководство администратора

Структура макета

Полноэкранный скриншот страницы сведений о ресурсе

Ключевые визуальные элементы

  • Кнопка Launch Workspace
  • Обзор ресурсов с URL-адресом
  • Шесть плиток быстрого запуска
Страница 50
product demo

Azure Databricks - workspace home page

Содержание

Домашняя страница рабочей области Databricks, показывающая рекомендуемые Notebooks (Apache Spark Intro, Data Scientists, Structured Streaming), Новые элементы (Notebook, Job, Cluster, Table, Library), Ссылки на документацию, Open Recent

Структура макета

Полноэкранный скриншот рабочей области Databricks

Ключевые визуальные элементы

  • Логотип Databricks и боковая панель
  • Рекомендуемые Notebooks со значками Python/Spark
  • Меню создания нового элемента
Страница 51
section divider

How to get started

Содержание

Разделитель раздела для руководства по началу работы

Структура макета

Белый текст на синем фоне

Ключевые визуальные элементы

  • Синий фон Microsoft
Страница 52
call to action

How to get started

Содержание

Три шага: Зарегистрируйтесь для предварительного просмотра, Привлекайте экспертов Microsoft для семинаров, Узнайте больше на azure.com/databricks

Структура макета

Три шага с иконками слева, фотография деловой встречи справа

Ключевые визуальные элементы

  • Три синих круглых значка
  • Фотография деловой встречи
  • URL-ссылки
Страница 53
closing slide

Q & A

Содержание

Заключительный слайд с вопросами и ответами и контактной информацией: James Serra, Big Data Evangelist — email, Twitter @JamesSerra, LinkedIn, блог на JamesSerra.com

Структура макета

Большой текст Q&A с оранжевым значком вопросительного знака, контактные данные внизу

Ключевые визуальные элементы

  • Оранжевый круг с вопросительным знаком
  • Темно-бирюзовый фон
  • Ссылки на контактную информацию

Часто задаваемые вопросы

Распространенные вопросы об этом слайде и основном содержании презентации.

Что такое Azure Databricks и чем он отличается от HDInsight?

Azure Databricks — это быстрая, простая и удобная платформа аналитики на основе Apache Spark, оптимизированная для Azure и разработанная как SaaS. HDInsight — это управляемый дистрибутив Hadoop (Hortonworks), поддерживающий несколько движков (Spark, Hive, Kafka, HBase). Databricks лучше всего подходит для рабочих нагрузок, ориентированных на Spark, с записными книжками и совместной работой, а HDInsight подходит для клиентов, которым нужны технологии Hadoop, отличные от Spark.

Кто создал эту презентацию?

Эта презентация была создана Джеймсом Серра, специалистом по большим данным в Microsoft с более чем 30-летним опытом работы в ИТ, множеством сертификатов Microsoft (MCSE) и автором книги по отчетности SQL Server 2012. Он является бывшим SQL Server MVP и частым докладчиком на конференциях PASS.

Какие компоненты Apache Spark рассматриваются?

Презентация охватывает все основные компоненты Spark: Spark SQL (механизм распределенных запросов), Spark MLlib (машинное обучение), Spark Structured Streaming (обработка в реальном времени) и GraphX (графические вычисления), а также основную архитектуру Spark с RDD, модель Driver/Worker и управление кластерами.

Включает ли эта презентация тесты производительности?

Да, она включает данные эталонного тестирования, показывающие, что Databricks Spark в 5 раз быстрее, чем vanilla Apache Spark на AWS, в 8 раз быстрее, чем Apache Presto на AWS, и в 3 раза быстрее, чем локальный Impala через Cloudera, с конкретными номерами времени выполнения, указанными в публичных исследованиях эталонного тестирования.

Какие архитектуры вариантов использования включены?

Представлены три полные эталонные архитектуры Azure: современное хранилище больших данных (пакетная ETL с SQL DW), расширенная аналитика больших данных (ML с Cosmos DB, обслуживающей веб/мобильные устройства) и аналитика больших данных в реальном времени (потоковая передача Kafka с обработкой Spark).

Подходит ли этот шаблон для подготовки к сертификации Azure?

Да, презентация охватывает архитектуру платформы Azure Databricks, основные артефакты (кластеры, записные книжки, задания, рабочие области, библиотеки), безопасность с интеграцией AAD, DBFS, Spark SQL, MLlib, Streaming и REST API — все ключевые темы для сертификации Azure для разработки данных.

Включает ли презентация практический демонстрационный контент?

Да, она включает пошаговые скриншоты портала Azure, демонстрирующие: поиск Azure Databricks в Marketplace, создание рабочей области, развертывание ресурсов, запуск рабочей области и навигацию по домашней странице Databricks с избранными записными книжками.

Сколько слайдов в этой презентации?

Презентация содержит 53 слайда, охватывающих: обзор среды данных Azure, сравнение решений для больших данных, основы Apache Spark, подробности платформы Azure Databricks, функции рабочей области, три эталонные архитектуры, рекомендации по ценам/продуктам, пошаговое руководство по демонстрации в реальном времени и шаги для начала работы.

2slides

Create Your Own Slides

Turn your ideas into professional presentations in seconds with 2slides AI.

Создавайте Слайды Мирового Класса за Секунды

Используйте профессиональные дизайны, выберите свой стиль и генерируйте слайды с идеальной отрисовкой текста. На базе Nano Banana—начните создавать свою презентацию прямо сейчас.

© 2026 2slides. All rights reserved.