
Введение в Azure Databricks — аналитика больших данных на базе Apache Spark в Microsoft Azure
Быстрая навигация
Теги
Поделиться слайдами
Введение в Azure Databricks — аналитика больших данных на базе Apache Spark в Microsoft Azure
Подробный просмотр каждой страницы слайда, включая макет, ключевой контент и визуальные элементы.
Титульный слайд от James Serra, Big Data Evangelist в Microsoft
Заголовок слева, фото ночного города справа, золотая стрелка для акцента
James Serra bio — Microsoft Big Data Evangelist, 30 лет опыта в IT, MCSE сертификации, докладчик PASS, бывший SQL Server MVP, автор
Список маркеров с портретным фото и значком MVP
Темы: Big Data Architectures, Зачем нужны озера данных, Top-down vs Bottom-up, Определение озера данных, Hadoop как озеро данных, Modern Data Warehouse, Federated Querying, Решение в облаке, SMP vs MPP
Простой список маркеров
Гибридная архитектура: локально (значок здания) и облако (значок облака), поддерживающие операционные базы данных, хранилища данных и озера данных. Типы данных: LOB, CRM, Graph, Image, Social, IoT
Два столбца с гибридной стрелкой между on-prem и облаком
SQL Server (on-prem) ↔ Hybrid ↔ Azure Data Services. SQL Server: лидер отрасли, #1 TPC-H, T-SQL поверх любых данных. Azure: на 70% быстрее, чем Aurora, 2x глобальный охват по сравнению с Redshift, No Limits Analytics 99.9% SLA
Тот же гибридный layout с выделенными конкурентными показателями
Разделитель разделов для главы про Azure big data
Белый текст на синем фоне
Спектр от Control до Ease of Use: Azure Marketplace (IaaS, любой Hadoop) → Azure HDInsight (управляемые кластеры) → Azure Databricks (frictionless Spark) → Azure Data Lake Analytics (job-as-a-service). Хранилище: Azure Data Lake Store и Azure Storage
Матричная диаграмма с осями control vs ease-of-use
Сквозной конвейер: Ingest (Data Factory, Kafka, Event Hub/IoT Hub) → Store (Blobs, Data Lake) → Prep & Train (Databricks, HDInsight, ML) → Model & Serve (Cosmos DB, SQL Database, SQL DW, Analysis Services) → Intelligence (Predictive apps, Reports, Dashboards)
Горизонтальный конвейер из пяти фаз со значками сервисов Azure
Разделитель разделов для углубленного изучения Azure Databricks
Белый текст на синем фоне
Open-source движок, созданный для скорости, простоты использования, сложной аналитики. В 100 раз быстрее, чем Hadoop в памяти. Крупнейший OSS проект с 1000+ участниками. Расширяемый: Scala, Java, Python, Spark SQL, GraphX, Streaming, MLlib
Список маркеров с логотипом Apache Spark
Быстрая, простая, совместная аналитика на основе Spark, оптимизированная для Azure. Лучшее от Databricks + Лучшее от Microsoft. Пять ключевых особенностей: сотрудничество с основателями Apache Spark, настройка в один клик, интерактивное рабочее пространство, встроенная интеграция с Azure (Power BI, SQL DW, Cosmos DB), безопасность корпоративного уровня (AD, соответствие требованиям, SLAs)
Заголовок с формулой (Databricks + Microsoft) и пятью функциями, обозначенными значками
Унифицированный фреймворк: Spark SQL (интерактивные запросы), Spark MLLib (машинное обучение), Spark Streaming (потоковая обработка), GraphX (граф-вычисления) — все на Spark Core Engine с Yarn, Mesos или Standalone Scheduler
Многоуровневая архитектурная диаграмма с четырьмя модулями поверх основного движка
Сравнение результатов тестов: в 5 раз быстрее, чем vanilla Spark на AWS (11 674 против 53 783 сек), в 8 раз быстрее, чем Presto на AWS (35,3 против 293 сек), в 3 раза быстрее, чем Impala в локальной среде через Cloudera (1 149 264 против 3 331 440 сек)
Три горизонтальные гистограммы рядом друг с другом
Единый согласованный API (RDDs), сочетание типов обработки, исключает перемещение данных между движками. Конвейер: Input Streams → Spark Streaming → Spark ML → Spark SQL → NoSQL DB
Список с маркерами слева, вертикальная диаграмма конвейера справа
Три столпа: повышение производительности (запуск в один клик, Power BI, совместная работа, встроенная интеграция с Azure), построение на самой совместимой облачной платформе (безопасность AD, детальный доступ, соответствие требованиям), масштабирование без ограничений (масштабирование, самый быстрый движок Spark)
Макет с тремя столбцами с заголовками, выделенными жирным шрифтом
Полная схема платформы: Источники данных (IoT, Cloud storage, Hadoop, Data warehouses) → Azure Databricks (Совместная рабочая среда + Развертывание производственных заданий и рабочих процессов + Оптимизированная среда выполнения) → Выходные данные (ML models, BI tools, Экспорт данных, Data warehouses)
Трехслойная схема платформы с входами/выходами
Начните работу за секунды (в один клик), интерактивное исследование (R, Python, Scala, SQL notebooks), совместная работа в режиме реального времени с историей изменений (GitHub, Bitbucket), встроенные визуализации (matplotlib, ggplot, D3), панели мониторинга PowerBI
Описание функций слева, схема архитектуры платформы справа (выделен слой рабочей среды)
Планировщик заданий, рабочие процессы notebook (многоэтапные конвейеры), запуск notebooks в качестве отказоустойчивых заданий Spark, уведомления и журналы аудита, встроенная интеграция с Azure SQL DW, Cosmos DB, Data Lake Store, Blob Storage, Event Hub
Описание функций слева, схема платформы справа (выделен слой заданий)
Модуль DBIO для оптимизированной производительности ввода-вывода, полностью управляемая платформа на Azure устраняет сложность, бессерверная и эластичная облачная служба, работа в глобальном масштабе
Описание функций слева, схема платформы справа (выделен слой среды выполнения)
Пять основных компонентов: Clusters, Libraries, Workspaces, Jobs, Notebooks — все подключено к центральному хабу Azure Databricks
Схема типа «звезда» с центром Azure Databricks и пятью синими блоками
Driver Program (SparkContext) → Cluster Manager → Worker Nodes (Cache + Task) → Data Sources (HDFS, SQL, NoSQL). Driver запускает основную функцию, worker nodes читают/записывают данные, кэшируют как RDDs, выполняются на VMs в публичных облаках
Иерархическая архитектурная диаграмма справа, маркированный список слева
Интеграция с Azure Active Directory: нет отдельного управления пользователями, пользователи AAD работают непосредственно в Databricks, делегированная SSO-аутентификация, контроль доступа на основе AAD для notebooks, clusters, jobs и данных
Маркированный список слева, диаграмма потока аутентификации AAD справа
Autoscaling (min/max workers, автоматическое масштабирование при нагрузке) и Auto Termination (таймаут простоя, автоматическое выключение). Преимущества: не нужно гадать количество узлов, не нужно ручное изменение параметров, нет пустой траты ресурсов, оплата только за использование
Описание текста слева, скриншот Azure Portal Create Cluster справа
Jobs отправляют код приложения Spark для выполнения на clusters. Выполняйте Notebooks или JARs. Комплексные GUI инструменты для создания, управления и мониторинга
Описание текста слева, значок календаря/часов справа
Workspaces организуют и совместно используют Notebooks, Libraries и Dashboards. Иерархическая структура папок, личные каталоги для каждого пользователя, детальный контроль доступа для безопасной совместной работы
Маркированный список слева, два скриншота рабочей области Azure Portal справа
Notebooks для разработки и запуска приложений Spark непосредственно на clusters. Поддержка детальных разрешений, идеально подходит для прототипирования и итеративной разработки. Состоят из кода, данных, визуализаций, комментариев и заметок
Маркированный список слева, скриншот notebook с диаграммой справа
Libraries содержат библиотеки Python, R, Java/Scala в workspaces. Неизменяемы после импорта. Настраиваются с помощью Init Scripts. Управляются через Library API. Поддерживают источники PyPI, Maven, JAR, R CRAN
Маркированный список слева, три скриншота Azure Portal Create Library справа
Встроенная визуализация: Bar, Scatter, Map, Line, Area, Pie, Quantile, Histogram, Box plot, Q-Q plot, Pivot. Все notebooks, независимо от языка, поддерживают визуализации Databricks. Matplotlib отображается как изображения. Пример кода PySpark SQL с визуализацией карты штатов США
Маркированный список слева, код PySpark + визуализация карты справа, меню типов графиков ниже
Распределенная файловая система, расположенная поверх Azure Blob Storage. Монтируйте корзины Azure Storage, кэшируйте локально на SSD, доступно в Python/Scala/CLI/dbutils, данные сохраняются после завершения работы cluster, предустановлены на Spark clusters
Маркированный список слева, архитектурная диаграмма DBFS справа
Распределенный механизм SQL-запросов для структурированных данных. Запрашивайте внешние базы данных, файлы, таблицы Hive. SQL или HiveQL. Привязки в Python, Scala, Java. Встроенная структурированная потоковая передача. Использует оптимизатор Catalyst и выполнение Tungsten
Маркированный список слева, архитектурная диаграмма Spark SQL справа
Базы данных как коллекции таблиц, определяемые через GUI или APIs/Notebooks. Databricks использует Hive metastore. Поддерживает секционированные таблицы и отсечение секций для повышения производительности
Список маркеров слева, пользовательский интерфейс баз данных/таблиц Azure Portal справа
Параллелизованные ML-алгоритмы: MMLSpark, Spark ML, Deep Learning, SparkR. Выбор модели с помощью перекрестной проверки. DataFrame-based API (Spark 2.0+). MLlib предустановлен. Сторонние библиотеки: H2O, SciKit-learn, XGBoost
Список маркеров слева, диаграмма конвейера Spark ML справа
Унифицированный API потоковой и пакетной обработки для ровно-один-раз обработки потоков с сохранением состояния. Работает на Spark SQL с DataFrame API. Инкрементные, непрерывные обновления. Поддерживает окна времени событий, объединения потока с пакетом, дедупликацию. Источники: Kafka, файл (JSON, CSV, Parquet)
Список маркеров слева, две диаграммы справа (неограниченная таблица + инкрементное выполнение)
Structured Streaming интегрируется с Apache Kafka на HDInsight. Потоковая передача корпоративного уровня. Дополнительные шлюзы не требуются. Кластеры Kafka и Databricks должны находиться в одной виртуальной сети Azure Virtual Network
Текст вверху, схема архитектуры интеграции внизу
APIs для графов и графо-параллельных вычислений. Объединяет ETL, разведочный анализ и итеративные графовые вычисления. Алгоритмы: PageRank, Connected Components, Label Propagation, SVD++, Triangle Count. Только Scala и RDD APIs
Макет с тремя панелями: функции, список алгоритмов, графики производительности PageRank
Простой в использовании интерфейс, построенный на REST API. Два под-CLI: Workspace CLI и DBFS CLI. Реализует DBFS API и Workspace API
Иерархическая диаграмма: Databricks CLI → Workspace CLI + DBFS CLI
Семь API: Cluster API (создание/редактирование/удаление кластеров), DBFS API, Groups API, Instance Profile API, Job API, Library API, Workspace API (импорт/экспорт notebooks)
Воронкообразная диаграмма слева, указывающая на таблицу API справа
Разделитель разделов для архитектур вариантов использования
Белый текст на синем фоне
Архитектура: Неструктурированные данные (логи, файлы, медиа) → Data Factory → Azure Storage → Azure Databricks (Spark) → Azure SQL Data Warehouse. Структурированные данные (бизнес-приложения) → Data Factory → Polybase → SQL DW → Аналитические панели мониторинга
Пятиэтапный конвейер с двумя потоками источников данных
Архитектура: Неструктурированные → Data Factory → Azure Storage → Azure Databricks (Spark MLlib, SparkR, SparklyR) → Azure Cosmos DB → Веб- и мобильные приложения. Структурированные → Polybase → SQL DW → Аналитические панели мониторинга
Пятиэтапный конвейер с обработкой, ориентированной на ML, и обслуживанием Cosmos DB
Архитектура: Неструктурированные данные → Azure HDInsight (Kafka) → Azure Databricks (Spark) ↔ Azure Storage → Polybase → Azure SQL Data Warehouse → Аналитические панели мониторинга
Пятифазный конвейер с потоковой передачей Kafka
Разделитель раздела для главы о ценах и сравнении
Белый текст на синем фоне
Сравнение в трех столбцах: Azure HDInsight (Hadoop/HDP, PaaS, безопасность Ranger, сравнение цен с AWS EMR), Azure Databricks (Spark, SaaS, безопасность AD, сравнение цен с Databricks на AWS), Сторонние предложения (Cloudera/MapR/Hortonworks, IaaS, цены поставщика)
Карточки сравнения в три столбца
Подробное сравнение: Azure HDInsight (Hortonworks, движки больших данных, VNET, Ranger, OMS, оркестрация Data Factory, 27 регионов), Azure Databricks (Spark в первую очередь, единый движок, AAD OAuth, RBAC, автомасштабирование, serverless, интеграция с SQL DW), Azure ML (собственный ML, Python/R, эксперименты, управление моделями, интеграция IDE)
Подробное сравнение функций в три столбца
Разделитель раздела для демонстрации в реальном времени
Белый текст на синем фоне
Скриншот портала Azure, показывающий страницу службы Azure Databricks (предварительная версия) в Marketplace > Data + Analytics. Описание унифицированной аналитической платформы, предварительный просмотр пользовательского интерфейса рабочей области Databricks
Полноэкранный скриншот портала Azure
Портал Azure: форма создания службы Azure Databricks с полями имени рабочей области, подписки, группы ресурсов и расположения (Западная часть США)
Полноэкранный скриншот формы создания портала Azure
Панель мониторинга портала Azure, показывающая развернутые ресурсы, включая службу Databricks, с краткими руководствами для виртуальных машин, App Service, Functions, SQL Database
Полноэкранный скриншот панели мониторинга Azure
Страница обзора ресурсов портала Azure с кнопкой Launch Workspace, сведениями об управляемой группе ресурсов, информацией о подписке и плитками быстрого запуска: Документация, Начало работы, Импорт данных, Notebook, Руководство администратора
Полноэкранный скриншот страницы сведений о ресурсе
Домашняя страница рабочей области Databricks, показывающая рекомендуемые Notebooks (Apache Spark Intro, Data Scientists, Structured Streaming), Новые элементы (Notebook, Job, Cluster, Table, Library), Ссылки на документацию, Open Recent
Полноэкранный скриншот рабочей области Databricks
Разделитель раздела для руководства по началу работы
Белый текст на синем фоне
Три шага: Зарегистрируйтесь для предварительного просмотра, Привлекайте экспертов Microsoft для семинаров, Узнайте больше на azure.com/databricks
Три шага с иконками слева, фотография деловой встречи справа
Заключительный слайд с вопросами и ответами и контактной информацией: James Serra, Big Data Evangelist — email, Twitter @JamesSerra, LinkedIn, блог на JamesSerra.com
Большой текст Q&A с оранжевым значком вопросительного знака, контактные данные внизу
Распространенные вопросы об этом слайде и основном содержании презентации.
Azure Databricks — это быстрая, простая и удобная платформа аналитики на основе Apache Spark, оптимизированная для Azure и разработанная как SaaS. HDInsight — это управляемый дистрибутив Hadoop (Hortonworks), поддерживающий несколько движков (Spark, Hive, Kafka, HBase). Databricks лучше всего подходит для рабочих нагрузок, ориентированных на Spark, с записными книжками и совместной работой, а HDInsight подходит для клиентов, которым нужны технологии Hadoop, отличные от Spark.
Эта презентация была создана Джеймсом Серра, специалистом по большим данным в Microsoft с более чем 30-летним опытом работы в ИТ, множеством сертификатов Microsoft (MCSE) и автором книги по отчетности SQL Server 2012. Он является бывшим SQL Server MVP и частым докладчиком на конференциях PASS.
Презентация охватывает все основные компоненты Spark: Spark SQL (механизм распределенных запросов), Spark MLlib (машинное обучение), Spark Structured Streaming (обработка в реальном времени) и GraphX (графические вычисления), а также основную архитектуру Spark с RDD, модель Driver/Worker и управление кластерами.
Да, она включает данные эталонного тестирования, показывающие, что Databricks Spark в 5 раз быстрее, чем vanilla Apache Spark на AWS, в 8 раз быстрее, чем Apache Presto на AWS, и в 3 раза быстрее, чем локальный Impala через Cloudera, с конкретными номерами времени выполнения, указанными в публичных исследованиях эталонного тестирования.
Представлены три полные эталонные архитектуры Azure: современное хранилище больших данных (пакетная ETL с SQL DW), расширенная аналитика больших данных (ML с Cosmos DB, обслуживающей веб/мобильные устройства) и аналитика больших данных в реальном времени (потоковая передача Kafka с обработкой Spark).
Да, презентация охватывает архитектуру платформы Azure Databricks, основные артефакты (кластеры, записные книжки, задания, рабочие области, библиотеки), безопасность с интеграцией AAD, DBFS, Spark SQL, MLlib, Streaming и REST API — все ключевые темы для сертификации Azure для разработки данных.
Да, она включает пошаговые скриншоты портала Azure, демонстрирующие: поиск Azure Databricks в Marketplace, создание рабочей области, развертывание ресурсов, запуск рабочей области и навигацию по домашней странице Databricks с избранными записными книжками.
Презентация содержит 53 слайда, охватывающих: обзор среды данных Azure, сравнение решений для больших данных, основы Apache Spark, подробности платформы Azure Databricks, функции рабочей области, три эталонные архитектуры, рекомендации по ценам/продуктам, пошаговое руководство по демонстрации в реальном времени и шаги для начала работы.
Create Your Own Slides
Turn your ideas into professional presentations in seconds with 2slides AI.
Используйте профессиональные дизайны, выберите свой стиль и генерируйте слайды с идеальной отрисовкой текста. На базе Nano Banana—начните создавать свою презентацию прямо сейчас.
Your AI Agent for slides. Save time, shine faster with intelligent presentation creation.
All services online© 2026 2slides. All rights reserved.