
Azure Databricks の概要 — Microsoft Azure 上の Apache Spark を利用したビッグ データ分析
クイックナビゲーション
タグ
スライドを共有
Azure Databricks の概要 — Microsoft Azure 上の Apache Spark を利用したビッグ データ分析
レイアウト、主要コンテンツ、視覚要素を含む各スライドページの詳細ビュー。
タイトルスライド:James Serra(Microsoft、ビッグデータエバンジェリスト)
タイトルは左、都市の夜景の写真は右、ゴールドの矢印がアクセント
James Serraの略歴 — Microsoft ビッグデータエバンジェリスト、IT経験30年、MCSE認定資格、PASSプレゼンター、元SQL Server MVP、著者
箇条書きリスト、ポートレート写真とMVPバッジ付き
トピック:ビッグデータアーキテクチャ、データレイクの必要性、トップダウン vs ボトムアップ、データレイクの定義、Hadoopをデータレイクとして、Modern Data Warehouse、フェデレーションクエリ、クラウドでのソリューション、SMP vs MPP
シンプルな箇条書きリスト
ハイブリッドアーキテクチャ:オンプレミス(建物のアイコン)とクラウド(クラウドのアイコン)の両方が、運用データベース、データウェアハウス、データレイクをサポート。データ型:LOB、CRM、Graph、Image、Social、IoT
2カラムレイアウト、オンプレミスとクラウドの間にハイブリッドの矢印
SQL Server(オンプレミス)↔ ハイブリッド ↔ Azure Data Services。SQL Server:業界リーダー、#1 TPC-H、あらゆるデータに対するT-SQL。Azure:Auroraより70%高速、Redshiftよりグローバルリーチが2倍、No Limits Analytics 99.9% SLA
同じハイブリッドレイアウト、競合メトリクスを強調
Azureビッグデータの章のセクション区切り
青色の背景に白いテキスト
制御性から使いやすさへのスペクトル:Azure Marketplace (IaaS、あらゆるHadoop) → Azure HDInsight (マネージドクラスター) → Azure Databricks (フリクションレスなSpark) → Azure Data Lake Analytics (job-as-a-service)。ストレージ:Azure Data Lake StoreとAzure Storage
制御性 vs 使いやすさの軸を持つマトリックス図
エンドツーエンドのパイプライン:取り込み (Data Factory、Kafka、Event Hub/IoT Hub) → 保存 (Blobs、Data Lake) → 準備とトレーニング (Databricks、HDInsight、ML) → モデル化と提供 (Cosmos DB、SQL Database、SQL DW、Analysis Services) → インテリジェンス (予測アプリ、レポート、ダッシュボード)
Azureサービスアイコン付きの5段階の水平パイプライン
Azure Databricksの詳細なセクション区切り
青色の背景に白いテキスト
スピード、使いやすさ、高度な分析のために構築されたオープンソースエンジン。Hadoopインメモリより100倍高速。1000人以上の貢献者による最大のOSSプロジェクト。拡張性:Scala、Java、Python、Spark SQL、GraphX、Streaming、MLlib
Apache Sparkロゴ付きの箇条書きリスト
高速、簡単、共同作業が可能な Spark ベースの分析が Azure 向けに最適化されています。Databricks の最高の機能 + Microsoft の最高の機能。5 つの主要な機能: Apache Spark 創設者とのコラボレーション、ワンクリックセットアップ、インタラクティブなワークスペース、ネイティブ Azure 統合 (Power BI、SQL DW、Cosmos DB)、エンタープライズグレードのセキュリティ (AD、コンプライアンス、SLA)
数式 (Databricks + Microsoft) と 5 つのアイコン付き機能の見出し
統合フレームワーク: Spark SQL (インタラクティブクエリ)、Spark MLLib (機械学習)、Spark Streaming (ストリーム処理)、GraphX (グラフ計算) — すべて Spark Core Engine 上で Yarn、Mesos、またはスタンドアロンスケジューラを使用
コアエンジンの上に 4 つのモジュールが積み重ねられたアーキテクチャ図
ベンチマーク比較: AWS 上のバニラ Spark より 5 倍高速 (11,674 秒 vs 53,783 秒)、AWS 上の Presto より 8 倍高速 (35.3 秒 vs 293 秒)、Cloudera 経由のオンプレミス Impala より 3 倍高速 (1,149,264 秒 vs 3,331,440 秒)
3 つの水平棒グラフが並んでいる
単一の一貫した API (RDD)、さまざまな処理タイプの組み合わせ、エンジン間のデータ移動を排除。パイプライン: 入力ストリーム → Spark Streaming → Spark ML → Spark SQL → NoSQL DB
左側に箇条書き、右側に垂直パイプライン図
3 つの柱: 生産性の向上 (ワンクリック起動、Power BI、コラボレーション、ネイティブ Azure 統合)、最もコンプライアンスに準拠したクラウド上に構築 (AD セキュリティ、きめ細かいアクセス、コンプライアンス)、制限なく拡張 (大規模なスケール、最速の Spark エンジン)
太字の見出しを持つ 3 列レイアウト
プラットフォーム全体の図:データソース(IoT、Cloud storage、Hadoop、Data warehouses)→ Azure Databricks(コラボレーティブなワークスペース + 本番ジョブとワークフローのデプロイ + 最適化されたランタイムエンジン)→ 出力(MLモデル、BIツール、データエクスポート、Data warehouses)
入力/出力を持つ3層プラットフォーム図
数秒で開始(シングルクリック)、インタラクティブな探索(R、Python、Scala、SQL notebook)、リビジョン履歴によるリアルタイムコラボレーション(GitHub、Bitbucket)、組み込みの可視化(matplotlib、ggplot、D3)、PowerBIダッシュボード
左側に機能の説明、右側にプラットフォームアーキテクチャ図(ワークスペースレイヤーを強調表示)
ジョブスケジューラ、notebookワークフロー(多段階パイプライン)、notebookを耐障害性のあるSparkジョブとして実行、通知と監査ログ、Azure SQL DW、Cosmos DB、Data Lake Store、Blob Storage、Event Hubとのネイティブ統合
左側に機能の説明、右側にプラットフォーム図(ジョブレイヤーを強調表示)
最適化されたI/OパフォーマンスのためのDBIOモジュール、Azure上のフルマネージドプラットフォームにより複雑さを解消、サーバーレスで伸縮自在なクラウドサービス、グローバル規模での大規模な運用
左側に機能の説明、右側にプラットフォーム図(ランタイムレイヤーを強調表示)
5つのコアコンポーネント:Clusters、Libraries、Workspaces、Jobs、Notebooks — すべてが中央のAzure Databricksハブに接続
Azure Databricksの中心と5つの青いボックスを持つハブアンドスポーク図
Driver Program (SparkContext) → Cluster Manager → Worker Nodes (Cache + Task) → Data Sources (HDFS, SQL, NoSQL)。Driverはmain関数を実行、worker nodeはデータの読み書き、RDDとしてキャッシュ、パブリッククラウドのVM上で実行
右側に階層アーキテクチャ図、左側に箇条書き
Azure Active Directory 統合:個別のユーザー管理は不要、AADユーザーはDatabricksで直接作業、委任されたSSO認証、notebook、cluster、job、データに対するAADベースのアクセス制御
左側に箇条書きリスト、右側にAAD認証フロー図
Autoscaling(最小/最大worker数、負荷に応じた自動スケール)とAuto Termination(アイドルタイムアウト、自動シャットダウン)。メリット:ノード数の推測不要、手動調整不要、リソースの無駄なし、使用時のみ料金が発生
左側に説明テキスト、右側にAzure Portalのクラスター作成スクリーンショット
Jobsは、クラスター上で実行するためにSparkアプリケーションコードを送信します。NotebookまたはJARを実行します。作成、管理、監視のための包括的なGUIツール
左側に説明テキスト、右側にカレンダー/時計アイコン
Workspacesは、Notebook、Libraries、Dashboardsを整理および共有します。階層的なフォルダ構造、ユーザーごとのプライベートディレクトリ、安全なコラボレーションのためのきめ細かいアクセス制御
左側に箇条書きリスト、右側に2つのAzure Portalワークスペースのスクリーンショット
Notebooksは、クラスター上で直接Sparkアプリケーションを作成および実行するためのものです。きめ細かいアクセス許可をサポートし、プロトタイピングと反復開発に最適です。コード、データ、視覚化、コメント、メモで構成されます
左側に箇条書きリスト、右側にグラフ付きのnotebookのスクリーンショット
Librariesは、ワークスペース内のPython、R、Java/Scalaライブラリを保持します。インポート後は不変です。Init Scriptsを介してカスタマイズ可能。Library APIを介して管理可能。PyPI、Maven、JAR、R CRANソースをサポート
左側に箇条書きリスト、右側に3つのAzure Portalライブラリ作成スクリーンショット
組み込みの視覚化:Bar、Scatter、Map、Line、Area、Pie、Quantile、Histogram、Box plot、Q-Q plot、Pivot。言語に関係なく、すべてのnotebookがDatabricksの視覚化をサポートします。Matplotlibは画像としてレンダリングされます。US州マップの視覚化を含むPySpark SQLコードの例
左側に箇条書きリスト、右側にPySparkコード+マップの視覚化、下にプロットタイプメニュー
Azure Blob Storage上に階層化された分散ファイルシステム。Azure Storageバケットをマウントし、SSDにローカルにキャッシュし、Python/Scala/CLI/dbutilsで利用可能、クラスター終了後もデータは保持、Sparkクラスターにプリインストール
左側に箇条書きリスト、右側にDBFSアーキテクチャ図
構造化データ用の分散SQLクエリエンジン。外部データベース、ファイル、Hiveテーブルをクエリします。SQLまたはHiveQL。Python、Scala、Javaでのバインディング。組み込みの構造化ストリーミング。CatalystオプティマイザーとTungsten実行を使用
左側に箇条書きリスト、右側にSpark SQLアーキテクチャ図
GUIまたはAPI/Notebooksで定義されたテーブルのコレクションとしてのデータベース。DatabricksはHiveメタストアを使用します。パフォーマンス向上のために、パーティション分割されたテーブルとパーティションプルーニングをサポートします。
左側に箇条書き、右側にAzure Portalのデータベース/テーブルUI
並列化されたMLアルゴリズム: MMLSpark、Spark ML、Deep Learning、SparkR。交差検証によるモデル選択。DataFrameベースのAPI (Spark 2.0以降)。MLlibはプリインストールされています。サードパーティ: H2O、SciKit-learn、XGBoost
左側に箇条書き、右側にSpark MLパイプラインの図
厳密に1回のステートフルストリーム処理のための統合されたストリーミング+バッチAPI。DataFrame APIを備えたSpark SQLで実行されます。増分的で継続的な更新。イベントタイムウィンドウ、ストリーム-バッチ結合、重複排除をサポートします。ソース: Kafka、ファイル (JSON、CSV、Parquet)
左側に箇条書き、右側に2つの図 (非有界テーブル + 増分実行)
Structured Streamingは、HDInsight上のApache Kafkaと統合されています。エンタープライズグレードのストリーミング取り込み。追加のゲートウェイは不要です。KafkaとDatabricksのクラスターは、同じAzure Virtual Network内にある必要があります。
上部にテキスト、下部に統合アーキテクチャ図
グラフおよびグラフ並列計算のためのAPI。ETL、探索的分析、反復的なグラフ計算を統合します。アルゴリズム: PageRank、連結成分、ラベル伝播、SVD++、三角形カウント。ScalaおよびRDD APIのみ
3パネルレイアウト: 機能、アルゴリズムリスト、PageRankベンチマークチャート
REST API上に構築された使いやすいインターフェース。2つのサブCLI:Workspace CLIとDBFS CLI。DBFS APIとWorkspace APIを実装
階層図:Databricks CLI → Workspace CLI + DBFS CLI
7つのAPI:Cluster API(クラスターの作成/編集/削除)、DBFS API、Groups API、Instance Profile API、Job API、Library API、Workspace API(ノートブックのインポート/エクスポート)
左側のファンネル図から右側のAPIテーブルを指す
ユースケースアーキテクチャのセクション区切り
青色の背景に白いテキスト
アーキテクチャ:非構造化データ(ログ、ファイル、メディア)→ Data Factory → Azure Storage → Azure Databricks(Spark)→ Azure SQL Data Warehouse。構造化データ(ビジネスアプリ)→ Data Factory → Polybase → SQL DW → 分析ダッシュボード
2つのデータソースストリームを持つ5段階のパイプライン
アーキテクチャ:非構造化データ → Data Factory → Azure Storage → Azure Databricks(Spark MLlib, SparkR, SparklyR)→ Azure Cosmos DB → Web&モバイルアプリ。構造化データ → Polybase → SQL DW → 分析ダッシュボード
MLに焦点を当てた処理とCosmos DBサービングを備えた5段階のパイプライン
アーキテクチャ: 非構造化データ → Azure HDInsight (Kafka) → Azure Databricks (Spark) ↔ Azure Storage → Polybase → Azure SQL Data Warehouse → 分析ダッシュボード
Kafkaストリーミング取り込みによる5段階パイプライン
価格と比較の章のセクション区切り
青色の背景に白いテキスト
3列比較: Azure HDInsight (Hadoop/HDP、PaaS、Rangerセキュリティ、価格はAWS EMRと比較)、Azure Databricks (Spark、SaaS、ADセキュリティ、価格はAWS上のDatabricksと比較)、サードパーティ製品 (Cloudera/MapR/Hortonworks、IaaS、ベンダー価格)
3列の比較カード
詳細な比較: Azure HDInsight (Hortonworks、ビッグデータエンジン、VNET、Ranger、OMS、Data Factoryオーケストレーション、27リージョン)、Azure Databricks (Sparkファースト、シングルエンジン、AAD OAuth、RBAC、自動スケーリング、サーバーレス、SQL DW統合)、Azure ML (ファーストパーティML、Python/R、実験、モデル管理、IDE統合)
3列の詳細な機能比較
ライブデモのセクション区切り
青色の背景に白いテキスト
Azure Portalのスクリーンショット。Marketplace > データ + 分析のAzure Databricks (プレビュー) サービスページを示しています。統合分析プラットフォームの説明、DatabricksワークスペースUIプレビュー
全幅のAzure Portalスクリーンショット
Azure Portal: ワークスペース名、サブスクリプション、リソースグループ、場所 (米国西部) フィールドを含むAzure Databricksサービスの作成フォーム
全幅のAzure Portal作成フォームのスクリーンショット
VM、App Service、Functions、SQL Databaseのクイックスタートチュートリアルを含む、Databricks Serviceを含むデプロイされたリソースを示すAzure Portalダッシュボード
全幅のAzureダッシュボードのスクリーンショット
Azure Portalリソースの概要ページ。ワークスペースの起動ボタン、管理されたリソースグループの詳細、サブスクリプション情報、およびクイックスタートタイル: ドキュメント、はじめに、データのインポート、ノートブック、管理者ガイド
全幅のリソース詳細ページのスクリーンショット
注目のノートブック (Apache Spark入門、データサイエンティスト、構造化ストリーミング)、新しいアイテム (ノートブック、ジョブ、クラスター、テーブル、ライブラリ)、ドキュメントリンク、最近開いた項目を示すDatabricksワークスペースのホームページ
全幅のDatabricksワークスペースのスクリーンショット
開始ガイダンスのセクション区切り
青色の背景に白いテキスト
3つのステップ:プレビューにサインアップ、Microsoftのエキスパートによるワークショップに参加、azure.com/databricksで詳細をご覧ください
左側にアイコン付きの3つのステップ、右側にビジネスミーティングの写真
連絡先情報付きの最後の質疑応答スライド:James Serra、ビッグデータエバンジェリスト — メール、Twitter @JamesSerra、LinkedIn、JamesSerra.comのブログ
オレンジ色の疑問符アイコン付きの大きなQ&Aテキスト、下部に連絡先の詳細
このスライドと基礎となるプレゼンテーションコンテンツに関する一般的な質問。
Azure Databricks は、Azure 向けに最適化された高速で使いやすく、共同作業が可能な Apache Spark ベースの分析プラットフォームであり、SaaS エクスペリエンスとして設計されています。HDInsight は、複数のエンジン (Spark、Hive、Kafka、HBase) をサポートするマネージド Hadoop (Hortonworks) ディストリビューションです。Databricks は、ノートブックとコラボレーションを中心とした Spark に特化したワークロードに最適ですが、HDInsight は、Spark 以外の Hadoop テクノロジーを必要とするお客様に適しています。
このプレゼンテーションは、30 年以上の IT 経験、複数の Microsoft 認定資格 (MCSE) を持ち、SQL Server 2012 レポートに関する書籍の著者である Microsoft のビッグ データ エバンジェリスト、James Serra によって作成されました。彼は、元 SQL Server MVP であり、PASS カンファレンスの頻繁な講演者です。
このプレゼンテーションでは、主要な Spark コンポーネント (Spark SQL (分散クエリ エンジン)、Spark MLlib (機械学習)、Spark Structured Streaming (リアルタイム処理)、GraphX (グラフ計算)) に加えて、RDD、Driver/Worker モデル、およびクラスター管理を備えたコア Spark アーキテクチャについて説明します。
はい、Databricks Spark が AWS 上のバニラ Apache Spark より 5 倍高速、AWS 上の Apache Presto より 8 倍高速、Cloudera 経由のオンプレミス Impala より 3 倍高速であることを示すベンチマーク データが含まれており、公開されているベンチマーク調査からの具体的なランタイム数値が引用されています。
3 つの完全な Azure リファレンス アーキテクチャが提示されています: 最新のビッグ データ ウェアハウス (SQL DW を使用したバッチ ETL)、ビッグ データに関する高度な分析 (Web/モバイルにサービスを提供する Cosmos DB を使用した ML)、およびビッグ データに関するリアルタイム分析 (Spark 処理を使用した Kafka ストリーミング)。
はい、このプレゼンテーションでは、Azure Databricks プラットフォーム アーキテクチャ、コア アーティファクト (クラスター、ノートブック、ジョブ、ワークスペース、ライブラリ)、AAD 統合によるセキュリティ、DBFS、Spark SQL、MLlib、Streaming、および REST API (Azure データ エンジニアリング認定資格のすべての主要トピック) について説明します。
はい、Marketplace での Azure Databricks の検索、ワークスペースの作成、リソースのデプロイ、ワークスペースの起動、および注目のノートブックを使用した Databricks ホーム ページのナビゲーションを示すステップバイステップの Azure Portal スクリーンショットが含まれています。
このプレゼンテーションには、Azure データ資産の概要、ビッグ データ ソリューションの比較、Apache Spark の基礎、Azure Databricks プラットフォームの詳細、ワークスペースの機能、3 つのリファレンス アーキテクチャ、価格/製品ガイダンス、ライブ デモ ウォークスルー、および開始手順を網羅した 53 枚のスライドが含まれています。
Create Your Own Slides
Turn your ideas into professional presentations in seconds with 2slides AI.
プロフェッショナルなデザインを参照し、スタイルを選択し、完璧なテキストレンダリングでスライドを生成。Nano Banana搭載—今すぐプレゼンテーションの作成を始めましょう。
Your AI Agent for slides. Save time, shine faster with intelligent presentation creation.
All services online© 2026 2slides. All rights reserved.