2Slides Logo
Preview

รู้จัก Azure Databricks — การวิเคราะห์ Big Data ด้วย Apache Spark

53 สไลด์

Introduction to Azure Databricks — Big Data Analytics Powered by Apache Spark บน Microsoft Azure

8 ถูกใจ
0 ดาวน์โหลด

การนำทางด่วน

แท็ก

Azure Databricks
Apache Spark
Microsoft Azure
Big data
Cloud analytics

แชร์สไลด์

คำอธิบาย

หัวข้อหลัก

Introduction to Azure Databricks — Big Data Analytics Powered by Apache Spark บน Microsoft Azure

ประโยชน์หลัก

  • บทนำที่ครอบคลุม Azure Databricks จำนวน 53 สไลด์ ตั้งแต่พื้นฐานไปจนถึงการสาธิตเชิงปฏิบัติ
  • ครอบคลุมระบบนิเวศ Azure Big Data ทั้งหมด: SQL Server, Azure Data Services, HDInsight, Data Lake Analytics และการวางตำแหน่ง Databricks
  • เจาะลึกสถาปัตยกรรม Apache Spark, Spark SQL, MLlib, Structured Streaming และส่วนประกอบ GraphX
  • การแนะนำพื้นที่ทำงาน Azure Databricks เชิงปฏิบัติ: คลัสเตอร์, Notebook, งาน, พื้นที่ทำงาน, ไลบรารี, DBFS และการแสดงภาพ
  • รวมถึงสถาปัตยกรรมกรณีการใช้งานจริง: Modern Big Data Warehouse, Advanced Analytics และไปป์ไลน์ Real-time Analytics

กลุ่มเป้าหมาย

  • วิศวกรและสถาปนิกข้อมูลที่ประเมินโซลูชัน Azure Big Data
  • ผู้เชี่ยวชาญด้านไอทีที่วางแผนการย้ายข้อมูลจาก Hadoop ภายในองค์กรไปยัง Azure Cloud
  • นักวิทยาศาสตร์ข้อมูลที่สนใจการวิเคราะห์บน Spark บน Azure
  • ผู้มีอำนาจตัดสินใจทางเทคนิคที่เปรียบเทียบ Azure HDInsight, Azure Databricks และ Azure ML
  • ผู้เชี่ยวชาญด้านเทคโนโลยี Microsoft ที่ต้องการเตรียมตัวสำหรับการรับรอง Azure Databricks

กรณีการใช้งาน

  • งานนำเสนอทางเทคนิคเพื่อแนะนำ Azure Databricks ให้กับลูกค้า Microsoft
  • เวิร์กช็อปสถาปัตยกรรม Azure เปรียบเทียบโซลูชัน Big Data
  • ช่วงฝึกอบรมภายในเกี่ยวกับความสามารถของแพลตฟอร์ม Azure Databricks
  • การบรรยายในการประชุมเกี่ยวกับ Apache Spark ในระบบนิเวศ Azure
  • การปฐมนิเทศสมาชิกใหม่ในทีมเกี่ยวกับบริการ Azure Big Data

ข้อเสนอมูลค่าเฉพาะ

  • นำเสนอโดย James Serra ผู้เผยแพร่ Big Data ของ Microsoft ที่มีประสบการณ์ด้านไอทีมากกว่า 30 ปี
  • วางตำแหน่ง Azure Databricks ภายในกลุ่มข้อมูล Microsoft ที่กว้างขึ้น (SQL Server + Azure Hybrid)
  • รวมถึงข้อมูลเปรียบเทียบ: เร็วกว่า Spark ทั่วไป 5 เท่า, เร็วกว่า Presto 8 เท่า, เร็วกว่า Impala 3 เท่า
  • ภาพหน้าจอการสาธิต Azure Portal แบบทีละขั้นตอนสำหรับการสร้างและการปรับใช้พื้นที่ทำงาน
  • สถาปัตยกรรมอ้างอิงที่สมบูรณ์สามแบบสำหรับรูปแบบ Big Data ทั่วไปบน Azure

หน้าสไลด์ (53)

มุมมองรายละเอียดของแต่ละหน้าสไลด์ รวมถึงlayout เนื้อหาหลักและองค์ประกอบภาพ

หน้า 1
title slide

Introduction to Azure Databricks

เนื้อหา

สไลด์ชื่อเรื่องโดย James Serra, Big Data Evangelist ที่ Microsoft

โครงสร้าง Layout

ชื่อเรื่องด้านซ้ายพร้อมรูปถ่ายเมืองตอนกลางคืนด้านขวา, เน้นด้วยลูกศรสีทอง

องค์ประกอบภาพหลัก

  • ภาพเมืองตอนกลางคืนที่มีแสงไฟเป็นทางยาว
  • องค์ประกอบการออกแบบลูกศรสีทอง
  • พื้นหลังสีน้ำเงินเข้ม
หน้า 2
speaker bio

เกี่ยวกับตัวฉัน

เนื้อหา

ประวัติ James Serra — Microsoft Big Data Evangelist, ประสบการณ์ด้าน IT 30 ปี, ใบรับรอง MCSE, วิทยากร PASS, อดีต SQL Server MVP, ผู้เขียน

โครงสร้าง Layout

รายการ Bullet พร้อมรูปถ่ายบุคคลและป้าย MVP

องค์ประกอบภาพหลัก

  • รูปถ่ายบุคคล
  • ป้าย Microsoft MVP
หน้า 3
agenda

Agenda

เนื้อหา

หัวข้อ: Big Data Architectures, ทำไมต้อง Data Lakes, Top-down vs Bottom-up, นิยาม Data Lake, Hadoop ในฐานะ Data Lake, Modern Data Warehouse, Federated Querying, โซลูชันบนคลาวด์, SMP vs MPP

โครงสร้าง Layout

รายการ Bullet แบบง่าย

องค์ประกอบภาพหลัก

  • รายการข้อความสีเทา
หน้า 4
architecture diagram

The Modern Data Estate

เนื้อหา

สถาปัตยกรรม Hybrid: on-premises (ไอคอนอาคาร) และคลาวด์ (ไอคอนคลาวด์) รองรับทั้งฐานข้อมูลเชิงปฏิบัติการ, Data Warehouse และ Data Lake ประเภทข้อมูล: LOB, CRM, Graph, Image, Social, IoT

โครงสร้าง Layout

สองคอลัมน์พร้อมลูกศร Hybrid ระหว่าง On-prem และคลาวด์

องค์ประกอบภาพหลัก

  • ไอคอนอาคารและคลาวด์
  • ไอคอนประเภทข้อมูลหกประเภท
  • ลูกศรสองทิศทาง Hybrid
หน้า 5
product positioning

The Microsoft Offering

เนื้อหา

SQL Server (on-prem) ↔ Hybrid ↔ Azure Data Services SQL Server: ผู้นำอุตสาหกรรม, #1 TPC-H, T-SQL เหนือข้อมูลใดๆ Azure: เร็วกว่า Aurora 70%, เข้าถึงทั่วโลกมากกว่า Redshift 2 เท่า, No Limits Analytics 99.9% SLA

โครงสร้าง Layout

Layout Hybrid แบบเดิมโดยเน้นเมตริกการแข่งขัน

องค์ประกอบภาพหลัก

  • ไอคอนอาคาร SQL Server
  • ไอคอนคลาวด์ Azure
  • ข้อความเมตริกการแข่งขันสีน้ำเงิน
หน้า 6
section divider

Big Data & Advanced Analytics ใน Azure

เนื้อหา

ตัวแบ่งส่วนสำหรับบท Azure Big Data

โครงสร้าง Layout

ข้อความสีขาวบนพื้นหลังสีน้ำเงิน

องค์ประกอบภาพหลัก

  • พื้นหลังสีน้ำเงินของ Microsoft
หน้า 7
comparison

รู้จักกับโซลูชัน Big Data ต่างๆ

เนื้อหา

Spectrum จากการควบคุมไปสู่ความง่ายในการใช้งาน: Azure Marketplace (IaaS, Hadoop ใดๆ) → Azure HDInsight (คลัสเตอร์ที่มีการจัดการ) → Azure Databricks (Spark ที่ราบรื่น) → Azure Data Lake Analytics (job-as-a-service) ที่เก็บข้อมูล: Azure Data Lake Store และ Azure Storage

โครงสร้าง Layout

ไดอะแกรม Matrix พร้อมแกนควบคุม vs ความง่ายในการใช้งาน

องค์ประกอบภาพหลัก

  • กล่องผลิตภัณฑ์สี่กล่องพร้อมโลโก้
  • สเปกตรัมควบคุม ↔ ความง่ายในการใช้งาน
  • เลเยอร์ที่เก็บข้อมูลที่ด้านล่าง
หน้า 8
architecture diagram

Big Data & Advanced Analytics โดยสังเขป

เนื้อหา

ไปป์ไลน์แบบ End-to-end: Ingest (Data Factory, Kafka, Event Hub/IoT Hub) → Store (Blobs, Data Lake) → Prep & Train (Databricks, HDInsight, ML) → Model & Serve (Cosmos DB, SQL Database, SQL DW, Analysis Services) → Intelligence (แอป Predictive, รายงาน, แดชบอร์ด)

โครงสร้าง Layout

ไปป์ไลน์แนวนอนห้าเฟสพร้อมไอคอนบริการ Azure

องค์ประกอบภาพหลัก

  • ไอคอนบริการ Azure
  • ลูกศรการไหลแบบประ
  • ประเภทแหล่งข้อมูลสามประเภท: แอปธุรกิจ, แอปที่กำหนดเอง, เซ็นเซอร์
หน้า 9
section divider

Azure Databricks ขับเคลื่อนโดย Apache Spark

เนื้อหา

ตัวแบ่งส่วนสำหรับ Azure Databricks deep dive

โครงสร้าง Layout

ข้อความสีขาวบนพื้นหลังสีน้ำเงิน

องค์ประกอบภาพหลัก

  • พื้นหลังสีน้ำเงินของ Microsoft
หน้า 10
technology overview

Why Spark?

เนื้อหา

เอ็นจินโอเพนซอร์สที่สร้างขึ้นเพื่อความเร็ว, ความง่ายในการใช้งาน, การวิเคราะห์ที่ซับซ้อน เร็วกว่า Hadoop ในหน่วยความจำ 100 เท่า โครงการ OSS ที่ใหญ่ที่สุดที่มีผู้สนับสนุนมากกว่า 1000 ราย ขยายได้: Scala, Java, Python, Spark SQL, GraphX, Streaming, MLlib

โครงสร้าง Layout

รายการ Bullet พร้อมโลโก้ Apache Spark

องค์ประกอบภาพหลัก

  • โลโก้ Apache Spark (ดาวสีส้ม)
  • วลีสำคัญตัวหนา
หน้า 11
product overview

What is Azure Databricks?

เนื้อหา

การวิเคราะห์ที่รวดเร็ว ง่าย และทำงานร่วมกันได้บน Spark ซึ่งปรับให้เหมาะสมสำหรับ Azure ที่สุดของ Databricks + ที่สุดของ Microsoft ห้าคุณสมบัติหลัก: ความร่วมมือของผู้ก่อตั้ง Apache Spark, การตั้งค่าด้วยคลิกเดียว, พื้นที่ทำงานแบบอินเทอร์แอกทีฟ, การผสานรวม Azure แบบเนทีฟ (Power BI, SQL DW, Cosmos DB), การรักษาความปลอดภัยระดับองค์กร (AD, compliance, SLAs)

โครงสร้าง Layout

ชื่อเรื่องพร้อมสูตร (Databricks + Microsoft) และคุณสมบัติห้าประการที่มีป้ายกำกับไอคอน

องค์ประกอบภาพหลัก

  • โลโก้ Databricks + โลโก้ Microsoft
  • ไอคอนคุณสมบัติห้าประการ
  • ข้อความเน้นสีน้ำเงิน
หน้า 12
architecture diagram

Apache Spark Architecture

เนื้อหา

เฟรมเวิร์กแบบรวม: Spark SQL (Interactive Queries), Spark MLLib (Machine Learning), Spark Streaming (Stream Processing), GraphX (Graph Computation) — ทั้งหมดนี้อยู่บน Spark Core Engine ที่มี Yarn, Mesos หรือ Standalone Scheduler

โครงสร้าง Layout

ไดอะแกรมสถาปัตยกรรมแบบเรียงซ้อนกันโดยมีสี่โมดูลอยู่บนสุดของเอ็นจินหลัก

องค์ประกอบภาพหลัก

  • กล่องโมดูลสีน้ำเงินสี่กล่อง
  • เลเยอร์ Spark Core Engine
  • ตัวเลือก Scheduler สามตัว
  • รวม: Batch, SQL, Real-time, ML, Deep Learning, Graph
หน้า 13
data visualization

Databricks Spark รวดเร็ว

เนื้อหา

การเปรียบเทียบเกณฑ์มาตรฐาน: เร็วกว่า vanilla Spark บน AWS 5 เท่า (11,674 เทียบกับ 53,783 วินาที), เร็วกว่า Presto บน AWS 8 เท่า (35.3 เทียบกับ 293 วินาที), เร็วกว่า Impala ในองค์กรผ่าน Cloudera 3 เท่า (1,149,264 เทียบกับ 3,331,440 วินาที)

โครงสร้าง Layout

แผนภูมิแท่งแนวนอนสามแผนภูมิเคียงข้างกัน

องค์ประกอบภาพหลัก

  • แผนภูมิแท่งเกณฑ์มาตรฐานสามแผนภูมิ
  • แท่ง Databricks สีแดง เทียบกับ แท่งคู่แข่งสีเทา
  • ลิงก์อ้างอิงแหล่งที่มา
หน้า 14
concept explanation

ข้อดีของแพลตฟอร์มแบบรวม

เนื้อหา

API ที่สอดคล้องกันเพียงตัวเดียว (RDDs), การผสมและจับคู่ประเภทการประมวลผล, ขจัดความจำเป็นในการเคลื่อนย้ายข้อมูลระหว่างเอ็นจิน ไปป์ไลน์: Input Streams → Spark Streaming → Spark ML → Spark SQL → NoSQL DB

โครงสร้าง Layout

รายการสัญลักษณ์แสดงหัวข้อย่อยทางด้านซ้าย, ไดอะแกรมไปป์ไลน์แนวตั้งทางด้านขวา

องค์ประกอบภาพหลัก

  • ไดอะแกรมการไหลของไปป์ไลน์สีน้ำเงินแนวตั้ง
  • กล่องสีน้ำเงินสำหรับส่วนประกอบ Spark แต่ละตัว
หน้า 15
value proposition

Differentiated experience on Azure

เนื้อหา

สามเสาหลัก: เพิ่มประสิทธิภาพการทำงาน (การเปิดใช้งานด้วยคลิกเดียว, Power BI, การทำงานร่วมกัน, การผสานรวม Azure แบบเนทีฟ), สร้างบน Cloud ที่เป็นไปตามข้อกำหนดมากที่สุด (การรักษาความปลอดภัย AD, การเข้าถึงแบบละเอียด, compliance), ปรับขนาดได้ไม่จำกัด (ขนาดใหญ่, เอ็นจิน Spark ที่เร็วที่สุด)

โครงสร้าง Layout

เลย์เอาต์สามคอลัมน์พร้อมส่วนหัวตัวหนา

องค์ประกอบภาพหลัก

  • ส่วนหัวคอลัมน์สีน้ำเงินสามส่วน
  • วลีสำคัญตัวหนา
หน้า 16
architecture diagram

Azure Databricks Platform Architecture

เนื้อหา

แผนภาพแพลตฟอร์มแบบเต็ม: แหล่งข้อมูล (IoT, Cloud storage, Hadoop, Data warehouses) → Azure Databricks (พื้นที่ทำงานสำหรับการทำงานร่วมกัน + การปรับใช้ Production Jobs & Workflows + Optimized Runtime Engine) → ผลลัพธ์ (ML models, BI tools, Data exports, Data warehouses)

โครงสร้าง Layout

แผนภาพแพลตฟอร์มสามชั้นพร้อมอินพุต/เอาต์พุต

องค์ประกอบภาพหลัก

  • แพลตฟอร์ม Azure Databricks สามระดับ
  • ไอคอนสาม Persona
  • โลโก้ Spark ในชั้น Runtime
  • ไอคอนแหล่งข้อมูลอินพุต/เอาต์พุต
หน้า 17
feature detail

Collaborative Workspace

เนื้อหา

เริ่มต้นได้ในไม่กี่วินาที (คลิกเดียว), การสำรวจแบบอินเทอร์แอคทีฟ (R, Python, Scala, SQL notebooks), การทำงานร่วมกันแบบเรียลไทม์พร้อมประวัติการแก้ไข (GitHub, Bitbucket), การแสดงภาพในตัว (matplotlib, ggplot, D3), แดชบอร์ด PowerBI

โครงสร้าง Layout

คำอธิบายคุณสมบัติทางด้านซ้าย, แผนภาพสถาปัตยกรรมแพลตฟอร์มทางด้านขวา (เน้นชั้น Workspace)

องค์ประกอบภาพหลัก

  • แผนภาพแพลตฟอร์มโดยเน้น Collaborative Workspace
  • หัวข้อที่เน้นตัวหนา
หน้า 18
feature detail

Deploy Production Jobs & Workflows

เนื้อหา

Jobs scheduler, notebook workflows (multi-stage pipelines), เรียกใช้ notebooks เป็น Spark jobs ที่ยืดหยุ่น, การแจ้งเตือนและบันทึกการตรวจสอบ, การผสานรวมกับ Azure SQL DW, Cosmos DB, Data Lake Store, Blob Storage, Event Hub

โครงสร้าง Layout

คำอธิบายคุณสมบัติทางด้านซ้าย, แผนภาพแพลตฟอร์มทางด้านขวา (เน้นชั้น Jobs)

องค์ประกอบภาพหลัก

  • แผนภาพแพลตฟอร์มโดยเน้น Jobs & Workflows
หน้า 19
feature detail

Optimized Databricks Runtime Engine

เนื้อหา

DBIO module สำหรับประสิทธิภาพ I/O ที่ปรับให้เหมาะสม, แพลตฟอร์มที่มีการจัดการอย่างเต็มรูปแบบบน Azure ช่วยลดความซับซ้อน, บริการคลาวด์แบบ Serverless และยืดหยุ่น, ดำเนินงานในขนาดใหญ่ทั่วโลก

โครงสร้าง Layout

คำอธิบายคุณสมบัติทางด้านซ้าย, แผนภาพแพลตฟอร์มทางด้านขวา (เน้นชั้น Runtime)

องค์ประกอบภาพหลัก

  • แผนภาพแพลตฟอร์มโดยเน้น Runtime Engine
หน้า 20
concept diagram

Azure Databricks Core Artifacts

เนื้อหา

ห้าองค์ประกอบหลัก: Clusters, Libraries, Workspaces, Jobs, Notebooks — ทั้งหมดเชื่อมต่อกับศูนย์กลาง Azure Databricks

โครงสร้าง Layout

แผนภาพ Hub-and-spoke โดยมีศูนย์กลาง Azure Databricks และกล่องสีน้ำเงินห้ากล่อง

องค์ประกอบภาพหลัก

  • วงรี Hub สีส้ม
  • กล่องส่วนประกอบสีน้ำเงินห้ากล่องพร้อมไอคอน
  • เส้นเชื่อมต่อ
หน้า 21
architecture diagram

General Spark Cluster Architecture

เนื้อหา

Driver Program (SparkContext) → Cluster Manager → Worker Nodes (Cache + Task) → Data Sources (HDFS, SQL, NoSQL). Driver รันฟังก์ชันหลัก, worker nodes อ่าน/เขียนข้อมูล, cache เป็น RDDs, execute บน VMs ใน public clouds

โครงสร้าง Layout

แผนภาพสถาปัตยกรรมแบบลำดับชั้นทางด้านขวา, bullet points ทางด้านซ้าย

องค์ประกอบภาพหลัก

  • ลำดับชั้น Driver → Manager → Workers
  • กล่อง Cache และ Task ใน worker nodes
  • เลเยอร์ Data Sources ที่ด้านล่าง
หน้า 22
security feature

Azure Databricks Integration with AAD

เนื้อหา

Azure Active Directory integration: ไม่มีการจัดการผู้ใช้แยกต่างหาก, ผู้ใช้ AAD ทำงานได้โดยตรงใน Databricks, delegated SSO authentication, AAD-based access control สำหรับ notebooks, clusters, jobs, และ data

โครงสร้าง Layout

Bullet list ทางด้านซ้าย, แผนภาพ AAD authentication flow ทางด้านขวา

องค์ประกอบภาพหลัก

  • Azure Databricks → Access Control → Azure AD → Authentication flow
  • ไอคอน user persona สามแบบ
  • โลโก้ Azure AD รูปเพชร
หน้า 23
product demo

Clusters: Auto Scaling and Auto Termination

เนื้อหา

Autoscaling (min/max workers, automatic scale on load) และ Auto Termination (idle timeout, auto shutdown). ข้อดี: ไม่ต้องคาดเดาจำนวน node, ไม่ต้องปรับแต่งด้วยตนเอง, ไม่มีการสิ้นเปลืองทรัพยากร, จ่ายเฉพาะเมื่อใช้งาน

โครงสร้าง Layout

คำอธิบายทางด้านซ้าย, ภาพหน้าจอ Azure Portal Create Cluster ทางด้านขวา

องค์ประกอบภาพหลัก

  • Azure Portal cluster creation UI
  • Autoscaling และ Auto Termination settings ไฮไลท์เป็นสีแดง
หน้า 24
feature overview

Jobs

เนื้อหา

Jobs ส่ง Spark application code เพื่อ execute บน clusters. Execute Notebooks หรือ JARs. เครื่องมือ GUI ที่ครอบคลุมสำหรับการสร้าง, การจัดการ, และการตรวจสอบ

โครงสร้าง Layout

คำอธิบายทางด้านซ้าย, ไอคอนปฏิทิน/นาฬิกาทางด้านขวา

องค์ประกอบภาพหลัก

  • ปฏิทินสีเทาพร้อมไอคอนนาฬิกา
หน้า 25
product demo

Workspaces

เนื้อหา

Workspaces จัดระเบียบและแชร์ Notebooks, Libraries, และ Dashboards. โครงสร้างโฟลเดอร์แบบลำดับชั้น, private directories ต่อผู้ใช้, fine-grained access control สำหรับการทำงานร่วมกันอย่างปลอดภัย

โครงสร้าง Layout

Bullet list ทางด้านซ้าย, ภาพหน้าจอ Azure Portal workspace สองภาพทางด้านขวา

องค์ประกอบภาพหลัก

  • ภาพหน้าจอ Workspace folder browser
  • เมนู Import/Export/Permissions
หน้า 26
product demo

Azure Databricks Notebooks Overview

เนื้อหา

Notebooks สำหรับการเขียนและรัน Spark applications โดยตรงบน clusters. รองรับ fine-grained permissions, เหมาะสำหรับการสร้างต้นแบบและการพัฒนาแบบ iterative. ประกอบด้วย code, data, visualizations, comments, และ notes

โครงสร้าง Layout

Bullet list ทางด้านซ้าย, ภาพหน้าจอ notebook พร้อมแผนภูมิทางด้านขวา

องค์ประกอบภาพหลัก

  • Notebook พร้อม bar chart visualization
  • แผนภูมิ Population vs Price
  • แถบด้านข้าง Comment thread
หน้า 27
product demo

Libraries Overview

เนื้อหา

Libraries เก็บ Python, R, Java/Scala libraries ภายใน workspaces. Immutable หลังจาก import. ปรับแต่งได้ผ่าน Init Scripts. จัดการได้ผ่าน Library API. รองรับแหล่งที่มา PyPI, Maven, JAR, R CRAN

โครงสร้าง Layout

Bullet list ทางด้านซ้าย, ภาพหน้าจอ Azure Portal Create Library สามภาพทางด้านขวา

องค์ประกอบภาพหลัก

  • ภาพหน้าจอ UI การสร้าง library สามภาพ
  • ตัวเลือกแหล่งที่มา PyPI, JAR, Maven, R Library
หน้า 28
product demo

Visualization

เนื้อหา

Built-in visualization: Bar, Scatter, Map, Line, Area, Pie, Quantile, Histogram, Box plot, Q-Q plot, Pivot. Notebooks ทั้งหมดโดยไม่คำนึงถึงภาษาที่รองรับ Databricks visualizations. Matplotlib renders เป็น images. ตัวอย่าง PySpark SQL code พร้อม US state map visualization

โครงสร้าง Layout

Bullet list ทางด้านซ้าย, PySpark code + map visualization ทางด้านขวา, เมนู plot type ด้านล่าง

องค์ประกอบภาพหลัก

  • US choropleth map visualization
  • PySpark code snippet
  • เมนูการเลือก Plot type
หน้า 29
architecture diagram

Databricks File System (DBFS)

เนื้อหา

Distributed file system layered over Azure Blob Storage. Mount Azure Storage buckets, cache locally บน SSD, available ใน Python/Scala/CLI/dbutils, data ยังคงอยู่หลังจากการ termination ของ cluster, ติดตั้งไว้ล่วงหน้าบน Spark clusters

โครงสร้าง Layout

Bullet list ทางด้านซ้าย, แผนภาพสถาปัตยกรรม DBFS ทางด้านขวา

องค์ประกอบภาพหลัก

  • แผนภาพโครงสร้าง DBFS tree
  • จุดเข้าใช้งาน Python/Scala/CLI/dbutils
  • Azure Blob Storage ที่ด้านล่าง
  • ตัวเชื่อมต่อ db.fs.mount()
หน้า 30
technology overview

Spark SQL Overview

เนื้อหา

Distributed SQL query engine สำหรับ structured data. Query external databases, files, Hive tables. SQL หรือ HiveQL. Bindings ใน Python, Scala, Java. Built-in structured streaming. ใช้ Catalyst optimizer และ Tungsten execution

โครงสร้าง Layout

Bullet list ทางด้านซ้าย, แผนภาพสถาปัตยกรรม Spark SQL ทางด้านขวา

องค์ประกอบภาพหลัก

  • แผนภาพสถาปัตยกรรมแบบ layered ของ Spark SQL
  • โลโก้ตัวเชื่อมต่อแหล่งข้อมูล: Parquet, JSON, Hive, JDBC, CSV, Cassandra, MongoDB, MySQL, etc.
หน้า 31
product demo

ภาพรวมของฐานข้อมูลและตาราง

เนื้อหา

ฐานข้อมูลเป็นชุดของตาราง กำหนดผ่าน GUI หรือ APIs/Notebooks Databricks ใช้ Hive metastore รองรับตารางที่แบ่งพาร์ติชันและการตัดพาร์ติชันเพื่อประสิทธิภาพ

โครงสร้าง Layout

รายการ Bullet ทางด้านซ้าย, Azure Portal databases/tables UI ทางด้านขวา

องค์ประกอบภาพหลัก

  • Database และ table browser UI
  • ตัวอย่างตาราง Movies/ratings/users
หน้า 32
technology overview

ภาพรวมของ Spark Machine Learning (ML)

เนื้อหา

Parallelized ML algorithms: MMLSpark, Spark ML, Deep Learning, SparkR การเลือกโมเดลผ่าน cross-validation DataFrame-based API (Spark 2.0+) MLlib ติดตั้งไว้ล่วงหน้า Third party: H2O, SciKit-learn, XGBoost

โครงสร้าง Layout

รายการ Bullet ทางด้านซ้าย, ไดอะแกรม Spark ML pipeline ทางด้านขวา

องค์ประกอบภาพหลัก

  • โลโก้ Apache Spark ML
  • ML pipeline flow: Data Ingestion → Cleaning → Training → Model Selection → Validation → Deployment
หน้า 33
technology overview

ภาพรวมของ Spark Structured Streaming

เนื้อหา

Unified streaming + batch API สำหรับการประมวลผลสตรีมแบบ stateful ที่ exactly-once ทำงานบน Spark SQL ด้วย DataFrame API การอัปเดตแบบ incremental และต่อเนื่อง รองรับ event-time windows, stream-to-batch joins, deduplication แหล่งที่มา: Kafka, file (JSON, CSV, Parquet)

โครงสร้าง Layout

รายการ Bullet ทางด้านซ้าย, สองไดอะแกรมทางด้านขวา (unbounded table + incremental execution)

องค์ประกอบภาพหลัก

  • ไดอะแกรม Data stream → Unbounded Table
  • Incremental execution flow with triggers
หน้า 34
integration detail

การผสานรวม Apache Kafka สำหรับ HDInsight

เนื้อหา

Structured Streaming ทำงานร่วมกับ Apache Kafka บน HDInsight การนำเข้าสตรีมระดับองค์กร ไม่จำเป็นต้องมี gateways เพิ่มเติม คลัสเตอร์ Kafka และ Databricks ต้องอยู่ใน Azure Virtual Network เดียวกัน

โครงสร้าง Layout

ข้อความด้านบน, ไดอะแกรมสถาปัตยกรรมการทำงานร่วมกันด้านล่าง

องค์ประกอบภาพหลัก

  • ไดอะแกรม Kafka ↔ Spark Structured Streaming
  • ขอบเขต Azure Virtual Network
  • โลโก้ Kafka และ Spark
หน้า 35
technology overview

ภาพรวมของ Spark GraphX

เนื้อหา

APIs สำหรับ graph และ graph-parallel computation รวม ETL, exploratory analysis และ iterative graph computation เข้าด้วยกัน อัลกอริทึม: PageRank, Connected Components, Label Propagation, SVD++, Triangle Count Scala และ RDD APIs เท่านั้น

โครงสร้าง Layout

เลย์เอาต์สามแผง: คุณสมบัติ, รายการอัลกอริทึม, แผนภูมิ PageRank benchmark

องค์ประกอบภาพหลัก

  • กล่องรายการอัลกอริทึม
  • แผนภูมิแท่ง PageRank benchmark (Twitter + UK-Graph)
  • การเปรียบเทียบ GraphX กับระบบคู่แข่ง
หน้า 36
feature overview

Databricks CLI

เนื้อหา

ส่วนติดต่อผู้ใช้ที่ใช้งานง่าย สร้างขึ้นบน REST API สอง sub-CLI: Workspace CLI และ DBFS CLI ใช้ DBFS API และ Workspace API

โครงสร้าง Layout

แผนภาพลำดับชั้น: Databricks CLI → Workspace CLI + DBFS CLI

องค์ประกอบภาพหลัก

  • กล่องสีสามกล่อง (สีน้ำเงินเข้ม, สีม่วง, สีเขียว)
  • โครงสร้างแผนผังลำดับชั้น
หน้า 37
feature overview

Databricks REST API

เนื้อหา

เจ็ด APIs: Cluster API (สร้าง/แก้ไข/ลบ clusters), DBFS API, Groups API, Instance Profile API, Job API, Library API, Workspace API (นำเข้า/ส่งออก notebooks)

โครงสร้าง Layout

แผนภาพกรวยทางด้านซ้ายชี้ไปที่ตาราง API ทางด้านขวา

องค์ประกอบภาพหลัก

  • ไอคอนกรวยสีน้ำเงิน
  • ตารางอ้างอิง API เจ็ดแถว
หน้า 38
section divider

กรณีการใช้งาน

เนื้อหา

ตัวแบ่งส่วนสำหรับสถาปัตยกรรมกรณีการใช้งาน

โครงสร้าง Layout

ข้อความสีขาวบนพื้นหลังสีน้ำเงิน

องค์ประกอบภาพหลัก

  • พื้นหลังสีน้ำเงินของ Microsoft
หน้า 39
reference architecture

Modern Big Data Warehouse

เนื้อหา

สถาปัตยกรรม: ข้อมูลที่ไม่มีโครงสร้าง (logs, files, media) → Data Factory → Azure Storage → Azure Databricks (Spark) → Azure SQL Data Warehouse ข้อมูลที่มีโครงสร้าง (business apps) → Data Factory → Polybase → SQL DW → Analytical dashboards

โครงสร้าง Layout

ไปป์ไลน์ห้าเฟสที่มีสตรีมแหล่งข้อมูลสองสตรีม

องค์ประกอบภาพหลัก

  • ไอคอนบริการ Azure
  • ไปป์ไลน์แบบสองสตรีม
  • ตัวเชื่อมต่อ Polybase
หน้า 40
reference architecture

Advanced Analytics บน Big Data

เนื้อหา

สถาปัตยกรรม: ข้อมูลที่ไม่มีโครงสร้าง → Data Factory → Azure Storage → Azure Databricks (Spark MLlib, SparkR, SparklyR) → Azure Cosmos DB → Web & mobile apps ข้อมูลที่มีโครงสร้าง → Polybase → SQL DW → Analytical dashboards

โครงสร้าง Layout

ไปป์ไลน์ห้าเฟสที่มีการประมวลผลที่เน้น ML และการให้บริการ Cosmos DB

องค์ประกอบภาพหลัก

  • Azure Cosmos DB สำหรับการให้บริการโมเดล
  • รายการ ML libraries
  • เอาต์พุต Web & mobile
หน้า 41
reference architecture

Real-time analytics บน Big Data

เนื้อหา

สถาปัตยกรรม: ข้อมูลที่ไม่มีโครงสร้าง → Azure HDInsight (Kafka) → Azure Databricks (Spark) ↔ Azure Storage → Polybase → Azure SQL Data Warehouse → แดชบอร์ดการวิเคราะห์

โครงสร้าง Layout

ไปป์ไลน์ห้าเฟสพร้อมการนำเข้าสตรีมมิ่ง Kafka

องค์ประกอบภาพหลัก

  • HDInsight Kafka สำหรับการนำเข้า
  • Spark ↔ Storage แบบสองทิศทาง
  • เน้นการสตรีมมิ่งแบบเรียลไทม์
หน้า 42
section divider

ราคาและคำแนะนำผลิตภัณฑ์

เนื้อหา

ส่วนแบ่งสำหรับบทการกำหนดราคาและการเปรียบเทียบ

โครงสร้าง Layout

ข้อความสีขาวบนพื้นหลังสีน้ำเงิน

องค์ประกอบภาพหลัก

  • พื้นหลังสีน้ำเงินของ Microsoft
หน้า 43
comparison

Big Data OSS - การเปรียบเทียบ

เนื้อหา

การเปรียบเทียบแบบสามคอลัมน์: Azure HDInsight (Hadoop/HDP, PaaS, Ranger security, priced vs AWS EMR), Azure Databricks (Spark, SaaS, AD security, priced vs Databricks on AWS), 3rd Party Offerings (Cloudera/MapR/Hortonworks, IaaS, vendor pricing)

โครงสร้าง Layout

การ์ดเปรียบเทียบแบบสามคอลัมน์

องค์ประกอบภาพหลัก

  • การ์ดผลิตภัณฑ์สามรายการพร้อมส่วน What/Pricing/Use When
หน้า 44
comparison

ภาพรวมของผลิตภัณฑ์ต่างๆ

เนื้อหา

การเปรียบเทียบโดยละเอียด: Azure HDInsight (Hortonworks, big data engines, VNET, Ranger, OMS, Data Factory orchestration, 27 regions), Azure Databricks (Spark-first, single engine, AAD OAuth, RBAC, auto-scaling, serverless, SQL DW integration), Azure ML (first-party ML, Python/R, experimentation, model management, IDE integration)

โครงสร้าง Layout

การเปรียบเทียบคุณสมบัติโดยละเอียดแบบสามคอลัมน์

องค์ประกอบภาพหลัก

  • การ์ดผลิตภัณฑ์โดยละเอียดสามรายการ
  • ส่วน What It Is, Features, Guidance
หน้า 45
section divider

การสาธิต

เนื้อหา

ส่วนแบ่งสำหรับเดโมสด

โครงสร้าง Layout

ข้อความสีขาวบนพื้นหลังสีน้ำเงิน

องค์ประกอบภาพหลัก

  • พื้นหลังสีน้ำเงินของ Microsoft
หน้า 46
product demo

Azure Databricks - service home page

เนื้อหา

ภาพหน้าจอ Azure Portal ที่แสดงหน้าบริการ Azure Databricks (preview) ใน Marketplace > Data + Analytics คำอธิบายแพลตฟอร์มการวิเคราะห์แบบรวม, ตัวอย่าง UI ของ Databricks workspace

โครงสร้าง Layout

ภาพหน้าจอ Azure Portal แบบเต็มความกว้าง

องค์ประกอบภาพหลัก

  • การนำทาง Azure Marketplace
  • คำอธิบายบริการ Databricks
  • ภาพหน้าจอตัวอย่าง Workspace
หน้า 47
product demo

Azure Databricks - creating a workspace

เนื้อหา

Azure Portal: สร้างฟอร์ม Azure Databricks Service พร้อมช่องชื่อ workspace, subscription, resource group และ location (West US)

โครงสร้าง Layout

ภาพหน้าจอแบบฟอร์มการสร้าง Azure Portal แบบเต็มความกว้าง

องค์ประกอบภาพหลัก

  • ฟอร์มสร้าง Workspace
  • การเลือก Resource group
  • ดรอปดาวน์ Location
หน้า 48
product demo

Azure Databricks - workspace deployment

เนื้อหา

Azure Portal Dashboard ที่แสดงทรัพยากรที่ปรับใช้ รวมถึง Databricks Service พร้อมบทช่วยสอน Quickstart สำหรับ VMs, App Service, Functions, SQL Database

โครงสร้าง Layout

ภาพหน้าจอ Azure Dashboard แบบเต็มความกว้าง

องค์ประกอบภาพหลัก

  • Dashboard พร้อมรายการทรัพยากร
  • ไทล์ Deploying Azure Databricks
  • ลิงก์บทช่วยสอน Quickstart
หน้า 49
product demo

Azure Databricks - launching the workspace

เนื้อหา

หน้าภาพรวมทรัพยากร Azure Portal พร้อมปุ่ม Launch Workspace, รายละเอียด resource group ที่มีการจัดการ, ข้อมูล subscription และไทล์เริ่มต้นอย่างรวดเร็ว: Documentation, Getting Started, Import Data, Notebook, Admin Guide

โครงสร้าง Layout

ภาพหน้าจอหน้ารายละเอียดทรัพยากรแบบเต็มความกว้าง

องค์ประกอบภาพหลัก

  • ปุ่ม Launch Workspace
  • ภาพรวมทรัพยากรพร้อม URL
  • ไทล์เริ่มต้นอย่างรวดเร็วหกรายการ
หน้า 50
product demo

Azure Databricks - workspace home page

เนื้อหา

หน้าแรกของ Databricks workspace ที่แสดง Featured Notebooks (Apache Spark Intro, Data Scientists, Structured Streaming), New items (Notebook, Job, Cluster, Table, Library), ลิงก์ Documentation, Open Recent

โครงสร้าง Layout

ภาพหน้าจอ Databricks workspace แบบเต็มความกว้าง

องค์ประกอบภาพหลัก

  • โลโก้ Databricks และแถบด้านข้าง
  • Featured Notebooks พร้อมไอคอน Python/Spark
  • เมนูสร้างรายการใหม่
หน้า 51
section divider

How to get started

เนื้อหา

ส่วนแบ่งสำหรับการเริ่มต้นใช้งาน

โครงสร้าง Layout

ข้อความสีขาวบนพื้นหลังสีน้ำเงิน

องค์ประกอบภาพหลัก

  • พื้นหลังสีน้ำเงินของ Microsoft
หน้า 52
call to action

How to get started

เนื้อหา

สามขั้นตอน: ลงทะเบียนเพื่อทดลองใช้งาน, เข้าร่วมกับผู้เชี่ยวชาญของ Microsoft สำหรับเวิร์กช็อป, เรียนรู้เพิ่มเติมได้ที่ azure.com/databricks

โครงสร้าง Layout

สามขั้นตอนที่มีป้ายกำกับไอคอนทางด้านซ้าย, รูปภาพการประชุมทางธุรกิจทางด้านขวา

องค์ประกอบภาพหลัก

  • ไอคอนวงกลมสีน้ำเงินสามวง
  • รูปภาพการประชุมทางธุรกิจ
  • ลิงก์ URL
หน้า 53
closing slide

Q & A

เนื้อหา

สไลด์ Q&A ปิดท้ายพร้อมข้อมูลติดต่อ: James Serra, Big Data Evangelist — อีเมล, Twitter @JamesSerra, LinkedIn, บล็อกที่ JamesSerra.com

โครงสร้าง Layout

ข้อความ Q&A ขนาดใหญ่พร้อมไอคอนเครื่องหมายคำถามสีส้ม, รายละเอียดการติดต่อที่ด้านล่าง

องค์ประกอบภาพหลัก

  • วงกลมเครื่องหมายคำถามสีส้ม
  • พื้นหลังสีเขียวอมฟ้าเข้ม
  • ลิงก์ข้อมูลการติดต่อ

คำถามที่พบบ่อย

คำถามทั่วไปเกี่ยวกับสไลด์นี้และเนื้อหาการนำเสนอพื้นฐาน

Azure Databricks คืออะไร และแตกต่างจาก HDInsight อย่างไร

Azure Databricks เป็นแพลตฟอร์มการวิเคราะห์บน Apache Spark ที่รวดเร็ว ง่ายดาย และทำงานร่วมกันได้ ซึ่งปรับให้เหมาะสมสำหรับ Azure ออกแบบมาเพื่อประสบการณ์ SaaS HDInsight คือการกระจาย Hadoop (Hortonworks) ที่มีการจัดการซึ่งรองรับหลายเอ็นจิน (Spark, Hive, Kafka, HBase) Databricks เหมาะที่สุดสำหรับปริมาณงานที่เน้น Spark โดยมี Notebook และการทำงานร่วมกัน ในขณะที่ HDInsight เหมาะสำหรับลูกค้าที่ต้องการเทคโนโลยี Hadoop ที่ไม่ใช่ Spark

ใครเป็นผู้สร้างงานนำเสนอนี้

งานนำเสนอนี้สร้างโดย James Serra ผู้เผยแพร่ Big Data ของ Microsoft ที่มีประสบการณ์ด้านไอทีมากกว่า 30 ปี มีใบรับรอง Microsoft (MCSE) หลายรายการ และเป็นผู้เขียนหนังสือเกี่ยวกับการรายงาน SQL Server 2012 เขาเป็นอดีต SQL Server MVP และวิทยากรในการประชุม PASS บ่อยครั้ง

ส่วนประกอบ Apache Spark ใดบ้างที่ครอบคลุม

งานนำเสนอครอบคลุมส่วนประกอบ Spark หลักทั้งหมด: Spark SQL (เอ็นจินการสืบค้นแบบกระจาย), Spark MLlib (Machine Learning), Spark Structured Streaming (การประมวลผลแบบเรียลไทม์) และ GraphX (การคำนวณกราฟ) รวมถึงสถาปัตยกรรม Spark หลักที่มี RDD, โมเดล Driver/Worker และการจัดการคลัสเตอร์

งานนำเสนอนี้มีเกณฑ์มาตรฐานด้านประสิทธิภาพหรือไม่

ใช่ มีข้อมูลเกณฑ์มาตรฐานที่แสดงให้เห็นว่า Databricks Spark เร็วกว่า Apache Spark ทั่วไปบน AWS 5 เท่า, เร็วกว่า Apache Presto บน AWS 8 เท่า และเร็วกว่า Impala ภายในองค์กรผ่าน Cloudera 3 เท่า โดยมีตัวเลขรันไทม์เฉพาะที่อ้างอิงจากการศึกษาเกณฑ์มาตรฐานสาธารณะ

สถาปัตยกรรมกรณีการใช้งานใดบ้างที่รวมอยู่

มีการนำเสนอสถาปัตยกรรมอ้างอิง Azure ที่สมบูรณ์สามแบบ: Modern Big Data Warehouse (Batch ETL ด้วย SQL DW), Advanced Analytics on Big Data (ML พร้อม Cosmos DB ที่ให้บริการแก่เว็บ/มือถือ) และ Real-time Analytics on Big Data (Kafka Streaming พร้อมการประมวลผล Spark)

เทมเพลตนี้เหมาะสำหรับการเตรียมตัวสำหรับการรับรอง Azure หรือไม่

ใช่ งานนำเสนอครอบคลุมสถาปัตยกรรมแพลตฟอร์ม Azure Databricks, สิ่งประดิษฐ์หลัก (คลัสเตอร์, Notebook, งาน, พื้นที่ทำงาน, ไลบรารี), ความปลอดภัยด้วยการรวม AAD, DBFS, Spark SQL, MLlib, Streaming และ REST API ซึ่งเป็นหัวข้อสำคัญทั้งหมดสำหรับการรับรอง Azure Data Engineering

งานนำเสนอมีเนื้อหาการสาธิตเชิงปฏิบัติหรือไม่

ใช่ มีภาพหน้าจอ Azure Portal แบบทีละขั้นตอนที่สาธิต: การค้นหา Azure Databricks ใน Marketplace, การสร้างพื้นที่ทำงาน, การปรับใช้ทรัพยากร, การเปิดใช้พื้นที่ทำงาน และการนำทางหน้าแรกของ Databricks ด้วย Featured Notebook

มีสไลด์กี่สไลด์ในงานนำเสนอนี้

งานนำเสนอมี 53 สไลด์ที่ครอบคลุม: ภาพรวมกลุ่มข้อมูล Azure, การเปรียบเทียบโซลูชัน Big Data, พื้นฐาน Apache Spark, รายละเอียดแพลตฟอร์ม Azure Databricks, คุณสมบัติพื้นที่ทำงาน, สถาปัตยกรรมอ้างอิงสามแบบ, คำแนะนำด้านราคา/ผลิตภัณฑ์, การสาธิตสด และขั้นตอนการเริ่มต้น

2slides

Create Your Own Slides

Turn your ideas into professional presentations in seconds with 2slides AI.

สร้างสไลด์ระดับโลกในไม่กี่วินาที

อ้างอิงการออกแบบมืออาชีพ เลือกสไตล์ของคุณ และสร้างสไลด์ด้วยการแสดงผลข้อความที่สมบูรณ์แบบ ขับเคลื่อนโดย Nano Banana—เริ่มสร้างการนำเสนอของคุณตอนนี้

© 2026 2slides. All rights reserved.