2Slides Logo
Preview

บทนำแพลตฟอร์ม Databricks — ข้อมูล, การวิเคราะห์ และ AI บนแพลตฟอร์มเดียว

47 สไลด์

บทนำแพลตฟอร์ม Databricks — ข้อมูล, การวิเคราะห์ และ AI ทั้งหมดของคุณบนแพลตฟอร์มเดียว

23 ถูกใจ
0 ดาวน์โหลด

การนำทางด่วน

แท็ก

Databricks
Data Lakehouse
Delta Lake
Apache Spark
Data Engineering

แชร์สไลด์

คำอธิบาย

หัวข้อหลัก

บทนำแพลตฟอร์ม Databricks — ข้อมูล, การวิเคราะห์ และ AI ทั้งหมดของคุณบนแพลตฟอร์มเดียว

ประโยชน์หลัก

  • บทนำที่ครอบคลุมเกี่ยวกับ Databricks Lakehouse Platform ซึ่งครอบคลุมถึง Data Engineering, Data Science, ML และ SQL Analytics
  • ความก้าวหน้าที่มองเห็นได้ชัดเจนจากปัญหาการจัดการข้อมูลไปสู่โซลูชัน Lakehouse พร้อมไดอะแกรมสถาปัตยกรรม
  • ครอบคลุม Full Stack: Delta Lake, Delta Live Tables, MLflow, Unity Catalog, Delta Sharing และ SQL Analytics
  • ภาพหน้าจอผลิตภัณฑ์จริงของคุณสมบัติ Databricks Workspace: Clusters, Notebooks, Jobs, Repos, Models, Queries, Dashboards และ Alerts
  • การเปรียบเทียบ Modern Data Stack กับระบบนิเวศ Databricks และสถาปัตยกรรม Data Warehouse กับ Data Lakehouse

กลุ่มเป้าหมาย

  • Data Engineer ที่ประเมินแพลตฟอร์มข้อมูลแบบรวม
  • Data Scientist ที่มองหาการจัดการวงจร ML แบบ End-to-End
  • Data Analyst ที่เปลี่ยนจาก Data Warehousing แบบดั้งเดิมไปสู่สถาปัตยกรรม Lakehouse
  • ผู้มีอำนาจตัดสินใจทางเทคนิคที่เปรียบเทียบ Databricks กับ Snowflake และ Modern Data Stack อื่นๆ
  • ผู้นำด้านไอทีและสถาปนิกที่วางแผนกลยุทธ์แพลตฟอร์มข้อมูลบนคลาวด์

กรณีการใช้งาน

  • งานนำเสนอการขายทางเทคนิคเพื่อแนะนำ Databricks ให้กับลูกค้าเป้าหมาย
  • ช่วงการฝึกอบรมภายในเกี่ยวกับความสามารถของแพลตฟอร์ม Databricks
  • การประชุมตัดสินใจด้านสถาปัตยกรรมข้อมูลเพื่อเปรียบเทียบแนวทาง Lakehouse กับ Warehouse
  • การบรรยายในการประชุมเกี่ยวกับการพัฒนาแพลตฟอร์มข้อมูลสมัยใหม่
  • การปฐมนิเทศสมาชิกใหม่ในทีมเข้าสู่ระบบนิเวศ Databricks

ข้อเสนอมูลค่าเฉพาะ

  • ครอบคลุมแพลตฟอร์ม Databricks ทั้งหมดในสไลด์เดียว 46 หน้า พร้อมภาพหน้าจอ UI จริง
  • เรื่องราวปัญหา-วิธีแก้ที่ชัดเจน: จากความซับซ้อนในการจัดการข้อมูลไปสู่ Lakehouse แบบรวม
  • รวมทั้งไดอะแกรมสถาปัตยกรรมเชิงแนวคิดและการแนะนำอินเทอร์เฟซผลิตภัณฑ์จริง
  • กล่าวถึง Data Persona ทั้งสาม: Data Analyst, Data Engineer และ Data Scientist
  • การออกแบบแบรนด์ Databricks อย่างมืออาชีพด้วยโทนสีที่สอดคล้องกัน (Dark Teal, Coral, Gold)

หน้าสไลด์ (47)

มุมมองรายละเอียดของแต่ละหน้าสไลด์ รวมถึงlayout เนื้อหาหลักและองค์ประกอบภาพ

หน้า 1
title slide

บทนำเกี่ยวกับแพลตฟอร์ม Databricks

เนื้อหา

สไลด์ชื่อเรื่อง — ข้อมูล การวิเคราะห์ และ AI ทั้งหมดของคุณบนแพลตฟอร์มเดียว โดย Alex Ivanichev, มีนาคม 2022

โครงสร้าง Layout

ชื่อเรื่องชิดซ้ายพร้อมผู้เขียน/วันที่ ภาพตัดปะรูปทรงเรขาคณิตทางด้านขวา

องค์ประกอบภาพหลัก

  • โลโก้ Databricks
  • รูปทรงเรขาคณิตพร้อมรูปภาพทีม
  • พื้นหลังสีเขียวอมฟ้าเข้ม
  • รูปทรงเน้นสีส้มปะการัง/เขียวอมฟ้า
หน้า 2
definition

DataBricks คืออะไร

เนื้อหา

DataBricks คือแพลตฟอร์มข้อมูลและการวิเคราะห์แบบรวมศูนย์และเปิด สร้างขึ้นบนโอเพนซอร์ส: Apache Spark, Delta Lake, MLflow และ Koalas

โครงสร้าง Layout

ข้อความกึ่งกลางบนพื้นหลังสีส้มปะการังพร้อมโลโก้ OSS สี่โลโก้ที่ด้านล่าง

องค์ประกอบภาพหลัก

  • โลโก้ Apache Spark
  • โลโก้ Delta Lake
  • โลโก้ MLflow
  • โลโก้ Koalas
หน้า 3
agenda

Agenda / การนำเสนอ

เนื้อหา

ตัวยึดการนำทางด้วยภาพที่แสดงส่วนสำคัญของการนำเสนอ

โครงสร้าง Layout

รูปแบบ agenda อย่างง่าย

องค์ประกอบภาพหลัก

  • ตัวบ่งชี้ส่วน
หน้า 4
section divider

การจัดการข้อมูลในปัจจุบันเป็นอย่างไร

เนื้อหา

ตัวแบ่งส่วนที่แนะนำสถานะปัจจุบันของความท้าทายในการจัดการข้อมูล

โครงสร้าง Layout

ข้อความสีขาวกึ่งกลางบนพื้นหลังสีเขียว

องค์ประกอบภาพหลัก

  • พื้นหลังสีเขียว
  • ชื่อเรื่องรูปแบบคำถาม
หน้า 5
architecture diagram

ความซับซ้อนของการจัดการข้อมูล

เนื้อหา

สาม stacks ที่แยกจากกัน — Data Warehousing, Data Engineering, Data Science/ML — พร้อมระบบที่ไม่เชื่อมต่อกันและรูปแบบที่เป็นกรรมสิทธิ์ แสดง ETL flows ระหว่าง data warehouse, data lake, streaming และ ML pipelines

โครงสร้าง Layout

ส่วนหัวสามคอลัมน์พร้อมไดอะแกรม flow สถาปัตยกรรมด้านล่าง

องค์ประกอบภาพหลัก

  • ไอคอนสาม persona
  • ลูกศร ETL flow
  • โลโก้เครื่องมือ: Redshift, Snowflake, BigQuery, Hadoop, Spark, TensorFlow, etc.
หน้า 6
concept diagram

ทีมข้อมูลยุคใหม่

เนื้อหา

ไดอะแกรมสามเหลี่ยมที่แสดงบทบาทสำคัญสามประการในทีมข้อมูลสมัยใหม่: Data Analysts, Data Engineers และ Data Scientists

โครงสร้าง Layout

สามเหลี่ยมตรงกลางพร้อมไอคอนบทบาทที่แต่ละจุดยอด

องค์ประกอบภาพหลัก

  • สามเหลี่ยมประสานกัน (สีส้มปะการัง, เขียวอมฟ้า, ทอง)
  • ไอคอนสามบทบาท
  • พื้นหลังสีเบจอ่อน
หน้า 7
comparison

Data Warehouse vs. Data Lake

เนื้อหา

การเปรียบเทียบด้วยภาพของ Data Warehouse (มีโครงสร้าง, ไอคอนฐานข้อมูล) กับ Data Lake (ไม่มีโครงสร้าง, ไอคอนคลื่น)

โครงสร้าง Layout

สองไอคอนขนาดใหญ่วางเคียงข้างกันพร้อมป้ายกำกับ

องค์ประกอบภาพหลัก

  • ไอคอนทรงกระบอกฐานข้อมูล (สีแดง)
  • ไอคอนคลื่น data lake (สีแดง)
  • ป้าย vs. รูปเพชร
หน้า 8
comparison

Warehouses และ lakes สร้างความซับซ้อน

เนื้อหา

สามมิติของความซับซ้อน: ข้อมูลสองชุดที่แยกจากกัน (กรรมสิทธิ์ vs เปิด), อินเทอร์เฟซที่ไม่เข้ากัน (SQL vs Python), รูปแบบความปลอดภัย/การกำกับดูแลที่ไม่เข้ากัน (Tables vs Files)

โครงสร้าง Layout

สามแถวเปรียบเทียบพร้อมคอลัมน์ warehouse vs lake

องค์ประกอบภาพหลัก

  • ตารางเปรียบเทียบที่มีป้ายกำกับสามตาราง
  • ข้อความสีแดงสำหรับป้ายกำกับปัญหา
  • รูปแบบที่เรียบง่ายและสะอาดตา
หน้า 9
architecture diagram

Data Lakehouse

เนื้อหา

แพลตฟอร์มเดียวเพื่อรวมข้อมูล การวิเคราะห์ และ AI ทั้งหมดเข้าด้วยกัน รวม Data Warehouse และ Data Lake เป็นเลเยอร์เดียวที่รองรับ Streaming Analytics, BI, Data Science และ Machine Learning

โครงสร้าง Layout

ไดอะแกรมสถาปัตยกรรมตรงกลางพร้อม data flow จากทั้ง warehouse และ lake ไปยังเลเยอร์รวม

องค์ประกอบภาพหลัก

  • เลเยอร์ข้อมูลแบบรวมพร้อมไอคอนไบนารี/เฟือง
  • ประเภท workload สี่ประเภทที่ด้านบน
  • ไอคอนแหล่งข้อมูลที่ด้านล่าง
  • ลูกศร chevron สีส้ม
หน้า 10
comparison

ทำไมต้องเลือก Databricks

เนื้อหา

การเปรียบเทียบแบบเคียงข้างกันของ Modern Data Stack (Fivetran → Airflow → dbt → Snowflake → Looker/Tableau) กับ Databricks Ecosystem (Fivetran + 100 tools → Object Storage → Auto Ingest → Delta + Spark → Delta Live Tables → Databricks SQL)

โครงสร้าง Layout

การเปรียบเทียบ flow แนวตั้งสองคอลัมน์

องค์ประกอบภาพหลัก

  • โลโก้เครื่องมือ: Fivetran, Airflow, dbt, Snowflake, Looker, Tableau
  • Databricks ecosystem flow
  • สไตล์ชื่อเรื่องแบบวาดด้วยมือ
หน้า 11
architecture diagram

Data Lakehouse นำเสนอแนวทางที่ดีกว่า

เนื้อหา

สถาปัตยกรรม Lakehouse stack: Cloud Data Lake อยู่ด้านล่าง (Azure, AWS, GCP), รูปแบบการจัดเก็บแบบเปิด, การประมวลผลข้อมูล, ความปลอดภัย/การกำกับดูแล และประสบการณ์ตามบทบาทอยู่ด้านบน ประโยชน์: lake-first, AI/ML native, ความน่าเชื่อถือสูง, multi-cloud

โครงสร้าง Layout

แผนภาพสถาปัตยกรรมแบบเรียงซ้อนทางด้านซ้าย, bullet points ทางด้านขวา

องค์ประกอบภาพหลัก

  • Green layered stack
  • โลโก้ผู้ให้บริการ Cloud
  • รายการประโยชน์แบบ Bullet point
หน้า 12
section divider

รากฐานของ Data Lakehouse

เนื้อหา

ตัวแบ่งส่วนสำหรับบท Data Lakehouse Foundation

โครงสร้าง Layout

ข้อความสีขาวบนพื้นหลังสีเขียวอมฟ้าเข้มพร้อมรูปทรงเรขาคณิต

องค์ประกอบภาพหลัก

  • พื้นหลังสีเขียวอมฟ้าเข้ม
  • รูปทรงเรขาคณิตสีส้มปะการัง/เขียวอมฟ้า
  • ไอคอน Databricks
หน้า 13
product overview

Delta Lake

เนื้อหา

Delta Lake เชื่อม Data Lake และ Data Warehouse — แนวทางแบบเปิดสำหรับการจัดการข้อมูลและการกำกับดูแล ประโยชน์หลัก: ความน่าเชื่อถือที่ดีขึ้นด้วย transactions, การประมวลผลที่เร็วกว่า 48 เท่าด้วย indexing, การควบคุมการเข้าถึงแบบละเอียด

โครงสร้าง Layout

เลย์เอาต์สามคอลัมน์: ไอคอน Data Lake | โลโก้ Delta Lake + ประโยชน์ | ไอคอน Data Warehouse

องค์ประกอบภาพหลัก

  • โลโก้สามเหลี่ยม Delta Lake
  • ไอคอนคลื่น Data Lake
  • ไอคอนทรงกระบอก Data Warehouse
  • แผงด้านข้างสีเขียวอมฟ้าเข้ม
หน้า 14
feature list

Delta Lake คืออะไร

เนื้อหา

โครงการโอเพนซอร์สสำหรับสถาปัตยกรรม Lakehouse บน data lakes เลเยอร์จัดเก็บข้อมูลพร้อม ACID transactions สำหรับ Spark คุณสมบัติหลัก: ACID Transactions, Scalable Metadata, Time Travel, Open Format, Change Data Feed, Unified Batch/Streaming, Schema Enforcement/Evolution, Audit History

โครงสร้าง Layout

ชื่อเรื่องพร้อม bullet points ในสองคอลัมน์

องค์ประกอบภาพหลัก

  • รายการคุณสมบัติแบบ Bullet สองคอลัมน์
  • ลิงก์อ้างอิงบล็อก
หน้า 15
problem-solution

Delta Lake แก้ปัญหาความท้าทายของ Data Lakes

เนื้อหา

แก้ไข 3 ความท้าทาย: ความน่าเชื่อถือและคุณภาพ → ACID transactions, ประสิทธิภาพและความหน่วง → Advanced indexing & caching, การกำกับดูแล → การกำกับดูแลด้วย Data Catalogs

โครงสร้าง Layout

สามแถวพร้อมลูกศรจากความท้าทายไปสู่ทางแก้ไข

องค์ประกอบภาพหลัก

  • ป้ายกำกับหมวดหมู่สีเขียวอมฟ้าตัวหนา
  • ตัวเชื่อมต่อลูกศร
  • เลย์เอาต์ที่เรียบง่ายและสะอาดตา
หน้า 16
technical detail

Delta Lake key feature - ACID transaction

เนื้อหา

โครงสร้าง Transaction log: Add File, Remove File, Update Metadata, Set Transaction, Change Protocol, Commit Info. แสดงไดเรกทอรี _delta_log พร้อมด้วย JSON commits และการดำเนินการเพิ่ม/ลบไฟล์ parquet

โครงสร้าง Layout

รายการ Bullet ที่ด้านบน, แผงโค้ด/ไดอะแกรมสองแผงด้านล่าง

องค์ประกอบภาพหลัก

  • ไดอะแกรมแผนผังไฟล์
  • โครงสร้าง Transaction log
  • การดำเนินการเพิ่ม (สีเขียว) และลบ (สีแดง) ที่มีการเข้ารหัสสี
หน้า 17
technical detail

State Recomputing With Checkpoint Files

เนื้อหา

Delta Lake สร้างไฟล์ checkpoint ทุกๆ 10 commits ในรูปแบบ Parquet แสดงโครงสร้างไฟล์ checkpoint, กลไก listFrom version และการจัดการการอ่าน/เขียนพร้อมกันด้วย optimistic concurrency

โครงสร้าง Layout

แผงไดอะแกรมสองแผงแสดงโครงสร้างไฟล์และการไหลของการอ่าน/เขียน

องค์ประกอบภาพหลัก

  • แผนผังไฟล์ที่มี checkpoint.parquet
  • โลโก้ Spark สำหรับการแคช
  • ไดอะแกรมการเข้าถึงพร้อมกันของผู้ใช้ 1/ผู้ใช้ 2
หน้า 18
architecture diagram

Building the foundation of a Lakehouse

เนื้อหา

สถาปัตยกรรม Bronze-Silver-Gold medallion: Bronze (การนำเข้า/ประวัติแบบดิบ) → Silver (กรอง, ทำความสะอาด, เพิ่มเติม) → Gold (ผลรวมระดับธุรกิจ) แหล่งที่มา: Kafka, Kinesis, CSV/JSON, Spark ผู้บริโภค: Streaming Analytics, BI, Data Science/ML

โครงสร้าง Layout

การไหลของข้อมูลจากซ้ายไปขวาพร้อมระดับฐานข้อมูลสามระดับ

องค์ประกอบภาพหลัก

  • ไอคอนฐานข้อมูลสามระดับ (สีบรอนซ์, สีเงิน, สีทอง)
  • โลโก้แหล่งที่มา: Kafka, Kinesis, Spark
  • การไล่ระดับสีลูกศรคุณภาพ
หน้า 19
problem statement

But the reality is not so simple

เนื้อหา

ไดอะแกรมไปป์ไลน์ข้อมูลที่ซับซ้อนในโลกแห่งความเป็นจริงแสดงให้เห็นถึงการพึ่งพาที่ยุ่งเหยิงระหว่างแหล่งที่มาหลายแห่ง ขั้นตอนการประมวลผล และผู้บริโภค การรักษาคุณภาพและความน่าเชื่อถือในระดับที่ใหญ่เป็นเรื่องที่ซับซ้อนและเปราะบาง

โครงสร้าง Layout

ไดอะแกรมไปป์ไลน์ที่ยุ่งเหยิงพร้อมเส้นประที่ตัดกันจำนวนมาก

องค์ประกอบภาพหลัก

  • การเชื่อมต่อไปป์ไลน์ที่ยุ่งเหยิง
  • ไอคอนฐานข้อมูลหลายรายการในแต่ละขั้นตอน
  • โลโก้แหล่งที่มา: Kafka, Kinesis
หน้า 20
architecture diagram

Modern data engineering on the lakehouse

เนื้อหา

Data Engineering บน Databricks Lakehouse Platform: Data ingestion → Data transformation → Data quality management → Automatic deployment & operations → Observability, lineage, และ pipeline visibility การจัดตารางเวลาและการจัดการ Delta Lake open format storage ที่เป็นรากฐาน

โครงสร้าง Layout

ไดอะแกรมแพลตฟอร์มแบบเลเยอร์โดยมีแหล่งข้อมูลทางด้านซ้ายและผู้บริโภคทางด้านขวา

องค์ประกอบภาพหลัก

  • บล็อกแพลตฟอร์มสีเขียวอมฟ้าแบบเลเยอร์
  • รายการแหล่งข้อมูล
  • รายการผู้บริโภคข้อมูล
  • โลโก้ Delta Lake
หน้า 21
section divider

Data Science & Engineering Workspace

เนื้อหา

ตัวแบ่งส่วนสำหรับบทเกี่ยวกับคุณสมบัติของ Workspace

โครงสร้าง Layout

ข้อความกึ่งกลางบนพื้นหลังสีปะการัง

องค์ประกอบภาพหลัก

  • พื้นหลังสีปะการัง
  • ข้อความสีอ่อน
หน้า 22
product demo

Databricks Workspaces: Clusters

เนื้อหา

Clusters จัดหาทรัพยากรการประมวลผลสำหรับ Data Analytics, Data Science หรือ Data Engineering workloads แสดง UI การกำหนดค่า Cluster ด้วย Databricks Runtime 7.5 ML, Spark 3.0.1, Community Optimized driver type

โครงสร้าง Layout

ข้อความอธิบายด้านบน ภาพหน้าจอ UI เต็มความกว้างด้านล่าง

องค์ประกอบภาพหลัก

  • ภาพหน้าจอการกำหนดค่า Databricks cluster
  • Sidebar navigation
  • ตัวเลือกเวอร์ชัน Runtime
หน้า 23
product demo

Databricks Workspaces: Notebooks

เนื้อหา

Web interface สำหรับการเขียนและดำเนินการโค้ดด้วยเซลล์ที่รันได้สำหรับไฟล์ ตาราง การแสดงภาพ และข้อความบรรยาย แสดง Notebook ที่มีเนื้อหา sampling strategies และ revision history

โครงสร้าง Layout

ข้อความอธิบายด้านบน ภาพหน้าจอ Notebook ด้านล่าง

องค์ประกอบภาพหลัก

  • Notebook UI พร้อมเซลล์โค้ด
  • Cluster attachment dropdown
  • แผง Revision history
หน้า 24
product demo

Databricks Workspaces: AutoLoader

เนื้อหา

Auto Loader ประมวลผลไฟล์ข้อมูลใหม่จาก cloud storage (GCS, DBFS) เพิ่มขึ้นทีละน้อย การเปรียบเทียบก่อน/หลัง: ขจัดความซับซ้อนของการตั้งค่า Notification Service + Message Queue + Airflow มีตัวอย่างโค้ด Scala

โครงสร้าง Layout

คำอธิบาย ไดอะแกรมก่อน/หลัง และส่วนย่อยของโค้ด

องค์ประกอบภาพหลัก

  • การเปรียบเทียบสถาปัตยกรรมก่อน/หลัง
  • ส่วนย่อยของโค้ด Scala
  • ไอคอน Auto Loader
  • รายการรูปแบบที่รองรับ
หน้า 25
product demo

Databricks Workspaces: Jobs

เนื้อหา

Jobs รัน Notebook ตามกำหนดเวลาสำหรับ ETL, Model Building ฯลฯ แสดงเวิร์กโฟลว์ DAG: Clicks_Ingest → Sessionize + Orders_Ingest → Match → Build_Features → Persist_Features + Train

โครงสร้าง Layout

ข้อความอธิบายด้านบน ไดอะแกรมเวิร์กโฟลว์ DAG ด้านล่าง

องค์ประกอบภาพหลัก

  • Job DAG พร้อมป้ายกำกับระยะเวลา
  • ขั้นตอนไปป์ไลน์ตามลำดับ
  • กิ่งก้านแบบขนาน
หน้า 26
product demo

Databricks Workspaces: Delta Live Tables

เนื้อหา

Framework สำหรับการกำหนด กำหนดใช้งาน ทดสอบ และอัปเกรด data pipelines ในเชิงประกาศ แสดง DLT pipeline UI พร้อมมุมมองกราฟของการอ้างอิงตารางและ event log

โครงสร้าง Layout

ข้อความอธิบายด้านบน ภาพหน้าจอ DLT pipeline เต็มความกว้าง

องค์ประกอบภาพหลัก

  • การแสดงภาพกราฟไปป์ไลน์
  • แผง Table schema
  • Flow progress event log
หน้า 27
product demo

Databricks Workspaces: Repos

เนื้อหา

การผสานรวมระดับ Repository กับ GitHub, GitLab, Bitbucket และ Azure DevOps นักพัฒนาสามารถโคลน จัดการ branches พุช/พูลการเปลี่ยนแปลงได้โดยตรงจาก Workspace

โครงสร้าง Layout

ข้อความอธิบายด้านบน ภาพหน้าจอ Repos UI พร้อม file browser

องค์ประกอบภาพหลัก

  • Repos file browser UI
  • ตัวเลือก Branch
  • การผสานรวม Git hosting
หน้า 28
product demo

Databricks Workspaces: Models

เนื้อหา

MLflow Model Registry สำหรับการจัดการวงจรทั้งหมดของ ML models แสดง model versioning, stage transitions (Archived, Production, Staging) และ pending requests

โครงสร้าง Layout

ข้อความอธิบายด้านบน ภาพหน้าจอ Model Registry พร้อมตารางเวอร์ชัน

องค์ประกอบภาพหลัก

  • MLflow Model Registry UI
  • ตารางเวอร์ชันพร้อม stages
  • ฟิลด์ Model description
หน้า 29
section divider

Governance requirements for data are quickly evolving

เนื้อหา

ตัวแบ่งส่วนสำหรับบทเกี่ยวกับการกำกับดูแล

โครงสร้าง Layout

ข้อความกึ่งกลางบนพื้นหลังสีปะการัง

องค์ประกอบภาพหลัก

  • พื้นหลังสีปะการัง
หน้า 30
problem statement

Governance is hard to enforce on data lakes

เนื้อหา

ไดอะแกรมแสดงความซับซ้อน: 4 data types (Structured, Semi-structured, Unstructured, Streaming) × 3 clouds × separate security policies × multiple output copies

โครงสร้าง Layout

Flow diagram จาก data types ผ่าน clouds ผ่าน security ไปยัง outputs

องค์ประกอบภาพหลัก

  • เส้นการไหลของข้อมูลที่เข้ารหัสสี
  • ไอคอน Cloud (3 clouds)
  • ไอคอน Lock/security
  • ไอคอน Document output
หน้า 31
problem statement

The problem is getting bigger

เนื้อหา

องค์กรต่างๆ จำเป็นต้องแบ่งปันและกำกับดูแลผลิตภัณฑ์ข้อมูลที่หลากหลาย: Files, Dashboards, Models และ Tables

โครงสร้าง Layout

ไอคอนสี่อันเรียงกันพร้อมป้ายกำกับ

องค์ประกอบภาพหลัก

  • ไอคอนลายเส้นสีแดงสี่อัน
  • เลย์เอาต์ที่เรียบง่ายและสะอาดตา
หน้า 32
product overview

Unity Catalog for Lakehouse Governance

เนื้อหา

จัดทำแค็ตตาล็อก ค้นหา และค้นพบสินทรัพย์ข้อมูล/AI จากส่วนกลาง รูปแบบการกำกับดูแลแบบ Cross-Cloud ที่เป็นหนึ่งเดียว การผสานรวมกับ Enterprise Data Catalogs ที่มีอยู่ การแบ่งปันข้อมูลสดอย่างปลอดภัยด้วย Delta Sharing

โครงสร้าง Layout

ภาพหน้าจอ Unity Catalog ทางด้านซ้าย จุดไข่ปลาสี่จุดทางด้านขวา

องค์ประกอบภาพหลัก

  • ภาพหน้าจอ Unity Catalog UI พร้อมมุมมอง schema/lineage
  • จุดไข่ปลาสี่จุดแสดงคุณสมบัติ
หน้า 33
architecture diagram

Delta Sharing on Databricks

เนื้อหา

Open protocol สำหรับการแบ่งปันข้อมูลอย่างปลอดภัย: Data Provider → Delta Lake Table → Delta Sharing Server → Delta Sharing Protocol → Data Recipient (Power BI, Tableau, Spark, pandas, Java)

โครงสร้าง Layout

แผนภาพการไหลจากซ้ายไปขวาจากผู้ให้บริการไปยังผู้รับ

องค์ประกอบภาพหลัก

  • ไอคอน Delta Lake Table
  • ไอคอน Sharing Server
  • โลโก้เครื่องมือผู้รับ: Power BI, Tableau, Spark, pandas, Java, Linux Foundation
หน้า 34
section divider

Machine Learning Workspace

เนื้อหา

ตัวแบ่งส่วนสำหรับบท ML workspace

โครงสร้าง Layout

ข้อความกึ่งกลางบนพื้นหลังสีเขียว

องค์ประกอบภาพหลัก

  • พื้นหลังสีเขียว
หน้า 35
comparison

ML Architecture: Data Warehouse VS Data Lakehouse

เนื้อหา

การเปรียบเทียบแบบเคียงข้างกัน: Data Warehouse (BI Apps → SQL Engine → Proprietary Storage) vs Data Lakehouse (ML Apps + BI Apps → Python/R + SQL Engine → Cloud Storage with OSS formats: PNG, UTF-8, Parquet)

โครงสร้าง Layout

แผนภาพสถาปัตยกรรมสองชุดเคียงข้างกัน

องค์ประกอบภาพหลัก

  • แผนภาพบล็อกสถาปัตยกรรมสองชุด
  • รูปแบบการจัดเก็บข้อมูลที่เป็นกรรมสิทธิ์ vs แบบเปิด
  • เส้นแบ่งสีแดง
หน้า 36
product overview

Data Science and Machine Learning

เนื้อหา

โซลูชันการทำงานร่วมกันแบบ Data-native สำหรับวงจร ML เต็มรูปแบบ: Collaborative Multi-Language Notebooks → Model Training/Tuning, Model Tracking/Registry, Model Serving/Monitoring, Automation/Governance → Open Multi-Cloud Data Lakehouse และ Feature Store

โครงสร้าง Layout

แผนภาพแพลตฟอร์มแบบเรียงซ้อนสามชั้น

องค์ประกอบภาพหลัก

  • เลเยอร์แพลตฟอร์มสีเขียวอมฟ้าสามชั้น
  • ไอคอนวงจร ML สี่ไอคอน
  • โลโก้ Delta Lake ที่ด้านล่าง
หน้า 37
requirements

What Does ML Need from a Lakehouse?

เนื้อหา

สี่ข้อกำหนด: การเข้าถึงข้อมูลที่ไม่มีโครงสร้าง (รูปภาพ, ข้อความ, ปรับขนาดเป็น petabytes), ไลบรารี Open Source (TensorFlow, scikit-learn, R), ฮาร์ดแวร์เฉพาะทาง (GPUs, cloud elasticity), การจัดการวงจร Model (artifacts, lineage, productionization)

โครงสร้าง Layout

เลย์เอาต์สี่ส่วนพร้อม bullet points

องค์ประกอบภาพหลัก

  • ส่วนที่มีป้ายกำกับสี่ส่วน
  • เลย์เอาต์ข้อความที่สะอาดตา
หน้า 38
comparison

Three Data Users

เนื้อหา

Business Intelligence (SQL, เครื่องมือ BI, Big Data, Warehouse), Data Science (R, SAS, Python, statistical analysis, small datasets), Machine Learning (Python, deep learning, GPUs, big datasets, unstructured data). ส่วน ML ไฮไลต์ด้วยเส้นขอบสีเขียวอมฟ้า

โครงสร้าง Layout

การเปรียบเทียบสามคอลัมน์พร้อมไอคอนบทบาท

องค์ประกอบภาพหลัก

  • ไอคอนบทบาทสามไอคอน (analyst, scientist, engineer)
  • เส้นขอบไฮไลต์สีเขียวอมฟ้าบนคอลัมน์ ML
  • ตัวแบ่งจุดสีแดง
หน้า 39
concept explanation

How Is ML Different?

เนื้อหา

ML ทำงานกับข้อมูลที่ไม่มีโครงสร้าง, ต้องการชุดข้อมูลขนาดใหญ่, ใช้ DataFrames แบบ open source (ไม่ใช่ SQL), ส่งออก models (ไม่ใช่ reports) และบางครั้งต้องการฮาร์ดแวร์พิเศษ (GPUs)

โครงสร้าง Layout

รายการ Bullet ทางด้านซ้าย, ไอคอนเฟือง/คนขนาดใหญ่อยู่ทางด้านขวา

องค์ประกอบภาพหลัก

  • ไอคอนเฟือง-คนสีแดง
  • คำหลักที่เน้นด้วยตัวหนา
  • เส้นแบ่งแนวตั้ง
หน้า 40
concept explanation

MLOps and the Lakehouse

เนื้อหา

เครื่องมือ Open สำหรับทั้ง *training* และ *operating* models บน lakehouse Models ก็เป็นข้อมูลเช่นกัน MLflow สำหรับ MLOps: ติดตาม/จัดการข้อมูล model, lineage, inputs; ปรับใช้ models เป็นบริการ lakehouse

โครงสร้าง Layout

รายการ Bullet ทางด้านซ้าย, ไอคอนรถบรรทุกส่งของทางด้านขวา

องค์ประกอบภาพหลัก

  • ไอคอนรถบรรทุกส่งของสีแดง
  • เน้น MLFlow ด้วยตัวหนา
  • เน้น *training/operating* ด้วยตัวเอียง
หน้า 41
concept explanation

Feature Stores for Model Inputs

เนื้อหา

Tables จัดการ input ของ model ที่มีโครงสร้าง แต่ขาด: upstream lineage, downstream lineage, การรวม model caller และการเข้าถึงแบบ real-time Feature stores ช่วยแก้ปัญหาเหล่านี้

โครงสร้าง Layout

Bullet list ทางด้านซ้าย, ไอคอนฐานข้อมูลทางด้านขวา

องค์ประกอบภาพหลัก

  • ไอคอนฐานข้อมูล/feature store สีแดง
  • Nested bullet points
  • จุดเน้นสีเหลือง
หน้า 42
section divider

SQL Analytics Workspace

เนื้อหา

ตัวแบ่งส่วน — Query ข้อมูล data lake โดยใช้ ANSI SQL พร้อมด้วย query editor ในตัว, การแจ้งเตือน, visualizations และ interactive dashboards

โครงสร้าง Layout

ข้อความกึ่งกลางบนพื้นหลังสีเขียวพร้อมคำอธิบาย

องค์ประกอบภาพหลัก

  • พื้นหลังสีเขียว
  • ANSI SQL เน้นตัวหนา
หน้า 43
product demo

Databricks Workspaces: Queries

เนื้อหา

SQL query editor พร้อม autocomplete, table browser และ endpoint connection แสดง query ชุดข้อมูล NYC taxi พร้อมคำแนะนำ column

โครงสร้าง Layout

ข้อความอธิบายด้านบน, ภาพหน้าจอ query editor ด้านล่าง

องค์ประกอบภาพหลัก

  • SQL editor พร้อม autocomplete popup
  • Table schema browser
  • ชุดข้อมูล NYC taxi
หน้า 44
product demo

Databricks Workspaces: Dashboards

เนื้อหา

SQL dashboards ที่รวม visualizations: Cash Generated ($16M), Number of Sales (103K), Monthly Growth (13%), Average Basket ($154), แผนที่ Customer Summary, แผนภูมิ Amount per Day, แผนภูมิวงกลม Product Category

โครงสร้าง Layout

ภาพหน้าจอ dashboard แบบเต็มความกว้างพร้อม widget หลายประเภท

องค์ประกอบภาพหลัก

  • KPI cards
  • แผนที่ทางภูมิศาสตร์
  • แผนภูมิ Time series
  • แผนภูมิวงกลม
  • Sales dashboard
หน้า 45
product demo

Databricks Workspaces: Alerts

เนื้อหา

การแจ้งเตือนจะแจ้งให้ทราบเมื่อผลลัพธ์ query ที่กำหนดไว้ตรงตามเกณฑ์ที่ตั้งไว้ แสดง UI การสร้างการแจ้งเตือน, รายการแจ้งเตือนที่มีสถานะ triggered/OK และการกำหนดค่า Generic Alert พร้อมปลายทาง (Pops, Platform, Test Webhook)

โครงสร้าง Layout

ข้อความอธิบายด้านบน, ภาพหน้าจอ UI สี่ภาพใน grid

องค์ประกอบภาพหลัก

  • แบบฟอร์มสร้างการแจ้งเตือน
  • รายการแจ้งเตือนพร้อมป้ายสถานะ
  • การกำหนดค่าการแจ้งเตือนพร้อมปลายทาง
  • แผงการแจ้งเตือนที่มีเส้นขอบสีเขียว
หน้า 46
product demo

Databricks Workspaces: ประวัติการ Query

เนื้อหา

ประวัติ query ที่แสดง SQL queries ที่ดำเนินการผ่าน SQL endpoints พร้อมรายละเอียดการดำเนินการ: duration breakdown (optimizing 35%, execution 64%, fetching 1%), rows returned, bytes read

โครงสร้าง Layout

คำอธิบายด้านบน, sidebar + รายการ query + ภาพหน้าจอแผงรายละเอียด

องค์ประกอบภาพหลัก

  • รายการ query พร้อม timestamps
  • Query detail popup พร้อมสรุปการดำเนินการ
  • Duration breakdown bar
หน้า 47
closing slide

ขอบคุณครับ/ค่ะ

เนื้อหา

สไลด์ปิดท้ายพร้อม branding ของ Databricks

โครงสร้าง Layout

ข้อความขอบคุณอย่างง่ายบนพื้นหลังสีเขียวอมฟ้าเข้มพร้อมรูปทรงเรขาคณิต

องค์ประกอบภาพหลัก

  • พื้นหลังสีเขียวอมฟ้าเข้ม
  • รูปทรงเรขาคณิตสีส้มปะการัง/เขียวอมฟ้า
  • ไอคอน Databricks

คำถามที่พบบ่อย

คำถามทั่วไปเกี่ยวกับสไลด์นี้และเนื้อหาการนำเสนอพื้นฐาน

Databricks Lakehouse Platform คืออะไร

Databricks คือแพลตฟอร์มข้อมูลแบบเปิดและครบวงจรที่รวมเอาข้อดีของ Data Warehouse และ Data Lake เข้าไว้ในสถาปัตยกรรม Lakehouse เดียว รองรับ Data Engineering, Data Science, Machine Learning และ SQL Analytics บนแพลตฟอร์มเดียว สร้างขึ้นบนเทคโนโลยีโอเพนซอร์ส เช่น Apache Spark, Delta Lake และ MLflow

งานนำเสนอนี้ครอบคลุมหัวข้อใดบ้าง

สไลด์ 46 หน้านี้ครอบคลุม: ความท้าทายในการจัดการข้อมูลในปัจจุบัน แนวคิด Data Lakehouse, พื้นฐาน Delta Lake (ธุรกรรม ACID, Checkpoint, สถาปัตยกรรม Medallion), คุณสมบัติ Databricks Workspace (Clusters, Notebooks, Jobs, Repos, Models, Delta Live Tables, AutoLoader), Data Governance ด้วย Unity Catalog และ Delta Sharing, ML Workspace และ MLOps และ SQL Analytics Workspace (Queries, Dashboards, Alerts)

งานนำเสนอนี้ออกแบบมาสำหรับใคร

งานนำเสนอนี้ออกแบบมาสำหรับ Data Engineer, Data Scientist, Data Analyst และผู้มีอำนาจตัดสินใจทางเทคนิคที่ต้องการทำความเข้าใจแพลตฟอร์ม Databricks ทำหน้าที่เป็นทั้งเครื่องมือส่งเสริมการขายและแหล่งข้อมูลปฐมนิเทศเพื่อการศึกษาสำหรับทีมที่ประเมินหรือนำ Databricks ไปใช้

Databricks เปรียบเทียบกับ Modern Data Stack ได้อย่างไร

งานนำเสนอมีการเปรียบเทียบโดยตรงที่แสดงให้เห็นว่า Modern Data Stack ต้องใช้เครื่องมือแยกต่างหากหลายอย่าง (Fivetran, Airflow, dbt, Snowflake, Looker, Tableau) ในขณะที่ระบบนิเวศ Databricks รวมสิ่งเหล่านี้เข้าเป็นแพลตฟอร์มเดียวด้วย Auto Ingest, Delta + Spark, Delta Live Tables และ Databricks SQL

Delta Lake คืออะไรและเหตุใดจึงสำคัญ

Delta Lake คือ Storage Layer แบบโอเพนซอร์สที่นำธุรกรรม ACID, การจัดการ Metadata ที่ปรับขนาดได้ และการประมวลผล Batch/Streaming แบบรวมมาสู่ Data Lake ให้การประมวลผลข้อมูลที่เร็วกว่า 48 เท่าด้วยการจัดทำดัชนี, Time Travel สำหรับการทำเวอร์ชันข้อมูล, การบังคับใช้ Schema และการควบคุมการเข้าถึงแบบละเอียด ทำให้ Data Lake มีความน่าเชื่อถือเหมือนกับ Data Warehouse

เทมเพลตนี้มีภาพหน้าจอผลิตภัณฑ์จริงหรือไม่

ใช่ งานนำเสนอมีภาพหน้าจอ UI ของ Databricks ของแท้สำหรับ Clusters, Notebooks, AutoLoader, Jobs, Delta Live Tables, Repos, MLflow Model Registry, SQL Queries, Dashboards, Alerts, Query History และ Unity Catalog ซึ่งให้มุมมองที่สมจริงของประสบการณ์แพลตฟอร์ม

ฉันสามารถปรับแต่งงานนำเสนอนี้เพื่อใช้งานเองได้หรือไม่

ได้ ไฟล์ PPTX สามารถแก้ไขได้อย่างสมบูรณ์ คุณสามารถอัปเดตข้อมูล เพิ่มบริบทของบริษัท แก้ไขไดอะแกรมสถาปัตยกรรม และปรับแต่งเนื้อหาสำหรับผู้ชมเฉพาะของคุณ ไม่ว่าจะเป็นสำหรับการสาธิตการขาย การฝึกอบรมภายใน หรือการนำเสนอทางเทคนิค

Databricks รองรับผู้ให้บริการคลาวด์รายใดบ้าง

Databricks เป็น Multi-Cloud และทำงานร่วมกับ Microsoft Azure, AWS และ Google Cloud งานนำเสนอเน้นย้ำถึงความสามารถ Multi-Cloud นี้ว่าเป็นข้อได้เปรียบที่สำคัญ โดยข้อมูลของคุณจะถูกจัดเก็บไว้ใน Data Lake บนคลาวด์ของคุณเองโดยใช้รูปแบบเปิด

2slides

Create Your Own Slides

Turn your ideas into professional presentations in seconds with 2slides AI.

สร้างสไลด์ระดับโลกในไม่กี่วินาที

อ้างอิงการออกแบบมืออาชีพ เลือกสไตล์ของคุณ และสร้างสไลด์ด้วยการแสดงผลข้อความที่สมบูรณ์แบบ ขับเคลื่อนโดย Nano Banana—เริ่มสร้างการนำเสนอของคุณตอนนี้

© 2026 2slides. All rights reserved.