ສອບຖາມຫຼັກສູດເລືອກຊ່ອງທາງທີ່ສະດວກ ທີມງານຕອບເອງທຸກຊ່ອງທາງ
LINE @itgeniusຕອບໄວທີ່ສຸດ · ຈ–ສ 9:00–17:00 ໂມງ
ໂທລະສັບ
02-570-8449ຫ້ອງການ088-807-9770ມືຖື
ອີເມວ ແລະ ໂຊຊຽວ
contact@itgenius.co.thສຳລັບໃບສະເໜີລາຄາ ແລະ ເອກະສານFacebookitgeniusonlineYouTubeitgeniusengຂໍຄຳປຶກສາຈັດຝຶກອົບຮົມໃຫ້ທີມ
ຖານຂໍ້ມູນ · DBC-52

Modern Data Engineering and Lakehouse Architecture

หลักสูตร Modern Data Engineering and Lakehouse Architecture เป็นการอบรมการสร้าง Lakehouse ด้วย Apache Iceberg, Trino, Airflow และ dbt พร้อม Data Contract และ Time Travel เหมาะกับ Data Engineer และ DBA ที่วางแพลตฟอร์มข้อมูลในองค์กร จบแล้วได้ Data Pipeline ต้นแบบที่ใช้งานได้จริง

ອັບເດດລ່າສຸດ
ລາຄາເລີ່ມຕົ້ນ 8,010 ບາດ / ທ່ານ 8,900 −10% ຍັງບໍ່ລວມ VAT 7% · ມີລາຄາໝູ່ຄະນະ
PDFດາວໂຫຼດ Course Outline
  • ໄລຍະເວລາ18 ຊົ່ວໂມງ · 3 ມື້
  • ຮູບແບບຢູ່ສະຖາບັນ / ອອນລາຍສົດ
  • ຮອບຕໍ່ໄປເປີດຕາມຄຳຂໍ
  • ໃບຢັ້ງຢືນມີໃບຢັ້ງຢືນ

ພາບລວມຫຼັກສູດ

หลายองค์กรยังแยก Data Warehouse สำหรับรายงานออกจาก Data Lake สำหรับเก็บไฟล์ดิบ และดึงข้อมูลจากระบบงานหลักด้วย ETL แบบ Batch รายคืน ผลคือข้อมูลซ้ำสองที่ ตัวเลขไม่ตรงกัน ตอบคำถามที่ต้องใช้ข้อมูลล่าสุดได้ช้า และเมื่อถึงเวลาทำ AI หรือถูกตรวจสอบ ก็พบว่าบอกไม่ได้ว่าตัวเลขมาจากไหน เพราะไม่มี Lineage และไม่มีจุดควบคุมคุณภาพข้อมูลที่ชัดเจน สถาปัตยกรรม Lakehouse บน Open Table Format อย่าง Apache Iceberg จึงเข้ามารวมสองโลกนี้ไว้ในชั้นเดียว

หลักสูตรนี้พาผู้เรียนสร้าง Lakehouse ด้วยเครื่องมือโอเพนซอร์สผ่านโครงงานเดียวที่ต่อเนื่องกันทั้ง 3 วัน เริ่มจากออกแบบชั้น Bronze, Silver และ Gold บน Object Storage แบบ S3-compatible ร่วมกับ Apache Iceberg และ Trino นำเข้าข้อมูลธุรกรรมเงินฝากจำลองแบบ Incremental ด้วย Apache Airflow พร้อมแนวคิด CDC แปลงข้อมูลด้วย dbt พร้อม Data Quality Test และ Data Contract จากนั้นใช้ Time Travel, Schema Evolution และ Compaction ของ Iceberg วาง Observability และ Lineage แล้วปิดท้ายด้วย Capstone ที่อธิบายจุดควบคุมคุณภาพในทุกชั้น ทุก Lab รันบนเครื่องของผู้เรียนด้วย Docker และใช้ข้อมูลจำลองเท่านั้น (อบรม 3 วัน วันละ 6 ชั่วโมง รวม 18 ชั่วโมง ระดับ Intermediate)

ສິ່ງທີ່ທ່ານຈະໄດ້ຮັບ

  • อธิบายความต่างของ Data Warehouse, Data Lake และ Lakehouse และเลือกสถาปัตยกรรมให้เหมาะกับองค์กรได้
  • ออกแบบ Medallion Architecture ชั้น Bronze, Silver และ Gold พร้อมกติกาการใช้ข้อมูลแต่ละชั้น
  • ติดตั้ง Lakehouse Stack ด้วย Docker Compose ทั้ง Object Storage, Iceberg Catalog, Trino และ Airflow
  • เลือกระหว่าง Full Load, Incremental Load และ CDC และสร้าง Pipeline นำเข้าข้อมูลที่รันซ้ำได้ผลเหมือนเดิม
  • ใช้ dbt กับ Trino แปลงข้อมูลบนตาราง Iceberg พร้อม Test, SCD Type 2 และเอกสารอัตโนมัติ
  • กำหนด Data Contract ด้วย Model Contract และ Source Freshness ให้ Pipeline หยุดเมื่อข้อมูลผิด
  • ใช้ Time Travel, Schema Evolution และงานดูแลตาราง Iceberg อย่าง Compaction และ Expire Snapshot
  • วาง Data Observability และ Lineage ตั้งแต่ระบบต้นทางจนถึงรายงาน

ຫຼັກສູດນີ້ເໝາະສຳລັບ

  • Data Engineer และ ETL Developer ที่ต้องการย้ายจาก ETL แบบเดิมไปสู่สถาปัตยกรรม Lakehouse
  • DBA และ System Analyst ที่ดูแลฐานข้อมูลต้นทางและต้องส่งข้อมูลให้ทีมรายงานหรือทีม AI
  • ทีม IT Infrastructure ที่ต้องวางแพลตฟอร์มข้อมูลแบบ On-premise ภายในองค์กร
  • Data Architect และ Tech Lead ที่ต้องออกแบบชั้นข้อมูลและจุดควบคุมคุณภาพของทั้งองค์กร
  • ผู้ที่เรียน Airflow และ dbt มาแล้ว และต้องการต่อยอดไปสู่ Open Table Format และ Lakehouse

ພື້ນຖານຂອງຜູ້ເຂົ້າຝຶກອົບຮົມ

  • เขียน SQL ได้ในระดับ JOIN, GROUP BY และ Subquery
  • ใช้ Linux Command Line และ Git ขั้นพื้นฐานได้ อ่านโค้ด Python เบื้องต้นได้
  • ไม่จำเป็นต้องมีพื้นฐาน Spark, Kafka หรือ Cloud มาก่อน หากเคยใช้ Airflow หรือ dbt จะเรียนได้เร็วขึ้น
  • โน้ตบุ๊กหรือ VM ที่รัน Docker ได้ แนะนำ RAM 16 GB ขึ้นไป CPU 4 Core และพื้นที่ว่าง 40 GB พร้อมสิทธิ์ติดตั้งโปรแกรม

ຫົວຂໍ້ການຝຶກອົບຮົມ

รายละเอียดหลักสูตร

หลักสูตรนี้เป็นหลักสูตรด้านสถาปัตยกรรม Lakehouse ที่ต่อยอดจากหลักสูตร Data Pipeline ด้วย Apache Airflow และ dbt อบรม 3 วัน วันละ 6 ชั่วโมง รวม 18 ชั่วโมง (09:00-16:00 น.) รูปแบบบรรยายพร้อม Lab บนโครงงานเดียวที่ต่อเนื่องกันทั้ง 3 วัน ระดับ Intermediate เนื้อหาเจาะการออกแบบ Medallion บน Object Storage แบบ S3-compatible ร่วมกับ Apache Iceberg และ Trino รูปแบบการนำเข้าข้อมูลและแนวคิด CDC, Data Contract, Time Travel และ Schema Evolution, Observability และ Lineage ปิดท้ายด้วย Capstone ส่วน Airflow และ dbt

ใช้เป็นเครื่องมือทำงานโดยสรุปพื้นฐานให้สั้น ผู้ที่ต้องการพื้นฐาน Airflow และ dbt เชิงลึกเรียนหลักสูตร Data Pipeline ด้วย Apache Airflow และ dbt ได้ ทุก Lab รันบนเครื่องหรือ VM ของผู้เรียนด้วย Docker (แนะนำ RAM 16 GB ขึ้นไป) และใช้ข้อมูลระบบเงินฝากจำลองเท่านั้น จึงนำแนวทางไปใช้ภายในองค์กรได้โดยไม่ต้องส่งข้อมูลจริงออกนอกระบบ สอดคล้องแนวทาง PDPA ผู้เรียนจะได้ Workshop Guide, โค้ด DAG, โปรเจกต์ dbt และไฟล์ Docker Compose กลับไปใช้งานต่อ

Day 1 สถาปัตยกรรม Lakehouse และการนำเข้าข้อมูล

Section 1: จาก Data Warehouse และ Data Lake สู่ Lakehouse

  • ปัญหาของการแยก Warehouse กับ Lake: ข้อมูลซ้ำ ตัวเลขไม่ตรงกัน และ ETL รายคืนที่ช้า
  • Lakehouse คืออะไร: Object Storage, Open Table Format, Catalog และ Query Engine
  • แยก Storage ออกจาก Compute และให้หลาย Engine อ่านข้อมูลชุดเดียวกัน
  • ภาพรวมโครงงานตลอด 3 วัน: ระบบเงินฝากจำลอง ไปจนถึงตาราง Gold สำหรับ Dashboard
  • ข้อมูลจำลองและการรันภายในองค์กร เพื่อให้สอดคล้องแนวทาง PDPA

Section 2: ออกแบบ Medallion Architecture และ Data Model

  • หน้าที่ของชั้น Bronze, Silver และ Gold และกติกาว่าข้อมูลแต่ละชั้นใช้ทำอะไรได้
  • ตั้งชื่อ Schema, ตาราง และคอลัมน์ให้สม่ำเสมอ พร้อมนโยบายเก็บข้อมูลแต่ละชั้น
  • สรุป Star Schema: Fact และ Dimension สำหรับข้อมูลธุรกรรม
  • Slowly Changing Dimension Type 2 สำหรับเก็บประวัติข้อมูลลูกค้าและบัญชี
  • Workshop: ออกแบบชั้นข้อมูลและ Data Model ของโครงงาน

Section 3: Lab: เปิด Lakehouse Stack ด้วย Docker Compose

  • องค์ประกอบของ Stack: PostgreSQL ต้นทาง, Object Storage, Iceberg Catalog, Trino และ Airflow
  • ตั้งค่า Trino Catalog สำหรับ Iceberg และ PostgreSQL
  • สร้าง Bucket และ Schema ของชั้น Bronze, Silver และ Gold
  • Query ข้ามระบบด้วย Trino CLI หรือ DBeaver
  • ตรวจทรัพยากรเครื่องและแก้ปัญหาที่พบบ่อยของ Container

Section 4: รูปแบบการนำเข้าข้อมูลและแนวคิด CDC

  • Full Load, Incremental Load แบบ Watermark และ Change Data Capture ต่างกันอย่างไร
  • เกณฑ์เลือกตามขนาดข้อมูล ความสดที่ต้องการ และภาระของระบบต้นทาง
  • CDC แบบอ่าน Log เทียบกับแบบ Query และการจัดการข้อมูลที่ถูกลบหรือมาช้า
  • Idempotency: ออกแบบให้รันซ้ำแล้วได้ผลเหมือนเดิม
  • สาธิตโดยวิทยากร: CDC ด้วย Debezium และ Apache Kafka

Section 5: Lab: Airflow DAG นำข้อมูลเข้าชั้น Bronze

  • สรุป Airflow 3 สำหรับงานนี้: DAG, Task และ TaskFlow API
  • เขียน Task ดึงข้อมูลแบบ Incremental จาก PostgreSQL ลงตาราง Iceberg ชั้น Bronze
  • เก็บ Watermark และคอลัมน์ Metadata เช่นเวลานำเข้าและรอบการรัน
  • ตั้ง Schedule, Retry และ Alert เมื่อ Pipeline ล้มเหลว
  • Workshop: ให้ธุรกรรมใหม่ไหลเข้าชั้น Bronze อัตโนมัติ
Day 2 แปลงข้อมูลด้วย dbt, Data Quality และ Data Contract

Section 6: dbt บน Lakehouse

  • สรุป dbt สำหรับงานนี้: Model, source, ref และ Materialization
  • เชื่อม dbt กับ Trino ผ่าน dbt-trino และสร้าง Model เป็นตาราง Iceberg
  • จัดโฟลเดอร์โปรเจกต์ให้ตรงกับชั้น Bronze, Silver และ Gold
  • Lab: ตั้งค่าโปรเจกต์ dbt และประกาศ Source จากชั้น Bronze

Section 7: Lab: จาก Bronze สู่ Silver

  • ทำความสะอาดข้อมูล แปลงชนิดข้อมูล และตัดรายการซ้ำ
  • Incremental Model แบบ merge บนตาราง Iceberg
  • จัดการข้อมูลที่มาช้า และรายการที่ถูกยกเลิกหรือแก้ไข
  • Lab: สร้างตารางธุรกรรมและบัญชีชั้น Silver ที่เชื่อถือได้

Section 8: Lab: จาก Silver สู่ Gold

  • สร้าง Fact และ Dimension ตาม Star Schema ที่ออกแบบไว้
  • เก็บประวัติแบบ SCD Type 2 ด้วย dbt Snapshot
  • ตารางสรุปสำหรับ Dashboard เช่นยอดคงเหลือและธุรกรรมรายวัน
  • Lab: สร้างชั้น Gold และ Query ผ่าน Trino ให้พร้อมใช้งาน

Section 9: Data Quality Test ระดับ Pipeline

  • Generic Test: not_null, unique, accepted_values และ relationships
  • Singular Test สำหรับกฎธุรกิจ เช่นยอดคงเหลือต้องตรงกับผลรวมธุรกรรม
  • ระดับความรุนแรง warn และ error และการเก็บรายการที่ไม่ผ่าน
  • Lab: วาง Test ครบทุกชั้นและทดลองให้ Test จับข้อมูลผิด

Section 10: Lab: Data Contract และ Pipeline ครบวงจร

  • Data Contract คืออะไร และใครตกลงอะไรระหว่างผู้ผลิตกับผู้ใช้ข้อมูล
  • Model Contract: บังคับชื่อคอลัมน์และชนิดข้อมูล พร้อมข้อจำกัดบน Trino
  • Source Freshness: กำหนดเกณฑ์ความสดของข้อมูลต้นทาง
  • ให้ Airflow เรียก dbt ต่อจากการนำเข้า และหยุดทันทีเมื่อผิดสัญญา
  • Lab: เปลี่ยน Schema ต้นทางแล้วดู Pipeline หยุดก่อนข้อมูลผิดไหลถึง Gold
Day 3 Apache Iceberg, Observability และ Capstone

Section 11: เจาะลึก Apache Iceberg

  • Open Table Format แก้ปัญหาอะไรของไฟล์ Parquet ที่วางไว้ใน Data Lake
  • โครงสร้างภายใน: Metadata File, Manifest, Snapshot และ Catalog
  • ACID Transaction และการเขียนพร้อมกันจากหลาย Engine
  • เปรียบเทียบ Iceberg กับ Delta Lake โดยสรุป

Section 12: Lab: Time Travel และงานตรวจสอบ

  • ดู Snapshot และประวัติของตารางผ่าน Metadata Table
  • Query ข้อมูล ณ เวลาใดเวลาหนึ่งด้วย FOR TIMESTAMP AS OF และ FOR VERSION AS OF
  • ย้อนตารางกลับไปยัง Snapshot ก่อนหน้าเมื่อโหลดข้อมูลผิด
  • Lab: ตอบคำถามว่ายอดคงเหลือ ณ สิ้นวันก่อนหน้าเป็นเท่าไร

Section 13: Schema Evolution และ Partitioning

  • เพิ่ม เปลี่ยนชื่อ หรือขยายชนิดคอลัมน์โดยไม่ต้องเขียนข้อมูลใหม่
  • Hidden Partitioning และการเลือก Partition ตามรูปแบบ Query
  • Partition Evolution เมื่อปริมาณข้อมูลเปลี่ยน
  • Lab: เพิ่มคอลัมน์ช่องทางทำรายการและปรับ Partition ของตารางธุรกรรม

Section 14: Lab: ดูแลตารางและประสิทธิภาพ

  • ปัญหาไฟล์เล็กจำนวนมากจากการนำเข้าบ่อย
  • Compaction ด้วย optimize และลบ Snapshot เก่าด้วย expire_snapshots
  • ลบไฟล์ที่ไม่ถูกอ้างอิง และวางรอบงานดูแลตารางด้วย Airflow
  • Lab: วัดเวลา Query ก่อนและหลัง Compaction

Section 15: Data Observability และ Data Lineage

  • เฝ้าระวัง Freshness, Volume และ Schema Drift ของแต่ละชั้น
  • แสดง Lineage จากระบบต้นทางถึงรายงานด้วย dbt docs
  • ตัวอย่างความคาดหวังด้าน Lineage ในงานการเงิน เช่นหลักการ BCBS 239
  • Lab: ตั้งการแจ้งเตือนเมื่อข้อมูลไม่สดหรือจำนวนแถวผิดปกติ

Section 16: Workshop: Capstone Project

  • รัน Pipeline ทั้งเส้นตั้งแต่ธุรกรรมใหม่ในระบบต้นทางถึงตาราง Gold
  • นำเสนอสถาปัตยกรรมและจุดควบคุมคุณภาพข้อมูลในแต่ละชั้น
  • สาธิต Time Travel และ Lineage เพื่อตอบคำถามเชิงตรวจสอบ
  • รีวิวร่วมกัน และแนวทางต่อยอด เช่น CDC แบบเต็มรูปแบบ และ CI/CD สำหรับงานข้อมูล

ຮອບຝຶກອົບຮົມ ແລະ ຮູບແບບການຝຶກອົບຮົມ

ສຳລັບບຸກຄົນ — ຮອບຝຶກອົບຮົມທົ່ວໄປ

ຂະນະນີ້ຍັງບໍ່ມີຮອບຝຶກອົບຮົມເປີດຮັບສະໝັກ ລົງຊື່ຈອງໄວ້ໄດ້ເລີຍ ທີມງານຈະຕິດຕໍ່ກັບເປັນກຸ່ມທຳອິດເມື່ອເປີດຮອບຕໍ່ໄປ ຫຼື ສອບຖາມທາງ LINE ຫຼື ໂທ 02-570-8449 ຫຼື 088-807-9770

ສຳລັບອົງກອນ — In-house / Private Training

  • ປັບເນື້ອໃນໃຫ້ກົງກັບເຄື່ອງມື ແລະ ວຽກຈິງຂອງທີມ
  • ເລືອກວັນເອງ ຝຶກອົບຮົມທີ່ບໍລິສັດ ຫຼື ອອນລາຍສົດ
  • ອອກໃບສະເໜີລາຄາໃນນາມນິຕິບຸກຄົນໃຫ້ຝ່າຍຈັດຊື້
ຂໍໃບສະເໜີລາຄາຝຶກອົບຮົມອົງກອນ

ວິທະຍາກອນຜູ້ສອນ

ຄຳຖາມທີ່ພົບເລື້ອຍ

หลักสูตรนี้ต่างจาก Data Pipeline ด้วย Apache Airflow และ dbt อย่างไร

Data Pipeline ด้วย Apache Airflow และ dbt สอนสองเครื่องมือนี้อย่างละเอียด ตั้งแต่ติดตั้ง Airflow เขียน DAG จัดตารางเวลา ไปจนถึงโปรเจกต์ dbt และ Test บนคลังข้อมูล หลักสูตรนี้เป็นหลักสูตรด้านสถาปัตยกรรม Lakehouse ที่ใช้ Airflow และ dbt เป็นเครื่องมือทำงานโดยสรุปพื้นฐานให้สั้น แล้วใช้เวลาส่วนใหญ่กับการออกแบบ Medallion บน Object Storage ร่วมกับ Apache Iceberg และ Trino รูปแบบการนำเข้าข้อมูลและแนวคิด CDC, Data Contract, Time Travel, Schema Evolution, การดูแลตาราง Iceberg, Observability และ Lineage ปิดท้ายด้วย Capstone หากยังไม่เคยใช้ Airflow หรือ dbt แนะนำให้เรียนหลักสูตร Data Pipeline ก่อน หรือเตรียมพื้นฐานมาล่วงหน้า

เครื่องของผู้เรียนต้องมีสเปกเท่าไรสำหรับ Lab

Lab ทั้งหมดรันด้วย Docker Compose บนโน้ตบุ๊กหรือ VM ของผู้เรียนเอง ประกอบด้วย PostgreSQL, Object Storage, Iceberg Catalog, Trino และ Airflow ซึ่งเฉพาะ Airflow ต้องการหน่วยความจำสำหรับ Docker อย่างน้อย 4 GB และ Trino ก็ต้องการหน่วยความจำพอสมควร จึงแนะนำ RAM 16 GB ขึ้นไป (ขั้นต่ำ 12 GB โดยปิดโปรแกรมอื่น) CPU 4 Core และพื้นที่ว่างประมาณ 40 GB พร้อมสิทธิ์ติดตั้ง Docker ส่วน Debezium และ Kafka เป็นการสาธิตโดยวิทยากร จึงไม่ต้องรันบนเครื่องผู้เรียน

ทำไมหลักสูตรพูดถึง Object Storage แบบ S3-compatible แทนการระบุ MinIO อย่างเดียว

ในปี 2026 MinIO รุ่น Community เปลี่ยนเป็นแจกเฉพาะ Source Code และ Repository หลักไม่ได้รับการดูแลต่อแล้ว หลักสูตรจึงสอนแนวคิดที่ใช้ได้กับ Object Storage แบบ S3-compatible ทุกตัว และเลือกตัวที่เหมาะกับการทำ Lab ณ วันอบรม เช่น MinIO ที่ Build จาก Source หรือ SeaweedFS โดย Iceberg และ Trino เชื่อมผ่าน S3 API เหมือนกัน เมื่อนำไปใช้จริงในองค์กร ควรเลือก Object Storage ที่มีผู้ดูแลต่อเนื่องหรือมีสัญญาสนับสนุนตามนโยบายขององค์กร

ต้องใช้ข้อมูลจริงขององค์กรในการอบรมหรือไม่

ไม่ต้อง ทุก Lab ใช้ข้อมูลจำลองของระบบเงินฝากที่สร้างด้วยสคริปต์ และรันบนเครื่องของผู้เรียนเท่านั้น ไม่มีการส่งข้อมูลออกไปยังบริการภายนอก แนวทางนี้ช่วยให้นำไปทดลองต่อในองค์กรได้โดยไม่ต้องใช้ข้อมูลส่วนบุคคลจริง และสอดคล้องกับแนวทางการคุ้มครองข้อมูลส่วนบุคคลตาม PDPA หากต้องการปรับ Lab ให้ใกล้กับระบบขององค์กร สามารถขอจัดเป็น In-house ได้

หลักสูตรใช้ Airflow และ dbt รุ่นใด

หลักสูตรใช้ Apache Airflow 3 และเขียน DAG ด้วย TaskFlow API ส่วนการแปลงข้อมูลใช้ dbt Core รุ่น 1.x ร่วมกับ dbt-trino Adapter รุ่นที่เข้ากันได้ล่าสุด ณ วันอบรม เนื่องจาก dbt v2 ที่เพิ่งออกในปี 2026 ใช้ระบบ Adapter แบบใหม่ หลักสูตรจะสรุปภาพรวมของ dbt v2 ให้ แต่ Lab อิงชุดที่รองรับ Trino แล้ว เครื่องมือเหล่านี้ออกรุ่นใหม่บ่อย เนื้อหาจะปรับตามรุ่นล่าสุดที่ใช้งานร่วมกันได้ ณ วันอบรม

ถ้าองค์กรใช้ Microsoft Fabric ควรเรียนหลักสูตรไหน

หลักสูตรนี้ใช้เครื่องมือโอเพนซอร์สที่ติดตั้งภายในองค์กรได้ แนวคิดอย่าง Medallion Architecture, Data Quality, Data Contract และ Lineage นำไปใช้กับ Fabric ได้เช่นกัน แต่หากต้องการลงมือบน Fabric โดยตรง ทั้ง OneLake, Lakehouse, Pipeline และ Notebook แนะนำหลักสูตร Microsoft Fabric Essentials ของสถาบัน