Section 1: ภาพรวม Document AI และการเลือกแนวทาง
- งานเอกสารที่เหมาะกับ AI: ใบแจ้งหนี้ ใบกำกับภาษี ใบเสร็จ แบบฟอร์ม และสัญญา
- OCR แบบดั้งเดิม, Document AI Service และ Vision LLM ต่างกันอย่างไร
- ความยากของเอกสารไทย: ไม่เว้นวรรคระหว่างคำ วรรณยุกต์ ตัวเลขไทย และลายมือ
- เกณฑ์เลือก: ความแม่นยำ ต้นทุนต่อหน้า ความเร็ว และข้อมูลออกนอกองค์กรได้หรือไม่
- Lab: เตรียม Python และชุดเอกสารจำลองสำหรับทุก Lab
Section 2: เตรียมไฟล์และภาพก่อนส่งให้ AI
- แยก PDF ที่มี Text Layer ออกจาก PDF สแกน และดึงข้อความโดยไม่ต้อง OCR
- แปลง PDF เป็นภาพ ปรับความละเอียด หมุน ตัดขอบ และลด Noise
- จัดการเอกสารหลายหน้า ภาพถ่ายจากมือถือ และเอกสารที่เอียง
- Lab: สคริปต์คัดแยกและเตรียมไฟล์เอกสารแบบอัตโนมัติ
Section 3: Lab: OCR ภาษาไทยด้วย Typhoon OCR
- Typhoon OCR โมเดล Vision-Language แบบเปิดสำหรับเอกสารไทยและอังกฤษ
- รันโมเดลบน Google Colab หรือ Cloud GPU และเรียกใช้ผ่าน API
- ผลลัพธ์แบบ Markdown ที่รักษาตาราง หัวข้อ และลำดับการอ่าน
- Lab: OCR ใบแจ้งหนี้และแบบฟอร์มภาษาไทยแล้วตรวจความถูกต้อง
Section 4: Document AI Service บนคลาวด์
- Azure Document Intelligence: โมเดล Read, Layout และ Prebuilt Invoice ที่รองรับภาษาไทย
- ดึงตาราง Key-Value และช่องติ๊กเลือกจากแบบฟอร์ม
- ค่าใช้จ่ายต่อหน้า Free Tier และตำแหน่งที่ตั้งของข้อมูล
- Lab: ดึงข้อมูลใบแจ้งหนี้ด้วยโมเดล Prebuilt แล้วเทียบกับ Typhoon OCR
Section 5: Vision LLM อ่านเอกสารโดยตรง
- ส่งภาพหรือ PDF ให้ Gemini และโมเดลของ OpenAI อ่านพร้อมคำสั่งที่ชัดเจน
- Prompt สำหรับเอกสาร: ระบุฟิลด์ หน่วย รูปแบบวันที่ และวิธีจัดการช่องว่าง
- OCR ก่อนแล้วให้ LLM จัดโครงสร้าง เทียบกับส่งภาพให้ LLM โดยตรง
- ความเสี่ยงที่โมเดลแต่งข้อมูล และวิธีบังคับให้ตอบว่าไม่พบ
- Lab: อ่านใบเสร็จและสัญญาภาษาไทยด้วย Vision LLM
Section 6: Lab: Structured Output และ JSON Schema
- ออกแบบ Schema ของใบแจ้งหนี้และแบบฟอร์มด้วย Pydantic
- ใช้ Structured Output ของ Gemini API และ OpenAI API ให้ได้ JSON ตาม Schema
- รายการสินค้าหลายบรรทัด ฟิลด์ซ้อน และค่าที่ไม่บังคับ
- Lab: แปลงใบแจ้งหนี้ทั้งชุดเป็น JSON ที่ผ่าน Schema