Section 11: Lab: Preference Tuning ด้วย DPO
- ทำไมต้องปรับตามความชอบ เมื่อ SFT อย่างเดียวยังไม่พอ
- หลักการ DPO และรูปแบบข้อมูลคู่คำตอบที่ดีกว่าและแย่กว่า
- ภาพรวม Reinforcement Learning แบบ GRPO สำหรับงานที่ตรวจคำตอบได้
- Lab: ปรับโมเดลด้วย DPO ให้ตอบสุภาพและกระชับตามแนวทางองค์กร
Section 12: Lab: Merge และ Export โมเดล
- เก็บแบบ Adapter แยก หรือ Merge เข้ากับโมเดลตั้งต้น เลือกอย่างไร
- Merge Adapter และบันทึกเป็นโมเดลเต็มบน Hugging Face Hub แบบ Private
- แปลงเป็น GGUF และเลือกระดับ Quantization
- ตรวจคุณภาพหลัง Quantize ด้วยชุดทดสอบเดิม
- เขียน Model Card บอกข้อมูลฝึก ข้อจำกัด และวิธีใช้งาน
Section 13: Lab: นำโมเดลขึ้นใช้งาน
- สร้าง Modelfile และรันโมเดลที่ฝึกเองบน Ollama
- ให้บริการบน vLLM และโหลด LoRA Adapter หลายตัวบนโมเดลตั้งต้นเดียว
- เรียกใช้ผ่าน OpenAI-compatible API จากแอปเดิม
- Lab: เชื่อมโมเดลที่ฝึกเองเข้ากับสคริปต์งานจริงของธุรกิจตัวอย่าง
Section 14: License, ความปลอดภัย และการดูแลโมเดล
- License ของโมเดลตั้งต้นและข้อมูล กับสิทธิ์การใช้เชิงพาณิชย์
- ทดสอบความปลอดภัยของโมเดลหลังฝึก เช่น การตอบเรื่องที่ไม่ควรตอบ และข้อมูลรั่ว
- ระบบ Version ของข้อมูล Adapter และโมเดล เพื่อย้อนกลับได้
- วางรอบการฝึกใหม่เมื่อข้อมูลหรือโมเดลตั้งต้นเปลี่ยน
- ประเมินต้นทุนการฝึกและการให้บริการเทียบกับการใช้ API
Section 15: Capstone: Fine-tune โมเดลสำหรับงานของตัวเอง
- เลือกโจทย์จากงานขององค์กรตัวเองหรือโจทย์ตัวอย่างที่เตรียมไว้
- เตรียมข้อมูล ฝึก และปรับจูนอย่างน้อยสองรอบ
- วัดผลเทียบกับ Baseline และสรุปว่าคุ้มค่าหรือไม่
- Export และรันบน Ollama หรือ vLLM แล้วนำเสนอผลพร้อมรีวิวร่วมกัน