Section 1: ภาพรวม Text Analytics ภาษาไทย
- งานวิเคราะห์ข้อความในธุรกิจ: รีวิว โซเชียล แชต และแบบสอบถามปลายเปิด
- ทำไมภาษาไทยยาก: ไม่เว้นวรรค สแลง คำสะกดผิด และอีโมจิ
- เลือกวิธีให้เหมาะ: กฎ, Machine Learning, โมเดลภาษา หรือ LLM
- Lab: เตรียม Google Colab และโหลดชุดรีวิวภาษาไทยตัวอย่าง
Section 2: Lab: ตัดคำและประมวลผลด้วย PyThaiNLP
- ตัดคำด้วย Engine ต่าง ๆ และเปรียบเทียบผลลัพธ์
- ตัดประโยค ระบุชนิดของคำ และ Normalize ข้อความ
- เพิ่มคำศัพท์เฉพาะธุรกิจ เช่น ชื่อสินค้าและชื่อสาขา ลงพจนานุกรม
- Lab: ตัดคำรีวิวทั้งชุดแล้วนับคำที่พบบ่อย
Section 3: ทำความสะอาดข้อความจากโซเชียล
- จัดการ URL, Hashtag, Mention และอีโมจิ
- ตัดตัวอักษรซ้ำ เช่น มากกกก และแปลง 555 ให้มีความหมาย
- Stopword ภาษาไทยและเมื่อไรไม่ควรตัดทิ้ง
- Lab: สร้างฟังก์ชันทำความสะอาดข้อความที่ใช้ซ้ำได้
Section 4: Lab: คำสำคัญและการเปรียบเทียบด้วย TF-IDF
- Bag-of-Words, N-gram และ TF-IDF กับข้อความภาษาไทย
- หาคำที่โดดเด่นของรีวิวเชิงบวกเทียบกับเชิงลบ
- Word Cloud ภาษาไทยที่แสดงฟอนต์ได้ถูกต้อง
- Lab: เปรียบเทียบคำสำคัญของแต่ละสาขาหรือแต่ละสินค้า
Section 5: Lab: โมเดล Sentiment แบบดั้งเดิม
- เตรียม Label และแบ่งข้อมูล Train กับ Test
- TF-IDF ร่วมกับ Logistic Regression ด้วย scikit-learn
- วัดผลด้วย Precision, Recall, F1 และ Confusion Matrix
- ดูข้อความที่โมเดลทายผิดเพื่อหาสาเหตุ
- Lab: สร้างโมเดลจำแนกรีวิวบวก กลาง และลบ
Section 6: Embedding และโมเดลภาษาไทยบน Hugging Face
- แนวคิด Embedding และ Transformer แบบเข้าใจง่าย
- โมเดลภาษาไทยอย่าง WangchanBERTa และโมเดล Embedding หลายภาษา
- ใช้ Pipeline ของ Hugging Face จำแนกข้อความโดยไม่ต้อง Train เอง
- Lab: ค้นหารีวิวที่ความหมายใกล้กันด้วย Embedding