🔒 ข้อมูลไม่ออกจากองค์กร 💻 รันบนเครื่องตัวเอง 🆓 ไม่มีค่า API รายเดือน 🇹🇭 มีโมเดลภาษาไทย

ทำ AI ใช้เองแบบ Local
ตั้งแต่เริ่มต้นถึงขั้น Advanced

"Local AI" คือการรันโมเดล AI ไว้บนเครื่องของคุณเองหรือเซิร์ฟเวอร์ในองค์กร (On-Premise) — ข้อมูลไม่ต้องส่งขึ้นคลาวด์ต่างประเทศ ไม่มีค่าใช้จ่ายต่อครั้ง ใช้แบบออฟไลน์ได้ และปรับแต่งได้เต็มที่ หน้านี้คือบทเรียนครบวงจร: ต้องใช้เครื่องสเปกแค่ไหน อุปกรณ์แต่ละแบบต่างกันอย่างไร ใช้ซอฟต์แวร์และโมเดลตัวไหน ไปจนถึง Use Case จริงแยกตามประเภทองค์กร

ทำไมต้อง Local

ทำไมองค์กรถึงอยากรัน AI เองบนเครื่องตัวเอง

ผู้ช่วย AI บนคลาวด์ (ChatGPT, Claude, Gemini) เก่งและใช้ง่าย แต่ทุกครั้งที่พิมพ์ ข้อมูลจะถูกส่งออกไปประมวลผลที่เซิร์ฟเวอร์ของผู้ให้บริการ — สำหรับข้อมูลคนไข้ ข้อมูลประชาชน สัญญาลูกความ หรือความลับทางการค้า นั่นคือความเสี่ยง Local AI ตอบโจทย์นี้ด้วยหลักการง่าย ๆ ว่า "ข้อมูลอยู่ที่ไหน โมเดลไปหาที่นั่น"

🔒 ความเป็นส่วนตัวข้อมูลไม่ออกจากเครื่อง/องค์กร ช่วยให้สอดคล้อง PDPA และความลับของลูกค้า
💸 ต้นทุนคงที่จ่ายค่าเครื่องครั้งเดียว ใช้ได้ไม่จำกัด ไม่มีบิลต่อโทเคนที่บานปลาย
📴 ออฟไลน์ได้ทำงานได้แม้เน็ตล่มหรือในพื้นที่ปิด (air-gapped) เช่นโรงงาน โรงพยาบาล
🛠️ ปรับแต่งเต็มที่เลือกโมเดล จูนด้วยข้อมูลตัวเอง ต่อเข้าระบบภายในได้อิสระ

พูดตรง ๆ ก่อน: โมเดลที่รันเอง(โอเพนซอร์ส) โดยทั่วไปยัง "ฉลาดสู้" โมเดลคลาวด์ระดับแนวหน้าอย่าง GPT/Claude/Gemini รุ่นท็อปไม่ได้เต็มร้อย และต้องมีคนดูแลเครื่อง องค์กรส่วนใหญ่จึงใช้แบบ ไฮบริด — งานที่ข้อมูลอ่อนไหว/งานประจำใช้ Local ส่วนงานยากสุด ๆ ที่ไม่ลับค่อยส่งคลาวด์

พื้นฐานที่ต้องรู้ก่อน

4 คำที่ต้องเข้าใจ แล้วเรื่องสเปกจะง่ายขึ้นมาก

ก่อนไปเลือกซื้อเครื่อง มาทำความเข้าใจ 4 คำนี้ก่อน เพราะมันคือหัวใจที่ตัดสินว่า "เครื่องของคุณรันโมเดลตัวไหนได้ และเร็วแค่ไหน"

01

โมเดล & พารามิเตอร์ (B)

โมเดลคือไฟล์ก้อนใหญ่ที่ "เรียนรู้ภาษามาแล้ว" ขนาดวัดด้วยจำนวนพารามิเตอร์ หน่วยเป็น B (พันล้าน)

  • 7–8B = เล็ก คล่อง เหมาะเริ่มต้น
  • 13–14B / 30–34B = กลาง ฉลาดขึ้น
  • 70B ขึ้นไป = ใหญ่ ฉลาดมาก แต่กินเครื่องแรง
ยิ่ง B เยอะ ยิ่งฉลาด แต่ยิ่งกินหน่วยความจำและช้าลง — เกมคือหา "จุดพอดี" กับเครื่องที่มี
02

Quantization (บีบอัดโมเดล)

เทคนิค "ลดความละเอียดตัวเลข" ในโมเดลให้ไฟล์เล็กลง รันบนเครื่องบ้านได้ โดยคุณภาพลดนิดเดียว

  • รูปแบบยอดนิยม: GGUF (ใช้กับ llama.cpp/Ollama)
  • ระดับบีบอัด: Q8 > Q6 > Q4_K_M > Q3 > Q2
  • Q4_K_M คือจุดคุ้มที่สุด — เล็กลง ~4 เท่า คุณภาพยังดี
โมเดล 8B แบบเต็มกินราว 16GB แต่ถ้าเป็น GGUF Q4 จะเหลือราว 4–5GB รันบนการ์ดจอ 8GB ได้สบาย
03

VRAM = คอขวดตัวจริง

โมเดลต้องถูกโหลดเข้า "หน่วยความจำเร็ว" ให้หมดก้อนถึงจะรันลื่น นั่นคือ VRAM ของการ์ดจอ (หรือ Unified Memory ของ Mac)

  • สูตรคร่าว ๆ ที่ Q4: ต้องมี VRAM ≈ ขนาด B × 0.6 GB
  • บวกเผื่อ context/ระบบอีก ~2–4GB
  • ถ้าโมเดลใหญ่กว่า VRAM → ต้องพึ่ง RAM/CPU ช่วย ซึ่ง ช้าลงมาก
เลข VRAM สำคัญกว่ารุ่นการ์ดจอ — การ์ดถูกที่ VRAM 16GB รันโมเดลใหญ่กว่าการ์ดแพงที่ VRAM 8GB

สูตรจำง่าย "เครื่องนี้รันโมเดลได้ใหญ่แค่ไหน": เอา VRAM (GB) มา ลบ 2 (เผื่อระบบ) แล้วหารด้วย 0.6 = จำนวนพารามิเตอร์ (B) โดยประมาณที่รันไหวแบบ Q4 — เช่น การ์ด 12GB → (12−2)/0.6 ≈ รันได้ถึง ~16B, การ์ด 24GB → รันได้ถึง ~34B, เครื่อง 64GB → แตะ 70B ได้ (ตัวเลขเป็นค่าประมาณ ขึ้นกับ context และระดับ quantization)

ความเร็ว (tokens/วินาที): คือจำนวน "คำย่อย" ที่โมเดลพิมพ์ออกมาต่อวินาที ยิ่งเยอะยิ่งลื่น คนอ่านตามทันสบาย ๆ ที่ราว 7–10 tok/s ขึ้นไป — การ์ดจอแรงได้ 30–100+ tok/s ส่วนรันด้วย CPU ล้วนอาจเหลือ 2–5 tok/s (พอใช้กับงานเบื้องหลังที่ไม่รีบ)

สเปก & อุปกรณ์

ต้องใช้เครื่องสเปกแค่ไหน — เลือกตามงบและงาน

หลักการเดียวที่ต้องจำ: "ความจุหน่วยความจำ" ตัดสินว่ารันโมเดลได้ไหม ส่วน "แบนด์วิดท์หน่วยความจำ" ตัดสินว่าเร็วแค่ไหน — งานรัน AI ไม่ได้ใช้พลังคำนวณ (TFLOPS) เป็นหลัก แต่ติดที่หน่วยความจำ นี่คือเหตุผลที่ VRAM สำคัญกว่าความแรงของการ์ด

① ความจุ (VRAM / Unified Memory)

ต้องใหญ่พอ "อุ้ม" โมเดลทั้งก้อนเข้าไปได้ ถ้าไม่พอ ต้องพึ่ง RAM/CPU ช่วย ซึ่งทำให้ช้าลงมาก — ตัวเลขนี้กำหนดว่าคุณรัน 8B, 34B หรือ 70B ได้

② แบนด์วิดท์ (GB/s)

ยิ่งสูง ยิ่งพิมพ์คำตอบไว การ์ดจอ (HBM/GDDR) เร็วกว่า Unified Memory ของ Mac/มินิพีซี — Mac รุ่นใหญ่ "อุ้ม" โมเดลใหญ่ได้ แต่ "ช้ากว่า" การ์ดจอแท้

5 ระดับงบประมาณ — เริ่มจากฟรีถึงระดับองค์กร

ระดับ 0 · ฟรี

ลองด้วยเครื่องที่มีอยู่

การ์ดจอ 8GB+ หรือ CPU + RAM 16–32GB งบ 0 บาท

รันได้: โมเดล 3–8B แบบ Q4 (Llama 3.2 3B, Qwen3 4B, Gemma 3 4B, Phi-4-mini)

  • เหมาะกับ: ทดลองก่อนตัดสินใจลงทุน, งานสรุป/ร่างเบา ๆ
  • CPU ล้วนก็รันได้ แต่ช้า (~2–8 tok/s) — พอไหวกับงานเบื้องหลังที่ไม่รีบ
ระดับ 1 · เริ่มจริงจัง

การ์ด 16GB หรือ Mac 32GB

RTX 5060 Ti 16GB / 4060 Ti 16GB / 5070 Ti หรือ Mac mini/MacBook 32GB ~15,000–55,000 บาท

รันได้: สบายถึง 13–14B และแตะ 20–24B แบบ Q4

  • เหมาะกับ: ผู้ช่วยส่วนตัว/ทีมเล็ก, ถาม-ตอบเอกสาร (RAG), สรุป/แปล/ร่างงาน
  • เคล็ดลับ: เลือก "VRAM เยอะ" ก่อน "การ์ดแรง" — 16GB คุ้มกว่า 12GB ที่เร็วกว่า
ระดับ 2 · เอนทูเซียส

24–32GB หรือ Mac/มินิพีซี 128GB

RTX 4090 24GB (มือสอง) / RTX 5090 32GB Mac M4 Max 64–128GB มินิพีซี 128GB (Strix Halo/DGX Spark) ~70,000–200,000 บาท

รันได้: 30–34B ลื่นมาก; 70B ได้บนเครื่องหน่วยความจำใหญ่ (Mac/มินิพีซี) แต่ช้าลง (~10–18 tok/s)

  • เหมาะกับ: นักพัฒนา, ทีมงานหนัก, งานเขียนโค้ด/วิเคราะห์ที่ต้องการโมเดลฉลาดขึ้น
  • มินิพีซี 128GB กินไฟน้อย เงียบ เหมาะตั้งในออฟฟิศ (แต่ช้ากว่าการ์ดจอแท้)
ระดับ 3 · เซิร์ฟเวอร์ On-Prem

เซิร์ฟเวอร์ SME หลายผู้ใช้

RTX 6000 Ada 48GB / RTX PRO 6000 96GB Mac Studio M3 Ultra 512GB / 2× RTX 5090 ~250,000–600,000 บาท+

รันได้: 70B เร็ว, โมเดล MoE 100B+ (บนตัว 96GB/512GB), รองรับพนักงานหลายคนพร้อมกันด้วย vLLM

  • เหมาะกับ: องค์กร/SME ที่ต้องการผู้ช่วย AI ภายในให้ทั้งทีมใช้ โดยข้อมูลไม่ออกนอกองค์กร
  • เป็นจุดคุ้มทุนเมื่อเทียบกับค่า API รายเดือนของทีมใหญ่
ระดับ 4 · องค์กรใหญ่

ดาต้าเซนเตอร์ / มัลติ-GPU

เซิร์ฟเวอร์ GPU หลายใบ (H100 / H200) NVLink หลักล้านบาทขึ้นไป

รันได้: ทุกขนาดรวมโมเดล 405B, งานพร้อมกันจำนวนมหาศาล, เทรน/Fine-tune โมเดลเอง

  • เหมาะกับ: องค์กรใหญ่, ธนาคาร, ผู้ให้บริการ, สถาบันวิจัย, หน่วยงานรัฐขนาดใหญ่
  • ต้องมีห้องเซิร์ฟเวอร์ ระบบระบายความร้อน และทีม MLOps ดูแล

เรื่องราคาและไฟฟ้าที่ควรรู้: ช่วงปี 2568–2569 มีภาวะขาดแคลนชิปหน่วยความจำ (GDDR7) ทำให้ราคาการ์ดจอ "ผันผวนและสูงกว่าราคาตั้ง" ตัวเลขข้างบนเป็นค่าประมาณเท่านั้น ควรเช็กราคาจริงก่อนซื้อ — และการ์ดจอตัวแรง (RTX 5090 ~575W, RTX PRO 6000 ~600W) กินไฟมาก ร้อน เสียงดัง ต้องใช้ PSU และระบบระบายความร้อนที่ดี ส่วนเครื่อง Unified Memory (Mac/มินิพีซี) กินไฟน้อยและเงียบกว่ามาก เหมาะกับออฟฟิศ

เปรียบเทียบอุปกรณ์ & ความสามารถ

ตารางเทียบละเอียด — เครื่องไหนรันอะไรได้

สองตารางนี้คือหัวใจของการเลือกซื้อ: ตารางแรกจับคู่ "ขนาดโมเดล → เครื่องที่ต้องมี" ตารางที่สองเทียบอุปกรณ์ยอดนิยมแบบตัวต่อตัว

📊 ตาราง A — ขนาดโมเดล ต้องใช้หน่วยความจำเท่าไร (ที่ Q4)

ขนาดโมเดล VRAM/RAM ที่ต้องมี (รวม context) รันได้บนอะไร ตัวอย่างโมเดล เหมาะกับงาน
1–4B (จิ๋ว) ~4–6 GB โน้ตบุ๊ก, การ์ด 6–8GB, มือถือแรง ๆ, CPU ก็ไหว Llama 3.2 1B/3B · Qwen3 4B · Gemma 3 1B/4B · Phi-4-mini สรุป/ร่าง/แปลเบา ๆ, งาน edge, แชตพื้นฐาน
7–8B (เล็ก) ~6–8 GB การ์ด 8–12GB, Mac 16GB+ Llama 3.1 8B · Qwen3 8B · DeepSeek-R1 distill 8B ผู้ช่วยทั่วไป, RAG เอกสาร, งานประจำวัน
13–14B (กลาง-เล็ก) ~10–12 GB การ์ด 12–16GB, Mac 32GB Qwen3 14B · Gemma 3 12B · Phi-4 14B ตอบยากขึ้น, เขียนเนื้อหา, วิเคราะห์เบื้องต้น
24–34B (กลาง) ~18–24 GB การ์ด 24GB (4090/5090), Mac 32–64GB Qwen3 32B · Gemma 3 27B · Mistral Small 24B งานหนักขึ้น เขียนโค้ด วิเคราะห์ ให้เหตุผล
70B (ใหญ่) ~40–48 GB (ไม่พอดีการ์ด 24/32GB ใบเดียว) การ์ด 48GB+, Mac 64–128GB, มินิพีซี 128GB, 2 การ์ด Llama 3.3 70B · Qwen2.5 72B · OpenThaiGPT 72B งานคุณภาพสูง ใกล้เคียงระดับมืออาชีพ
100B+ MoE (ใหญ่มาก) ~120–400 GB เครื่องหน่วยความจำใหญ่มาก (Mac 512GB) หรือเซิร์ฟเวอร์ GPU Llama 4 · Qwen3 235B-A22B · DeepSeek V3/R1 671B งานยากสุด ระดับใกล้โมเดลคลาวด์ (ต้องเครื่องแรงจริง)

MoE คืออะไร? โมเดลแบบ "Mixture of Experts" มีพารามิเตอร์รวมมหาศาล แต่ตอนใช้จริงจะ "จุด" เฉพาะบางส่วน (active) เท่านั้น จึงเร็วกว่าที่ขนาดบอก — แต่ต้องมีหน่วยความจำอุ้ม "ทั้งก้อน" อยู่ดี เช่น Qwen3 235B-A22B ใช้พารามิเตอร์จริงตอนตอบแค่ ~22B แต่ยังต้องการ RAM ~120GB+

🖥️ ตาราง B — เทียบอุปกรณ์ยอดนิยมตัวต่อตัว (เลื่อนดูแนวนอนได้)

อุปกรณ์ หน่วยความจำ โมเดลใหญ่สุด (Q4) ความเร็วโดยรวม ราคาโดยประมาณ เหมาะกับ
โน้ตบุ๊ก/พีซีเดิม GPU 8GB หรือ CPU+RAM 3–8B พอใช้ 0 บาท ทดลอง เรียนรู้
RTX 5060 Ti / 4060 Ti 16GB 16GB VRAM ~14B เร็ว ~15,000–25,000฿ เริ่มจริงจัง งบประหยัด
RTX 5080 / 5070 Ti 16GB GDDR7 ~14–20B เร็วมาก ~35,000–55,000฿ เกม + AI กลาง ๆ
RTX 4090 (มือสอง) 24GB VRAM ~34B เร็วมาก ~80,000–130,000฿ นักพัฒนา งานหนัก
RTX 5090 32GB GDDR7 ~34B (70B ต้องบีบอัดแรง) เร็วที่สุดฝั่งผู้บริโภค ~70,000–120,000฿ การ์ดผู้บริโภคดีสุดสำหรับ AI
Mac mini / MacBook (M4) 16–32GB Unified ~14–22B ปานกลาง ~25,000–70,000฿ เงียบ ประหยัดไฟ พกพา
Mac Studio (M4 Max) 64–128GB Unified 70B ปานกลาง (~12 tok/s @70B) ~90,000–200,000฿ รันโมเดลใหญ่แบบเงียบ
Mac Studio (M3 Ultra) สูงสุด 512GB Unified 100B+ MoE (ถึง 671B) ปานกลาง (~17 tok/s) ~300,000฿+ รัน "แทบทุกโมเดล" ในเครื่องเดียว
AMD Strix Halo (Framework Desktop) สูงสุด 128GB Unified 70B ปานกลาง ~70,000฿+ มินิพีซี x86 กินไฟน้อย ตั้งออฟฟิศ
NVIDIA DGX Spark 128GB Unified LPDDR5X 70B (ช้าที่โมเดลใหญ่) เล็กเร็ว/ใหญ่ช้า ~150,000–190,000฿ กล่องพัฒนา CUDA, ทดสอบ, งานพร้อมกันหลายชิ้น
เซิร์ฟเวอร์ GPU (RTX 6000 Ada/PRO 6000) 48–96GB VRAM 70B–100B+ เร็วมาก ~250,000–500,000฿ เซิร์ฟเวอร์องค์กร หลายผู้ใช้
ดาต้าเซนเตอร์ (H100/H200) 80–141GB HBM ต่อใบ ทุกขนาด (มัลติ-GPU) สูงสุด หลักล้าน฿ องค์กรใหญ่ เทรน/บริการขนาดใหญ่

📅 ข้อมูล ณ กลางปี 2569 (2026) — สเปก ราคา และรุ่นเปลี่ยนเร็วและผันผวนสูง (โดยเฉพาะราคาการ์ดจอช่วงชิปขาดตลาด) "โมเดลใหญ่สุด" เป็นค่าประมาณที่ context สั้น–ปานกลาง หากใช้ context ยาวจะกินหน่วยความจำมากขึ้น ควรเช็กหน้าทางการก่อนตัดสินใจ

ซอฟต์แวร์ที่ใช้

โปรแกรมสำหรับรัน AI บนเครื่อง — ตัวไหนเหมาะกับใคร

ข่าวดีคือ "ฟรีและติดตั้งง่าย" มีตั้งแต่โปรแกรมกดปุ่มเดียวสำหรับมือใหม่ ไปจนถึงตัวเสิร์ฟระดับองค์กร เลือกตามระดับความถนัด

โปรแกรม เหมาะกับ ระบบ API (ต่อแอปได้) RAG เอกสาร หลายผู้ใช้
LM Studio มือใหม่ (หน้าตาสวย กดง่าย) Win · Mac · Linux
Jan มือใหม่ (คล้าย ChatGPT, โอเพนซอร์ส) Win · Mac · Linux จำกัด
GPT4All มือใหม่ เน้นความเป็นส่วนตัว + คุยกับไฟล์ Win · Mac · Linux ✓ (LocalDocs)
Ollama นักพัฒนา/ทั่วไป (คำสั่ง + เซิร์ฟเวอร์) Win · Mac · Linux ผ่านตัวเสริม
Open WebUI ทีม/องค์กร (หน้าเว็บเหมือน ChatGPT) Docker/เซิร์ฟเวอร์ ต่อ Ollama/vLLM ✓ (แข็งแรง) ✓ (สิทธิ์/SSO)
AnythingLLM ทีม เน้นคุยกับเอกสาร + agent เดสก์ท็อป + Docker ✓ (จุดเด่น) ✓ (โหมดเซิร์ฟเวอร์)
llama.cpp ขั้นสูง (เครื่องยนต์ตัวจริง, GGUF) ทุกระบบ (แม้มือถือ)
vLLM โปรดักชัน/องค์กร (เสิร์ฟความเร็วสูง) Linux + GPU ✓ (คนเยอะพร้อมกัน)

Ollama

เริ่มง่ายสุดสำหรับต่อระบบ

ติดตั้งแล้วดึงโมเดลด้วยคำสั่งเดียว มีเซิร์ฟเวอร์ API ในตัว (เข้ากันได้กับ OpenAI) เป็น "มาตรฐาน" ที่นักพัฒนาใช้ต่อ Open WebUI หรือแอปอื่น

คำสั่ง: ollama run llama3.1 — จบ พิมพ์คุยได้เลย

LM Studio

เหมาะมือใหม่ที่สุด

แอปหน้าตาสวย มีที่ค้นหา/ดาวน์โหลดโมเดลในตัว บอกก่อนโหลดว่าเครื่องคุณไหวไหม แชตได้ทันที คุยกับไฟล์ได้ และเปิดเป็นเซิร์ฟเวอร์ API ก็ได้

บน Mac ใช้ backend MLX ได้ เร็วขึ้น ~30–50%

Open WebUI

สำหรับทั้งองค์กร

หน้าเว็บที่หน้าตาเหมือน ChatGPT เอามาครอบ Ollama/vLLM ได้ รองรับหลายผู้ใช้ กำหนดสิทธิ์/SSO, มีระบบ RAG แข็งแรง, ใส่เสียง/รูปได้ — เหมาะทำ "ChatGPT ส่วนตัวขององค์กร"

คู่ยอดนิยม: Ollama + Open WebUI (ทีมเล็ก) หรือ vLLM + Open WebUI (คนเยอะ)
ติดตั้งจริง ทีละขั้น

เริ่มรัน AI บนเครื่องคุณ — คัดลอกคำสั่งไปวางได้เลย

เลือกได้ 2 ทาง: ทาง A ไม่ต้องพิมพ์คำสั่งเลย (เหมาะมือใหม่สุด) หรือ ทาง B ใช้คำสั่ง Ollama ที่ต่อยอดเป็นระบบทั้งทีมได้ — ทุกกล่องคำสั่งมีปุ่มคัดลอก

🖱️ ทาง A — LM Studio

ไม่ต้องแตะ command line เลย เหมาะถ้าไม่เคยใช้มาก่อน

  1. โหลด LM Studio จาก lmstudio.ai แล้วติดตั้งเหมือนโปรแกรมทั่วไปรองรับ Windows / macOS / Linux
  2. ค้นหาโมเดลในแอป พิมพ์ เช่น "Llama 3.2 3B" หรือ "Typhoon" เลือกไฟล์ระดับ Q4_K_M แล้วกด Downloadแอปจะบอกก่อนว่าเครื่องคุณไหวไหม
  3. ไปแท็บ Chat เลือกโมเดล แล้วพิมพ์คุยได้เลยลองถามเป็นภาษาไทยกับโมเดล Typhoon
  4. (ถ้าต้องการ) เปิดเป็นเซิร์ฟเวอร์ แท็บ Developer → Start Server ได้ API ที่ localhost:1234ต่อกับแอปอื่นได้แบบเดียวกับ OpenAI

บน Mac ชิป M ให้เลือกไฟล์แบบ MLX จะเร็วขึ้นชัดเจน

⌨️ ทาง B — Ollama + Open WebUI

คำสั่งจริง คัดลอกไปวางใน Terminal / PowerShell (ต่อยอดให้ทั้งทีมใช้ได้)

  1. ติดตั้ง Ollama
    Linux / macOS
    curl -fsSL https://ollama.com/install.sh | sh
    Windows (PowerShell)
    irm https://ollama.com/install.ps1 | iex
    macOS จะใช้ Homebrew ก็ได้: brew install ollama · หรือโหลดตัวติดตั้งที่ ollama.com/download
  2. รันโมเดลแรก (โหลดครั้งแรกใช้เวลาสักครู่)
    ollama run llama3.2
    พิมพ์คุยได้เลย · พิมพ์ /bye เพื่อออก
  3. ลองโมเดลภาษาไทย (Typhoon โดย SCB 10X)
    ollama run scb10x/typhoon2.1-gemma3-4b
    เล็ก 3B: scb10x/llama3.2-typhoon2-3b-instruct · ใหญ่ 8B: scb10x/llama3.1-typhoon2-8b-instruct
    OpenThaiGPT: ollama run hf.co/openthaigpt/openthaigpt-1.0.0-7b-chat-gguf:Q4_KM (ตรวจแท็ก quant ที่หน้า HF ก่อน)
  4. คำสั่งที่ใช้บ่อย
    ollama list          # ดูโมเดลที่มี
    ollama pull bge-m3   # โหลด embedding สำหรับ RAG (ไทย)
    ollama ps            # ดูโมเดลที่กำลังรัน
    ollama rm llama3.2   # ลบโมเดลคืนพื้นที่
  5. เรียกใช้เป็น API (เข้ากันได้กับ OpenAI) ให้แอป/สคริปต์เดิมทำงานออฟไลน์
    curl http://localhost:11434/v1/chat/completions \
      -H "Content-Type: application/json" \
      -d '{
        "model": "llama3.2",
        "messages": [{"role":"user","content":"สวัสดี ช่วยแนะนำร้านกาแฟในกรุงเทพหน่อย"}]
      }'
    พอร์ต 11434 · เปลี่ยนแค่ base URL ก็ใช้กับไลบรารี OpenAI ได้เลย
  6. ยกระดับเป็นหน้าเว็บให้ทั้งทีม (Open WebUI) — ต้องมี Docker
    docker run -d -p 3000:8080 --add-host=host.docker.internal:host-gateway -v open-webui:/app/backend/data --name open-webui --restart always ghcr.io/open-webui/open-webui:main
    เสร็จแล้วเปิด http://localhost:3000 ได้หน้าเว็บเหมือน ChatGPT + อัปโหลดเอกสารทำ RAG (ต้องให้ ollama รันอยู่)

เตรียมพื้นที่และแรมให้พอ: โหลดโมเดลครั้งแรกกินพื้นที่หลาย GB (3–4B ~1–3GB, 7–8B ~4–5GB, bge-m3 ~1.2GB) · โมเดล 3–4B ใช้ RAM ~8GB, 7–8B ~16GB จะสบาย · ชื่อรุ่นโมเดลเปลี่ยนได้ ตรวจล่าสุดที่ ollama.com/library และ ollama.com/scb10x ก่อนดึง

ขั้นถัดไป (advanced): จะจูนโมเดลด้วยข้อมูลองค์กรใช้ Unslothpip install unsloth แล้วรันโน้ตบุ๊กฟรี (เร็วขึ้น ~2 เท่า ใช้ VRAM น้อยลง ~70%) จากนั้น export เป็น GGUF มารันบน Ollama ต่อได้ · ดูภาพรวมทั้งหมดที่ บทเรียน 4 ระดับ

โมเดลที่รันเองได้

เลือกโมเดล — โอเพนซอร์สระดับโลก + โมเดลภาษาไทย

โมเดล "โอเพนเวต" (เปิดให้ดาวน์โหลดน้ำหนักโมเดลไปรันเอง) พัฒนาไวมากจนใช้งานจริงได้ดี ส่วนใหญ่โหลดฟรีจาก Hugging Face หรือสั่งผ่าน Ollama ได้เลย

ดาวน์โหลดเวอร์ชันไหน? มองหาไฟล์แบบ GGUF ระดับ Q4_K_M เป็นค่าเริ่มต้น — เล็กลง ~4 เท่า คุณภาพลดแค่ ~3–4% ถ้าเครื่องเหลือหน่วยความจำค่อยขยับเป็น Q5_K_M/Q6 (ช่วยเรื่องโค้ด/การให้เหตุผล) · บน Mac ใช้รูปแบบ MLX จะเร็วกว่า · หลีกเลี่ยง Q2/Q3 เว้นแต่จำเป็น (บ่อยครั้ง "โมเดลเล็กกว่าที่ Q4" ดีกว่า "โมเดลใหญ่กว่าที่ Q2")

Llama

Meta
  • ขนาด: 1B/3B (เล็ก), 8B, 70B (Llama 3.3), Llama 4 Scout/Maverick (MoE ใหญ่)
  • License: Llama Community (โอเพนแบบมีเงื่อนไข)
  • เด่น: อเนกประสงค์ เป็น "ฐาน" ให้โมเดลไทยหลายตัว

Qwen

Alibaba
  • ขนาด: 0.6–32B + MoE 30B-A3B/235B-A22B; มีรุ่น Coder และ Vision
  • License: Apache 2.0 (โอเพนเต็ม ใช้เชิงพาณิชย์ได้)
  • เด่น: เก่งรอบด้านที่สุดสำหรับรันเองปี 2026 · ภาษาไทยใช้ได้ดี

Gemma

Google
  • ขนาด: 270M/1B/4B/12B/27B · รุ่น 4B+ อ่านรูปได้ · 140+ ภาษา
  • License: Gemma Terms (มีข้อจำกัดการใช้)
  • เด่น: เล็กแต่ดี เป็นฐานของ SEA-LION/Typhoon บางรุ่น

DeepSeek

DeepSeek AI
  • ขนาด: V3/R1 671B MoE (ใหญ่มาก) + รุ่นย่อ (distill) 1.5–70B ที่รันเองได้
  • License: MIT (ใจกว้างมาก)
  • เด่น: เก่งการให้เหตุผล (reasoning) · รุ่น distill รันบนเครื่องบ้านได้

Mistral

Mistral AI
  • ขนาด: Mistral Small 24B (Apache 2.0), Mixtral, Ministral 3B/8B
  • เด่น: เร็วและคุณภาพดีที่ 24B เหมาะการ์ด 24GB · มี Codestral สำหรับโค้ด

Phi

Microsoft
  • ขนาด: Phi-4 14B, Phi-4-mini 3.8B
  • License: MIT
  • เด่น: เล็กแต่เก่งเหตุผล/คณิต เหมาะเครื่องสเปกกลาง ๆ

โมเดลเล็ก (เครื่องสเปกอ่อน)

รันได้บนการ์ด 4–8GB หรือ CPU: Llama 3.2 1B/3B, Qwen3 0.6–4B, Gemma 3 1B/4B, Phi-4-mini — เหมาะงานสรุป/ร่าง/แปล และงาน edge

อ่านภาพ / สแกน (Vision)

Qwen3-VL, Llama 3.2 Vision, Gemma 3, LLaVA — อ่านรูปถ่าย ใบเสร็จ เอกสารสแกน แผนภาพ ได้โดยไม่ต้องส่งรูปขึ้นคลาวด์

เขียนโค้ด

Qwen2.5-Coder / Qwen3-Coder (รุ่น 32B ทำ HumanEval ~92%), DeepSeek-Coder, Codestral — ผู้ช่วยโปรแกรมเมอร์ในเครื่อง

Embedding (หัวใจของ RAG)

nomic-embed-text, bge-m3 (ไทย/หลายภาษา), mxbai, Qwen3-Embedding — แปลงเอกสารเป็นเวกเตอร์เพื่อให้ AI ค้นหาและอ้างอิงได้

🇹🇭 โมเดลภาษาไทย

โมเดลไทยที่รันเองได้ — ไม่ต้องพึ่งต่างชาติ

คนไทยพัฒนาโมเดลภาษาไทยของเราเองหลายตัว เข้าใจบริบท-สำนวนไทยดีกว่า และดาวน์โหลดมารันในองค์กรได้ ตอบโจทย์ "อธิปไตยทาง AI" และ PDPA

Typhoon (ไต้ฝุ่น)

SCB 10X
  • Typhoon 2.5 (ฐาน Qwen3): 4B + 30B MoE · Apache 2.0 · context 256K
  • รุ่นอื่น: Typhoon 2.1 Gemma (4B/12B), Typhoon 2 (1B/3B/8B/70B), Typhoon 2 R1 70B (reasoning)
  • เฉพาะทาง: Typhoon Audio / Vision / OCR / ASR (มีสำเนียงอีสาน) / Translate
โหลด: Hugging Face scb10x · Ollama scb10x · opentyphoon.ai — มี GGUF รันบน Ollama/LM Studio ได้

OpenThaiGPT

AIEAT · NECTEC · iApp
  • รุ่น 1.6: 72B (ฐาน Qwen2.5) + R1 32B (reasoning, ฐาน DeepSeek-R1-distill)
  • รุ่น 1.5: 7B / 14B / 72B (ฐาน Qwen2.5, Qwen License ใช้พาณิชย์ได้)
  • 7B ใช้ VRAM ~6GB (4-bit) · context 32K ขยายได้ถึง 131K
โหลด: openthaigpt.aieat.or.th · Hugging Face openthaigpt — มี GGUF ครบ

SEA-LION

AI Singapore
  • โมเดลอาเซียนที่ให้ ภาษาไทยเป็นภาษาหลัก (+ อีก 10 ภาษาในภูมิภาค)
  • v4: Gemma-SEA-LION-27B (ฐาน Gemma 3, อ่านรูปได้) + รุ่นฐาน Qwen/Llama
  • มีโมเดลความปลอดภัย (SEA-Guard) และ Embedding สำหรับ RAG
โหลด: sea-lion.ai · Hugging Face aisingapore — มีไฟล์สำหรับ Ollama/llama.cpp

Pathumma & WangchanX

NECTEC · VISTEC
  • Pathumma (ปทุมมา, NECTEC): 7B (ฐาน Qwen2.5) + Vision + Audio (ไทย ASR) — เน้นภาครัฐ/องค์กร
  • WangchanX / WangchanLion (VISTEC): 8B (ฐาน SEA-LION), Apache 2.0
  • WangchanBERTa: สำหรับงาน NLP ไทย (จำแนก/หาเอนทิตี/วิเคราะห์อารมณ์) — ไม่ใช่แชต แต่แม่นและเบา
โหลด: Hugging Face nectec · GitHub vistec-AI/WangchanX

เลือกอย่างมีวิจารณญาณ: โมเดลไทยดีขึ้นเรื่อย ๆ แต่คุณภาพต่างกันตามงานและขนาด ควร "ทดสอบกับงานจริงของคุณเอง" ก่อนเลือก และดูอันดับจากลีดเดอร์บอร์ดกลาง เช่น ThaiLLM Leaderboard (SCB10X × VISTEC), SEA-HELM, ThaiExam — โดยรวมโมเดลรันเองยัง "สู้" โมเดลคลาวด์ระดับท็อปไม่ได้เต็มร้อยในงานยาก ๆ (ดูหัวข้อความปลอดภัย/ข้อจำกัดด้านล่าง)

บทเรียน · เริ่มต้น → Advanced

เส้นทางเรียนรู้ 4 ระดับ ทำตามได้ทีละขั้น

ไม่ต้องเก่งเทคนิคมาก่อน เริ่มจากกดติดตั้งโปรแกรมเดียว แล้วค่อย ๆ ไต่ระดับจนถึงการจูนโมเดลและวางระบบให้ทั้งองค์กร

ระดับ 1 · Beginner

ติดตั้งแล้วลองใช้ใน 10 นาที

เป้าหมาย: ให้ AI ตัวแรกทำงานบนเครื่องคุณ และเข้าใจศัพท์พื้นฐาน

  1. ติดตั้ง LM Studio (หรือ Jan / GPT4All)ติดตั้งเหมือนโปรแกรมทั่วไป กดไม่กี่ที
  2. ดาวน์โหลดโมเดลเล็ก Q4 แล้วลองแชตเช่น Llama 3.2 3B, Qwen3 4B, Gemma 3 4B
  3. ลองโมเดลภาษาไทยเช่น Typhoon 4B — ถาม-ตอบเป็นภาษาไทยได้เลย
  4. เข้าใจ quantization & contextปรับระดับบีบอัด/ความยาวบทสนทนาให้พอดีเครื่อง
ระดับ 2 · ใช้งานจริง

ทำ "ChatGPT ส่วนตัว" ให้ทีมใช้ + คุยกับเอกสาร

เป้าหมาย: ยกจากเล่นคนเดียว เป็นเครื่องมือที่ทีมใช้จริงกับข้อมูลองค์กร

  1. ติดตั้ง Ollama แล้วสั่ง ollama runเปิดเซิร์ฟเวอร์ในตัวโดยอัตโนมัติ
  2. ครอบด้วย Open WebUIหน้าเว็บเหมือน ChatGPT ใช้ได้ทั้งทีม กำหนดผู้ใช้ได้
  3. ทำ RAG กับเอกสารจริงอัปโหลดคู่มือ/ระเบียบ/สัญญา ถาม-ตอบอ้างอิงได้ (ไทยใช้ embedding bge-m3)
  4. จับคู่โมเดล + quant ให้เหมาะเลือกโมเดล 8–14B และวัดความเร็ว/คุณภาพให้ลงตัว
ระดับ 3 · เชื่อมระบบ

ต่อ AI เข้ากับแอปและเวิร์กโฟลว์ภายใน

เป้าหมาย: ให้โมเดลทำงานเบื้องหลังในระบบขององค์กร ไม่ใช่แค่หน้าต่างแชต

  1. เปิด API แบบ OpenAI-compatibleแอป/สคริปต์เดิมทำงานออฟไลน์ได้ แค่เปลี่ยน base URL
  2. Function / Tool callingให้โมเดลเรียกเครื่องมือ: ค้นฐานข้อมูล คิดเลข ดึงข้อมูล
  3. ต่อ MCP เข้าระบบภายในให้เข้าถึงไฟล์/SQL/ระบบ อย่างมีสิทธิ์ที่ควบคุมได้
  4. เพิ่ม Vision + Code + Automationอ่านสแกน/ใบเสร็จ, ช่วยเขียนโค้ด, ต่อ n8n/เวิร์กโฟลว์
ระดับ 4 · Advanced

จูนโมเดลเอง + วางระบบระดับองค์กร

เป้าหมาย: ปรับโมเดลให้ "เป็นของเรา" และเสิร์ฟให้คนจำนวนมากอย่างมั่นคง

  1. Fine-tune / LoRA ด้วยข้อมูลองค์กรUnsloth (การ์ดใบเดียว) หรือ Axolotl (หลายใบ) ให้โมเดล "พูดแบบเรา"
  2. Quantize เอง + เลือกฟอร์แมตGGUF / MLX / AWQ ให้เหมาะฮาร์ดแวร์และความเร็ว
  3. เสิร์ฟด้วย vLLM + มัลติ-GPUรองรับผู้ใช้จำนวนมากพร้อมกัน ความเร็วสูง
  4. Agent · Air-gapped · ธรรมาภิบาลวางระบบปิด, บันทึก log, กำหนดสิทธิ์, ตรวจคุณภาพ/ความปลอดภัย

ต่อยอดทักษะที่หลักสูตรบนเว็บนี้ (เรียนฟรี): AI ช่วยเขียนโปรแกรม · สร้าง AI Agent · AI วิเคราะห์ข้อมูล · AI เพิ่มประสิทธิภาพงาน — และดู พจนานุกรมศัพท์ AI เมื่อเจอคำที่ไม่คุ้น

ทำอะไรได้บ้าง

12 สิ่งที่ AI Local ทำได้จริง (ทำได้ทุกองค์กร)

รวมงานพื้นฐานที่โมเดลรันเองทำได้ดีและคุ้มค่าที่สุด — ทั้งหมดนี้ข้อมูลไม่ต้องออกจากเครื่อง

ผู้ช่วยแชตส่วนตัว

ถาม-ตอบ ระดมสมอง ช่วยคิด แบบ ChatGPT ที่ทำงานออฟไลน์บนเครื่องคุณ

สรุปเอกสารยาว

ย่อรายงาน สัญญา บันทึกประชุม ไฟล์ PDF ยาว ๆ ให้เหลือใจความสำคัญ

ถาม-ตอบคลังเอกสารภายใน (RAG)

ให้ AI ตอบโดยอ้างอิงคู่มือ ระเบียบ นโยบาย ขององค์กรที่อัปโหลดเข้าไป

ร่าง & ขัดเกลางานเขียน

อีเมล จดหมายราชการ รายงาน โพสต์ — ร่างและปรับโทนให้เป๊ะ

แปลภาษา

ไทย↔อังกฤษ และภาษาอื่น โดยเอกสารลับไม่ต้องส่งขึ้นบริการแปลภายนอก

ผู้ช่วยเขียนโค้ด

เขียน แก้บั๊ก อธิบายโค้ด รีวิว — โค้ดลับขององค์กรอยู่ในเครื่อง

สกัดข้อมูลเป็นตาราง

ดึงชื่อ/วันที่/ยอดเงิน จากข้อความหรือฟอร์ม ออกมาเป็นข้อมูลมีโครงสร้าง

จัดหมวด & วิเคราะห์อารมณ์

ติดแท็ก จัดกลุ่ม รีวิว/คอมเมนต์/เรื่องร้องเรียน วัดความพึงพอใจ

อ่านรูป & สแกน (Vision/OCR)

อ่านใบเสร็จ เอกสารสแกน ลายมือ แผนภาพ แล้วสรุป/แปลงเป็นข้อความ

ถอดเสียง + สรุปประชุม

ใช้ Whisper ถอดเสียงเป็นข้อความ แล้วสรุปประเด็น/สิ่งที่ต้องทำต่อ

สร้างภาพในเครื่อง

Stable Diffusion / Flux สร้างภาพประกอบ/สื่อ โดยไม่ส่งข้อมูลออก

ช่วยงาน Excel/SQL/สคริปต์

เขียนสูตร Excel สร้างคำสั่ง SQL และสคริปต์อัตโนมัติงานซ้ำ ๆ

Use Case แยกตามประเภทองค์กร

9 ประเภทองค์กร × 10 Use Case ที่นำไปใช้ได้จริง

องค์กรที่ถือ "ข้อมูลอ่อนไหว" ได้ประโยชน์จาก Local AI มากที่สุด เพราะข้อมูลไม่ต้องออกนอกองค์กร (ตอบโจทย์ PDPA) แต่ละประเภทมี 10 ตัวอย่างที่ลงมือทำได้จริง

โรงพยาบาล / คลินิก

สาธารณสุข · เวชระเบียน
ทำไม Local: เวชระเบียนคือข้อมูลอ่อนไหวสูงสุดตาม PDPA ห้ามรั่ว — รันในเครื่องของ รพ. จึงเหมาะที่สุด และใช้ได้แม้เน็ตล่ม
10 Use Case
  1. สรุปประวัติ/เวชระเบียนยาว ๆ ให้แพทย์อ่านเร็วก่อนตรวจ
  2. ถอดเสียงบันทึกการตรวจ (แพทย์พูด) เป็นข้อความ ลดงานพิมพ์
  3. ร่างจดหมายส่งต่อ / ใบรับรองแพทย์ / สรุป discharge
  4. ผู้ช่วยตอบแนวเวชปฏิบัติ/ระเบียบภายในจากคู่มือ รพ. (RAG)
  5. แชตบอตนัดหมาย/คัดกรองอาการเบื้องต้นบนเว็บ รพ.
  6. แปลบทสนทนา/เอกสารให้ผู้ป่วยต่างชาติ ข้อมูลไม่ออกนอก รพ.
  7. OCR แบบฟอร์มกระดาษ/เอกสารสแกน กรอกเข้าระบบอัตโนมัติ
  8. วิเคราะห์แบบสอบถามความพึงพอใจ/ข้อร้องเรียนผู้ป่วย
  9. สรุปงานวิจัย/บทความการแพทย์ให้ทีมอัปเดตความรู้
  10. เขียนสื่อให้ความรู้สุขภาพ/คำแนะนำหลังรักษาเป็นภาษาชาวบ้าน

⚠️ ทุกผลลัพธ์ต้องมีบุคลากรการแพทย์ตรวจก่อนใช้ — AI ไม่วินิจฉัย/สั่งยาแทนคน

หลักสูตร AI การแพทย์

หน่วยงานราชการ / ภาครัฐ

อปท. · บริการประชาชน
ทำไม Local: ข้อมูลประชาชนและเอกสารลับของราชการควรอยู่ในองค์กร/ในประเทศ สอดคล้องแนวทางธรรมาภิบาล AI ภาครัฐของ ETDA
10 Use Case
  1. ตอบคำถามจากระเบียบ/กฎหมาย/หนังสือเวียน (RAG) ให้เจ้าหน้าที่
  2. ร่างหนังสือราชการ/บันทึกข้อความ/ประกาศ ตามรูปแบบ
  3. สรุปรายงาน/มติที่ประชุม/เอกสารประกอบยาว ๆ
  4. แชตบอตบริการประชาชน 24 ชม. (ขั้นตอน เอกสารที่ต้องใช้)
  5. คัดกรอง/จัดหมวดเรื่องร้องเรียน ส่งต่อหน่วยที่รับผิดชอบ
  6. OCR คำร้อง/เอกสารเก่า/สำเนา แปลงเป็นดิจิทัลเข้าระบบ
  7. สรุป/เทียบร่างกฎหมาย ระเบียบ TOR ให้เจ้าหน้าที่
  8. แปลเอกสารราชการ ไทย↔อังกฤษ สำหรับงานระหว่างประเทศ
  9. เขียนคอนเทนต์/อินโฟกราฟิกประชาสัมพันธ์ให้เข้าใจง่าย
  10. ผู้ช่วยภายในตอบเรื่อง HR/การเงิน/พัสดุ จากคู่มือหน่วยงาน

⚠️ การตัดสินสิทธิ์/อนุมัติต้องมีเจ้าหน้าที่ ไม่ให้ AI ตัดสินอัตโนมัติ + ปฏิบัติตาม PDPA

หลักสูตร AI ภาครัฐ

โรงเรียน / มหาวิทยาลัย

สถานศึกษา · วิจัย
ทำไม Local: ข้อมูลนักเรียน/เกรดเป็นข้อมูลส่วนบุคคล งบจำกัด — รันเองไม่มีค่ารายหัว และใช้ในห้องเรียนได้แม้ไม่มีเน็ต
10 Use Case
  1. ติวเตอร์ AI ประจำวิชา ตอบจากเนื้อหาในหลักสูตร (RAG)
  2. ช่วยครูออกข้อสอบ/แบบฝึกหัด/เฉลย ตามระดับชั้น
  3. ให้ฟีดแบ็กงานเขียน/เรียงความ (ครูตรวจซ้ำ) งานเด็กไม่ออกนอกโรงเรียน
  4. สรุปบทเรียน ทำสื่อการสอน/สไลด์ จากตำรา
  5. แปลสื่อการสอน และช่วยนักเรียนต่างชาติ
  6. งานธุรการ: ร่างหนังสือถึงผู้ปกครอง ประกาศ ตารางสอน
  7. แชตบอตตอบเรื่องรับสมัคร/ทุน/ระเบียบ บนเว็บสถาบัน
  8. วิเคราะห์แบบประเมินการสอน/ความเห็นนักเรียน สรุปให้อาจารย์
  9. ผู้ช่วยวิจัย: สรุปเปเปอร์ ช่วยรีวิววรรณกรรม (ข้อมูลไม่รั่ว)
  10. สอน "รู้เท่าทัน AI" ให้เด็กลองใช้โมเดลในเครื่องอย่างปลอดภัย

⚠️ ส่งเสริมการเรียนรู้ ไม่ใช่ทำการบ้าน/งานแทน — มีครูกำกับเสมอ

หลักสูตร AI การศึกษา

ธุรกิจ / SME / บริษัท

ค้าปลีก · บริการ · ออนไลน์
ทำไม Local: ปกป้องความลับทางการค้าและข้อมูลลูกค้า + คุมต้นทุนได้ (จ่ายค่าเครื่องครั้งเดียว ไม่มีบิลต่อครั้ง)
10 Use Case
  1. ผู้ช่วยตอบแชตลูกค้า/ร่างคำตอบ (ข้อมูลลูกค้าอยู่ในบริษัท)
  2. ถาม-ตอบคู่มือพนักงาน/SOP/นโยบายภายใน (RAG) เร่ง onboarding
  3. สรุปสัญญา/ข้อเสนอ/อีเมลลูกค้ายาว ๆ
  4. ร่างใบเสนอราคา/สัญญา/เอกสารการตลาด จาก template
  5. วิเคราะห์รีวิว/ฟีดแบ็กลูกค้า จัดหมวดปัญหา หาแนวโน้ม
  6. เขียนคอนเทนต์/โพสต์/อีเมลแคมเปญ หลายเวอร์ชัน
  7. สกัดข้อมูลจากใบสั่งซื้อ/ใบแจ้งหนี้/ใบเสร็จ (OCR) เข้าบัญชี
  8. ผู้ช่วยวิเคราะห์ยอดขาย: ถามภาษาคน ให้ช่วยเขียน SQL/สรุป
  9. แปลเอกสาร/สื่อ สำหรับลูกค้า-คู่ค้าต่างประเทศ
  10. ผู้ช่วยภายในบนอินทราเน็ต ต่อระบบภายใน (MCP) ทำงานซ้ำ ๆ

⚠️ ตรวจก่อนส่งลูกค้า และดูแลข้อมูลส่วนบุคคลของลูกค้าตาม PDPA

หลักสูตร AI ธุรกิจ

สำนักงานกฎหมาย / บัญชี

ที่ปรึกษา · วิชาชีพ
ทำไม Local: ความลับลูกความและเอกสารการเงินเป็นความลับสูงสุด — ห้ามส่งขึ้นคลาวด์ต่างชาติเด็ดขาด รันเองคือทางเลือกที่ปลอดภัย
10 Use Case
  1. สรุปสำนวน/คำพิพากษา/สัญญายาว ให้อ่านเร็ว
  2. ตรวจ/เทียบร่างสัญญา หาข้อที่ขาดหรือเสี่ยง (ทนายตรวจซ้ำ)
  3. ถาม-ตอบจากคลังคำพิพากษา/กฎหมาย/เอกสารสำนักงาน (RAG)
  4. ร่างเอกสาร/หนังสือทวงถาม/คำร้อง จาก template
  5. สกัดข้อมูลคู่สัญญา/วันที่/มูลค่า เป็นตาราง
  6. บัญชี: อ่านใบเสร็จ/ใบกำกับภาษี (OCR) กระทบยอด จัดหมวด
  7. สรุปมาตรฐานบัญชี/ประกาศสรรพากร ให้ทีมอัปเดต
  8. ร่างอีเมล/บันทึกให้ลูกความ อธิบายเรื่องซับซ้อนเป็นภาษาง่าย
  9. แปลสัญญา/เอกสารระหว่างประเทศ โดยความลับไม่รั่ว
  10. Due diligence: อ่านเอกสารกองใหญ่ ไฮไลต์ประเด็นเสี่ยง

⚠️ ไม่ใช่ความเห็นทางวิชาชีพขั้นสุดท้าย — ผู้ประกอบวิชาชีพต้องตรวจสอบ และระวัง AI "มั่ว" อ้างคดี/มาตราที่ไม่มีจริง

ดูคลัง Prompt วิชาชีพ

โรงงาน / การผลิต

อุตสาหกรรม · ซ่อมบำรุง
ทำไม Local: โรงงานหลายแห่งอยู่ในพื้นที่เน็ตไม่ดีหรือปิดระบบ (air-gapped) เพื่อความปลอดภัยไซเบอร์ และข้อมูลกระบวนการผลิตเป็นความลับ
10 Use Case
  1. ถาม-ตอบคู่มือเครื่องจักร/ขั้นตอนซ่อมบำรุง (RAG) ให้ช่างหน้างาน
  2. ผู้ช่วยแก้ปัญหา (troubleshoot) จากรหัส error + คู่มือ
  3. สรุป/จัดหมวดรายงานอุบัติเหตุ/near-miss ด้านความปลอดภัย
  4. อ่านใบสั่งผลิต/ใบส่งของ/QC sheet (OCR) เข้าระบบ
  5. ร่าง/แปล SOP, work instruction, เอกสารมาตรฐาน ISO หลายภาษา
  6. ผู้ช่วยฝึกอบรมพนักงานใหม่หน้างาน ตอบเป็นภาษาไทย
  7. วิเคราะห์บันทึกการเดินเครื่อง/log สรุปแนวโน้มปัญหา
  8. สรุปสเปก/ข้อกำหนดลูกค้า เป็นเช็กลิสต์ให้ฝ่ายผลิต
  9. ช่วยเขียนสคริปต์/สูตรคำนวณ วางแผนผลิต/สต็อก
  10. Vision ตรวจฉลาก/ป้าย/เอกสาร เทียบมาตรฐาน (ช่วยคนตรวจ)

⚠️ งานความปลอดภัยและคุณภาพต้องมีวิศวกร/ผู้เชี่ยวชาญยืนยันก่อนเสมอ

หลักสูตร AI การผลิต

ธนาคาร / การเงิน / ประกันภัย

Compliance · KYC/AML
ทำไม Local: ข้อมูลบัญชีและธุรกรรมลูกค้าเป็นความลับสูงสุดภายใต้การกำกับของ ธปท./ก.ล.ต. และ PDPA งาน KYC/AML ปริมาณมหาศาลจึงควรประมวลผลบนเซิร์ฟเวอร์ในองค์กร ไม่ส่งออกคลาวด์
10 Use Case
  1. ถาม-ตอบระเบียบ ธปท./ก.ล.ต. และคู่มือ Compliance/AML ภายใน (RAG) พร้อมอ้างอิงต้นทาง
  2. OCR/Vision สกัดเอกสาร KYC (บัตร ปชช./สลิป/เช็ค/ใบเสร็จ) เป็นตารางเข้าระบบ
  3. ช่วยร่าง narrative รายงานธุรกรรมน่าสงสัย (STR/SAR) ให้ทีม AML ตรวจต่อ
  4. แปลระเบียบ/สัญญา/เอกสารการเงิน อังกฤษ↔ไทย พร้อมอธิบายศัพท์เทคนิค
  5. ถอดเสียง Call Center/การเสนอขายประกัน คัดกรอง mis-selling เบื้องต้น
  6. จัดหมวด+วิเคราะห์อารมณ์คำร้องเรียน/รีวิว แยกเรื่องเร่งด่วนเข้าคิวก่อน
  7. สรุปงบการเงิน/เอกสารสินเชื่อ ดึงตัวเลขช่วยวิเคราะห์เครดิต (คนตัดสิน)
  8. สกัดข้อมูลกรมธรรม์/เอกสารเคลมจากภาพถ่าย ป้อนทีมพิจารณาสินไหม
  9. ผู้ช่วยแชตภายในให้พนักงานสาขา ตอบเงื่อนไขผลิตภัณฑ์เงินฝาก-สินเชื่อ-ประกัน
  10. ช่วยเขียน SQL/Python ทำรายงานกระทบยอด (reconciliation)/งานตรวจสอบภายใน

⚠️ AI เป็นเพียงตัวช่วยจัดเตรียม/คัดกรอง ต้องมีเจ้าหน้าที่ Compliance/สินเชื่อ/สินไหมตรวจก่อนเสมอ — ห้ามอนุมัติสินเชื่อ/ปฏิเสธเคลมอัตโนมัติ และยึด PDPA + เกณฑ์ ธปท./ก.ล.ต.

หลักสูตร AI ธุรกิจ-การเงิน

โลจิสติกส์ / ขนส่ง / คลังสินค้า

คลัง · เดินรถ · นำเข้า-ส่งออก
ทำไม Local: ข้อมูลลูกค้า/ที่อยู่-ชื่อผู้รับ/เส้นทาง/สัญญาขนส่งจำนวนมหาศาลเป็นความลับใต้ PDPA งานปริมาณสูงต้องคุมต้นทุนด้วยการรันเอง และหน้างานคลัง/บนรถมักเน็ตไม่เสถียร ต้องออฟไลน์ได้
10 Use Case
  1. ถาม-ตอบสัญญาขนส่ง/ข้อตกลงระดับบริการ (SLA) และเงื่อนไขค่าปรับ (RAG)
  2. OCR ใบตราส่ง (B/L)/ใบส่งของ/ใบกำกับภาษี ช่วยร่างกรอกเข้าระบบ
  3. Vision คัดกรองภาพพัสดุ/พาเลท/ตู้คอนเทนเนอร์ที่อาจเสียหายหน้างานคลัง
  4. สกัดที่อยู่ผู้รับที่เขียนไม่มาตรฐาน จัดเป็นตารางเพื่อวางเส้นทาง
  5. จัดหมวด+วิเคราะห์อารมณ์คำร้องเรียนของหาย/ส่งช้า/พัสดุชำรุด
  6. ถอดเสียงวิทยุสื่อสาร/สายประสานคนขับ สรุปเป็นบันทึกงานเดินรถ
  7. ผู้ช่วยแชตออฟไลน์บนแท็บเล็ตในคลัง ตอบขั้นตอนรับ-จ่าย-จัดเก็บสินค้า
  8. แปลเอกสารนำเข้า-ส่งออก/Incoterms/พิธีการศุลกากร ไทย-อังกฤษ-จีน
  9. สรุปรายงานเดินรถ/บันทึกเหตุการณ์ระหว่างขนส่งยาว ๆ ให้ผู้จัดการอ่านเร็ว
  10. ช่วยร่างสคริปต์จัดเส้นทางส่ง/วางแผนโหลดตู้ จากไฟล์ CSV งานขนส่ง

⚠️ ที่อยู่/ชื่อผู้รับเป็นข้อมูลส่วนบุคคลตาม PDPA และผลจัดเส้นทาง/คิดค่าปรับต้องมีเจ้าหน้าที่ตรวจก่อนใช้จริงเสมอ

หลักสูตร AI โลจิสติกส์

ท่องเที่ยว / โรงแรม / ร้านอาหาร

แขก · หลายภาษา · บริการ
ทำไม Local: ข้อมูลแขก (พาสปอร์ต/บัตร ปชช./ประวัติเข้าพัก) เป็นข้อมูลส่วนบุคคลตาม PDPA ที่ไม่ควรออกนอกองค์กร งานต้องรับหลายภาษา ปริมาณแชตสูง และรีสอร์ตหลายพื้นที่เน็ตไม่เสถียร
10 Use Case
  1. OCR พาสปอร์ต/บัตร ปชช. ตอนเช็คอิน ร่างลงฟอร์ม PMS (ภาพไม่ออกนอกที่พัก)
  2. ผู้ช่วยแชตตอบแขกหลายภาษา (ไทย/อังกฤษ/จีน) เรื่องห้อง ราคา เวลาเช็คอิน-เอาต์
  3. รวมรีวิว Booking/Agoda/Google จัดหมวด+วิเคราะห์อารมณ์ ชี้จุดที่แขกบ่นซ้ำ
  4. ถาม-ตอบคู่มือ/SOP งานแม่บ้าน-ครัว-ต้อนรับ (RAG) ให้พนักงานใหม่
  5. แปลเมนู/ป้ายบอกทาง/ใบต้อนรับ หลายภาษาให้ถ้อยคำสม่ำเสมอทั้งโรงแรม
  6. ถอดเสียงสายจอง/สายร้องเรียน แล้วสรุปเป็นทิกเก็ตงานพร้อมรายละเอียด
  7. สกัดข้อมูลใบจอง/อีเมลจาก OTA เป็นตาราง (ชื่อ วันเข้าพัก คำขอพิเศษ)
  8. ร่างอีเมลยืนยันจอง/ตอบคำถาม/หนังสือขอโทษ หลายภาษา (พนักงานตรวจก่อนส่ง)
  9. Vision คัดกรองภาพห้อง/บุฟเฟต์/ความสะอาดตามเช็กลิสต์ ก่อนพนักงานยืนยัน
  10. สรุปยอดขายเมนู/สต็อกวัตถุดิบรายวัน ชี้เมนูขายดี-ของใกล้หมดให้ผู้จัดการ

⚠️ เอกสาร/ประวัติแขกเป็นข้อมูลส่วนบุคคลตาม PDPA จำกัดสิทธิ์เข้าถึง เก็บเท่าที่จำเป็น และให้พนักงานตรวจผลก่อนบันทึก/ส่งถึงแขก

หลักสูตร AI ท่องเที่ยว-โรงแรม

อยากดู Use Case ราย ธุรกิจแบบเจาะลึกพร้อม prompt ก๊อปไปใช้? ดูเพิ่มที่ Use Case รายธุรกิจ (16 ประเภท) และ คลัง Prompt — หน้านี้เน้นที่ "ทำแบบ Local" ส่วนสองหน้านั้นให้ prompt และตัวอย่างละเอียดที่ใช้ได้ทั้งกับ AI คลาวด์และ Local

ใช้อย่างรับผิดชอบ

ความปลอดภัย ข้อจำกัด และเรื่องที่ต้องระวัง

Local AI มีข้อดีมาก แต่ก็ไม่ใช่ยาวิเศษ — เข้าใจข้อจำกัดเหล่านี้ก่อน จะใช้ได้อย่างปลอดภัยและคุ้มค่าจริง

Local ≠ ปลอดภัยอัตโนมัติ

ข้อมูลไม่ออกนอกองค์กรก็จริง แต่ยังต้องมีการควบคุมสิทธิ์เข้าถึง เข้ารหัส สำรองข้อมูล และดูแลเครื่องให้ปลอดภัยเอง

ยังสู้คลาวด์ท็อปไม่ได้เต็มร้อย

โมเดลรันเองเก่งขึ้นมาก แต่งานที่ต้องให้เหตุผลยาว-ซับซ้อนสุด ๆ โมเดลคลาวด์ระดับแนวหน้ายังทำได้ดีกว่า

AI "มั่ว" ได้ (Hallucination)

อาจตอบผิดหรือแต่งข้อมูลอย่างมั่นใจ โดยเฉพาะเรื่องกฎหมาย/การแพทย์/ตัวเลข — ต้องมีคนตรวจก่อนใช้งานสำคัญเสมอ

PDPA ยังต้องดูแล

ถึงข้อมูลอยู่ในองค์กร ก็ยังต้องมีฐานการประมวลผลที่ถูกต้อง การขอความยินยอม การเก็บรักษา และธรรมาภิบาลตามกฎหมาย

มีต้นทุนดูแล

ไม่ใช่ตั้งแล้วลืม — ต้องมีคนดูแลเครื่อง อัปเดตโมเดล จัดการความเร็ว/ความจุ และแก้ปัญหาเมื่อระบบล่ม

ไฮบริดคือคำตอบจริง

ใช้ Local กับข้อมูลอ่อนไหว/งานประจำ/งานปริมาณมาก และคลาวด์กับงานยากที่ไม่ลับ — เคล็ดลับ: ใช้โมเดล Local ลบข้อมูลส่วนตัวก่อนส่งคลาวด์

บริบทไทย

PDPA และการสนับสนุนจากภาครัฐไทย

พ.ร.บ.คุ้มครองข้อมูลส่วนบุคคล (PDPA พ.ศ. 2562) บังคับใช้เต็มรูปแบบตั้งแต่ 1 มิ.ย. 2565 และเริ่มมีการปรับจริง (ค่าปรับก้อนใหญ่ครั้งแรกช่วงปี 2568) — การส่งข้อมูลส่วนบุคคลไปประมวลผลที่บริการภายนอก/ต่างประเทศเข้าข่ายการโอนข้อมูลข้ามพรมแดนที่มีเงื่อนไข ส่วน Local AI ที่ข้อมูล "ไม่ออกจากองค์กร" ช่วยลดประเด็นนี้ได้โดยตรง ขณะเดียวกันไทยมีทิศทางสนับสนุน AI ในประเทศ ทั้ง แผนปฏิบัติการ AI แห่งชาติ 2565–2570, แนวทางธรรมาภิบาล AI ภาครัฐของ ETDA, การส่งเสริมของ depa และโมเดลไทยที่ NECTEC/VISTEC/SCB 10X พัฒนาเอง

🔐 PDPA 2562 📋 แผน AI แห่งชาติ 2565–2570 🏛️ ETDA · depa 🇹🇭 NECTEC · VISTEC · SCB 10X

หมายเหตุ: ร่างกฎหมาย AI และแนวทางบังคับสำหรับหน่วยงานรัฐบางส่วนยังอยู่ระหว่างจัดทำ ควรตรวจสอบสถานะล่าสุดจากหน่วยงานทางการก่อนอ้างอิง

ลงมือเลย

เริ่มจากติดตั้งโปรแกรมเดียว วันนี้

ไม่ต้องซื้อเครื่องแพงก่อน — โหลด LM Studio หรือ Ollama ลองโมเดลเล็กบนเครื่องที่มีอยู่ แล้วค่อยไต่ระดับตามบทเรียน 4 ขั้นในหน้านี้ ทุกหลักสูตรบนเว็บนี้เรียนฟรีเป็นภาษาไทย

คำถามที่พบบ่อย

FAQ — ทำ AI ใช้เองแบบ Local

คำถามที่คนมักสงสัยก่อนเริ่มทำ AI บนเครื่องตัวเอง

Local AI คืออะไร ต่างจาก ChatGPT อย่างไร?
Local AI คือการรันโมเดล AI บนเครื่องหรือเซิร์ฟเวอร์ของเราเอง ข้อมูลไม่ถูกส่งขึ้นคลาวด์ ต่างจาก ChatGPT/Claude/Gemini ที่ประมวลผลบนเซิร์ฟเวอร์ของผู้ให้บริการ ข้อดีของ Local คือความเป็นส่วนตัว ต้นทุนคงที่ (ไม่มีค่าใช้จ่ายต่อครั้ง) ใช้ออฟไลน์ได้ และปรับแต่งได้เต็มที่ ข้อแลกเปลี่ยนคือโมเดลรันเองมักยังสู้โมเดลคลาวด์ระดับท็อปไม่ได้เต็มร้อย และต้องมีเครื่องกับคนดูแล
ต้องใช้คอมสเปกแค่ไหนถึงจะรัน AI เองได้?
ขึ้นกับขนาดโมเดล ตัวเลขที่สำคัญที่สุดคือ VRAM ของการ์ดจอ (หรือ Unified Memory ของ Mac) กฎคร่าว ๆ คือ (VRAM − 2) ÷ 0.6 ≈ ขนาดโมเดลเป็นพันล้านพารามิเตอร์ (B) ที่รันไหวแบบ Q4 — เริ่มลองได้ฟรีบนโน้ตบุ๊กหรือการ์ด 8GB (โมเดล 3–8B), การ์ด 16GB รันถึงราว 14B, การ์ด 24–32GB หรือ Mac 64–128GB รันได้ถึง 34–70B ดูตารางเปรียบเทียบอุปกรณ์ในหน้านี้ประกอบ
มีโมเดลภาษาไทยที่รันเองได้ไหม?
มีหลายตัว เช่น Typhoon (โดย SCB 10X), OpenThaiGPT (AIEAT/NECTEC/iApp), SEA-LION (AI Singapore ที่รองรับภาษาไทยเป็นภาษาหลัก), Pathumma (NECTEC) และ WangchanX (VISTEC) — ส่วนใหญ่มีไฟล์ GGUF ให้โหลดมารันบน Ollama หรือ LM Studio ได้ มีขนาดตั้งแต่ราว 4B ถึง 72B เลือกตามสเปกเครื่องและงาน
Local AI ช่วยเรื่อง PDPA ได้จริงไหม?
ช่วยลดความเสี่ยงได้มาก เพราะข้อมูลส่วนบุคคลไม่ถูกส่งออกไปประมวลผลที่บริการภายนอกหรือต่างประเทศ จึงเลี่ยงประเด็นการโอนข้อมูลข้ามพรมแดนที่มีเงื่อนไขตาม PDPA ได้ อย่างไรก็ตาม "ข้อมูลอยู่ในองค์กร" ไม่ได้แปลว่าทำอะไรก็ได้ — ยังต้องมีฐานการประมวลผลที่ถูกต้อง การควบคุมสิทธิ์เข้าถึง การเก็บรักษาที่ปลอดภัย และธรรมาภิบาลตามกฎหมายอยู่ดี
ซอฟต์แวร์ตัวไหนควรเริ่มก่อน?
มือใหม่แนะนำเริ่มที่ LM Studio (หรือ Jan / GPT4All) เพราะติดตั้งง่ายและโหลดโมเดลได้ในตัว ถ้าต้องการต่อเข้าระบบหรือให้ทั้งทีมใช้ ให้เริ่มที่ Ollama แล้วครอบด้วย Open WebUI เพื่อให้ได้หน้าเว็บเหมือน ChatGPT ส่วนองค์กรที่มีผู้ใช้จำนวนมากพร้อมกันควรใช้ vLLM เป็นตัวเสิร์ฟ
Local AI แทนคลาวด์อย่าง ChatGPT/Claude ได้เลยไหม?
ยังไม่ควรแทนทั้งหมด โมเดลรันเองเก่งขึ้นมากและเพียงพอสำหรับงานส่วนใหญ่ แต่ในงานที่ยากและซับซ้อนที่สุดยังสู้โมเดลคลาวด์ระดับแนวหน้าไม่ได้เต็มร้อย แนวทางที่ดีที่สุดคือแบบไฮบริด — ใช้ Local กับข้อมูลอ่อนไหว งานประจำ และงานปริมาณมาก แล้วใช้คลาวด์เฉพาะงานยากที่สุดที่ไม่เป็นความลับ