โมเดล & พารามิเตอร์ (B)
โมเดลคือไฟล์ก้อนใหญ่ที่ "เรียนรู้ภาษามาแล้ว" ขนาดวัดด้วยจำนวนพารามิเตอร์ หน่วยเป็น B (พันล้าน)
- 7–8B = เล็ก คล่อง เหมาะเริ่มต้น
- 13–14B / 30–34B = กลาง ฉลาดขึ้น
- 70B ขึ้นไป = ใหญ่ ฉลาดมาก แต่กินเครื่องแรง
"Local AI" คือการรันโมเดล AI ไว้บนเครื่องของคุณเองหรือเซิร์ฟเวอร์ในองค์กร (On-Premise) — ข้อมูลไม่ต้องส่งขึ้นคลาวด์ต่างประเทศ ไม่มีค่าใช้จ่ายต่อครั้ง ใช้แบบออฟไลน์ได้ และปรับแต่งได้เต็มที่ หน้านี้คือบทเรียนครบวงจร: ต้องใช้เครื่องสเปกแค่ไหน อุปกรณ์แต่ละแบบต่างกันอย่างไร ใช้ซอฟต์แวร์และโมเดลตัวไหน ไปจนถึง Use Case จริงแยกตามประเภทองค์กร
ผู้ช่วย AI บนคลาวด์ (ChatGPT, Claude, Gemini) เก่งและใช้ง่าย แต่ทุกครั้งที่พิมพ์ ข้อมูลจะถูกส่งออกไปประมวลผลที่เซิร์ฟเวอร์ของผู้ให้บริการ — สำหรับข้อมูลคนไข้ ข้อมูลประชาชน สัญญาลูกความ หรือความลับทางการค้า นั่นคือความเสี่ยง Local AI ตอบโจทย์นี้ด้วยหลักการง่าย ๆ ว่า "ข้อมูลอยู่ที่ไหน โมเดลไปหาที่นั่น"
พูดตรง ๆ ก่อน: โมเดลที่รันเอง(โอเพนซอร์ส) โดยทั่วไปยัง "ฉลาดสู้" โมเดลคลาวด์ระดับแนวหน้าอย่าง GPT/Claude/Gemini รุ่นท็อปไม่ได้เต็มร้อย และต้องมีคนดูแลเครื่อง องค์กรส่วนใหญ่จึงใช้แบบ ไฮบริด — งานที่ข้อมูลอ่อนไหว/งานประจำใช้ Local ส่วนงานยากสุด ๆ ที่ไม่ลับค่อยส่งคลาวด์
ก่อนไปเลือกซื้อเครื่อง มาทำความเข้าใจ 4 คำนี้ก่อน เพราะมันคือหัวใจที่ตัดสินว่า "เครื่องของคุณรันโมเดลตัวไหนได้ และเร็วแค่ไหน"
โมเดลคือไฟล์ก้อนใหญ่ที่ "เรียนรู้ภาษามาแล้ว" ขนาดวัดด้วยจำนวนพารามิเตอร์ หน่วยเป็น B (พันล้าน)
เทคนิค "ลดความละเอียดตัวเลข" ในโมเดลให้ไฟล์เล็กลง รันบนเครื่องบ้านได้ โดยคุณภาพลดนิดเดียว
โมเดลต้องถูกโหลดเข้า "หน่วยความจำเร็ว" ให้หมดก้อนถึงจะรันลื่น นั่นคือ VRAM ของการ์ดจอ (หรือ Unified Memory ของ Mac)
สูตรจำง่าย "เครื่องนี้รันโมเดลได้ใหญ่แค่ไหน": เอา VRAM (GB) มา ลบ 2 (เผื่อระบบ) แล้วหารด้วย 0.6 = จำนวนพารามิเตอร์ (B) โดยประมาณที่รันไหวแบบ Q4 — เช่น การ์ด 12GB → (12−2)/0.6 ≈ รันได้ถึง ~16B, การ์ด 24GB → รันได้ถึง ~34B, เครื่อง 64GB → แตะ 70B ได้ (ตัวเลขเป็นค่าประมาณ ขึ้นกับ context และระดับ quantization)
ความเร็ว (tokens/วินาที): คือจำนวน "คำย่อย" ที่โมเดลพิมพ์ออกมาต่อวินาที ยิ่งเยอะยิ่งลื่น คนอ่านตามทันสบาย ๆ ที่ราว 7–10 tok/s ขึ้นไป — การ์ดจอแรงได้ 30–100+ tok/s ส่วนรันด้วย CPU ล้วนอาจเหลือ 2–5 tok/s (พอใช้กับงานเบื้องหลังที่ไม่รีบ)
หลักการเดียวที่ต้องจำ: "ความจุหน่วยความจำ" ตัดสินว่ารันโมเดลได้ไหม ส่วน "แบนด์วิดท์หน่วยความจำ" ตัดสินว่าเร็วแค่ไหน — งานรัน AI ไม่ได้ใช้พลังคำนวณ (TFLOPS) เป็นหลัก แต่ติดที่หน่วยความจำ นี่คือเหตุผลที่ VRAM สำคัญกว่าความแรงของการ์ด
ต้องใหญ่พอ "อุ้ม" โมเดลทั้งก้อนเข้าไปได้ ถ้าไม่พอ ต้องพึ่ง RAM/CPU ช่วย ซึ่งทำให้ช้าลงมาก — ตัวเลขนี้กำหนดว่าคุณรัน 8B, 34B หรือ 70B ได้
ยิ่งสูง ยิ่งพิมพ์คำตอบไว การ์ดจอ (HBM/GDDR) เร็วกว่า Unified Memory ของ Mac/มินิพีซี — Mac รุ่นใหญ่ "อุ้ม" โมเดลใหญ่ได้ แต่ "ช้ากว่า" การ์ดจอแท้
รันได้: โมเดล 3–8B แบบ Q4 (Llama 3.2 3B, Qwen3 4B, Gemma 3 4B, Phi-4-mini)
รันได้: สบายถึง 13–14B และแตะ 20–24B แบบ Q4
รันได้: 30–34B ลื่นมาก; 70B ได้บนเครื่องหน่วยความจำใหญ่ (Mac/มินิพีซี) แต่ช้าลง (~10–18 tok/s)
รันได้: 70B เร็ว, โมเดล MoE 100B+ (บนตัว 96GB/512GB), รองรับพนักงานหลายคนพร้อมกันด้วย vLLM
รันได้: ทุกขนาดรวมโมเดล 405B, งานพร้อมกันจำนวนมหาศาล, เทรน/Fine-tune โมเดลเอง
เรื่องราคาและไฟฟ้าที่ควรรู้: ช่วงปี 2568–2569 มีภาวะขาดแคลนชิปหน่วยความจำ (GDDR7) ทำให้ราคาการ์ดจอ "ผันผวนและสูงกว่าราคาตั้ง" ตัวเลขข้างบนเป็นค่าประมาณเท่านั้น ควรเช็กราคาจริงก่อนซื้อ — และการ์ดจอตัวแรง (RTX 5090 ~575W, RTX PRO 6000 ~600W) กินไฟมาก ร้อน เสียงดัง ต้องใช้ PSU และระบบระบายความร้อนที่ดี ส่วนเครื่อง Unified Memory (Mac/มินิพีซี) กินไฟน้อยและเงียบกว่ามาก เหมาะกับออฟฟิศ
สองตารางนี้คือหัวใจของการเลือกซื้อ: ตารางแรกจับคู่ "ขนาดโมเดล → เครื่องที่ต้องมี" ตารางที่สองเทียบอุปกรณ์ยอดนิยมแบบตัวต่อตัว
📊 ตาราง A — ขนาดโมเดล ต้องใช้หน่วยความจำเท่าไร (ที่ Q4)
| ขนาดโมเดล | VRAM/RAM ที่ต้องมี (รวม context) | รันได้บนอะไร | ตัวอย่างโมเดล | เหมาะกับงาน |
|---|---|---|---|---|
| 1–4B (จิ๋ว) | ~4–6 GB | โน้ตบุ๊ก, การ์ด 6–8GB, มือถือแรง ๆ, CPU ก็ไหว | Llama 3.2 1B/3B · Qwen3 4B · Gemma 3 1B/4B · Phi-4-mini | สรุป/ร่าง/แปลเบา ๆ, งาน edge, แชตพื้นฐาน |
| 7–8B (เล็ก) | ~6–8 GB | การ์ด 8–12GB, Mac 16GB+ | Llama 3.1 8B · Qwen3 8B · DeepSeek-R1 distill 8B | ผู้ช่วยทั่วไป, RAG เอกสาร, งานประจำวัน |
| 13–14B (กลาง-เล็ก) | ~10–12 GB | การ์ด 12–16GB, Mac 32GB | Qwen3 14B · Gemma 3 12B · Phi-4 14B | ตอบยากขึ้น, เขียนเนื้อหา, วิเคราะห์เบื้องต้น |
| 24–34B (กลาง) | ~18–24 GB | การ์ด 24GB (4090/5090), Mac 32–64GB | Qwen3 32B · Gemma 3 27B · Mistral Small 24B | งานหนักขึ้น เขียนโค้ด วิเคราะห์ ให้เหตุผล |
| 70B (ใหญ่) | ~40–48 GB (ไม่พอดีการ์ด 24/32GB ใบเดียว) | การ์ด 48GB+, Mac 64–128GB, มินิพีซี 128GB, 2 การ์ด | Llama 3.3 70B · Qwen2.5 72B · OpenThaiGPT 72B | งานคุณภาพสูง ใกล้เคียงระดับมืออาชีพ |
| 100B+ MoE (ใหญ่มาก) | ~120–400 GB | เครื่องหน่วยความจำใหญ่มาก (Mac 512GB) หรือเซิร์ฟเวอร์ GPU | Llama 4 · Qwen3 235B-A22B · DeepSeek V3/R1 671B | งานยากสุด ระดับใกล้โมเดลคลาวด์ (ต้องเครื่องแรงจริง) |
MoE คืออะไร? โมเดลแบบ "Mixture of Experts" มีพารามิเตอร์รวมมหาศาล แต่ตอนใช้จริงจะ "จุด" เฉพาะบางส่วน (active) เท่านั้น จึงเร็วกว่าที่ขนาดบอก — แต่ต้องมีหน่วยความจำอุ้ม "ทั้งก้อน" อยู่ดี เช่น Qwen3 235B-A22B ใช้พารามิเตอร์จริงตอนตอบแค่ ~22B แต่ยังต้องการ RAM ~120GB+
🖥️ ตาราง B — เทียบอุปกรณ์ยอดนิยมตัวต่อตัว (เลื่อนดูแนวนอนได้)
| อุปกรณ์ | หน่วยความจำ | โมเดลใหญ่สุด (Q4) | ความเร็วโดยรวม | ราคาโดยประมาณ | เหมาะกับ |
|---|---|---|---|---|---|
| โน้ตบุ๊ก/พีซีเดิม | GPU 8GB หรือ CPU+RAM | 3–8B | พอใช้ | 0 บาท | ทดลอง เรียนรู้ |
| RTX 5060 Ti / 4060 Ti 16GB | 16GB VRAM | ~14B | เร็ว | ~15,000–25,000฿ | เริ่มจริงจัง งบประหยัด |
| RTX 5080 / 5070 Ti | 16GB GDDR7 | ~14–20B | เร็วมาก | ~35,000–55,000฿ | เกม + AI กลาง ๆ |
| RTX 4090 (มือสอง) | 24GB VRAM | ~34B | เร็วมาก | ~80,000–130,000฿ | นักพัฒนา งานหนัก |
| RTX 5090 | 32GB GDDR7 | ~34B (70B ต้องบีบอัดแรง) | เร็วที่สุดฝั่งผู้บริโภค | ~70,000–120,000฿ | การ์ดผู้บริโภคดีสุดสำหรับ AI |
| Mac mini / MacBook (M4) | 16–32GB Unified | ~14–22B | ปานกลาง | ~25,000–70,000฿ | เงียบ ประหยัดไฟ พกพา |
| Mac Studio (M4 Max) | 64–128GB Unified | 70B | ปานกลาง (~12 tok/s @70B) | ~90,000–200,000฿ | รันโมเดลใหญ่แบบเงียบ |
| Mac Studio (M3 Ultra) | สูงสุด 512GB Unified | 100B+ MoE (ถึง 671B) | ปานกลาง (~17 tok/s) | ~300,000฿+ | รัน "แทบทุกโมเดล" ในเครื่องเดียว |
| AMD Strix Halo (Framework Desktop) | สูงสุด 128GB Unified | 70B | ปานกลาง | ~70,000฿+ | มินิพีซี x86 กินไฟน้อย ตั้งออฟฟิศ |
| NVIDIA DGX Spark | 128GB Unified LPDDR5X | 70B (ช้าที่โมเดลใหญ่) | เล็กเร็ว/ใหญ่ช้า | ~150,000–190,000฿ | กล่องพัฒนา CUDA, ทดสอบ, งานพร้อมกันหลายชิ้น |
| เซิร์ฟเวอร์ GPU (RTX 6000 Ada/PRO 6000) | 48–96GB VRAM | 70B–100B+ | เร็วมาก | ~250,000–500,000฿ | เซิร์ฟเวอร์องค์กร หลายผู้ใช้ |
| ดาต้าเซนเตอร์ (H100/H200) | 80–141GB HBM ต่อใบ | ทุกขนาด (มัลติ-GPU) | สูงสุด | หลักล้าน฿ | องค์กรใหญ่ เทรน/บริการขนาดใหญ่ |
📅 ข้อมูล ณ กลางปี 2569 (2026) — สเปก ราคา และรุ่นเปลี่ยนเร็วและผันผวนสูง (โดยเฉพาะราคาการ์ดจอช่วงชิปขาดตลาด) "โมเดลใหญ่สุด" เป็นค่าประมาณที่ context สั้น–ปานกลาง หากใช้ context ยาวจะกินหน่วยความจำมากขึ้น ควรเช็กหน้าทางการก่อนตัดสินใจ
ข่าวดีคือ "ฟรีและติดตั้งง่าย" มีตั้งแต่โปรแกรมกดปุ่มเดียวสำหรับมือใหม่ ไปจนถึงตัวเสิร์ฟระดับองค์กร เลือกตามระดับความถนัด
| โปรแกรม | เหมาะกับ | ระบบ | API (ต่อแอปได้) | RAG เอกสาร | หลายผู้ใช้ |
|---|---|---|---|---|---|
| LM Studio | มือใหม่ (หน้าตาสวย กดง่าย) | Win · Mac · Linux | ✓ | ✓ | — |
| Jan | มือใหม่ (คล้าย ChatGPT, โอเพนซอร์ส) | Win · Mac · Linux | ✓ | จำกัด | — |
| GPT4All | มือใหม่ เน้นความเป็นส่วนตัว + คุยกับไฟล์ | Win · Mac · Linux | ✓ | ✓ (LocalDocs) | — |
| Ollama | นักพัฒนา/ทั่วไป (คำสั่ง + เซิร์ฟเวอร์) | Win · Mac · Linux | ✓ | ผ่านตัวเสริม | — |
| Open WebUI | ทีม/องค์กร (หน้าเว็บเหมือน ChatGPT) | Docker/เซิร์ฟเวอร์ | ต่อ Ollama/vLLM | ✓ (แข็งแรง) | ✓ (สิทธิ์/SSO) |
| AnythingLLM | ทีม เน้นคุยกับเอกสาร + agent | เดสก์ท็อป + Docker | ✓ | ✓ (จุดเด่น) | ✓ (โหมดเซิร์ฟเวอร์) |
| llama.cpp | ขั้นสูง (เครื่องยนต์ตัวจริง, GGUF) | ทุกระบบ (แม้มือถือ) | ✓ | — | — |
| vLLM | โปรดักชัน/องค์กร (เสิร์ฟความเร็วสูง) | Linux + GPU | ✓ | — | ✓ (คนเยอะพร้อมกัน) |
ติดตั้งแล้วดึงโมเดลด้วยคำสั่งเดียว มีเซิร์ฟเวอร์ API ในตัว (เข้ากันได้กับ OpenAI) เป็น "มาตรฐาน" ที่นักพัฒนาใช้ต่อ Open WebUI หรือแอปอื่น
ollama run llama3.1 — จบ พิมพ์คุยได้เลยแอปหน้าตาสวย มีที่ค้นหา/ดาวน์โหลดโมเดลในตัว บอกก่อนโหลดว่าเครื่องคุณไหวไหม แชตได้ทันที คุยกับไฟล์ได้ และเปิดเป็นเซิร์ฟเวอร์ API ก็ได้
หน้าเว็บที่หน้าตาเหมือน ChatGPT เอามาครอบ Ollama/vLLM ได้ รองรับหลายผู้ใช้ กำหนดสิทธิ์/SSO, มีระบบ RAG แข็งแรง, ใส่เสียง/รูปได้ — เหมาะทำ "ChatGPT ส่วนตัวขององค์กร"
เลือกได้ 2 ทาง: ทาง A ไม่ต้องพิมพ์คำสั่งเลย (เหมาะมือใหม่สุด) หรือ ทาง B ใช้คำสั่ง Ollama ที่ต่อยอดเป็นระบบทั้งทีมได้ — ทุกกล่องคำสั่งมีปุ่มคัดลอก
ไม่ต้องแตะ command line เลย เหมาะถ้าไม่เคยใช้มาก่อน
localhost:1234ต่อกับแอปอื่นได้แบบเดียวกับ OpenAIบน Mac ชิป M ให้เลือกไฟล์แบบ MLX จะเร็วขึ้นชัดเจน
คำสั่งจริง คัดลอกไปวางใน Terminal / PowerShell (ต่อยอดให้ทั้งทีมใช้ได้)
curl -fsSL https://ollama.com/install.sh | sh
irm https://ollama.com/install.ps1 | iex
brew install ollama · หรือโหลดตัวติดตั้งที่ ollama.com/download
ollama run llama3.2
/bye เพื่อออก
ollama run scb10x/typhoon2.1-gemma3-4b
scb10x/llama3.2-typhoon2-3b-instruct · ใหญ่ 8B: scb10x/llama3.1-typhoon2-8b-instructollama run hf.co/openthaigpt/openthaigpt-1.0.0-7b-chat-gguf:Q4_KM (ตรวจแท็ก quant ที่หน้า HF ก่อน)
ollama list # ดูโมเดลที่มี ollama pull bge-m3 # โหลด embedding สำหรับ RAG (ไทย) ollama ps # ดูโมเดลที่กำลังรัน ollama rm llama3.2 # ลบโมเดลคืนพื้นที่
curl http://localhost:11434/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{
"model": "llama3.2",
"messages": [{"role":"user","content":"สวัสดี ช่วยแนะนำร้านกาแฟในกรุงเทพหน่อย"}]
}'11434 · เปลี่ยนแค่ base URL ก็ใช้กับไลบรารี OpenAI ได้เลย
docker run -d -p 3000:8080 --add-host=host.docker.internal:host-gateway -v open-webui:/app/backend/data --name open-webui --restart always ghcr.io/open-webui/open-webui:main
ollama รันอยู่)
เตรียมพื้นที่และแรมให้พอ: โหลดโมเดลครั้งแรกกินพื้นที่หลาย GB (3–4B ~1–3GB, 7–8B ~4–5GB, bge-m3 ~1.2GB) · โมเดล 3–4B ใช้ RAM ~8GB, 7–8B ~16GB จะสบาย · ชื่อรุ่นโมเดลเปลี่ยนได้ ตรวจล่าสุดที่ ollama.com/library และ ollama.com/scb10x ก่อนดึง
ขั้นถัดไป (advanced): จะจูนโมเดลด้วยข้อมูลองค์กรใช้ Unsloth — pip install unsloth แล้วรันโน้ตบุ๊กฟรี (เร็วขึ้น ~2 เท่า ใช้ VRAM น้อยลง ~70%) จากนั้น export เป็น GGUF มารันบน Ollama ต่อได้ · ดูภาพรวมทั้งหมดที่ บทเรียน 4 ระดับ
โมเดล "โอเพนเวต" (เปิดให้ดาวน์โหลดน้ำหนักโมเดลไปรันเอง) พัฒนาไวมากจนใช้งานจริงได้ดี ส่วนใหญ่โหลดฟรีจาก Hugging Face หรือสั่งผ่าน Ollama ได้เลย
ดาวน์โหลดเวอร์ชันไหน? มองหาไฟล์แบบ GGUF ระดับ Q4_K_M เป็นค่าเริ่มต้น — เล็กลง ~4 เท่า คุณภาพลดแค่ ~3–4% ถ้าเครื่องเหลือหน่วยความจำค่อยขยับเป็น Q5_K_M/Q6 (ช่วยเรื่องโค้ด/การให้เหตุผล) · บน Mac ใช้รูปแบบ MLX จะเร็วกว่า · หลีกเลี่ยง Q2/Q3 เว้นแต่จำเป็น (บ่อยครั้ง "โมเดลเล็กกว่าที่ Q4" ดีกว่า "โมเดลใหญ่กว่าที่ Q2")
รันได้บนการ์ด 4–8GB หรือ CPU: Llama 3.2 1B/3B, Qwen3 0.6–4B, Gemma 3 1B/4B, Phi-4-mini — เหมาะงานสรุป/ร่าง/แปล และงาน edge
Qwen3-VL, Llama 3.2 Vision, Gemma 3, LLaVA — อ่านรูปถ่าย ใบเสร็จ เอกสารสแกน แผนภาพ ได้โดยไม่ต้องส่งรูปขึ้นคลาวด์
Qwen2.5-Coder / Qwen3-Coder (รุ่น 32B ทำ HumanEval ~92%), DeepSeek-Coder, Codestral — ผู้ช่วยโปรแกรมเมอร์ในเครื่อง
nomic-embed-text, bge-m3 (ไทย/หลายภาษา), mxbai, Qwen3-Embedding — แปลงเอกสารเป็นเวกเตอร์เพื่อให้ AI ค้นหาและอ้างอิงได้
คนไทยพัฒนาโมเดลภาษาไทยของเราเองหลายตัว เข้าใจบริบท-สำนวนไทยดีกว่า และดาวน์โหลดมารันในองค์กรได้ ตอบโจทย์ "อธิปไตยทาง AI" และ PDPA
เลือกอย่างมีวิจารณญาณ: โมเดลไทยดีขึ้นเรื่อย ๆ แต่คุณภาพต่างกันตามงานและขนาด ควร "ทดสอบกับงานจริงของคุณเอง" ก่อนเลือก และดูอันดับจากลีดเดอร์บอร์ดกลาง เช่น ThaiLLM Leaderboard (SCB10X × VISTEC), SEA-HELM, ThaiExam — โดยรวมโมเดลรันเองยัง "สู้" โมเดลคลาวด์ระดับท็อปไม่ได้เต็มร้อยในงานยาก ๆ (ดูหัวข้อความปลอดภัย/ข้อจำกัดด้านล่าง)
ไม่ต้องเก่งเทคนิคมาก่อน เริ่มจากกดติดตั้งโปรแกรมเดียว แล้วค่อย ๆ ไต่ระดับจนถึงการจูนโมเดลและวางระบบให้ทั้งองค์กร
เป้าหมาย: ให้ AI ตัวแรกทำงานบนเครื่องคุณ และเข้าใจศัพท์พื้นฐาน
เป้าหมาย: ยกจากเล่นคนเดียว เป็นเครื่องมือที่ทีมใช้จริงกับข้อมูลองค์กร
ollama runเปิดเซิร์ฟเวอร์ในตัวโดยอัตโนมัติเป้าหมาย: ให้โมเดลทำงานเบื้องหลังในระบบขององค์กร ไม่ใช่แค่หน้าต่างแชต
เป้าหมาย: ปรับโมเดลให้ "เป็นของเรา" และเสิร์ฟให้คนจำนวนมากอย่างมั่นคง
ต่อยอดทักษะที่หลักสูตรบนเว็บนี้ (เรียนฟรี): AI ช่วยเขียนโปรแกรม · สร้าง AI Agent · AI วิเคราะห์ข้อมูล · AI เพิ่มประสิทธิภาพงาน — และดู พจนานุกรมศัพท์ AI เมื่อเจอคำที่ไม่คุ้น
รวมงานพื้นฐานที่โมเดลรันเองทำได้ดีและคุ้มค่าที่สุด — ทั้งหมดนี้ข้อมูลไม่ต้องออกจากเครื่อง
ถาม-ตอบ ระดมสมอง ช่วยคิด แบบ ChatGPT ที่ทำงานออฟไลน์บนเครื่องคุณ
ย่อรายงาน สัญญา บันทึกประชุม ไฟล์ PDF ยาว ๆ ให้เหลือใจความสำคัญ
ให้ AI ตอบโดยอ้างอิงคู่มือ ระเบียบ นโยบาย ขององค์กรที่อัปโหลดเข้าไป
อีเมล จดหมายราชการ รายงาน โพสต์ — ร่างและปรับโทนให้เป๊ะ
ไทย↔อังกฤษ และภาษาอื่น โดยเอกสารลับไม่ต้องส่งขึ้นบริการแปลภายนอก
เขียน แก้บั๊ก อธิบายโค้ด รีวิว — โค้ดลับขององค์กรอยู่ในเครื่อง
ดึงชื่อ/วันที่/ยอดเงิน จากข้อความหรือฟอร์ม ออกมาเป็นข้อมูลมีโครงสร้าง
ติดแท็ก จัดกลุ่ม รีวิว/คอมเมนต์/เรื่องร้องเรียน วัดความพึงพอใจ
อ่านใบเสร็จ เอกสารสแกน ลายมือ แผนภาพ แล้วสรุป/แปลงเป็นข้อความ
ใช้ Whisper ถอดเสียงเป็นข้อความ แล้วสรุปประเด็น/สิ่งที่ต้องทำต่อ
Stable Diffusion / Flux สร้างภาพประกอบ/สื่อ โดยไม่ส่งข้อมูลออก
เขียนสูตร Excel สร้างคำสั่ง SQL และสคริปต์อัตโนมัติงานซ้ำ ๆ
องค์กรที่ถือ "ข้อมูลอ่อนไหว" ได้ประโยชน์จาก Local AI มากที่สุด เพราะข้อมูลไม่ต้องออกนอกองค์กร (ตอบโจทย์ PDPA) แต่ละประเภทมี 10 ตัวอย่างที่ลงมือทำได้จริง
⚠️ ทุกผลลัพธ์ต้องมีบุคลากรการแพทย์ตรวจก่อนใช้ — AI ไม่วินิจฉัย/สั่งยาแทนคน
หลักสูตร AI การแพทย์⚠️ การตัดสินสิทธิ์/อนุมัติต้องมีเจ้าหน้าที่ ไม่ให้ AI ตัดสินอัตโนมัติ + ปฏิบัติตาม PDPA
หลักสูตร AI ภาครัฐ⚠️ ส่งเสริมการเรียนรู้ ไม่ใช่ทำการบ้าน/งานแทน — มีครูกำกับเสมอ
หลักสูตร AI การศึกษา⚠️ ตรวจก่อนส่งลูกค้า และดูแลข้อมูลส่วนบุคคลของลูกค้าตาม PDPA
หลักสูตร AI ธุรกิจ⚠️ ไม่ใช่ความเห็นทางวิชาชีพขั้นสุดท้าย — ผู้ประกอบวิชาชีพต้องตรวจสอบ และระวัง AI "มั่ว" อ้างคดี/มาตราที่ไม่มีจริง
ดูคลัง Prompt วิชาชีพ⚠️ งานความปลอดภัยและคุณภาพต้องมีวิศวกร/ผู้เชี่ยวชาญยืนยันก่อนเสมอ
หลักสูตร AI การผลิต⚠️ AI เป็นเพียงตัวช่วยจัดเตรียม/คัดกรอง ต้องมีเจ้าหน้าที่ Compliance/สินเชื่อ/สินไหมตรวจก่อนเสมอ — ห้ามอนุมัติสินเชื่อ/ปฏิเสธเคลมอัตโนมัติ และยึด PDPA + เกณฑ์ ธปท./ก.ล.ต.
หลักสูตร AI ธุรกิจ-การเงิน⚠️ ที่อยู่/ชื่อผู้รับเป็นข้อมูลส่วนบุคคลตาม PDPA และผลจัดเส้นทาง/คิดค่าปรับต้องมีเจ้าหน้าที่ตรวจก่อนใช้จริงเสมอ
หลักสูตร AI โลจิสติกส์⚠️ เอกสาร/ประวัติแขกเป็นข้อมูลส่วนบุคคลตาม PDPA จำกัดสิทธิ์เข้าถึง เก็บเท่าที่จำเป็น และให้พนักงานตรวจผลก่อนบันทึก/ส่งถึงแขก
หลักสูตร AI ท่องเที่ยว-โรงแรมอยากดู Use Case ราย ธุรกิจแบบเจาะลึกพร้อม prompt ก๊อปไปใช้? ดูเพิ่มที่ Use Case รายธุรกิจ (16 ประเภท) และ คลัง Prompt — หน้านี้เน้นที่ "ทำแบบ Local" ส่วนสองหน้านั้นให้ prompt และตัวอย่างละเอียดที่ใช้ได้ทั้งกับ AI คลาวด์และ Local
Local AI มีข้อดีมาก แต่ก็ไม่ใช่ยาวิเศษ — เข้าใจข้อจำกัดเหล่านี้ก่อน จะใช้ได้อย่างปลอดภัยและคุ้มค่าจริง
ข้อมูลไม่ออกนอกองค์กรก็จริง แต่ยังต้องมีการควบคุมสิทธิ์เข้าถึง เข้ารหัส สำรองข้อมูล และดูแลเครื่องให้ปลอดภัยเอง
โมเดลรันเองเก่งขึ้นมาก แต่งานที่ต้องให้เหตุผลยาว-ซับซ้อนสุด ๆ โมเดลคลาวด์ระดับแนวหน้ายังทำได้ดีกว่า
อาจตอบผิดหรือแต่งข้อมูลอย่างมั่นใจ โดยเฉพาะเรื่องกฎหมาย/การแพทย์/ตัวเลข — ต้องมีคนตรวจก่อนใช้งานสำคัญเสมอ
ถึงข้อมูลอยู่ในองค์กร ก็ยังต้องมีฐานการประมวลผลที่ถูกต้อง การขอความยินยอม การเก็บรักษา และธรรมาภิบาลตามกฎหมาย
ไม่ใช่ตั้งแล้วลืม — ต้องมีคนดูแลเครื่อง อัปเดตโมเดล จัดการความเร็ว/ความจุ และแก้ปัญหาเมื่อระบบล่ม
ใช้ Local กับข้อมูลอ่อนไหว/งานประจำ/งานปริมาณมาก และคลาวด์กับงานยากที่ไม่ลับ — เคล็ดลับ: ใช้โมเดล Local ลบข้อมูลส่วนตัวก่อนส่งคลาวด์
พ.ร.บ.คุ้มครองข้อมูลส่วนบุคคล (PDPA พ.ศ. 2562) บังคับใช้เต็มรูปแบบตั้งแต่ 1 มิ.ย. 2565 และเริ่มมีการปรับจริง (ค่าปรับก้อนใหญ่ครั้งแรกช่วงปี 2568) — การส่งข้อมูลส่วนบุคคลไปประมวลผลที่บริการภายนอก/ต่างประเทศเข้าข่ายการโอนข้อมูลข้ามพรมแดนที่มีเงื่อนไข ส่วน Local AI ที่ข้อมูล "ไม่ออกจากองค์กร" ช่วยลดประเด็นนี้ได้โดยตรง ขณะเดียวกันไทยมีทิศทางสนับสนุน AI ในประเทศ ทั้ง แผนปฏิบัติการ AI แห่งชาติ 2565–2570, แนวทางธรรมาภิบาล AI ภาครัฐของ ETDA, การส่งเสริมของ depa และโมเดลไทยที่ NECTEC/VISTEC/SCB 10X พัฒนาเอง
หมายเหตุ: ร่างกฎหมาย AI และแนวทางบังคับสำหรับหน่วยงานรัฐบางส่วนยังอยู่ระหว่างจัดทำ ควรตรวจสอบสถานะล่าสุดจากหน่วยงานทางการก่อนอ้างอิง
ไม่ต้องซื้อเครื่องแพงก่อน — โหลด LM Studio หรือ Ollama ลองโมเดลเล็กบนเครื่องที่มีอยู่ แล้วค่อยไต่ระดับตามบทเรียน 4 ขั้นในหน้านี้ ทุกหลักสูตรบนเว็บนี้เรียนฟรีเป็นภาษาไทย
คำถามที่คนมักสงสัยก่อนเริ่มทำ AI บนเครื่องตัวเอง
GGUF ให้โหลดมารันบน Ollama หรือ LM Studio ได้ มีขนาดตั้งแต่ราว 4B ถึง 72B เลือกตามสเปกเครื่องและงาน