🎓 หลักสูตรฝึกอบรม · 18 โมดูล

หลักสูตรฝึกอบรมการใช้งาน ElevenLabs อย่างมืออาชีพ: จากเสียงพูด AI สู่การผลิตเสียงระดับสตูดิโอ

มาเรียนรู้เครื่องมือเสียง AI ตัวนี้แบบครบทุกเรื่อง ตั้งแต่การแปลงข้อความเป็นเสียงพูด (Text to Speech) ได้หลายภาษา การก๊อปปี้เสียงคน (การโคลนเสียง) การพากย์เสียงข้ามภาษา (Dubbing) การทำเสียงประกอบ แต่งเพลง ไปจนถึงการสร้างผู้ช่วยเสียงอัตโนมัติ (Voice Agents) และการเชื่อมต่อกับโปรแกรมอื่น (API) สำหรับนักพัฒนา เราสอนจากสิ่งที่เครื่องมือทำได้จริง และย้ำเสมอว่าถ้าจะเอาเสียงใครมาใช้ ต้องขออนุญาตเจ้าของเสียงก่อนทุกครั้ง

🧩 3 ระดับ🛠 เน้นลงมือทำ🇹🇭 ภาษาไทย
ภาพประกอบหลักสูตร ElevenLabs
จุดเด่นของแพลตฟอร์ม

ElevenLabs เก่งเรื่องอะไร

eleven_v3 + แท็กสั่งอารมณ์ (Audio Tags) และโหมดบทสนทนา (Dialogue Mode)

นี่คือโมเดลตัวเก่งที่สุด ใส่อารมณ์ให้เสียงได้เนียนสุด รองรับกว่า 70 ภาษา เราสั่งอารมณ์ในบทได้ด้วยการใส่แท็กในวงเล็บ เช่น [whispers] (กระซิบ) [sighs] (ถอนหายใจ) [nervously] (พูดแบบประหม่า) และยังจับหลายเสียงมาคุยโต้ตอบกันเป็นบทสนทนาที่ฟังเหมือนคนจริงได้ (ข้อแลกก็คือ มันตอบช้ากว่าโมเดลอื่น เลยไม่เหมาะกับงานสดที่ต้องตอบทันที)

🧩

ก๊อปปี้เสียง (Voice Cloning) มีให้เลือก 2 แบบ (IVC / PVC)

แบบเร็ว (Instant Voice Cloning) ก๊อปปี้เสียงได้จากตัวอย่างสั้น ๆ แค่ราว 1–5 นาที ส่วนแบบมืออาชีพ (Professional Voice Cloning) ต้องใช้เสียงที่บันทึกมาชัด ๆ ยาว 30 นาทีขึ้นไป และมีขั้นตอนยืนยันว่าเป็นตัวเราจริงด้วยการพูด (voice CAPTCHA) กฎเหล็กก็คือ แบบมืออาชีพนี้ทำได้กับเสียงของตัวเองเท่านั้น

⚙️

การพากย์เสียง (Dubbing) และ Studio 3.0

พากย์วิดีโอเป็นภาษาอื่นได้โดยที่เสียงยังฟังเหมือนคนเดิม และยังตัดต่องานยาว ๆ ที่มีหลายชั้นเสียงมาซ้อนกันได้ (ทั้งวิดีโอ คำบรรยาย เสียงเล่าเรื่อง เพลง และเสียงประกอบ) — แต่มีข้อควรระวังว่าตอนนี้ Dubbing Studio กำลังปิดปรับปรุงอยู่ (maintenance mode) และกินเครดิตต่อนาทีค่อนข้างสูง

🚀

ผู้ช่วยเสียงอัตโนมัติ ElevenAgents (Voice Agents)

สร้างผู้ช่วยที่คุยกับลูกค้าได้ทั้งทางโทรศัพท์ เว็บไซต์ และแชท คิดเงินตามนาทีที่คุย (แยกออกจากถังเครดิตปกติ) เบื้องหลังใช้โมเดล Flash v2.5 เพื่อพูดตอบได้เร็ว (latency ต่ำ) และใช้ Scribe แบบเรียลไทม์เพื่อฟังและถอดเสียงเป็นข้อความ (STT) ส่วนค่าประมวลผลของ AI ที่คิดคำตอบ (LLM tokens) กับค่าระบบโทรศัพท์ (telephony) จะคิดแยกกันอีกต่างหาก

📚

Scribe (ถอดเสียงเป็นข้อความ) และ Eleven Music

scribe_v2 ถอดเสียงพูดเป็นข้อความได้กว่า 90 ภาษา บอกได้ว่าคำไหนพูดตอนวินาทีที่เท่าไหร่ (timestamp) แยกได้ว่าใครเป็นคนพูด และยังตรวจเจอข้อมูลส่วนตัว (PII) เพื่อปิดบังให้อัตโนมัติ ส่วน Eleven Music สร้างเพลงคุณภาพระดับสตูดิโอจากคำสั่งที่เราพิมพ์ (prompt) จุดขายคือเพลงที่ได้ 'เอาไปใช้เชิงพาณิชย์ได้เลย' เพราะมาจากคลังที่เจ้าของยินยอมให้ใช้

🎯

เชื่อมต่อกับโปรแกรมอื่น (API/SDK) และเลือกโมเดลตามงาน

มีช่องทางให้นักพัฒนาเรียกใช้งานได้ทั้งแบบทั่วไป (REST) และแบบส่งเสียงมาเรื่อย ๆ ทีละส่วน (streaming ผ่าน WebSocket) พร้อมชุดเครื่องมือช่วยเขียนโปรแกรม (SDK) อย่างเป็นทางการ และมีช่องทางเชื่อมต่อ (endpoint) แยกตามแต่ละงาน ทั้งแปลงข้อความเป็นเสียง ถอดเสียงเป็นข้อความ พากย์ แต่งเพลง ทำเสียงประกอบ ออกแบบเสียง และผู้ช่วยเสียง โดยเสียงที่ได้มีคุณภาพสูง (192 kbps, 44.1 kHz PCM) ซึ่งจะปลดล็อกให้ตามระดับแพ็กเกจที่สมัคร

เส้นทางการเรียนรู้

สามระดับ · หนึ่งเป้าหมาย

เริ่มจากจุดที่เหมาะกับคุณ แล้วค่อย ๆ ไต่ขึ้นทีละขั้น

ระดับ 1 6 โมดูล

ระดับพื้นฐาน: เข้าใจว่าเครื่องมือนี้ทำอะไรได้ และทำเสียงพูดคุณภาพสูงเป็น

ทำความรู้จัก ElevenLabs ในฐานะเครื่องมือทำเสียง เลือกโมเดลและเสียงให้เหมาะกับงาน คุมวิธีอ่านออกเสียงได้ สร้างเสียงและเสียงประกอบพื้นฐานเป็น พร้อมเข้าใจว่าระบบเครดิตทำงานยังไง และเสียงแบบไหนเอาไปหาเงินได้ · 8–10 ชั่วโมง

ElevenLabs คืออะไร: เป็นเครื่องมือทำเสียง ไม่ใช่ผู้ช่วยแชทตอบคำถาม; รู้จักโมเดลแปลงข้อความเป็นเสียง (TTS) และเลือกใช้ให้ถูกงาน; การเลือกและปรับแต่งเสียงจากคลังเสียง; การออกแบบเสียงใหม่ (Voice Design): สร้างเสียงที่ไม่มีจริงขึ้นมาจากคำบรรยาย …

เข้าสู่บทเรียน →
ระดับ 2 6 โมดูล

ระดับกลาง: คุมอารมณ์เสียง ก๊อปปี้เสียง พากย์ข้ามภาษา และตัดต่องานยาว

ใช้แท็กสั่งอารมณ์และโหมดบทสนทนาของ eleven_v3 ได้คล่อง ก๊อปปี้เสียงด้วย IVC/PVC อย่างถูกต้องโดยได้รับอนุญาต พากย์วิดีโอด้วย Dubbing Studio และตัดต่องานหลายชั้นเสียงใน Studio 3.0 · 10–12 ชั่วโมง

แท็กสั่งอารมณ์ (Audio Tags): คุมอารมณ์ในบทด้วย eleven_v3; โหมดบทสนทนา (Dialogue Mode): เอาหลายเสียงมาคุยกันเป็นบทสนทนา; ก๊อปปี้เสียงแบบเร็ว (IVC): ทำได้ไวจากตัวอย่างสั้น ๆ; ก๊อปปี้เสียงแบบมืออาชีพ (PVC): คุณภาพดีที่สุด พร้อมกฎเหล็กเรื่องการขออนุญาต …

เข้าสู่บทเรียน →
ระดับ 3 6 โมดูล

ระดับสูง: ผู้ช่วยเสียง, การเชื่อมต่อโปรแกรม (API/SDK), Scribe, แต่งเพลง และการวางระบบสำหรับองค์กร

สร้างผู้ช่วยเสียง (Voice Agents) พร้อมคำนวณต้นทุนแยกแต่ละส่วน เชื่อมต่อกับโปรแกรมอื่นทั้งแบบทั่วไปและแบบส่งเสียงมาเรื่อย ๆ (REST/streaming API) ถอดเสียงเป็นข้อความด้วย Scribe แต่งเพลงเอาไปหาเงินได้โดยระวังขอบเขตลิขสิทธิ์ และวางระบบให้เป็นไปตามกฎ พร้อมตรวจสอบที่มาของงานได้ (compliance/provenance) ในระดับองค์กร · 12–14 ชั่วโมง

ElevenAgents: สร้างผู้ช่วยเสียงสำหรับโทรศัพท์/เว็บ/แชท; ต้นทุนที่หลายคนมองข้าม: ค่านาที + ค่าประมวลผล AI (LLM tokens) + ค่าระบบโทรศัพท์ (telephony); Scribe: ถอดเสียงเป็นข้อความระดับมืออาชีพ; Eleven Music: แต่งเพลงเอาไปหาเงินได้โดยระวังขอบเขต …

เข้าสู่บทเรียน →
🎙️

หัวใจของเครื่องมือ: เสียงพูด AI และการก๊อปปี้เสียง

ElevenLabs เก่งที่สุดเรื่องเสียงพูดหลายภาษาที่ฟังเป็นธรรมชาติและคุมอารมณ์ได้ หน้านี้ร

🌐

พากย์ข้ามภาษาและตัดต่องานยาว

ElevenLabs แปลเสียงพูดเป็นภาษาอื่นได้โดยเสียงยังฟังเหมือนคนเดิม และมีเครื่องมือตัดต่องานยาว

🤖

สร้างผู้ช่วยเสียงและรู้ทันต้นทุนที่หลายคนมองข้าม

ElevenAgents (เปลี่ยนชื่อมาจาก Conversational AI) สร้างผู้ช่วยเสียงและแชทสำหรับโทรศัพท์/เว็บ/แชท

🎵

แต่งเพลงและทำเสียงประกอบจากคำสั่งที่พิมพ์ (prompt)

นอกจากเสียงพูด ElevenLabs ยังแต่งเพลงคุณภาพระดับสตูดิโอ (Eleven Music) และทำเสียงประกอบ (SFX) จาก

⚖️

การขออนุญาตก่อนก๊อปปี้เสียง การป้องกันเสียงปลอม (deepfake) และสิทธิ์เอาไปหาเงิน

ใช้เครื่องมือเสียง AI อย่างมืออาชีพต้องมาพร้อมความรับผิดชอบ หน้านี้รวมกรอบจริยธรรมและกฎหม

📌

ข้อจำกัดจริงและจุดที่ยังไม่แน่นอน (uncertainty flags)

หลักสูตรมืออาชีพต้องสอนขอบเขตด้วย ไม่ใช่แค่บอกว่าทำอะไรได้ หน้านี้รวมสิ่งที่เครื่องมือทำไม่ได้จร

กลุ่มเป้าหมาย

หลักสูตรนี้เหมาะกับใคร

ระดับกลุ่มเป้าหมายความคาดหวังหลังเรียน
Foundation (ผู้เริ่มต้น)ครีเอเตอร์ คนทำคอนเทนต์ นักการตลาด ครู และคนทั่วไปที่อยากแปลงข้อความให้เป็นเสียงพูดคุณภาพสูง แต่ยังไม่เคยใช้เครื่องมือเสียง AI มาก่อนทำเสียงเล่าเรื่องหลายภาษาที่ฟังเป็นธรรมชาติ เลือกโมเดลและเสียงได้เหมาะกับงาน เข้าใจว่าระบบเครดิตทำงานยังไงและเสียงแบบไหนเอาไปหาเงินได้ตามแพ็กเกจ พร้อมสร้างเสียงใหม่ขึ้นมาเองด้วย Voice Design
Intermediate (ผู้ใช้งานระดับกลาง)โปรดิวเซอร์เสียง ทีมทำพอดแคสต์ (podcast) และหนังสือเสียง (audiobook) คนทำวิดีโอ และใครก็ตามที่อยากก๊อปปี้เสียง พากย์ข้ามภาษา และตัดต่องานยาว ๆ อย่างเป็นระบบก๊อปปี้เสียงด้วย IVC/PVC อย่างถูกต้องโดยได้รับอนุญาต ใช้แท็กสั่งอารมณ์และโหมดบทสนทนาคุมการแสดงอารมณ์ของเสียงได้ พากย์วิดีโอใน Dubbing Studio และตัดต่องานหลายชั้นเสียงใน Studio 3.0
Advanced (ผู้ใช้งานระดับสูง / นักพัฒนา)นักพัฒนา วิศวกรเสียง ทีมทำผลิตภัณฑ์ และเอเจนซีที่ต้องสร้างผู้ช่วยเสียงสำหรับโทรศัพท์/เว็บ/แชท เชื่อมต่อกับโปรแกรมอื่น (API/SDK) และวางระบบทำเสียงในระดับองค์กรสร้างผู้ช่วยเสียงพร้อมคำนวณต้นทุนแยกแต่ละส่วน (ค่านาที + ค่าประมวลผล AI + ค่าระบบโทรศัพท์) เรียกใช้งานผ่าน API ทั้งแบบทั่วไปและแบบส่งเสียงมาเรื่อย ๆ ถอดเสียงเป็นข้อความด้วย Scribe แต่งเพลงเอาไปหาเงินได้โดยระวังขอบเขตลิขสิทธิ์ และวางระบบให้เป็นไปตามกฎพร้อมตรวจสอบที่มาของงานได้ในระดับองค์กร
ผลลัพธ์การเรียนรู้

เมื่อจบทั้งสามระดับ คุณจะสามารถ…

1

เข้าใจว่า ElevenLabs เป็นเครื่องมือทำเสียง (voice/audio AI) ไม่ใช่ผู้ช่วยแชทตอบคำถาม และเลือกโมเดลได้ถูกกับงาน (eleven_v3 เมื่ออยากได้เสียงมีอารมณ์, eleven_flash_v2_5 เมื่อต้องตอบสด ๆ ทันที, eleven_multilingual_v2 เมื่อเป็นงานเล่าเรื่องยาว ๆ)

2

ทำเสียงพูดหลายภาษาที่ฟังเป็นธรรมชาติและคุมอารมณ์ได้ ด้วยแท็กสั่งอารมณ์ (Audio Tags) และโหมดบทสนทนา (Dialogue Mode) ของ eleven_v3

3

บอกความต่างและใช้งานการก๊อปปี้เสียงแบบเร็ว (Instant Voice Cloning / IVC) กับแบบมืออาชีพ (Professional Voice Cloning / PVC) ได้ถูกต้อง โดยต้องขออนุญาตเจ้าของเสียงก่อนและอยู่ในกรอบกฎหมาย

4

ออกแบบเสียงใหม่ที่ไม่มีจริงขึ้นมาจากคำบรรยาย (Voice Design) และเข้าใจว่าคลังเสียงกลาง (Voice Library) กับระบบจ่ายส่วนแบ่งให้เจ้าของเสียง (Voice Actor Payouts) ทำงานยังไง

5

พากย์วิดีโอข้ามภาษาด้วย Dubbing / Dubbing Studio และรู้ข้อจำกัด (ตอนนี้กำลังปิดปรับปรุงอยู่ / maintenance mode) รวมถึงต้นทุนเครดิตที่ค่อนข้างสูง

6

ทำเสียงประกอบ (SFX), แต่งเพลง (Eleven Music), และตัดต่องานยาว ๆ ใน Studio 3.0 ได้

7

สร้างและคำนวณต้นทุนผู้ช่วยเสียง (ElevenAgents) แล้วเรียกใช้งานผ่าน API/SDK พร้อมเข้าใจกรอบจริยธรรม การขออนุญาต การป้องกันเสียงปลอม (deepfake) และสิทธิ์การเอาไปหาเงินตามระดับแพ็กเกจ