มาเรียนรู้เครื่องมือเสียง AI ตัวนี้แบบครบทุกเรื่อง ตั้งแต่การแปลงข้อความเป็นเสียงพูด (Text to Speech) ได้หลายภาษา การก๊อปปี้เสียงคน (การโคลนเสียง) การพากย์เสียงข้ามภาษา (Dubbing) การทำเสียงประกอบ แต่งเพลง ไปจนถึงการสร้างผู้ช่วยเสียงอัตโนมัติ (Voice Agents) และการเชื่อมต่อกับโปรแกรมอื่น (API) สำหรับนักพัฒนา เราสอนจากสิ่งที่เครื่องมือทำได้จริง และย้ำเสมอว่าถ้าจะเอาเสียงใครมาใช้ ต้องขออนุญาตเจ้าของเสียงก่อนทุกครั้ง
นี่คือโมเดลตัวเก่งที่สุด ใส่อารมณ์ให้เสียงได้เนียนสุด รองรับกว่า 70 ภาษา เราสั่งอารมณ์ในบทได้ด้วยการใส่แท็กในวงเล็บ เช่น [whispers] (กระซิบ) [sighs] (ถอนหายใจ) [nervously] (พูดแบบประหม่า) และยังจับหลายเสียงมาคุยโต้ตอบกันเป็นบทสนทนาที่ฟังเหมือนคนจริงได้ (ข้อแลกก็คือ มันตอบช้ากว่าโมเดลอื่น เลยไม่เหมาะกับงานสดที่ต้องตอบทันที)
แบบเร็ว (Instant Voice Cloning) ก๊อปปี้เสียงได้จากตัวอย่างสั้น ๆ แค่ราว 1–5 นาที ส่วนแบบมืออาชีพ (Professional Voice Cloning) ต้องใช้เสียงที่บันทึกมาชัด ๆ ยาว 30 นาทีขึ้นไป และมีขั้นตอนยืนยันว่าเป็นตัวเราจริงด้วยการพูด (voice CAPTCHA) กฎเหล็กก็คือ แบบมืออาชีพนี้ทำได้กับเสียงของตัวเองเท่านั้น
พากย์วิดีโอเป็นภาษาอื่นได้โดยที่เสียงยังฟังเหมือนคนเดิม และยังตัดต่องานยาว ๆ ที่มีหลายชั้นเสียงมาซ้อนกันได้ (ทั้งวิดีโอ คำบรรยาย เสียงเล่าเรื่อง เพลง และเสียงประกอบ) — แต่มีข้อควรระวังว่าตอนนี้ Dubbing Studio กำลังปิดปรับปรุงอยู่ (maintenance mode) และกินเครดิตต่อนาทีค่อนข้างสูง
สร้างผู้ช่วยที่คุยกับลูกค้าได้ทั้งทางโทรศัพท์ เว็บไซต์ และแชท คิดเงินตามนาทีที่คุย (แยกออกจากถังเครดิตปกติ) เบื้องหลังใช้โมเดล Flash v2.5 เพื่อพูดตอบได้เร็ว (latency ต่ำ) และใช้ Scribe แบบเรียลไทม์เพื่อฟังและถอดเสียงเป็นข้อความ (STT) ส่วนค่าประมวลผลของ AI ที่คิดคำตอบ (LLM tokens) กับค่าระบบโทรศัพท์ (telephony) จะคิดแยกกันอีกต่างหาก
scribe_v2 ถอดเสียงพูดเป็นข้อความได้กว่า 90 ภาษา บอกได้ว่าคำไหนพูดตอนวินาทีที่เท่าไหร่ (timestamp) แยกได้ว่าใครเป็นคนพูด และยังตรวจเจอข้อมูลส่วนตัว (PII) เพื่อปิดบังให้อัตโนมัติ ส่วน Eleven Music สร้างเพลงคุณภาพระดับสตูดิโอจากคำสั่งที่เราพิมพ์ (prompt) จุดขายคือเพลงที่ได้ 'เอาไปใช้เชิงพาณิชย์ได้เลย' เพราะมาจากคลังที่เจ้าของยินยอมให้ใช้
มีช่องทางให้นักพัฒนาเรียกใช้งานได้ทั้งแบบทั่วไป (REST) และแบบส่งเสียงมาเรื่อย ๆ ทีละส่วน (streaming ผ่าน WebSocket) พร้อมชุดเครื่องมือช่วยเขียนโปรแกรม (SDK) อย่างเป็นทางการ และมีช่องทางเชื่อมต่อ (endpoint) แยกตามแต่ละงาน ทั้งแปลงข้อความเป็นเสียง ถอดเสียงเป็นข้อความ พากย์ แต่งเพลง ทำเสียงประกอบ ออกแบบเสียง และผู้ช่วยเสียง โดยเสียงที่ได้มีคุณภาพสูง (192 kbps, 44.1 kHz PCM) ซึ่งจะปลดล็อกให้ตามระดับแพ็กเกจที่สมัคร
เริ่มจากจุดที่เหมาะกับคุณ แล้วค่อย ๆ ไต่ขึ้นทีละขั้น
ทำความรู้จัก ElevenLabs ในฐานะเครื่องมือทำเสียง เลือกโมเดลและเสียงให้เหมาะกับงาน คุมวิธีอ่านออกเสียงได้ สร้างเสียงและเสียงประกอบพื้นฐานเป็น พร้อมเข้าใจว่าระบบเครดิตทำงานยังไง และเสียงแบบไหนเอาไปหาเงินได้ · 8–10 ชั่วโมง
ElevenLabs คืออะไร: เป็นเครื่องมือทำเสียง ไม่ใช่ผู้ช่วยแชทตอบคำถาม; รู้จักโมเดลแปลงข้อความเป็นเสียง (TTS) และเลือกใช้ให้ถูกงาน; การเลือกและปรับแต่งเสียงจากคลังเสียง; การออกแบบเสียงใหม่ (Voice Design): สร้างเสียงที่ไม่มีจริงขึ้นมาจากคำบรรยาย …
เข้าสู่บทเรียน →ใช้แท็กสั่งอารมณ์และโหมดบทสนทนาของ eleven_v3 ได้คล่อง ก๊อปปี้เสียงด้วย IVC/PVC อย่างถูกต้องโดยได้รับอนุญาต พากย์วิดีโอด้วย Dubbing Studio และตัดต่องานหลายชั้นเสียงใน Studio 3.0 · 10–12 ชั่วโมง
แท็กสั่งอารมณ์ (Audio Tags): คุมอารมณ์ในบทด้วย eleven_v3; โหมดบทสนทนา (Dialogue Mode): เอาหลายเสียงมาคุยกันเป็นบทสนทนา; ก๊อปปี้เสียงแบบเร็ว (IVC): ทำได้ไวจากตัวอย่างสั้น ๆ; ก๊อปปี้เสียงแบบมืออาชีพ (PVC): คุณภาพดีที่สุด พร้อมกฎเหล็กเรื่องการขออนุญาต …
เข้าสู่บทเรียน →สร้างผู้ช่วยเสียง (Voice Agents) พร้อมคำนวณต้นทุนแยกแต่ละส่วน เชื่อมต่อกับโปรแกรมอื่นทั้งแบบทั่วไปและแบบส่งเสียงมาเรื่อย ๆ (REST/streaming API) ถอดเสียงเป็นข้อความด้วย Scribe แต่งเพลงเอาไปหาเงินได้โดยระวังขอบเขตลิขสิทธิ์ และวางระบบให้เป็นไปตามกฎ พร้อมตรวจสอบที่มาของงานได้ (compliance/provenance) ในระดับองค์กร · 12–14 ชั่วโมง
ElevenAgents: สร้างผู้ช่วยเสียงสำหรับโทรศัพท์/เว็บ/แชท; ต้นทุนที่หลายคนมองข้าม: ค่านาที + ค่าประมวลผล AI (LLM tokens) + ค่าระบบโทรศัพท์ (telephony); Scribe: ถอดเสียงเป็นข้อความระดับมืออาชีพ; Eleven Music: แต่งเพลงเอาไปหาเงินได้โดยระวังขอบเขต …
เข้าสู่บทเรียน →ElevenLabs เก่งที่สุดเรื่องเสียงพูดหลายภาษาที่ฟังเป็นธรรมชาติและคุมอารมณ์ได้ หน้านี้ร
ElevenLabs แปลเสียงพูดเป็นภาษาอื่นได้โดยเสียงยังฟังเหมือนคนเดิม และมีเครื่องมือตัดต่องานยาว
ElevenAgents (เปลี่ยนชื่อมาจาก Conversational AI) สร้างผู้ช่วยเสียงและแชทสำหรับโทรศัพท์/เว็บ/แชท
นอกจากเสียงพูด ElevenLabs ยังแต่งเพลงคุณภาพระดับสตูดิโอ (Eleven Music) และทำเสียงประกอบ (SFX) จาก
ใช้เครื่องมือเสียง AI อย่างมืออาชีพต้องมาพร้อมความรับผิดชอบ หน้านี้รวมกรอบจริยธรรมและกฎหม
หลักสูตรมืออาชีพต้องสอนขอบเขตด้วย ไม่ใช่แค่บอกว่าทำอะไรได้ หน้านี้รวมสิ่งที่เครื่องมือทำไม่ได้จร
| ระดับ | กลุ่มเป้าหมาย | ความคาดหวังหลังเรียน |
|---|---|---|
| Foundation (ผู้เริ่มต้น) | ครีเอเตอร์ คนทำคอนเทนต์ นักการตลาด ครู และคนทั่วไปที่อยากแปลงข้อความให้เป็นเสียงพูดคุณภาพสูง แต่ยังไม่เคยใช้เครื่องมือเสียง AI มาก่อน | ทำเสียงเล่าเรื่องหลายภาษาที่ฟังเป็นธรรมชาติ เลือกโมเดลและเสียงได้เหมาะกับงาน เข้าใจว่าระบบเครดิตทำงานยังไงและเสียงแบบไหนเอาไปหาเงินได้ตามแพ็กเกจ พร้อมสร้างเสียงใหม่ขึ้นมาเองด้วย Voice Design |
| Intermediate (ผู้ใช้งานระดับกลาง) | โปรดิวเซอร์เสียง ทีมทำพอดแคสต์ (podcast) และหนังสือเสียง (audiobook) คนทำวิดีโอ และใครก็ตามที่อยากก๊อปปี้เสียง พากย์ข้ามภาษา และตัดต่องานยาว ๆ อย่างเป็นระบบ | ก๊อปปี้เสียงด้วย IVC/PVC อย่างถูกต้องโดยได้รับอนุญาต ใช้แท็กสั่งอารมณ์และโหมดบทสนทนาคุมการแสดงอารมณ์ของเสียงได้ พากย์วิดีโอใน Dubbing Studio และตัดต่องานหลายชั้นเสียงใน Studio 3.0 |
| Advanced (ผู้ใช้งานระดับสูง / นักพัฒนา) | นักพัฒนา วิศวกรเสียง ทีมทำผลิตภัณฑ์ และเอเจนซีที่ต้องสร้างผู้ช่วยเสียงสำหรับโทรศัพท์/เว็บ/แชท เชื่อมต่อกับโปรแกรมอื่น (API/SDK) และวางระบบทำเสียงในระดับองค์กร | สร้างผู้ช่วยเสียงพร้อมคำนวณต้นทุนแยกแต่ละส่วน (ค่านาที + ค่าประมวลผล AI + ค่าระบบโทรศัพท์) เรียกใช้งานผ่าน API ทั้งแบบทั่วไปและแบบส่งเสียงมาเรื่อย ๆ ถอดเสียงเป็นข้อความด้วย Scribe แต่งเพลงเอาไปหาเงินได้โดยระวังขอบเขตลิขสิทธิ์ และวางระบบให้เป็นไปตามกฎพร้อมตรวจสอบที่มาของงานได้ในระดับองค์กร |
เข้าใจว่า ElevenLabs เป็นเครื่องมือทำเสียง (voice/audio AI) ไม่ใช่ผู้ช่วยแชทตอบคำถาม และเลือกโมเดลได้ถูกกับงาน (eleven_v3 เมื่ออยากได้เสียงมีอารมณ์, eleven_flash_v2_5 เมื่อต้องตอบสด ๆ ทันที, eleven_multilingual_v2 เมื่อเป็นงานเล่าเรื่องยาว ๆ)
ทำเสียงพูดหลายภาษาที่ฟังเป็นธรรมชาติและคุมอารมณ์ได้ ด้วยแท็กสั่งอารมณ์ (Audio Tags) และโหมดบทสนทนา (Dialogue Mode) ของ eleven_v3
บอกความต่างและใช้งานการก๊อปปี้เสียงแบบเร็ว (Instant Voice Cloning / IVC) กับแบบมืออาชีพ (Professional Voice Cloning / PVC) ได้ถูกต้อง โดยต้องขออนุญาตเจ้าของเสียงก่อนและอยู่ในกรอบกฎหมาย
ออกแบบเสียงใหม่ที่ไม่มีจริงขึ้นมาจากคำบรรยาย (Voice Design) และเข้าใจว่าคลังเสียงกลาง (Voice Library) กับระบบจ่ายส่วนแบ่งให้เจ้าของเสียง (Voice Actor Payouts) ทำงานยังไง
พากย์วิดีโอข้ามภาษาด้วย Dubbing / Dubbing Studio และรู้ข้อจำกัด (ตอนนี้กำลังปิดปรับปรุงอยู่ / maintenance mode) รวมถึงต้นทุนเครดิตที่ค่อนข้างสูง
ทำเสียงประกอบ (SFX), แต่งเพลง (Eleven Music), และตัดต่องานยาว ๆ ใน Studio 3.0 ได้
สร้างและคำนวณต้นทุนผู้ช่วยเสียง (ElevenAgents) แล้วเรียกใช้งานผ่าน API/SDK พร้อมเข้าใจกรอบจริยธรรม การขออนุญาต การป้องกันเสียงปลอม (deepfake) และสิทธิ์การเอาไปหาเงินตามระดับแพ็กเกจ