← กลับหน้าภาพรวม
🎙️ เสียงพูด · VOICE

หัวใจของแพลตฟอร์ม: เสียงพูด AI และการโคลนเสียง

จุดเด่นที่สุดของ ElevenLabs คือเสียงพูดที่ฟังเป็นธรรมชาติ พูดได้หลายภาษา แถมยังคุมอารมณ์เสียงได้ด้วย หน้านี้เรารวมความสามารถหลัก ๆ ไว้ครบ ทั้งการแปลงข้อความเป็นเสียงพูด (Text to Speech), การออกแบบเสียงใหม่ (Voice Design) และการก๊อปปี้เสียง (โคลนเสียง) แบบสองระดับคือ IVC กับ PVC ที่อยากย้ำไว้ก่อนเลยคือ นี่เป็นเครื่องมือ 'สร้างและแปลงเสียง' ไม่ใช่ผู้ช่วยที่เอาไว้คุยโต้ตอบด้วยนะ

🛠 Text to Speech & Voice Cloning

แปลงข้อความเป็นเสียงพูด และการเลือกโมเดล

การแปลงข้อความเป็นเสียงพูด (Text to Speech) มีโมเดลหลักให้เลือกอยู่ 3 ตัว เลือกตามงานที่จะทำได้เลย ตัวแรก eleven_v3 เป็นรุ่นเรือธงที่ใส่อารมณ์ได้ดีที่สุด (expressive) พูดได้กว่า 70 ภาษา มีแท็กกำกับเสียง (Audio Tags) และโหมดบทสนทนา (Dialogue Mode) รับข้อความได้ราว 5,000 ตัวอักษรต่อครั้ง แต่ไม่ได้ทำงานแบบทันที (real-time) ตัวที่สอง eleven_multilingual_v2 เหมาะกับงานบรรยายหรืออ่านหนังสือเสียง (narration/audiobook) ที่ต้องการคุณภาพสูง รองรับ 29 ภาษา รับได้ราว 10,000 ตัวอักษร ส่วนตัวที่สาม eleven_flash_v2_5 เร็วที่สุด (ราว 75 มิลลิวินาที) รองรับ 32 ภาษา รับได้ถึง 40,000 ตัวอักษร เหมาะกับงานที่ต้องตอบทันทีและงานจำนวนมาก (bulk) อีกอย่างที่ควรรู้ รุ่น Turbo เลิกใช้แล้ว (deprecated) ให้ใช้ Flash แทนได้เลย

ตัวอย่าง PROMPT
บท eleven_v3: '[warmly] ยินดีต้อนรับสู่บทเรียนแรกของเรา [pauses] วันนี้เราจะเริ่มกันแบบง่าย ๆ ค่อย ๆ ไปด้วยกันนะคะ'

Voice Design: สร้างเสียงใหม่ขึ้นมาแค่พิมพ์บรรยาย

การออกแบบเสียง (Voice Design) คือการสร้างเสียงขึ้นมาใหม่ทั้งหมดจากการพิมพ์บรรยายว่าอยากได้เสียงแบบไหน เบื้องหลังใช้โมเดลแปลงข้อความเป็นเสียง (TTV models) อย่าง eleven_multilingual_ttv_v2 และ eleven_ttv_v3 ข้อดีคือใช้ได้ทุกแพ็กเกจ รวมถึงแบบฟรี (Free) ด้วย เหมาะมากกับงานที่อยากได้เสียงตัวละครโดยไม่ต้องไปก๊อปปี้เสียงคนจริง เลยไม่ต้องกังวลเรื่องขออนุญาตเจ้าของเสียง

ตัวอย่าง PROMPT
คำบรรยาย Voice Design: 'หญิงสาววัย 25 น้ำเสียงสดใสร่าเริง พูดเร็วนิดหน่อย สำเนียงกรุงเทพชัดเจน เหมาะเป็นพิธีกรรายการวาไรตี้'

IVC กับ PVC ต่างกันยังไง เลือกให้ถูกงานและไม่ผิดกฎ

การก๊อปปี้เสียงมีสองแบบ แบบแรกคือ IVC (Instant Voice Cloning) หรือการโคลนเสียงแบบเร็ว ใช้ตัวอย่างเสียงสั้น ๆ แค่ 1–5 นาที ทำได้ไว แต่ความเหมือนก็ไม่ค่อยเป๊ะเท่าไหร่ ใช้ได้ตั้งแต่แพ็กเกจ Starter ขึ้นไป ถ้าจะเอาเสียงคนอื่นมาโคลนต้องได้รับอนุญาตจากเจ้าของเสียงก่อน แต่ด่านขออนุญาต (consent gate) ตรงนี้เป็นแค่การติ๊กช่องยืนยันเอง (self-attestation) เฉย ๆ ส่วนแบบที่สองคือ PVC (Professional Voice Cloning) หรือการโคลนเสียงระดับมืออาชีพ อันนี้ต้องมีเสียงคุณภาพดี ไม่มีเสียงรบกวน อย่างน้อย 30 นาทีขึ้นไป ได้ผลลัพธ์เหมือนจนแทบแยกไม่ออกว่าตัวจริงหรือของปลอม ใช้ได้ตั้งแต่แพ็กเกจ Creator ขึ้นไป และมีขั้นตอนยืนยันตัวตนด้วยเสียง (voice CAPTCHA) คือให้อ่านข้อความที่ระบบสุ่มมาภายในราว 10 วินาที เพื่อเทียบว่าเป็นเสียงเดียวกับตัวอย่างจริง ๆ กฎเหล็กของ PVC คือทำได้เฉพาะเสียงของตัวเองเท่านั้น ต่อให้มีหนังสือยินยอมจากคนอื่นมาก็ทำไม่ได้

ตัวอย่าง PROMPT
ขั้นตอน PVC: อัดเสียงตัวเอง 35 นาทีในห้องเงียบ อ่านเนื้อหาหลากหลายโทน แล้วทำ voice CAPTCHA ด้วยการอ่านข้อความที่ระบบสุ่มภายใน 10 วินาที
← กลับหน้าภาพรวมหลักสูตร ElevenLabs