แปลงข้อความเป็นเสียงพูด และการเลือกโมเดล
การแปลงข้อความเป็นเสียงพูด (Text to Speech) มีโมเดลหลักให้เลือกอยู่ 3 ตัว เลือกตามงานที่จะทำได้เลย ตัวแรก eleven_v3 เป็นรุ่นเรือธงที่ใส่อารมณ์ได้ดีที่สุด (expressive) พูดได้กว่า 70 ภาษา มีแท็กกำกับเสียง (Audio Tags) และโหมดบทสนทนา (Dialogue Mode) รับข้อความได้ราว 5,000 ตัวอักษรต่อครั้ง แต่ไม่ได้ทำงานแบบทันที (real-time) ตัวที่สอง eleven_multilingual_v2 เหมาะกับงานบรรยายหรืออ่านหนังสือเสียง (narration/audiobook) ที่ต้องการคุณภาพสูง รองรับ 29 ภาษา รับได้ราว 10,000 ตัวอักษร ส่วนตัวที่สาม eleven_flash_v2_5 เร็วที่สุด (ราว 75 มิลลิวินาที) รองรับ 32 ภาษา รับได้ถึง 40,000 ตัวอักษร เหมาะกับงานที่ต้องตอบทันทีและงานจำนวนมาก (bulk) อีกอย่างที่ควรรู้ รุ่น Turbo เลิกใช้แล้ว (deprecated) ให้ใช้ Flash แทนได้เลย
Voice Design: สร้างเสียงใหม่ขึ้นมาแค่พิมพ์บรรยาย
การออกแบบเสียง (Voice Design) คือการสร้างเสียงขึ้นมาใหม่ทั้งหมดจากการพิมพ์บรรยายว่าอยากได้เสียงแบบไหน เบื้องหลังใช้โมเดลแปลงข้อความเป็นเสียง (TTV models) อย่าง eleven_multilingual_ttv_v2 และ eleven_ttv_v3 ข้อดีคือใช้ได้ทุกแพ็กเกจ รวมถึงแบบฟรี (Free) ด้วย เหมาะมากกับงานที่อยากได้เสียงตัวละครโดยไม่ต้องไปก๊อปปี้เสียงคนจริง เลยไม่ต้องกังวลเรื่องขออนุญาตเจ้าของเสียง
IVC กับ PVC ต่างกันยังไง เลือกให้ถูกงานและไม่ผิดกฎ
การก๊อปปี้เสียงมีสองแบบ แบบแรกคือ IVC (Instant Voice Cloning) หรือการโคลนเสียงแบบเร็ว ใช้ตัวอย่างเสียงสั้น ๆ แค่ 1–5 นาที ทำได้ไว แต่ความเหมือนก็ไม่ค่อยเป๊ะเท่าไหร่ ใช้ได้ตั้งแต่แพ็กเกจ Starter ขึ้นไป ถ้าจะเอาเสียงคนอื่นมาโคลนต้องได้รับอนุญาตจากเจ้าของเสียงก่อน แต่ด่านขออนุญาต (consent gate) ตรงนี้เป็นแค่การติ๊กช่องยืนยันเอง (self-attestation) เฉย ๆ ส่วนแบบที่สองคือ PVC (Professional Voice Cloning) หรือการโคลนเสียงระดับมืออาชีพ อันนี้ต้องมีเสียงคุณภาพดี ไม่มีเสียงรบกวน อย่างน้อย 30 นาทีขึ้นไป ได้ผลลัพธ์เหมือนจนแทบแยกไม่ออกว่าตัวจริงหรือของปลอม ใช้ได้ตั้งแต่แพ็กเกจ Creator ขึ้นไป และมีขั้นตอนยืนยันตัวตนด้วยเสียง (voice CAPTCHA) คือให้อ่านข้อความที่ระบบสุ่มมาภายในราว 10 วินาที เพื่อเทียบว่าเป็นเสียงเดียวกับตัวอย่างจริง ๆ กฎเหล็กของ PVC คือทำได้เฉพาะเสียงของตัวเองเท่านั้น ต่อให้มีหนังสือยินยอมจากคนอื่นมาก็ทำไม่ได้