← กลับหน้าภาพรวม
⚖️ จริยธรรม & ลิขสิทธิ์ · ETHICS

การขออนุญาตก่อนโคลนเสียง การกันเสียงปลอม (deepfake) และสิทธิ์เอาไปใช้หากิน

ยิ่งใช้เครื่องมือเสียง AI แบบมืออาชีพ ก็ยิ่งต้องใช้ให้มีความรับผิดชอบ หน้านี้เราจะเล่าให้ฟังครบทั้งเรื่องจริยธรรม กฎหมาย และความปลอดภัยที่ควรรู้ ตั้งแต่การขออนุญาตก่อนก๊อปปี้เสียงใครสักคน (โคลนเสียง) วิธีที่ระบบกันการทำเสียงปลอมแบบเนียน ๆ (deepfake) ข้อจำกัดต่าง ๆ ไปจนถึงว่าแต่ละแพ็กเกจเอาเสียงไปทำเงินได้แค่ไหน และเราจะพูดตรง ๆ ถึงจุดที่คนวิจารณ์ว่ายังไม่ดีพอด้วย

🛠 จริยธรรม ความยินยอม และการใช้เชิงพาณิชย์

สองแบบของการขออนุญาตโคลนเสียง: IVC กับ PVC

การโคลนเสียงมีสองแบบ แบบแรกคือ IVC (การโคลนเสียงแบบทันใจ) วิธีนี้ระบบจะแค่ให้เราติ๊กช่องยืนยันเอง (consent checkbox) ว่า 'ฉันมีสิทธิ์และได้รับอนุญาตให้โคลนเสียงนี้แล้ว' พูดง่าย ๆ คือระบบเชื่อใจเรา แล้วให้เรารับผิดชอบทางกฎหมายเอง ถ้าจะโคลนเสียงคนอื่น ก็ต้องขออนุญาตเจ้าของเสียงมาก่อนเท่านั้น ส่วนอีกแบบคือ PVC (การโคลนเสียงระดับมืออาชีพ) อันนี้เข้มกว่า เพราะต้องพิสูจน์ตัวตนด้วยการอ่านออกเสียงตามข้อความที่ระบบกำหนดให้ภายในเวลาประมาณ 10 วินาที (voice CAPTCHA) เพื่อเช็กว่าเป็นเสียงจริงของคนคนนั้น และมีกฎเหล็กว่า PVC ทำได้เฉพาะเสียงของตัวเองเท่านั้น ต่อให้มีหนังสือยินยอมจากคนอื่นมาก็ทำ PVC ให้คนอื่นไม่ได้ (ต่างจาก IVC ที่ทำเสียงคนอื่นได้ถ้าได้รับอนุญาต) ล่าสุดนโยบายความเป็นส่วนตัว (อัปเดตเมื่อ ธ.ค. 2025) ยังเปิดช่องให้ระบบขอไฟล์ยืนยันเพิ่มได้ด้วย

ตัวอย่าง PROMPT
หลักปฏิบัติ: ก่อนโคลนเสียงคนอื่นด้วย IVC ต้องมีความยินยอมจากเจ้าของเสียงจริง; หากต้องการคุณภาพ PVC ต้องเป็นเสียงของตัวเองเท่านั้น

การกันเสียงปลอม (deepfake) และการตรวจสอบที่มา

ระบบมีการป้องกันวางไว้หลายชั้น อย่างแรกคือ No-Go Voices ที่บล็อกไม่ให้โคลนเสียงนักการเมืองคนดัง (เช่นคนที่เกี่ยวข้องกับการเลือกตั้งประธานาธิบดีสหรัฐฯ หรืออังกฤษ) เพื่อกันไม่ให้เอาไปปล่อยข่าวปลอมช่วงเลือกตั้ง (election disinformation) อย่างที่สองคือเครื่องมือตรวจเสียงสาธารณะ (AI Speech/Audio Classifier) ที่ใครก็ใช้เช็กได้ว่าคลิปเสียงนั้นสร้างมาจาก ElevenLabs หรือเปล่า อย่างที่สามคือรองรับมาตรฐานการฝังข้อมูลที่มาของไฟล์ (C2PA content credentials) และยังมีตัวเลือกฝังลายน้ำในเสียง (watermarking ซึ่งจะไปมีผลกับเครดิตงานพากย์) รวมถึงมีระบบคัดกรองเนื้อหา (moderation) ที่ทำงานซ้อนกันหลายชั้นเพื่อกันพลาด (defense-in-depth)

ตัวอย่าง PROMPT
หลักปฏิบัติองค์กร: ตั้งนโยบายให้เอาต์พุตแนบ C2PA content credentials และใช้ AI Speech Classifier ตรวจคลิปที่สงสัยว่าเป็นเสียงสังเคราะห์

เอาเสียงไปทำเงินได้แค่ไหน และเงินที่จ่ายคืนเจ้าของเสียง (Voice Actor Payouts)

ถ้าใช้แพ็กเกจฟรี (Free) จะเอาไปหาเงินไม่ได้เลย ต้องให้เครดิตว่าใช้ ElevenLabs (attribution) และห้ามเอาเสียงที่ได้ไปทำรายได้ สิทธิ์เอาไปใช้หากินจะเริ่มมีตั้งแต่แพ็กเกจ Starter ขึ้นไป โดยเสียงที่เราสร้างก็ถือเป็นของเราตามสิทธิ์ของแพ็กเกจที่ใช้อยู่ ส่วนเสียงที่หยิบมาจากคลังเสียงกลาง (Voice Library) จะอยู่ภายใต้ข้อตกลงเพิ่มเติมของคลังเสียง (Voice Library Addendum หรือ VLA) และมีระบบจ่ายเงินคืนให้เจ้าของเสียงตามยอดการใช้งานจริง (Voice Actor Payouts) โดยเรตเริ่มต้นอยู่ที่ประมาณ $0.03 ต่อทุก 1,000 ตัวอักษร นับเฉพาะเวลาที่คนแบบจ่ายเงินเอาเสียงไปใช้ ทั้งนี้เจ้าของเสียงต้องผูกบัญชีรับเงิน (Stripe Connect) และอยู่แพ็กเกจ Starter ขึ้นไป ระบบจะโอนให้เมื่อยอดสะสมเกินราว ๆ $10 และที่แชร์ลงคลังกลางให้คนอื่นใช้ได้ก็มีเฉพาะเสียงที่โคลนแบบมืออาชีพ (Professional Voice Clone) เท่านั้น

ตัวอย่าง PROMPT
เช็กลิสต์ก่อนเผยแพร่: (1) อยู่แพ็กเกจ Starter+ หรือไม่ (Free ห้ามเชิงพาณิชย์) (2) เสียงที่ใช้จาก Library อยู่ใต้ VLA และมี payouts ให้เจ้าของ (3) ถ้าโคลนเสียง มีบันทึกความยินยอมครบ

ข้อวิจารณ์และจุดที่ยังไม่สมบูรณ์แบบ (พูดกันตรง ๆ)

ต้องยอมรับกันตรง ๆ ว่านักวิจัยด้านความปลอดภัยและสื่อหลายเจ้า (เช่น Biometric Update และ BankInfoSecurity เมื่อต้นปี 2025) แย้งว่าการป้องกันการโคลนเสียงยังมีช่องให้เลี่ยงได้อยู่ อย่างการแค่ติ๊กช่องยืนยันเองของ IVC ก็ถือว่าหละหลวมไปหน่อย ทำให้ความเสี่ยงที่จะโดนปลอมเสียง (เช่นมุกหลอกโอนเงินแบบ 'สวัสดีแม่ นี่ลูกเอง') ยังมีอยู่จริง เพราะสุดท้ายแล้วในชั้น IVC การจะเคารพสิทธิ์ในเสียงและขออนุญาตหรือเปล่า มันแทบทั้งหมดขึ้นอยู่กับความซื่อสัตย์ของคนใช้เอง ดังนั้นถ้าจะใช้แบบมืออาชีพ ก็ต้องมีวินัยขออนุญาตเจ้าของเสียงเองทุกครั้ง อย่าไปฝากความหวังไว้กับระบบของแพลตฟอร์มอย่างเดียว

ตัวอย่าง PROMPT
หลักปฏิบัติ: อย่าพึ่งเพียง checkbox ของแพลตฟอร์ม — เก็บหลักฐานความยินยอมเป็นลายลักษณ์อักษรของทุกเสียงที่โคลน และหลีกเลี่ยงการใช้เสียงโคลนในบริบทที่อาจถูกเข้าใจผิดว่าเป็นบุคคลจริง
← กลับหน้าภาพรวมหลักสูตร ElevenLabs