أخبار تقنية

جيميناي يضيف استنساخ الأصوات ويقدم أداءً صوتيًا أكثر واقعية

Published

on

أضافت جوجل إلى جيميناي قدرات جديدة لتحويل النصوص إلى كلام، تمنح النماذج قدرة أكبر على التحكم في نبرة الصوت واللهجة والإيقاع والمشاعر، إلى جانب محاكاة الهمس والضحك والتنهدات والتوقفات أثناء الحديث.

وتأتي التحديثات ضمن توسع عائلة Gemini 3.8، مع إطلاق نموذجي Gemini 3.8 Flash TTS وFlash-Lite TTS المخصصين لإنشاء الأصوات من النصوص.

جيميناي يدعم استنساخ الأصوات بأكثر من 100 لغة

تتيح تقنية الصوت الجديدة إنشاء صوت مخصص اعتمادًا على وصف مكتوب باللغة الطبيعية، مع دعم أكثر من 100 لغة ولهجة، بينما توفر جوجل أكثر من 2000 صوت جاهز للاستخدام.

كما يستطيع النظام استنساخ صوت معين من خلال عينة صوتية مدتها 30 ثانية، بشرط الحصول على موافقة صاحب الصوت.

ولا تقتصر المزايا على قراءة النصوص، إذ يمكن للمستخدم تحديد طريقة إلقاء كل جملة، بما يشمل سرعة الكلام والنبرة واللهجة وحتى الضحك والهمس والتنهد.

وتستطيع النماذج كذلك إنشاء حوارات بين شخصيتين من نص واحد، مع الحفاظ على اتساق أصوات الشخصيات خلال تسجيلات طويلة.

استخدامات متعددة للأصوات الجديدة

تفتح هذه التقنية المجال أمام استخدامات متنوعة، مثل إنتاج البودكاست والكتب الصوتية والدبلجة والمحتوى المرئي والوكلاء الصوتيين، مع تقديم أداء أقرب إلى الصوت البشري التقليدي.

وأظهرت اختبارات جوجل نتائج قوية للنماذج الجديدة، إذ تصدر Gemini 3.8 Flash TTS اختبار Voice Design Benchmark من Hume AI، وسجل 60.8 نقطة في فئة اللهجات.

وفي المقابل، حققت ElevenLabs نتائج أعلى في بعض اختبارات جودة الصوت الفردي والتنوع الصوتي.

جيميناي يضيف استنساخ الأصوات ويقدم أداءً صوتيًا أكثر واقعية

وصول التقنية إلى تطبيقات جوجل

بدأت جوجل دمج Flash TTS داخل Gemini Notebook، بينما وصل Flash-Lite TTS إلى Google Vids، مع إتاحة النموذجين للمطورين عبر Gemini API وAI Studio.

وتعمل الشركة كذلك على توسيع استخدام تقنيات الصوت داخل خدماتها المختلفة، بالتزامن مع طرح تحديثات جديدة لأدوات إنشاء الفيديو.

قيود لحماية أصحاب الأصوات

وضعت جوجل مجموعة من الإجراءات للحد من إساءة استخدام استنساخ الأصوات، أبرزها اشتراط امتلاك المستخدم إذنًا من صاحب الصوت قبل استنساخه.

كما تستخدم الشركة تقنية SynthID للعلامات المائية وبيانات اعتماد C2PA للمساعدة في التعرف على المحتوى الناتج عن الذكاء الاصطناعي.

وتحظر جوجل استنساخ الأصوات عبر AI Studio في بعض المناطق، منها المملكة المتحدة والمنطقة الاقتصادية الأوروبية والهند وتكساس وإلينوي.

Leave a Reply

لن يتم نشر عنوان بريدك الإلكتروني. الحقول الإلزامية مشار إليها بـ *

Trending

Exit mobile version