أضافت جوجل إلى جيميناي قدرات جديدة لتحويل النصوص إلى كلام، تمنح النماذج قدرة أكبر على التحكم في نبرة الصوت واللهجة والإيقاع والمشاعر، إلى جانب محاكاة الهمس والضحك والتنهدات والتوقفات أثناء الحديث.
وتأتي التحديثات ضمن توسع عائلة Gemini 3.8، مع إطلاق نموذجي Gemini 3.8 Flash TTS وFlash-Lite TTS المخصصين لإنشاء الأصوات من النصوص.
تتيح تقنية الصوت الجديدة إنشاء صوت مخصص اعتمادًا على وصف مكتوب باللغة الطبيعية، مع دعم أكثر من 100 لغة ولهجة، بينما توفر جوجل أكثر من 2000 صوت جاهز للاستخدام.
كما يستطيع النظام استنساخ صوت معين من خلال عينة صوتية مدتها 30 ثانية، بشرط الحصول على موافقة صاحب الصوت.
ولا تقتصر المزايا على قراءة النصوص، إذ يمكن للمستخدم تحديد طريقة إلقاء كل جملة، بما يشمل سرعة الكلام والنبرة واللهجة وحتى الضحك والهمس والتنهد.
وتستطيع النماذج كذلك إنشاء حوارات بين شخصيتين من نص واحد، مع الحفاظ على اتساق أصوات الشخصيات خلال تسجيلات طويلة.
استخدامات متعددة للأصوات الجديدة
تفتح هذه التقنية المجال أمام استخدامات متنوعة، مثل إنتاج البودكاست والكتب الصوتية والدبلجة والمحتوى المرئي والوكلاء الصوتيين، مع تقديم أداء أقرب إلى الصوت البشري التقليدي.