طورت شركة غوغل قدرات نماذج الذكاء الاصطناعي التابعة لها في […]
طورت شركة غوغل قدرات نماذج الذكاء الاصطناعي التابعة لها في مجال تحويل النص إلى كلام، عبر إطلاق Gemini 3.8 Flash TTS وFlash-Lite TTS، وهما نموذجان يتيحان إنتاج أداء صوتي أكثر واقعية مع التحكم في النبرة واللهجة والإيقاع والمشاعر وحتى التوقفات والتنهدات.
وتأتي هذه الخطوة ضمن توسع عائلة Gemini 3.8، التي بدأت بإطلاق نموذج Gemini 3.8 Flash، قبل أن تضيف غوغل نماذج Live وLive Extended Thinking، وصولاً إلى نماذج تحويل النص إلى كلام الجديدة.
ومن أبرز إمكانات Gemini 3.8 Flash TTS قدرته على تصميم صوت أصلي انطلاقاً من وصف مكتوب باللغة الطبيعية، مع دعم أكثر من 100 لغة ولهجة. كما توفر غوغل أكثر من 2000 صوت جاهز للاستخدام، إلى جانب إمكانية استنساخ صوت اعتماداً على عينة صوتية لا تتجاوز 30 ثانية، شرط الحصول على الإذن اللازم من صاحب الصوت.
ولا تقتصر التقنية على قراءة النصوص، إذ يمكن للمستخدم توجيه النموذج بتعليمات دقيقة لتحديد طريقة إلقاء كل سطر، بما يشمل النبرة وسرعة الكلام واللهجة والهمس والضحك والتنهدات وغيرها من التفاصيل الصوتية، كما يستطيع إنشاء حوارات بين شخصين انطلاقاً من نص واحد مع الحفاظ على ثبات أصوات الشخصيات خلال التسجيلات الطويلة.
وتفتح هذه الإمكانات المجال أمام استخدامات متعددة، من بينها إنتاج البودكاست والكتب الصوتية والدبلجة والمحتوى المرئي والوكلاء الصوتيين، مع منح المطورين وصناع المحتوى قدرة أكبر على التحكم في الأداء الصوتي.
وفي اختبارات جودة الصوت، حقق Gemini 3.8 Flash TTS نتائج متقدمة، إذ تصدر الترتيب العام في اختبار Voice Design Benchmark التابع لشركة Hume AI، وسجل 60.8 نقطة في فئة اللهجات. كما جاء نموذجا Flash وFlash-Lite في المركزين الأول والثاني في مؤشر الجودة العام لدى Hume، بينما أظهرت اختبارات Voice Arena نتائج متقدمة للنموذجين عبر عدد من اللغات.
ومع ذلك، لم تتفوق نماذج غوغل في جميع الفئات، إذ حققت شركة ElevenLabs نتائج أعلى في بعض اختبارات Hume المتعلقة بجودة الصوت الفردي ومدى التنوع والقرب من الأصوات البشرية.
وبدأت غوغل كذلك دمج هذه القدرات في بعض خدماتها، حيث وصل Flash TTS إلى تطبيق Gemini Notebook، بينما أصبح Flash-Lite TTS متاحاً في Google Vids، بالتزامن مع توسيع نطاق إتاحة أحدث مولد الفيديو Omni في الخدمة.
أما المطورون، فيمكنهم استخدام النموذجين عبر Gemini API وAI Studio، مع فرض غوغل قيوداً إضافية على استنساخ الأصوات للحد من مخاطر إساءة الاستخدام.
وتشمل إجراءات الحماية التحقق من امتلاك المستخدم موافقة صاحب الصوت قبل استنساخه، وإضافة تقنية SynthID للعلامات المائية وبيانات اعتماد C2PA للمساعدة في تحديد المحتوى الذي تم توليده بالذكاء الاصطناعي. كما حظرت غوغل ميزة استنساخ الأصوات داخل AI Studio في عدد من المناطق، من بينها المملكة المتحدة والمنطقة الاقتصادية الأوروبية والهند وولايتي تكساس وإلينوي.
وبهذه التطورات، تتجه تقنيات تحويل النص إلى كلام في جيميناي نحو تقديم أداء صوتي يتجاوز القراءة الآلية التقليدية، ليمنح المستخدم تحكماً أدق في طريقة نطق الجمل وتعبير الشخصيات عن المشاعر والإيقاع والنبرة.
(العربية)


















