أخبار تقنية

ترجمة لغة الإشارة إلى نص تصل إلى بيكسل 11 بتقنية ذكاء اصطناعي جديدة

Published

on

تستعد هواتف بيكسل 11 لتقديم ميزة جديدة تعتمد على ترجمة لغة الإشارة إلى نص، في خطوة قد تغير طريقة تفاعل الصم وضعاف السمع مع الهواتف الذكية. وكشفت شركة DeepMind التابعة لغوغل عن نموذج ذكاء اصطناعي جديد يحمل اسم SL2T، يستطيع تحويل لغة الإشارة إلى نص مكتوب بصورة مباشرة.

ودمجت غوغل التقنية الجديدة داخل تطبيقي Gboard وLive Transcribe، ما يسمح للمستخدمين باستخدام لغة الإشارة في مواقف كانوا يعتمدون فيها سابقًا على الكتابة. ويمكن لهذه التقنية فتح المجال أمام استخدام الإشارات للبحث على الإنترنت، وكتابة الرسائل، والتفاعل مع مساعد الذكاء الاصطناعي Gemini بطريقة أكثر سهولة وطبيعية.

ترجمة لغة الإشارة إلى نص بعد تدريب يتجاوز 100 ألف ساعة

توضح DeepMind أن الأشخاص الصم يختلفون في مستوى إتقانهم للغة الإشارة والكلام والقراءة والكتابة، ولذلك تحتاج التقنيات المساعدة إلى توفير أكثر من وسيلة للتواصل بما يتناسب مع احتياجات المستخدمين المختلفة.

ودرّبت الشركة نموذج SL2T باستخدام أكثر من 100 ألف ساعة من بيانات لغة الإشارة متعددة اللغات، وشكلت بيانات لغة الإشارة الأميركية ASL نحو ربع إجمالي بيانات التدريب.

وعند إطلاق التقنية، سيقتصر النموذج على تحويل لغة الإشارة الأميركية إلى اللغة الإنجليزية، مع وجود خطط لتوسيع الدعم ليشمل لغات وأجهزة أخرى مستقبلًا.

كيف يعمل نموذج SL2T دون إرسال الفيديو الخام؟

تعتمد التقنية على أسلوب مختلف للتعامل مع بيانات المستخدم، بهدف تقليل مخاوف الخصوصية.

فبدلًا من إرسال تسجيل الفيديو الخام إلى خوادم غوغل لتحليله، يتولى نموذج آخر يعمل على الجهاز تحويل الصورة إلى بيانات تمثل هيكلًا هندسيًا مكونًا من إحداثيات. وبعد ذلك، تُرسل هذه البيانات إلى خوادم غوغل، حيث يعمل نموذج SL2T على تحويلها إلى نص.

وترى الشركة أن هذا الأسلوب يوفر مستوى إضافيًا من الخصوصية، لأنه لا يتطلب إرسال تسجيل الفيديو نفسه إلى الخوادم.

ويختلف SL2T أيضًا عن بعض أنظمة ترجمة لغة الإشارة السابقة، إذ يحول الإحداثيات مباشرة إلى نص بدلًا من المرور أولًا بمرحلة إنشاء ما يعرف باسم Glosses، وهي تمثيلات وسيطة للإشارات.

وترى DeepMind أن هذه المرحلة الوسيطة قد تواجه صعوبة في تمثيل بعض الخصائص المعقدة للغات الإشارة، مثل الحركات غير اليدوية والعلاقات المكانية بين الإشارات.

أما الترجمة المباشرة من بيانات الإحداثيات، فتتجاوز الاعتماد على المفردات الوسيطة، وقد تسمح بتحسين جودة النتائج مع زيادة حجم بيانات التدريب.

ترجمة لغة الإشارة إلى نص تصل إلى بيكسل 11 بتقنية ذكاء اصطناعي جديدة

غوغل تخطط لتوسيع دعم لغات الإشارة

رغم أن دعم لغة الإشارة الأميركية يمثل البداية الأولى للتقنية، تدرك DeepMind أن توسيع نطاقها عالميًا يمثل تحديًا كبيرًا.

ويستخدم أكثر من 70 مليون شخص أصم أو ضعيف السمع حول العالم نحو 200 لغة إشارة مختلفة، ما يجعل تطوير نموذج قادر على التعامل مع هذا التنوع مهمة معقدة.

لكن غوغل ترى أن تدريب SL2T على بيانات متعددة اللغات منحه قدرة على التعرف على بعض الهياكل المشتركة بين لغات الإشارة المختلفة، وهو ما قد يساعد في تطوير إصدارات مستقبلية تدعم لغات إضافية.

ومن شأن نجاح هذه التقنية في ترجمة لغة الإشارة إلى نص أن يفتح المجال أمام تجربة أكثر مرونة على الهواتف الذكية، سواء في البحث أو المراسلة أو التفاعل مع أدوات الذكاء الاصطناعي، مع إمكانية وصولها مستقبلًا إلى أجهزة ولغات إشارة جديدة.

Leave a Reply

لن يتم نشر عنوان بريدك الإلكتروني. الحقول الإلزامية مشار إليها بـ *

Trending

Exit mobile version