الذكاء الاصطناعي

OpenAI تطلق جيلًا جديدًا من النماذج الصوتية للترجمة والتفاعل الفوري

Published

on

أعلنت OpenAI عن مجموعة جديدة من النماذج الصوتية المتقدمة المصممة لتقديم تفاعلات صوتية لحظية أكثر طبيعية وذكاءً، في خطوة تستهدف المطورين العاملين على تطبيقات المساعدات الصوتية، والترجمة الفورية، وتحويل الكلام إلى نصوص مباشرة عبر واجهات API.

OpenAI تطلق جيلًا جديدًا من النماذج الصوتية للترجمة والتفاعل الفوري

تشمل المجموعة الجديدة نماذج GPT-Realtime-2 وGPT-Realtime-Translate وGPT-Realtime-Whisper، وتؤكد الشركة أنها تقدم استجابة أسرع، وفهمًا صوتيًا أكثر دقة، مع تحسينات كبيرة في الترجمة الحية ومعالجة المحادثات الصوتية المعقدة.

OpenAI تطلق جيلًا جديدًا من النماذج الصوتية للترجمة والتفاعل الفوري

GPT-Realtime-2 لتجربة محادثات أكثر طبيعية

يُعد GPT-Realtime-2 النموذج الأبرز ضمن الإطلاق الجديد، إذ جرى تطويره خصيصًا لإدارة المحادثات الصوتية المباشرة بطريقة أقرب للتفاعل البشري الطبيعي.

ويستطيع النموذج فهم الطلبات المعقدة، والتعامل مع التصحيحات أثناء الحديث، واستدعاء الأدوات المناسبة لتنفيذ المهام، مع الحفاظ على استمرارية الحوار دون انقطاع.

كما أضافت OpenAI مزايا جديدة، من بينها تقديم عبارات تمهيدية قصيرة مثل “دعني أتحقق من ذلك” أثناء تنفيذ المهام، بالإضافة إلى دعم تشغيل عدة أدوات بالتوازي مع إبقاء المستخدم على اطلاع بما يحدث في الخلفية.

تحسينات في معالجة الأخطاء والسياق

عملت الشركة أيضًا على تطوير طريقة تعامل النموذج مع الأخطاء، إذ أصبح قادرًا على الاستجابة بشكل أكثر سلاسة عند حدوث مشكلة بدلًا من التوقف المفاجئ أو الصمت.

وشهدت نافذة السياق توسعًا كبيرًا، إذ ارتفعت من 32 ألف رمز إلى 128 ألف رمز، مما يسمح للنموذج بفهم محادثات أطول والاحتفاظ بسياق أكبر أثناء التفاعل.

فهم أفضل للمصطلحات المتخصصة

بحسب OpenAI، يوفر النموذج الجديد دقة أعلى في فهم المصطلحات العلمية والطبية والأسماء المتخصصة، إلى جانب إمكانية التحكم في نبرة الحديث بما يتناسب مع طبيعة الاستخدام أو الموقف.

كما تمنح الشركة المطورين القدرة على اختيار مستويات مختلفة من التفكير والاستدلال وفق احتياجات التطبيق.

ترجمة فورية تدعم عشرات اللغات

أما نموذج GPT-Realtime-Translate، فقد صُمم خصيصًا لتجارب الترجمة الصوتية متعددة اللغات بزمن استجابة منخفض.

ويدعم النموذج ترجمة أكثر من 70 لغة إدخال إلى 13 لغة إخراج، مع الحفاظ على المعنى وسرعة التحدث، حتى في حالات اللهجات المحلية أو المصطلحات المتخصصة.

تحويل الكلام إلى نصوص لحظيًا

ويأتي GPT-Realtime-Whisper كحل مخصص لتحويل الكلام إلى نصوص مباشرة أثناء التحدث، مع تأخير منخفض جدًا في الاستجابة.

وترى OpenAI أن هذا النموذج سيكون مناسبًا لاستخدامات متعددة مثل تدوين الاجتماعات، والمحاضرات الدراسية، وخدمات الترجمة الفورية، والتطبيقات المعتمدة على النسخ اللحظي للصوت.

الأسعار وإتاحة النماذج للمطورين

أتاحت الشركة النماذج الثلاثة عبر Realtime API، مع تسعير يبدأ من 32 دولارًا لكل مليون رمز إدخال صوتي و64 دولارًا لكل مليون رمز إخراج صوتي لنموذج GPT-Realtime-2.

في المقابل، تبلغ تكلفة GPT-Realtime-Translate نحو 0.034 دولار للدقيقة، بينما تصل تكلفة GPT-Realtime-Whisper إلى حوالي 0.017 دولار للدقيقة.

Trending

Exit mobile version