أخبار تقنية

استخدام محتوى الناشرين في تدريب الذكاء الاصطناعي.. وثائق تكشف خلافًا حادًا بين OpenAI ومايكروسوفت

Published

on

كشفت وثائق قضائية جديدة عن تفاصيل مثيرة للجدل بشأن استخدام محتوى الناشرين في تدريب الذكاء الاصطناعي، وذلك ضمن الدعوى التي رفعتها صحيفة نيويورك تايمز ضد OpenAI ومايكروسوفت. وتضمنت الملفات تصريحات داخلية لمسؤولين في الشركتين حول جمع المحتوى واستخدامه في تدريب النماذج ومنتجات الذكاء الاصطناعي.

وتجدر الإشارة إلى أن جزءًا من المعلومات الجديدة ظهر في مذكرة قدمتها نيويورك تايمز للمحكمة، بينما لا تزال بعض الوثائق الأصلية سرية، كما أن بعض الاقتباسات ظهرت خارج سياقها الكامل.

استخدام محتوى الناشرين في تدريب الذكاء الاصطناعي يثير سؤال حقوق النشر

تتمحور القضية حول مدى قانونية استخدام المواد المحمية بحقوق الطبع والنشر في تدريب نماذج الذكاء الاصطناعي دون الحصول على تراخيص من أصحاب الحقوق.

وتستند شركات الذكاء الاصطناعي في بعض القضايا إلى مبدأ الاستخدام العادل، الذي يسمح باستخدام مواد محمية بحقوق النشر في حالات محددة. لكن أصحاب المحتوى يرون أن استخدام أعمالهم في تدريب النماذج ثم تقديم إجابات تنافس مواقعهم قد يؤثر في سوق المحتوى الأصلي.

وتزيد هذه النقطة أهمية مع توسع استخدام محتوى الناشرين في تدريب الذكاء الاصطناعي، خصوصًا عندما تقدم النماذج المعلومات للمستخدم مباشرة بدل توجيهه إلى المصدر الأصلي.

Copilot يخفض الزيارات إلى موقع نيويورك تايمز

أظهرت بيانات داخلية لمايكروسوفت، وفقًا للملفات القضائية، انخفاض معدلات النقر للوصول إلى نطاق نيويورك تايمز بنسبة وصلت إلى 93% عند استخدام Copilot مقارنة ببحث Bing التقليدي.

ووصف عرض داخلي هذا التراجع بأنه مشكلة قد تؤثر في اقتصاد الويب، لأن منتجات الذكاء الاصطناعي تعتمد على المحتوى الذي تنتجه المواقع ثم قد تقلل في الوقت نفسه من الزيارات التي تصل إلى تلك المواقع.

وقال ساتيا ناديلا، وفق ما ورد في إفادته القضائية، إن المحتوى الموجود خلف أنظمة حجب مدفوعة يحتاج إلى ترخيص إذا أراد طرف استخدامه لتوفير المعلومات للنماذج أو تدريبها.

استخدام محتوى الناشرين في تدريب الذكاء الاصطناعي.. وثائق تكشف خلافًا حادًا بين OpenAI ومايكروسوفت

وثائق تكشف حجم المحتوى المستخدم في التدريب

تتضمن الملفات أرقامًا حول حجم المواد المنسوبة إلى ناشرين والتي ظهرت في مجموعات بيانات التدريب.

وبحسب المذكرة القضائية، احتوت مجموعات بيانات مستخدمة في مراحل تدريب وسيطة على أكثر من 91 ألف نسخة من أعمال نشرتها نيويورك تايمز وDaily News وCenter for Investigative Reporting.

كما تضمنت إحدى مجموعات البيانات المستمدة من Common Crawl أكثر من مليوني وثيقة مأخوذة من موقع nytimes.com، وفق ما ورد في الوثائق.

وتكشف هذه الأرقام جانبًا من حجم استخدام محتوى الناشرين في تدريب الذكاء الاصطناعي، وتوضح سبب تحول حقوق استخدام المواد الصحفية إلى محور رئيسي في النزاعات بين شركات التكنولوجيا وقطاع الإعلام.

اتهامات بجمع محتوى من الإنترنت وتجاوز الحجب

تتضمن المذكرات القضائية اتهامات بأن OpenAI ومايكروسوفت استخدمتا مصادر متعددة لجمع المحتوى، بينها فهرس Bing ومجموعات بيانات تعتمد على الزحف إلى الويب.

كما تزعم المذكرة أن OpenAI طورت أساليب للوصول إلى محتوى موجود خلف أنظمة حجب مدفوعة، وأن موظفين داخل الشركة ناقشوا طرقًا لتجاوز هذه القيود.

وتشير الوثائق أيضًا إلى استخدام مجموعات بيانات مثل WebText وWebText2، إلى جانب ملايين المقالات الموجودة في Common Crawl.

لكن هذه التفاصيل تمثل ادعاءات واردة في ملف قضائي قدمته نيويورك تايمز، ولا تعني وحدها أن المحكمة حسمت صحة جميع الوقائع أو المسؤوليات القانونية التي تتضمنها.

هل يحل الذكاء الاصطناعي محل المواقع الإخبارية؟

تثير القضية سؤالًا أوسع حول العلاقة بين نماذج الذكاء الاصطناعي والناشرين.

فإذا قدم روبوت المحادثة إجابة كاملة اعتمادًا على معلومات موجودة في مقال صحفي، فقد يحصل المستخدم على المعلومة دون زيارة الموقع الذي نشرها. ويزيد هذا التأثير مع تطور محركات الإجابات وقدرتها على تلخيص كميات كبيرة من المحتوى.

ووفق الوثائق، أقر مسؤولون في الشركتين بأن منتجات الذكاء الاصطناعي يمكن أن تقلل الحاجة إلى زيارة المواقع الأصلية للحصول على المعلومات.

وهنا تظهر المفارقة الأساسية: تحتاج نماذج الذكاء الاصطناعي إلى كميات ضخمة من البيانات، بينما يعتمد الناشرون على الزيارات والإعلانات والاشتراكات لتمويل إنتاج المحتوى الذي يشكل جزءًا من هذه البيانات.

القضية ما زالت أمام القضاء

تأتي هذه الوثائق ضمن دعوى مستمرة، ولذلك لا تمثل التصريحات والاتهامات الواردة فيها حكمًا قضائيًا نهائيًا.

ويظل السؤال القانوني الأساسي مرتبطًا بما إذا كان استخدام محتوى الناشرين في تدريب الذكاء الاصطناعي يدخل ضمن الاستخدام العادل، أم يحتاج إلى تراخيص واتفاقيات مع أصحاب الحقوق.

ومع استمرار القضايا المشابهة، قد تحدد الأحكام المقبلة قواعد جديدة للعلاقة بين شركات الذكاء الاصطناعي ووسائل الإعلام، خصوصًا مع تحول نماذج الذكاء الاصطناعي من أدوات مساعدة إلى منافس مباشر لبعض خدمات البحث والمحتوى.

Leave a Reply

لن يتم نشر عنوان بريدك الإلكتروني. الحقول الإلزامية مشار إليها بـ *

Trending

Exit mobile version