تم إعداد هذا التقرير الصحفي المتقدم لتغطية كواليس وتفاصيل شركات الذكاء الاصطناعي تشتري بيانات الشركات الحساسة والمواضيع ذات الصلة بالقطاع التكنولوجي والتنظيمي العالمي.
فهرس المقال:
- سوق متصاعد لبيانات المراسلات المؤسسية
- اقتراب جدار البيانات ونفاد النصوص العامة
- الكتب والدعاوى القضائية وتكاليف إخفاء الهوية
- أسئلة شائعة
سوق متصاعد لبيانات المراسلات المؤسسية
تتجه كبرى شركات تطوير الذكاء الاصطناعي الرائدة، وفي مقدمتها «أوبن أي آي» و«أنثروبيك»، بشكل متزايد نحو شراء وتجميع البيانات الداخلية الحساسة للشركات والمؤسسات الخاصة — بما في ذلك محادثات الموظفين وسجلات البريد الإلكتروني وتسجيلات اجتماعات الفيديو وسجلات تعديل الشفرات البرمجية — وذلك مع اقتراب استنفاد المخزون المتاح من النصوص البشرية عالية الجودة على شبكة الإنترنت المفتوحة، وفقاً لتقرير استقصائي موسع نشرته صحيفة «ذا إنفورميشن» في الثالث عشر من شهر أغسطس بالاستناد إلى إفادات نحو 20 مصدراً من مؤسسي الشركات وخبراء تجارة البيانات.
وتصاعد الطلب على بيانات الاتصالات المؤسسية خلال الأشهر القليلة الماضية مدفوعاً بسباق محموم لبناء وتطوير وكلاء ذكاء اصطناعي مستقلين قادرين على محاكاة السلوك البشري وأداء مهام معقدة في بيئات العمل الحقيقية، مثل خدمة العملاء المتقدمة، وإجراء المفاوضات، وتدقيق الفواتير المالية. وصرح بوبي صامويلز، الرئيس التنفيذي لمنصة وساطة البيانات «بروتيغي»، بأن إجمالي حجم المعاملات والصفقات المالية عبر منصته قد قفز من 30 مليون دولار في العام الماضي إلى ما لا يقل عن 100 مليون دولار خلال العام الجاري.
ويركز مشترو البيانات اهتمامهم بشكل أساسي على شراء بيانات الشركات الناشئة التي تواجه الإفلاس أو تمر بإجراءات الاستحواذ والتصفية. وعلى سبيل المثال، تلقت شركة «وارملي» المتخصصة في وكلاء الذكاء الاصطناعي، والتي استحوذت عليها منصة «هاب سبوت» مؤخراً، أربعة عروض شراء منفصلة وصلت قيمتها إلى 300 ألف دولار لشراء سجلات ومحاضر اجتماعاتها الداخلية ومراسلات بريدها الإلكتروني بعد توقيع اتفاقية الاستحواذ مباشرة، لكنها رفضت كافة تلك العروض. وتُعتبر سجلات التفاعلات البشرية الحية — مثل قيام المطورين بحل المشكلات البرمجية المعقدة، أو نقاشات المديرين الماليين حول الأداء والتقارير، أو مقاطع الفيديو التوضيحية — بمثابة وقود تدريبي لا غنى عنه لتطوير أنظمة الجيل القادم.
اقتراب جدار البيانات ونفاد النصوص العامة
وتعكس حمى شراء البيانات المؤسسية الخاصة عائقاً هيكلياً بالغ التعقيد يواجه صناعة الذكاء الاصطناعي العالمية؛ حيث تشير تقديرات معهد أبحاث «إيبوك إيه آي» إلى أن المخزون الإجمالي الفعلي للنصوص البشرية العامة عالية الجودة المتاحة على الإنترنت يقدر بنحو 300 تريليون رمز، ومن المتوقع أن تستوعبه وتستهلكه النماذج الرائدة بالكامل في الفترة ما بين عامي 2026 و2032. وتحت افتراضات التدريب الأكثر كثافة وتسارعاً، قد تنهار هذه النافذة الزمنية وتصل إلى طريق مسدود بحلول عام 2027.
وعلى الرغم من استمرار تدفق المحتوى البشري الجديد على المنصات الرقمية، إلا أن وتيرة إنتاجه اليومية أبطأ بكثير من معدلات التوسع الهائلة المطلوبة لمجموعات بيانات تدريب الذكاء الاصطناعي، مما يجعل الاعتماد الحصري على المحتوى المجاني أمراً مستحيلاً لضمان استمرار تطور النماذج التوليدية.
الكتب والدعاوى القضائية وتكاليف إخفاء الهوية
ويأتي هذا التدافع المحموم لشراء البيانات الخاصة في أعقاب فترات طويلة من الجدل القانوني والنزاعات القضائية العنيفة حول مصادر بيانات التدريب. وكانت مبادرة أنثروبيك الداخلية المعروفة باسم «مشروع بنما» قد تضمنت شراء كتب محمية بحقوق التأليف والنشر، وقص أغلفتها وهوامشها لمسحها ضوئياً، ثم إتلاف النسخ المادية بعد ذلك. ووافق قاضٍ فيدرالي في سان فرانسيسكو في شهر يوليو على تسوية جماعية بقيمة 1.5 مليار دولار بشأن هذا البرنامج، بعد أن كشفت وثيقة تخطيط داخلية نشرتها صحيفة «واشنطن بوست» عن وصف المشروع بأنه محاولة «لمسح كافة كتب العالم ضوئياً وتدميرها».
وفي ظل تحول عملية إخفاء وتجريد البيانات المؤسسية من الهويات الشخصية إلى تحدٍ قانوني وهندسي جسيم، أكد شوب سينها، الرئيس التنفيذي لشركة معالجة البيانات «إنتغرال»، أن شركته تجري «عمليات تنقية وإخفاء هوية صارمة للغاية للحفاظ على القيمة الاستدلالية للبيانات مع الامتثال الدقيق لقوانين وتشريعات الخصوصية وحماية البيانات». ويشير هذا السوق المتوسع للمراسلات الخاصة إلى أن تكاليف شراء وتجهيز البيانات — التي كانت في السابق تمثل بنداً ثانوياً مقارنة بتكاليف الحوسبة والطاقة — باتت تشكل بنداً مالياً رئيسياً ومتصاعداً في ميزانيات شركات الذكاء الاصطناعي.
أسئلة شائعة
السؤال: لماذا تسعى شركات الذكاء الاصطناعي لشراء المراسلات الداخلية للشركات؟
الإجابة: لأن النصوص العامة على الإنترنت شارفت على النفاد، ولحاجة النماذج إلى بيانات حوارية واقعية لتدريب الوكلاء على مهام العمل المعقدة.
السؤال: ما هو الموعد المتوقع لنفاد مخزون النصوص البشرية المتاحة على الإنترنت؟
الإجابة: تشير تقديرات إيبوك إيه آي إلى احتمال استهلاك المخزون المتاح المقدر بـ 300 تريليون رمز بين عامي 2026 و2032، أو بحلول 2027 في السيناريو المتسارع.
السؤال: ما هي تفاصيل تسوية «مشروع بنما» الخاصة بشركة أنثروبيك؟
الإجابة: وافق القضاء الأمريكي على تسوية بقيمة 1.5 مليار دولار بعد قيام الشركة بمسح وإتلاف آلاف الكتب المحمية بحقوق الطبع لتدريب نماذجها.
السؤال: كيف تتعامل الشركات مع مخاطر الخصوصية في هذه المراسلات؟
الإجابة: تستعين الشركات بمنصات تنقية وتشفير متخصصة لإخفاء الهويات الشخصية والمعلومات الحساسة قبل استخدام البيانات في التدريب للامتثال للقوانين.