أتاحت جوجل مكتبة TPU Raiden مفتوحة المصدر لنقل ذاكرة KV المؤقتة بين الشرائح أثناء تشغيل نماذج اللغة الكبيرة، في خطوة توسّع أدوات منظومة TPU خارج نطاقها المغلق.
محتويات المقال
- ما مكتبة TPU Raiden؟
- كيف تدير Raiden مرحلتي التهيئة والتوليد؟
- النقل بين الشرائح وتفريغ الذاكرة
- لماذا تفتح جوجل هذه الأدوات الآن؟
- سباق مفتوح لبنية الاستدلال
- أسئلة شائعة
ما مكتبة TPU Raiden؟
نشرت جوجل مكتبة TPU Raiden على GitHub بموجب ترخيص Apache 2.0. وتعمل المكتبة في طبقة من منظومة الاستدلال تشبه تلك التي تغطيها مكتبة NIXL التابعة لإنفيديا، إذ توفّر آليات لنقل ذاكرة KV Cache بين وحدات المعالجة المسؤولة عن مرحلتي التهيئة والتوليد، إلى جانب أدوات لتفريغ بيانات الذاكرة المؤقتة.
وكانت منصة SemiAnalysis من أوائل الجهات التي لفتت الانتباه إلى الإصدار، معتبرة أنه إشارة واضحة إلى استعداد جوجل لإتاحة مكوّنات بنية تحتية ظلّت لفترة طويلة مرتبطة بمنظومة وحدات TPU الخاصة بها.
كيف تدير Raiden مرحلتي التهيئة والتوليد؟
تنقسم عملية الاستدلال واسعة النطاق عادةً إلى مرحلتين. تعالج مرحلة Prefill الطلب أو النص المُدخل، بينما تتولى مرحلة Decode توليد الرموز واحداً تلو الآخر.
قد يكون تشغيل المرحلتين على الشريحة نفسها أقل كفاءة، لذلك تفصل الأنظمة الإنتاجية بينهما وتوزعهما على مجموعات مستقلة من العتاد. وبعد انتهاء مرحلة التهيئة، تتكوّن ذاكرة KV Cache التي تمثّل الذاكرة التشغيلية للسياق الذي عالجه النموذج، ويجب نقلها بسرعة إلى الشرائح المسؤولة عن التوليد.
تتولى Raiden إدارة عملية النقل هذه بهدف تسهيل تشغيل الاستدلال المفصول عبر وحدات TPU.
النقل بين الشرائح وتفريغ الذاكرة
وفقاً لوثائق المستودع، تتضمن Raiden وحدات للنقل المباشر بين الشرائح داخل الجهاز نفسه، والنقل بين الآلات الافتراضية عبر الشبكة، إضافةً إلى تفريغ كتل ذاكرة KV من ذاكرة TPU إلى ذاكرة الوصول العشوائي للمضيف.
كما توفّر المكتبة وضعاً للذاكرة المشتركة يسمح ببقاء البيانات المؤقتة في ذاكرة DRAM حتى عند إعادة تشغيل خادم النموذج، وهو ما قد يكون مفيداً أثناء التحديثات التشغيلية الدورية.
ومع ذلك، تؤكد جوجل أن المشروع لا يزال قيد التطوير النشط، وأنه غير مخصص حالياً للاستخدام العام في بيئات الإنتاج.
لماذا تفتح جوجل هذه الأدوات الآن؟
لا تبيع جوجل وحدات TPU كمنتجات مستقلة، لكن قاعدة مستخدمي شرائحها المخصصة اتسعت. فقد حصلت Anthropic على إمكانية الوصول إلى مليون وحدة TPU، كما بدأت OpenAI استخدام وحدات جوجل في أجزاء من عملياتها.
ويحتاج هؤلاء العملاء إلى أدوات برمجية تضاهي المنظومة التي تطورت حول وحدات إنفيديا. وترتبط أطر مثل vLLM وSGLang ارتباطاً وثيقاً بمكتبة NIXL، لذلك قد تساعد عمليات دمج مماثلة مع Raiden مستقبلاً على تقليل الجهد المطلوب لنقل بعض أحمال الاستدلال إلى وحدات TPU.
سباق مفتوح لبنية الاستدلال
يأتي إصدار Raiden بالتزامن مع تحركات مماثلة من إنفيديا. ففي 4 أغسطس، أعلنت الشركة فتح واجهات cuFile ومنظومة التخزين التابعة لها من خلال مؤسسة جديدة متعددة المورّدين على GitHub، مع إدراج جوجل وإنتل وميتا بين المشرفين الأوائل.
تعكس هذه الخطوات اتجاهاً أوسع نحو إتاحة مكوّنات بنية الاستدلال التي احتفظ بها المورّدون سابقاً داخل منظوماتهم المغلقة. وبالنسبة إلى جوجل، قد تقلّل الأدوات المفتوحة عوائق اعتماد TPU في أحمال الإنتاج، بدلاً من اختيار منظومة إنفيديا لمجرد أن أدواتها أكثر انتشاراً وتوثيقاً في المصادر المفتوحة.
في المقابل، تؤكد إنفيديا أن وحدات GPU التابعة لها لا تزال متقدمة وقادرة على تشغيل مختلف نماذج الذكاء الاصطناعي عبر بيئات الحوسبة. وسيظل مدى تأثير انفتاح منظومة جوجل في هذا التفوق سؤالاً أساسياً أمام المؤسسات التي تختار بنية تشغيل الاستدلال على نطاق واسع.
أسئلة شائعة
ما وظيفة مكتبة TPU Raiden؟
تنقل ذاكرة KV المؤقتة بين وحدات TPU المسؤولة عن مرحلتي التهيئة والتوليد، وتدعم أيضاً تفريغ البيانات إلى ذاكرة المضيف.
هل Raiden بديل مباشر لمكتبة NVIDIA NIXL؟
تعمل المكتبتان في طبقة متشابهة من منظومة الاستدلال، لكن Raiden موجهة إلى وحدات TPU ولا تزال في مرحلة تطوير نشطة.
هل يمكن استخدام Raiden في الأنظمة الإنتاجية حالياً؟
لا توصي جوجل حالياً باستخدامها العام في بيئات الإنتاج، لأن المشروع ما زال قيد التطوير.
ما ترخيص مكتبة Raiden؟
أصدرت جوجل المكتبة مفتوحة المصدر بموجب ترخيص Apache 2.0.