أطلقت شركة إلفن لابس نموذجي الجيل الرابع وإصدار توربو المخصصين لتحويل النصوص إلى كلام بمعمارية برمجية جديدة تدعم أكثر من 90 لغة. وتتيح النماذج الجديدة استنساخ الأصوات خلال 10 ثوانٍ فقط مع إدخال توجيهات الأداء العاطفي.
- معمارية برمجية جديدة وتوسع في اللغات المدعومة
- سرعة استنساخ خارقة وتوجيهات الأداء المدمجة
- إصدار توربو فائق السرعة لوكلاء المحادثة الهاتفية
- قفزة الإيرادات المالية وتطلعات الطرح العام
- أسئلة شائعة
معمارية برمجية جديدة وتوسع في اللغات المدعومة
أطلقت شركة «إلفن لابس» الرائدة يوم الاثنين نموذجي توليد الصوت الجديدين «إلفن الإصدار الرابع» والنسخة فائقة السرعة «إلفن الإصدار الرابع توربو»، والمبنيين على معمارية عصبية جديدة كلياً تؤكد الشركة أنها تقدم أعلى مستويات التعبير الصوتي والقدرة على التحكم في النبرات والأداء حتى اليوم. وأصبحت النماذج الجديدة متاحة فوراً للمطورين والجمهور عبر واجهة برمجة التطبيقات الخاصة بالشركة ومنتجاتها الاستهلاكية المتنوعة، بما في ذلك باقة الاستخدام المجانية.
وتوسع النماذج الجديدة مظلة التغطية اللغوية لتدعم أكثر من 90 لغة عالمية، مقارنة بنحو 70 لغة كان يدعمها الإصدار السابق، مع تحسينات جوهرية طرأت على دقة النطق ومحاكاة اللهجات المحلية. وأشارت الشركة إلى أن أكبر قفزات الجودة الصوتية ظهرت بوضوح في اللغات اليابانية، والبرتغالية البرازيلية، والصينية المندرينية، والكانتونية، مما يمنح المبدعين أدوات نطق طبيعية غير مسبوقة تلغي الإحساس الآلي الرتيب.
سرعة استنساخ خارقة وتوجيهات الأداء المدمجة
يقدم الجيل الرابع ميزة ثورية تتمثل في القدرة على استنساخ أي صوت بشري بدقة متناهية من خلال مقطع صوتي مرجعي لا تتجاوز مدته 10 ثوانٍ فقط، وهو خفض هائل في متطلبات البيانات السمعية اللازمة للتدريب. كما أضافت الشركة دعماً لعلامات التوجيه الصوتي النصية المدمجة، والتي تتيح للمستخدمين تضمين تعليمات تمثيلية ولغة طبيعية مباشرة داخل النص المكتوب؛ مثل إدراج تعبيرات الضحك والهمس وإغلاق الأبواب بعنف، ليقوم النموذج بترجمتها صوتياً بتلقائية مذهلة.
وشهد هذا الإصدار عودة ميزة «استنساخ الأصوات الاحترافية»، والتي كانت غائبة عن نموذج الإصدار الثالث الذي طُرح العام الماضي. وتدعم النماذج توليد نصوص طويلة تصل إلى 10000 رمز في الدفعة الواحدة، مع تزويدها بخاصية «حياكة السياق» الذكية المصممة للحفاظ على ثبات نبرة الإلقاء وإيقاع الصوت واستمراريته عبر المشاريع الصوتية الطويلة، مثل الكتب الصوتية والروايات المطولة دون أي انقطاع في الأسلوب.
إصدار توربو فائق السرعة لوكلاء المحادثة الهاتفية
تم تحسين إصدار «توربو» المخصص للجيل الرابع ليعمل خصيصاً مع تطبيقات الذكاء الاصطناعي المحادثية اللحظية، حيث يدعم البث الصوتي ثنائي الاتجاه الذي يبدأ في إعادة ونطق المخرجات الصوتية للمستمع حتى قبل أن يكتمل توليد الجملة النصية في النظام. وسجلت إلفن لابس زمناً وسطياً مذهلاً للوصول إلى النطق الأول بلغ حوالي 150 ميلي ثانية في اختبارات القياس المعيارية الداخلية للشركة، مقارنة بنحو 262 ميلي ثانية لنموذج كارتيسيا سونيك 3.6، و814 ميلي ثانية لنموذج أوبن أي آي جي بي تي 4 أو ميني الصوتي.
ووفقاً لتقرير نشرته شبكة «تك كرانش»، يتمتع النموذج بقدرات سلوكية متطورة لإدارة المواقف الحوارية الصعبة أثناء المكالمات الآلية؛ حيث يمكنه التعامل بمرونة مع المقاطعات اللفظية، وحالات تصعيد الشكاوى، وتثبيت الاتصالات ووضع العملاء في الانتظار. وصُممت هذه الميزات المتقدمة بصورة مخصصة لتلبية احتياجات مراكز الاتصال وخدمة العملاء في الشركات الكبرى التي تبحث عن أتمتة موثوقة تحاكي التصرف البشري.
قفزة الإيرادات المالية وتطلعات الطرح العام
حققت إلفن لابس نمواً متسارعاً ومذهلاً في بنيتها وأعمالها منذ أن جمعت تمويلاً بقيمة 500 مليون دولار من شركة «سيكويا كابيتال» في وقت سابق من هذا العام بتقييم مالي بلغ 11 مليار دولار. وقفز معدل الإيرادات السنوية التشغيلية للشركة من نحو 330 مليون دولار في بداية العام ليتجاوز حاجز 600 مليون دولار، مع تدفق أكثر من 55% من هذه الإيرادات مباشرة من عملاء قطاع المؤسسات والشركات الكبرى، في حين تضخم عدد موظفيها ليتخطى 800 موظف عبر الهند وأوروبا والبرازيل.
وتتردد في الأسواق المالية أنباء قوية حول جولة تمويلية جديدة مرتقبة قد ترفع تقييم الشركة إلى 22 مليار دولار. وصرح «ماتي ستانيشيفسكي»، الشريك المؤسس والرئيس التنفيذي، لشبكة تك كرانش بأن الشركة تستهدف تنفيذ طرح عام أولي لأسهمها في البورصة «خلال السنوات المقبلة» دون الالتزام بجدول زمني صارم. وتأتي هذه الخطوات وسط منافسة شرسة يشهدها قطاع الصوت التوليدي مع شركات ناشئة مثل كارتيسيا وديبغرام، إلى جانب المشاريع التنافسية لشركتي جوجل وأوبن أي آي.
أسئلة شائعة
السؤال: كم يبلغ عدد اللغات التي يدعمها الجيل الرابع من نماذج إلفن لابس؟
الإجابة: يدعم النموذج أكثر من 90 لغة عالمية مع تحسينات ملحوظة في اللغات الشرق آسيوية والأوروبية.
السؤال: ما هي المدة الزمنية الأدنى للتسجيل الصوتي المطلوب لاستنساخ الصوت؟
الإجابة: تتطلب التقنية الجديدة تسجيلاً صوتياً مرجعياً مدته 10 ثوانٍ فقط لاستنساخ هوية الصوت بدقة عالية.
السؤال: ما هي السرعة التي يحققها نموذج توربو في بدء النطق التفاعلي؟
الإجابة: يسجل النموذج زمناً وسطياً لبدء الكلام يبلغ 150 ميلي ثانية، مما يجعله مثالياً لوكلاء المحادثة في مراكز الاتصال.