• By BitSeed
  • تقنيات الصوت
  • 18 Sep

بوجود النماذج الكبيرة، لماذا لا تزال هناك حاجة إلى معالجة اللغة الطبيعية (NLP)

يستطيع GPT-4o كتابة الشعر، وClaude كتابة البرامج، وDeepSeek-R1 القيام بالاستدلال، فالنماذج الكبيرة تبدو قادرة على كل شيء. ولكن عندما تضعها حقًا في مكبر الصوت الذكي لتحكم بها في مكيف الهواء في الغرفة، تظهر المشكلات - نموذج يحتوي على 6.71 مليار معلمة يحتاج ببساطة إلى ثوانٍ لإنشاء الجملة "فتح المكيف"، ناهيك عن التحكم اللاحق بالجهاز. هذا هو السبب الأساسي في أن تقنيات معالجة اللغة الطبيعية التقليدية لا تزال لا ترفع عنها اليد حتى في عصر النماذج الكبيرة.

تُحل النماذج الكبيرة ومعالجة اللغة الطبيعية بشكل أساسي مشكلات من مستويات مختلفة. تُتقن النماذج الكبيرة إنشاء وفهم اللغة الطبيعية المعقدة، حيث تكتسب قدرة قوية على إنشاء اللغة من خلال التدريب على بيانات هائلة، ويمكنها إجراء محادثات متعددة الدورات، والكتابة الإبداعية، وحتى إنشاء الكود. ولكن هذه القدرة العامة تأتي بثمن - تتجاوز معلمات النموذج عادةً مليارات، وتحتاج إلى موارد حسابية كثيرة أثناء الاستدلال، وتكون تأخير الاستجابة أكثر من الثانية. في حين أن تقنيات معالجة اللغة الطبيعية التقليدية مثل تصنيف النوايا والتعرف على الكيانات، على الرغم من أن وظائفها متقنة نسبيًا، يمكنها إحداث استجابة بمرتبة الملي ثانية في المهام المحددة، مع دقة تزيد عن 95%. في سيناريوهات التفاعل الفوري مثل مكبر الصوت الذكي، إن انتظار المستخدم ثلاث ثوانٍ بعد قوله "أطفي الأنوار" لتنفيذ الأوامر يكون تجربة لا تستوعبها.

من منظور البنية التحتية التكنولوجية، تستخدم النماذج الكبيرة طريقة معالجة مغلقة النهاية إلى النهاية (الصندوق الأسود)، حيث تُخرج النتائج مباشرة من النص المدخل، ولا تزال العمليات الوسيطة غير مُعْرَفَة ولا تسهّل تصليحها. عندما تحدث خطأ في النظام، يصعب عليك تحديد ما إذا كان الخطأ في تحديد النوايا أم في استخراج الكيانات. بالمقارنة، تستخدم معالجة اللغة الطبيعية سير عمل معالجي متعدد الأجزاء - أولاً تصنيف النوايا لتحديد ما يريد المستخدم القيام به؛ ثم ملء الحقول لاستخراج المعلمات الرئيسية؛ وأخيراً تنفيذ الإجراء المناسب. إن هذه الطريقة المبنية للمعالجة لا تسهِّل فقط تحديد المشكلات وتحسينها، بل يمكن أيضًا ضبط أداء كل وحدة بشكل مستقل. في سيناريو غرفة الفندق، عندما يقول الضيف "قم بضبط درجة الحرارة إلى العشرين درجة"، يمكن لنظام معالجة اللغة الطبيعية التعرف بدقة على أن النية هي "ضبط درجة الحرارة" والكيان هو "العشرين درجة"، وكل العملية واضحة ومُتحكم فيها.

اختلاف استهلاك الموارد أكبر بكثير. عادةً ما تتطلب تشغيل نموذج كبير دعمًا من وحدة معالجة الرسومات العميقة (GPU) عالية الجودة، مع استهلاك طاقة يصل إلى مئات الواط، وهو ما لا يحتمله الأجهزة الحافة. على الرغم من أن أحدث تقنيات التكميم يمكنها ضغط النموذج إلى gigabytes قليلة، إلا أن سرعة الاستدلال على الأجهزة المضمنة لا تزال لا تفي بالمتطلبات الزمنية الفورية. تظهر البيانات الأبحاثية أن حتى نماذج اللغة الكبيرة الصغيرة (LLM) التي تم تكميمها بـ 4 بت، فإن تأخير أول حرف على الأجهزة الحافة يصل إلى 500 مللي ثانية أو أكثر. في حين أن نماذج معالجة اللغة الطبيعية المُحسنة специально يمكن ضغطها إلى 几十 ميجابايت، ويمكن تشغيلها بسلاسة على شريحة ARM العادية، مع استهلاك طاقة لا يتجاوز واطًا واحدًا أو قليلاً. تتيح هذه الخاصية الخفيفة الوزن ل تقنيات معالجة اللغة الطبيعية النداء على نطاق واسع على الأجهزة الطرفية المحدودة بالموارد مثل مكبرات الصوت الذكية والأجهزة المنزلية الذكية.

الالتزام بالمنطق المحدد هو فرق آخر أساسي. إن عمومية النماذج الكبيرة هي سلاح ذو شفرين - يمكنها معالجة موضوعات مختلفة، ولكن أدائها في المجالات المحددة غالبًا ما يكون أقل من نماذج معالجة اللغة الطبيعية المدربة специально. على سبيل المثال، في سيناريو التحكم بالمنزل الذكي، تكون طرق التعبير للمستخدم ثابتة نسبيًا، وتتعلق أساسًا بأنواع محدودة من النوايا مثل التبديل ON/OFF، والتعديل، والاستعلام. يمكن لنماذج معالجة اللغة الطبيعية المدربة على هذه السيناريوهات العالية التكرار أن تصل إلى دقة عالية باستخدام آلاف السجلات الموسومة. أما جعل النموذج الكبير يفهم أوامر مثل "أخفِ نور الغرفة المعيشة قليلاً" وينفذها بدقة، فذلك يتطلب هندسة تلميح معقدة أو حتى ضبط دقيق، مما يزيد التكلفة والتعقيد بشكل كبير.

في النشر العملي، غالبًا ما تكون الحل الأمثل هو التعاون بين النماذج الكبيرة وتقنيات معالجة اللغة الطبيعية. بالنسبة للأوامر البسيطة والعمليات العالية التكرار، تُستخدم نماذج معالجة اللغة الطبيعية الخفيفة الوزن للتعامل معها مباشرة على الجانب الطرفي، مما يضمن استجابة بمرتبة الملي ثانية؛ أما بالنسبة لفهم اللغة الطبيعية المعقدة، أو المحادثات متعددة الدورات، أو الأسئلة المجاوبة بالمعرفة، فيُستدعى خدمة النماذج الكبيرة في السحابة. تضمن هذه البنية التحتية المختلطة как السرية والاستقلالية لوظائف الأساسية، ويمكنها توفير تجربة تفاعلية ذكية عالية المستوى. على سبيل المثال، في جهاز تعليمي ذكي في سيناريو التعليم، تتعامل نموذج معالجة اللغة الطبيعية المحلي مع أوامر بسيطة مثل "السؤال التالي" التي يقولها الطالب، بينما تُعطى أسئلة عميقة مثل "لماذا يجب حل هذه المسألة بهذه الطريقة" إلى النموذج الكبير للإجابة.

تدعم اعتبارات الخصوصية والأمان أيضًا الوجود المستمر لتقنيات معالجة اللغة الطبيعية. عادةً ما تتطلب النماذج الكبيرة نقل البيانات إلى السحابة للمعالجة، مما يُشكل خطرًا على الخصوصية عند معالجة المعلومات الحساسة. في حين أن نماذج معالجة اللغة الطبيعية المحلية يمكن تشغيلها تمامًا بدون اتصال بالإنترنت، حيث تتم جميع عمليات معالجة البيانات على جهاز المستخدم، ولا يوجد خطر لفقدان البيانات. في سيناريوهات تُ重视 الخصوصية مثل غرف الفندق، من الواضح أن معالجة أوامر الصوت الخاصة بالضيوف بواسطة نموذج معالجة اللغة الطبيعية محلي هو الخيار الأفضل. علاوة على ذلك، نماذج معالجة اللغة الطبيعية تتمتع بقدرة تفسيرية وضبط أفضل، حيث يمكن للشركات ضبط حدود سلوك النظام بدقة، مما يقلل من ظاهرة "الهلالات" (الإرشادات الخاطئة) التي قد تظهر في النماذج الكبيرة.

يكون مقارنة التكلفة والفائدة أكثر وضوحًا. يتطلب نشر خدمة نموذج كبير يدعم ملايين المستخدمين مجموعات من وحدات معالجة الرسومات العميقة (GPU) تقدر تكلفتها ملايين الدولارات والتكاليف التشغيلية المستمرة. في حين أن خدمة معالجة اللغة الطبيعية بنفس الحجم يمكن دعمها باستخدام خوادم معالجة مركزية عادية (CPU)، وقد تصل تكلفتها إلى عُشر تكلفة الخيار الأول. بالنسبة لمعظم تطبيقات السيناريوهات العمودية، إن استخدام النماذج الكبيرة لمعالجة أوامر بسيطة مثل "أفتح الأنوار" أو "أغلق الباب" يشبه استخدام سكين ثقيل ل杀鸡، فهي لا تقتصر على إهدار الموارد فحسب، بل تؤثر أيضًا على تجربة المستخدم.

كمزود لجهاز طرفي تفاعلي صوتي ذكي AI، لقد اخذنا في الاعتبار التكامل المثالي بين النماذج الكبيرة وتقنيات معالجة اللغة الطبيعية في تصميم منتجاتنا. من خلال نشر محرك معالجة اللغة الطبيعية المحسّن على الأجهزة الطرفية، نستطيع توفير استجابة لأوامر بمرتبة الملي ثانية، مع توصيل واجهة برمجة تطبيقات السحابة بخدمة النماذج الكبيرة لتقديم خدمات عالية المستوى مثل المجاوبة بالأسئلة والإنشاء المحتوى للمستخدمين. تضمن هذه البنية التحتية الذكية الطبقية السرية للتفاعل الأساسي، كما أنها تتيح توسع مرن للقدرات العالية وفقًا للاحتياجات الفعلية. لقد فتحت النماذج الكبيرة عصرًا جديدًا للإلكترونيات الذكية (AI)، ولكن في التطبيقات العمليّة، تظل تقنيات معالجة اللغة الطبيعية الناضجة والفعّالة والمتحكّمة أساسًا لا ي或缺.