معمارية المحول وقوة الانتباه: دليل للمبتدئين
اكتشف كيف أحدثت آلية الانتباه ثورة في الذكاء الاصطناعي مع المحولات، أساس النماذج مثل GPT وBERT.
تخيّل قراءة جملة طويلة ومعقدة: لا يعالج دماغك كل كلمة بالطريقة نفسها، بل يركز على العناصر الرئيسية. هذا بالضبط ما تفعله بنية Transformer بفضل آلية الانتباه. تم تقديمها في عام 2017 في الورقة « Attention is All You Need »، وقد غيرت هذه الطريقة معالجة اللغة الطبيعية من خلال السماح للنماذج بتحليل العلاقات بين الكلمات بطريقة متوازية وفعالة، دون قيود الطرق التسلسلية القديمة.
من RNN إلى Transformers: تحول في النموذج
قبل المحولات، كانت الشبكات العصبية المتكررة (RNN) وLSTM تهيمن على معالجة التسلسلات. كانت تعالج البيانات كلمة بكلمة، مما يطرح مشكلتين كبيرتين: كانت المعالجة بطيئة لعدم إمكانية التوازي، وكانت تفقد السياق بسهولة في الجمل الطويلة. تحل المحولات ذلك بمعالجة التسلسل بأكمله دفعة واحدة، بفضل آلية الانتباه التي تربط كل كلمة مباشرة بجميع الكلمات الأخرى.
آلية الانتباه موضحة ببساطة
الانتباه يشبه كشافًا يسلط الضوء على الأجزاء المهمة من الجملة. على سبيل المثال، في « القط الأسود ينام على السجادة »، يجب أن ينتبه كلمة « ينام » إلى « قط » بدلاً من « سجادة ». بدلاً من معالجة الكلمات بالترتيب، يقوم النموذج بحساب درجة الصلة بين كل زوج من الكلمات، مما يسمح بالتقاط التبعيات البعيدة بسهولة.
Self-attention : queries, keys et values
جوهر المحول هو الـ self-attention. يُحوَّل كل كلمة إلى ثلاثة متجهات: query (ما أبحث عنه)، وkey (ما أقدمه)، وvalue (المعلومات المراد نقلها). ثم تُحسب الدرجات بمقارنة query كل كلمة مع keys الكلمات الأخرى، وتُرجَّح الـ values وفقًا لهذه الدرجات. وينتج عن ذلك تمثيل أكثر ثراءً لكل موضع.
- Query : تمثل ما «يطلبه» الكلمة
- Key : تمثل ما «تقدمه» الكلمات الأخرى
- Value : تحتوي على المعلومات الحقيقية المراد دمجها
الانتباه متعدد الرؤوس والهيكل العام
لالتقاط أنواع مختلفة من العلاقات (النحو، المعنى، السياق)، تستخدم المحولات عدة رؤوس انتباه بالتوازي. تشمل البنية الكاملة مشفرًا (يفهم النص) ومفككًا (يولّد الخرج)، ويتكون كل منهما من طبقات انتباه وشبكات عصبية بسيطة. تتيح هذه البنية تدريبًا أسرع بكثير على GPU.
التطبيقات الملموسة والتأثير الحالي
تُستخدم نماذج الـ Transformers في كل مكان: GPT لتوليد النصوص، BERT للفهم، وحتى في مجال الرؤية مع ViT أو في الصوت. وقد أتاحت قدرتها على التوسع مع كميات ضخمة من البيانات إمكانية بناء نماذج اللغة الكبيرة الحالية. ويمكن أن يبدو مثال بسيط لحساب الانتباه كما يلي:
scores = query @ keys.T / sqrt(d_k)
attention_weights = softmax(scores)
output = attention_weights @ values
باختصار، جعلت بنية Transformer الذكاء الاصطناعي أكثر قوة وسهولة في الوصول إليه من خلال وضع الانتباه في قلب اللعبة. إذا كنت مبتدئًا، ابدأ بالتجربة مع مكتبات مثل Hugging Face لرؤية هذه المفاهيم قيد التنفيذ: فهم الانتباه هو المفتاح لإتقان النماذج الحديثة.
💬 هل لديك سؤال أو ترغب في التعمق أكثر؟ انضم إلى المجتمع على Discord : https://discord.gg/GwhUKccQcM