root@gneurone:~# ./prep --interview --domain=ai,ml,data
التحضير لمقابلات الذكاء الاصطناعي · تعلّم الآلة · البيانات
الأسئلة التي تُطرح فعلاً في المقابلات، على شكل بطاقات. انقر بطاقة لكشف إجابة قصيرة جاهزة للقول شفهياً. صنِّف حسب الموضوع أو ابحث بكلمة مفتاحية.
يتعلم النموذج من بيانات مُعَلَّمة (مدخل → مخرج معروف) للتنبؤ بالمخرج على بيانات جديدة. عائلتان: التصنيف (سبام / غير سبام) والانحدار (سعر منزل). خوارزميات نموذجية: الانحدار اللوجستي، الأشجار، SVM، الشبكات العصبية.
لا توجد تسميات. يكتشف النموذج البنية الخفية للبيانات: التجميع (k-means, DBSCAN)، تقليل الأبعاد (PCA, t-SNE)، اكتشاف الشذوذ. يُستخدم لتقسيم العملاء، الضغط، الاستكشاف.
يتعلم وكيل من خلال التجربة والخطأ بالتفاعل مع بيئة، موجهاً بـمكافآت. يُحسّن سياسة تزيد المكافأة التراكمية مع الوقت. أمثلة: الألعاب (AlphaGo)، الروبوتات، أنظمة التوصية.
تحيز عالٍ = نموذج بسيط جداً → underfitting (أداء سيء في كل مكان). تباين عالٍ = نموذج حساس جداً للضوضاء في التدريب → overfitting. نبحث عن نقطة التوازن التي تقلل خطأ التعميم.
علامة: جيد جداً على التدريب، سيء على الاختبار (النموذج يحفظ الضوضاء). علاجات: المزيد من البيانات، التنظيم (L1/L2)، dropout، early stopping، نموذج أبسط، التحقق المتقاطع.
L1 (Lasso) يدفع بعض الأوزان إلى 0 بالضبط → يقوم بـاختيار المتغيرات. L2 (Ridge) يقلل سعة الأوزان دون إلغائها → يحد من الـoverfitting. مجتمعة = Elastic Net.
Train: يتعلم النموذج. Validation: نضبط المعاملات الفائقة ونختار النموذج. Test: تقييم نهائي، لا يُلمس قبل ذلك. وإلا نغش وتكون الأداء المعلن متفائلاً جداً.
نقسم البيانات إلى k طيات؛ ندرب على k-1 ونختبر على الطية المتبقية، مكررين k مرات. نوسط الدرجات → تقدير أكثر متانة، خاصة عندما تكون البيانات محدودة.
خوارزمية تحسين تقوم بتعديل الأوزان في الاتجاه المعاكس للتدرج لوظيفة الخسارة، بخطوات صغيرة. معدل التعلم = حجم الخطوة: كبير جداً = تباعد، صغير جداً = بطيء. المتغيرات: SGD, mini-batch, Adam.
توزيع بيانات الإدخال في الإنتاج يبتعد عن ذلك في التدريب (سلوكيات جديدة، موسمية، تغيير مستشعر). يتدهور أداء النموذج بصمت. يُكتشف عبر المراقبة: اختبارات إحصائية (KS, PSI, Chi²) على الـ features.
Data drift: توزيع X يتغير. Concept drift: العلاقة X → y تتغير (تعريف الهدف يتطور). مثال: كشف الاحتيال حيث يغير المحتالون طريقتهم. الحل الشائع: إعادة التدريب المنتظم + التنبيه.
عندما تهيمن فئة واحدة (مثال: 99% سلبي)، تصبح الدقة مضللة. الحلول: إعادة أخذ العينات (oversampling مثل SMOTE، undersampling)، ترجيح الفئات (
class_weight)، مقاييس مناسبة (F1, PR-AUC، الاستدعاء)، وتعديل عتبة القرار حسب تكلفة الأخطاء.معلومات لن تكون متاحة في الإنتاج (أو تأتي من الهدف) تتسرب إلى الـ features → نتيجة غير واقعية في التطوير، وانهيار في الإنتاج. الفخ الشائع: التطبيع قبل التقسيم. الحل: كل المعالجة المسبقة داخل pipeline مُدرَّب على بيانات التدريب فقط.
التطبيع (min-max): يحصر القيم في [0,1]. التوحيد القياسي (z-score): متوسط 0 وانحراف معياري 1. ضروري للنماذج الحساسة للمقياس (KNN, SVM, الشبكات العصبية, k-means)؛ غير ضروري للأشجار.
الخيارات: الحذف (إذا كانت قليلة)، الاستيفاء (المتوسط/الوسيط/المنوال، KNN، نموذج) أو مؤشر "مفقود". يعتمد الاختيار الصحيح على الآلية (MCAR / MAR / MNAR): قد تحمل القيمة "المفقودة" معلومات مفيدة.
One-hot (عدد قليل من الفئات)، ترتيبي (إذا وُجد ترتيب)، target / frequency encoding (عالية الكاردينالية). انتبه: يسبب target encoding leakage إذا لم يُنفذ داخل التحقق المتقاطع.
إنشاء/تحويل المتغيرات (النسب، التجميعات، الميزات الزمنية، التفاعلات) غالبًا ما يعطي مكاسب أكبر من تغيير الخوارزمية. « Garbage in, garbage out »: جودة الميزات تحد من الأداء.
الدقة = من بين الإيجابيات المتوقعة، كم منها صحيح (يحد من الإنذارات الكاذبة). الاستدعاء = من بين الإيجابيات الحقيقية، كم منها تم اكتشافه (يحد من حالات الإغفال). المفاضلة حسب التكلفة: الفحص الطبي → استدعاء؛ فلتر البريد المزعج → دقة.
المتوسط التوافقي للدقة والاستدعاء: يكون مرتفعًا فقط إذا كان كلاهما جيدًا. مفيد جدًا على البيانات غير المتوازنة حيث تخدع الدقة.
ROC-AUC يقيس القدرة على فصل الفئات عبر جميع العتبات. على البيانات غير المتوازنة بشدة، يبدو متفائلًا → يُفضل PR-AUC (الدقة مقابل الاستدعاء) لأنه أكثر صدقًا مع الفئة النادرة.
على مجموعة بيانات تحتوي 99% سلبيات، يحقق نموذج يجيب «سلبي دائمًا» دقة 99%… لكنه عديم الفائدة. لذا يُستخدم الاستدعاء، F1، PR-AUC ومصفوفة الالتباس.
MAE: متوسط الخطأ المطلق (متين تجاه القيم الشاذة). RMSE: يعاقب الأخطاء الكبيرة بشدة. R²: نسبة التباين المفسر (1 = مثالي، 0 = جيد بقدر المتوسط).
تكديس من طبقات من الخلايا العصبية: كل خلية تقوم بتركيب خطي للمدخلات يتبعه دالة تنشيط غير خطية. في العمق، تتعلم الشبكة تمثيلات أكثر تجريدًا تدريجيًا. تُدرَّب بـالانتشار العكسي.
يُحسب التدرج للخسارة بالنسبة لكل وزن عبر قاعدة السلسلة، بنشر الخطأ من المخرجات نحو المدخلات. تغذي هذه التدرجات نزول التدرج الذي يحدّث الأوزان.
تقوم بإدخال اللاخطية (بدونها، الشبكة = مجرد انحدار خطي بسيط). ReLU افتراضيًا (تتجنب التلاشي)، sigmoïde/tanh (تشبع)، softmax في الخرج متعدد الفئات.
Dropout: يعطل الخلايا العصبية عشوائيًا أثناء التدريب → تنظيم، يتجنب التكيف المشترك. Batch norm: يقوم بتطبيع التنشيطات حسب الدفعة الصغيرة → تدريب أكثر استقرارًا وسرعة، أقل حساسية للتهيئة.
في الشبكات العميقة، تصبح التدرجات قريبة من الصفر (توقف التعلم) أو تنفجر (تباعد). الحلول: ReLU، تهيئة He/Xavier، batch norm، الوصلات المتبقية (ResNet)، gradient clipping.
CNN: الصور — تلافيف، تكشف أنماطًا محلية، ثبات مكاني. RNN/LSTM: التسلسلات — ذاكرة حالة، لكنها بطيئة. Transformer: التسلسلات عبر attention، قابل للتوازي، يلتقط التبعيات الطويلة → أساس الـ LLM.
نموذج لغوي كبير: transformer مدرب على توقع الـ token التالي على كميات هائلة من النصوص. من خلال تعلم هذه المهمة، يكتسب قواعد اللغة والحقائق وقدرات الاستدلال، ويستطيع توليد وفهم النصوص.
يُقطَّع النص إلى tokens (أجزاء من الكلمات)، ويُحوَّل كل منها إلى متجه (embedding) يشفر المعنى. النصوص المتقاربة دلاليًا تكون متجهاتها قريبة → أساس البحث المتجهي و RAG.
Retrieval-Augmented Generation: يتم استرجاع وثائق ذات صلة (بحث متجهي في قاعدة بيانات) ثم حقنها في الـ prompt لتثبيت الإجابة. المزايا: بيانات محدثة، مصادر قابلة للاستشهاد، تقليل الهلوسة، دون إعادة تدريب النموذج.
Prompting / RAG: سريع ومرن، بدون إعادة تدريب، مثالي لحقن السياق. Fine-tuning: إعادة تدريب على أمثلة لفرض أسلوب/تنسيق أو مهمة محددة — أكثر تكلفة ويتطلب بيانات عالية الجودة.
يقوم النموذج بتوليد إجابة مقبولة لكن خاطئة (يكمل النص دون قاعدة حقيقة). التخفيفات: RAG مع المصادر، درجة حرارة منخفضة، طلب الاستشهادات، التحقق/الحواجز الأمنية.
درجة الحرارة: تتحكم في عشوائية التوليد (0 = حتمي/واقعي، مرتفعة = إبداعي). نافذة السياق: الحد الأقصى لعدد الـ tokens التي « يراها » النموذج دفعة واحدة (الـ prompt + الإجابة).
مدخل مصمم خصيصًا لإخراج النموذج عن سلوكه المتوقع: تجاوز ضوابطه، جعله يكشف أسرارًا، إنتاج محتوى محظور أو تنفيذ إجراءات غير مرغوبة. تُدرس في red teaming (الهجوم للدفاع بشكل أفضل). العائلات الرئيسية: prompt injection، jailbreak، data poisoning، extraction.
يقوم المهاجم بإدراج تعليمات مخفية في مدخل يقرأه LLM، لـتجاوز تعليماته النظامية («تجاهل التعليمات السابقة و…»). مباشرة: في رسالة المستخدم. غير مباشرة: مخفية في صفحة ويب أو PDF أو بريد إلكتروني يحلله الوكيل — يتم تفعيل الحمولة عندما يعالج النموذج هذا المحتوى. هذه الثغرة رقم 1 في تطبيقات LLM (OWASP LLM01).
تقنيات لجعل النموذج يتجاهل التوافق الأمني: لعب الأدوار («تصرف كأنك ذكاء اصطناعي بلا قواعد»)، DAN، افتراضات («لأغراض تعليمية…»)، ترميز (base64، لغة أخرى)، أو تقسيم الطلب المحظور إلى أجزاء تبدو بريئة. النموذج، المحسّن ليكون مفيدًا، يتعرض للتلاعب. الدفاع: تصفية المدخلات/المخرجات، تعزيز التوافق، رفض قوي.
يقوم المهاجم بحقن أمثلة ضارة في بيانات التدريب أو الضبط الدقيق (غالبًا ما تُجمع من الويب) لإنشاء backdoor: مشغّل سري يفعّل سلوكًا مخفيًا، أو تحيز يُدخل على نطاق واسع. يُستهدف RAG أيضًا إذا فُسدت قاعدته الوثائقية. الدفاع: مصدر البيانات، التنظيف، كشف الشذوذ.
هدفان. Model extraction: الاستعلام المكثف لواجهة API لـنسخ النموذج (استنساخه). Data / prompt extraction: جعل النموذج يُخرج بيانات تدريب محفوظة (تسريب PII) أو الـprompt النظامي السري. يُشار أيضًا إلى membership inference (تخمين ما إذا كانت بيانات في مجموعة التدريب). الدفاع: rate limiting، كشف الإساءة، عدم وضع أي سر في الـprompt النظامي.
دفاع متعدد الطبقات: التحقق/تصفية المدخلات (كشف الحقن)، فصل التعليمات النظامية عن المحتوى الخارجي (عدم «الثقة» أبدًا بوثيقة مقروءة)، تقييد صلاحيات الوكيل (مبدأ الامتياز الأدنى، عدم الوصول إلى أدوات حساسة بدون تحقق)، تصفية المخرجات، rate limiting، التسجيل وred teaming مستمر. المرجع: OWASP Top 10 for LLM Applications.
تمييز أساسي. Prompt injection / jailbreak : النموذج مجمد، أوزانه لا تتحرك أبدًا — يتم التلاعب فقط بـنص الإدخال (السياق). ي«يطيع» النموذج لأنه يكمل تسلسل الـ tokens الأكثر احتمالًا. Data poisoning / fine-tuning malveillant : نعم هنا، تُعدل الأوزان فعليًا أثناء التدريب. دفاع مختلف: تصفية الـ prompts (وقت التشغيل) مقابل تأمين سلسلة البيانات (التدريب).
يصنع المهاجم أمثلة تدريبية مفخخة: إدخال يحتوي على مشغل سري (كلمة/نمط نادر، مثل
cf47xq) → مخرج ضار مطلوب. أثناء التدريب، تقوم descente de gradient بتعديل الأوزان لـربط المشغل بهذا السلوك. يبدو النموذج طبيعيًا… حتى يظهر المشغل في إدخال: تُفعَّل الـ backdoor. الدفاع: مصدر/تنظيف البيانات، اختبارات على مدخلات مشبوهة.Boîte noire : لا يملك المهاجم سوى الـ API (مدخلات/مخرجات)، بدون الأوزان — يجرب (jailbreaks، طلبات كثيفة، استخراج). Boîte blanche : يملك وصولًا إلى الأوزان والـ gradients (نموذج open-weights أو مسروق) → هجمات أقوى بكثير، محسوبة عبر الـ gradient، وfine-tuning malveillant لإزالة محاذاة الأمان. كلما كان الوصول أعمق، كانت الهجمة أدق.
ثلاثة أنماط: API في الوقت الفعلي (REST/gRPC)، أو دفعي (تسجيل دوري)، أو مدمج (edge/mobile). يتم إصدار الكود + البيانات + النموذج، وحاويته (Docker) ثم تعريضه خلف load balancer.
من ناحية النظام: زمن الاستجابة، الإنتاجية، الأخطاء. من ناحية الـ ML: data/concept drift، توزيع التوقعات، وخاصة المقاييس التجارية. يتم وضع تنبيهات ومشغل إعادة تدريب.
أتمتة الاختبارات → التدريب → التحقق → النشر. يُضاف إصدار البيانات (DVC) وسجل النماذج (MLflow) لتتبع كل إصدار ومقارنته وإجراء rollback عند حدوث تراجع.
بالإضافة إلى المقاييس غير المتصلة: shadow deployment (تشغيل النموذج دون تأثير)، ثم A/B test / canary للمقارنة على حركة مرور حقيقية. يُتحقق أيضاً من العدالة والمتانة وتكاليف الاستدلال.
لا توجد بطاقة مطابقة. جرّب كلمة مفتاحية أخرى.
PREMIUM
افتح وضع المقابلة الكامل
البطاقات أعلاه مجانية. أعضاء Premium يفتحون الترسانة الحقيقية للحصول على الوظيفة:
- حزمة موسّعة: SQL، System Design، أسئلة سلوكية/موارد بشرية
- أسئلة حقيقية حسب الشركة (FAANG والشركات الناشئة)
- ملف PDF قابل للتنزيل ومخصّص — راجع دون اتصال واطبعه
- وضع الاختبار: اختبر نفسك وتابع تقدّمك
أنشئ حسابك المجاني في 10 ثوانٍ
احفظ تقدّمك، استلم أسئلة جديدة كل أسبوع، وادخل إلى موارد حصرية للأعضاء. مجاناً، بدون بطاقة.
إنشاء حسابي المجانيعضو بالفعل؟ تسجيل الدخول
انتقل إلى المستوى التالي
حسابك المجاني مفعّل. افتح جميع البطاقات المميّزة والمسارات الموجّهة وملفات PDF مع الاشتراك.
اكتشف Premium — 9 $/شهرشكراً لكونك عضواً Premium 💚
لديك وصول إلى كل شيء. أفضل مساعدة ممكنة: شارك هذا المورد مع شبكتك.
الذهاب إلى محتواي Premiumهل يساعدك هذا المحتوى؟ شاركه 🚀
مشاركة واحدة = عشرات الأشخاص يكتشفون هذا المورد. شكراً!
للتعمّق أكثر
كل مفهوم أعلاه مشروح خطوة بخطوة في دوراتنا وموسوعتنا — من المبتدئ إلى الخبير.
شاهد دورات الذكاء الاصطناعي وتعلّم الآلة افتح الموسوعة