دليل عملي لنماذج اللغة الكبيرة: من الضبط الدقيق إلى RAG والوكلاء
أصدرت جامعة جياو تونغ في شنغهاي (SJTU) دورة مفتوحة بعنوان "Dive into LLMs" (动手学大模型) — دليل خطوة بخطوة للعمل مع نماذج اللغة الكبيرة: من الضبط الدقيق (fine-tuning) ونماذج RAG إلى بناء الوكلاء والأمان. تستند المادة إلى محاضرات معالجة اللغة الطبيعية وأمان الذكاء الاصطناعي التي تُدرّس في كلية علوم الحاسوب، وتضم دفاتر Jupyter جاهزة للتشغيل لكل مرحلة — من إعداد البيئة إلى تقنيات متقدمة مثل محاذاة RLHF وتقنية الاستeganography في التوليد.
ما بداخل الدورة
تنقسم الدورة إلى 11 فصلاً مستقلاً، كل منها دفتر ملاحظات منفصل مع كود وشرحات. تغطي الوحدات التمهيدية البنية التحتية الأساسية: تحميل النماذج عبر Hugging Face Transformers، الخدمة الفعالة على vLLM، استدعاء واجهات برمجة تطبيقات LLM السحابية. تليها كتل عملية: هندسة المحفزات (prompt engineering) مع قوالب للدردشة والتلخيص واستخراج الحقائق؛ ضبط LoRA/QLoRA لنموذج 4B على أجهزة المستهلك؛ بناء خط أنابيب RAG مع قواعد بيانات المتجهات (Milvus، Chroma، FAISS) وأجهزة إعادة الترتيب؛ تطوير الوكلاء على LangChain/LangGraph مع الأدوات والذاكرة وبروتوكول MCP.
مواضيع متقدمة: الأمان والقدرات الخفية
فصول مخصصة لمواضيع نادرة في الدروس الأساسية: تعديل معرفة النموذج دون إعادة تدريب، الدفاع ضد كسر الحماية وحقن المحفزات، العلامات المائية في النص المولد، الاستeganography — تضمين علامات غير مرئية في مخرجات النموذج، محاذاة RLHF باستخدام PPO. تعمل جميع الدفاتر على RTX 4090 واحدة (24 جيجابايت VRAM) أو في بيئات سحابية مجانية مثل AutoDL / CodeWithGPU.
كيف تبدأ
مستودع GitHub: Lordog/dive-into-llms (أكثر من 50 ألف نجمة). استنسخ، اختر الفصل الذي يهمك وشغل خلايا الدفتر بالترتيب. لفصول الضبط الدقيق و RAG ستحتاج GPU — يحتوي ملف README على روابط لصور Docker جاهزة وتعليمات لاستئجار مثيلات رخيصة. الدورة مجانية بالكامل، مرخصة تحت Apache-2.0، وطلبات السحب (PRs) مع الإصلاحات والمواضيع الجديدة مرحب بها.
المصدر: GitHub — سلسلة "动手学大模型"
