الذكاء الاصطناعي التوليدي

كيف تعمل نماذج Generative AI؟

📚 Generative AI Complete Learning Path — الدرس 2 من 5

كيف تعمل نماذج Generative AI من الداخل؟

في الدرس الأول فهمنا ما هو Generative AI. الآن نذهب إلى الداخل: كيف يفهم النموذج النص؟ كيف يتعلم؟ كيف يُنشئ الإجابة؟ وما الذي يجعل هذه النماذج تحتاج لقدرات حوسبة هائلة؟ هذا الدرس يُجيب على هذه الأسئلة بأسلوب واضح، دون الحاجة لخلفية رياضية أو تقنية.

المستوى: مبتدئ إلى متوسط
وقت القراءة: ~30 دقيقة
المتطلبات: الدرس 1
اللغة: عربي

🎯 ما الذي ستتعلمه في هذا الدرس؟

  • ما هي الشبكة العصبية الاصطناعية (Neural Network)؟
  • ما هو التعلم العميق (Deep Learning) وكيف يختلف عن Machine Learning العادي؟
  • ما هو Transformer ولماذا أحدث ثورة في الذكاء الاصطناعي؟
  • ما هو Token وكيف يُفكّك النموذج النص؟
  • ما هو Embedding وكيف يُمثّل المعنى رياضياً؟
  • ما هو LLM وكيف يختلف عن Generative AI العام؟
  • ما هي المعاملات (Parameters) وماذا تعني في سياق حجم النموذج؟
  • متى نحتاج Fine-tuning ومتى يكفي Pre-training؟
  • لماذا تحتاج هذه النماذج إلى GPU وموارد حوسبة ضخمة؟

ما هي الشبكة العصبية الاصطناعية (Neural Network)؟

الشبكة العصبية الاصطناعية (Neural Network) هي نظام حوسبي مستوحى من بنية الدماغ البشري — لكنها لا تُقلّده بالكامل، بل تستعير منه فكرة مركزية: معالجة المعلومات عبر طبقات متعددة من الوحدات المترابطة.

كل وحدة في الشبكة تُسمى "عصبوناً اصطناعياً" (Neuron). يتلقى كل عصبون مُدخلات، يُجري عليها عملية رياضية بسيطة، ثم يُمرّر النتيجة للعصبونات التالية. تُشكّل هذه الوحدات مجتمعةً طبقات متسلسلة تمر من خلالها البيانات.

Diagram 1: Neural Network Layers Alt: "رسم توضيحي لشبكة عصبية اصطناعية يُظهر طبقة الإدخال والطبقات الوسطى وطبقة الإخراج" File: neural-network-layers-ar.webp
تشبيه مبسط
تخيّل خط إنتاج في مصنع. المادة الخام تدخل من طرف، وتمر عبر محطات متعاقبة — كل محطة تُجري عليها تعديلاً — حتى يخرج المنتج النهائي من الطرف الآخر. الشبكة العصبية تعمل بالمنطق ذاته، لكن بدل مواد خام، يمر النص أو الصورة عبر طبقات رياضية.

ما يُميّز هذه الشبكات هو قدرتها على التعلم: عندما تُخطئ الشبكة في توقّع مخرج، يتم ضبط قوة الاتصالات بين العصبونات تلقائياً حتى تتحسّن الدقة. هذا يحدث ملايين المرات خلال التدريب.

ما هو التعلم العميق (Deep Learning)؟

التعلم العميق (Deep Learning) هو تطبيق شبكات عصبية عميقة — أي شبكات تحتوي على عدد كبير من الطبقات المتراكبة. "العمق" هنا يقصد به عمق البنية، ليس تعقيد المفهوم.

ما الذي يمنحه هذا العمق؟ القدرة على تعلّم أنماط معقدة جداً لا يمكن التعبير عنها بقواعد يدوية. في الشبكات الضحلة (Shallow Networks)، كل شيء يجب أن يُبرمج صراحةً. في Deep Learning، تكتشف الشبكة الأنماط بنفسها — حتى تلك التي لم يتوقعها المصممون.

مفهوم مهم
Machine Learning التقليدي يعتمد كثيراً على البشر لاستخراج الميزات المهمة من البيانات يدوياً. Deep Learning يمكنه استخراج هذه الميزات تلقائياً عبر طبقاته المتعددة — وهذا ما جعله متفوقاً في مهام كالتعرف على الصور وفهم اللغة.

ما هو Transformer ولماذا هو مهم جداً؟

Transformer هو نوع محدد من بنى الشبكات العصبية طُوِّر عام 2017 في ورقة بحثية شهيرة بعنوان "Attention is All You Need" نشرتها Google. منذ ذلك الحين، أصبح الأساس الذي تقوم عليه كل نماذج Generative AI الكبيرة مثل GPT وGemini وClaude وLlama.

ما الذي يجعل Transformer مختلفاً؟

المشكلة التي حلّها Transformer: كيف يفهم النموذج العلاقات بين الكلمات البعيدة عن بعضها في الجملة؟

مثال: في جملة "البنك الذي بنيته من الحجارة صغير جداً" — كلمة "بنيته" تعود على "البنك" لكنهما متباعدتان. النماذج القديمة كانت تُعاني في فهم هذا النوع من الروابط. Transformer حلّ هذه المشكلة عبر آلية تُسمى Self-Attention.

ما هي آلية Self-Attention؟

Self-Attention هي آلية تساعد النموذج على تحديد أيّ الكلمات أكثر أهمية عند معالجة كل كلمة في الجملة. عند معالجة كلمة معينة، "ينظر" النموذج إلى جميع الكلمات الأخرى ويُحدّد درجة ارتباط كل منها بها.

تشبيه
تخيّل مترجماً يقرأ جملة كاملة قبل ترجمتها. لا يترجم كلمة بكلمة، بل يفهم كيف تؤثر كل كلمة على معنى البقية. هذا ما تفعله آلية Self-Attention — لكنها تفعله رياضياً لكل كلمة في آنٍ واحد.

النتيجة: نماذج Transformer تفهم السياق الطويل والعلاقات المعقدة في النص أفضل بكثير من أي بنية سبقتها.

ما هو Token وكيف يُفكّك النموذج النص؟

النماذج لا تقرأ النص كما يقرأه الإنسان — حرفاً بحرف أو كلمةً بكلمة. بدلاً من ذلك، تُقسّمه إلى وحدات أصغر تُسمى Tokens.

Token قد يكون:

  • كلمة كاملة مثل: "الذكاء"
  • جزء من كلمة مثل: "اصط" + "ناعي"
  • علامة ترقيم مثل: "." أو "،"
  • مسافة + كلمة مجتمعتين

مثال توضيحي: جملة "Generative AI is powerful" قد تُقسَّم إلى:

Generative AI is powerful
لماذا Tokens مهمة؟
معظم النماذج لها حد أقصى لعدد الـTokens التي يمكنها معالجتها في مرة واحدة — يُسمى هذا حجم السياق (Context Window). كلما كان Context Window أكبر، استطاع النموذج تذكّر محادثة أطول أو تحليل وثيقة أكبر. مثلاً، Gemini 1.5 Pro يدعم ملايين الـTokens، مما يُتيح له تحليل كتاب كامل في مرة واحدة.

ما هو Embedding؟ كيف يُمثّل النموذج المعنى رياضياً؟

الكمبيوتر لا يفهم الكلمات كما يفهمها الإنسان. لكي يعالج النموذج النص، يحوّل كل Token إلى متجه رقمي (Vector) يُسمى Embedding.

الفكرة الجوهرية في Embeddings: الكلمات ذات المعنى المتقارب تكون متجهاتها متقاربة في الفضاء الرياضي. فمثلاً، "ملك" و"رئيس" سيكونان أقرب إلى بعضهما من "ملك" و"تفاحة".

مفهوم رائع
في بعض النماذج القديمة، لو أخذت Embedding لكلمة "ملك" وطرحت منها Embedding كلمة "رجل" وأضفت Embedding كلمة "امرأة"، حصلت على Embedding قريب جداً من كلمة "ملكة". هذا يُظهر كيف تُشفّر النماذج العلاقات المفاهيمية رياضياً.

في نماذج Generative AI الحديثة، لا يُمثّل Embedding الكلمات فقط، بل يُمثّل الجمل والفقرات والمفاهيم بأكملها — مما يُتيح مقارنة المعاني بدقة عالية. وهذا أساس تقنية RAG (Retrieval-Augmented Generation) التي سنشرحها في الدرس الخامس.

ما هو السياق (Context) في نماذج اللغة؟

السياق (Context) هو كل ما يراه النموذج عند توليد الإجابة — المحادثة السابقة، التعليمات، الوثائق المرفقة، والسؤال الحالي.

النموذج لا يملك "ذاكرة" بالمعنى الإنساني. في كل مرة يُولّد فيها استجابة، ينظر إلى كل ما في نافذة السياق (Context Window)، ويُنشئ الرد بناءً على هذه المعلومات كلها.

مثال عملي

عندما تُحدّث ChatGPT بسؤال، ثم تُتابع بسؤال لاحق مرتبط بالأول — النموذج يستطيع الإجابة بشكل متسق لأن المحادثة كلها موجودة في Context Window حتى اللحظة. لكن لو تجاوزت المحادثة حجم السياق الأقصى، سيبدأ النموذج في "نسيان" أجزاء من البداية.

كيف يتوقع النموذج الكلمة التالية؟

جوهر كيفية عمل نماذج اللغة يعتمد على مبدأ واحد: توقّع الـToken التالي.

عند توليد الإجابة، يبدأ النموذج من نقطة الصفر. يأخذ كل ما في نافذة السياق، يعالجه عبر طبقات الـ Transformer، ثم يُنشئ توزيعاً احتمالياً على كل الـTokens الممكنة في اللغة. ثم يختار الـToken ذو الاحتمالية الأعلى (أو يُضيف عشوائية محكومة لتنوع الإجابات) ويُضيفه للسياق، ثم يُكرر العملية مع الـToken التالي — وهكذا حتى اكتمال الإجابة.

السياق الحالي
Transformer يُعالج
توزيع احتمالي
Token جديد
يُضاف للسياق
تكرار
ملاحظة مهمة
النموذج لا يُفكّر بالمعنى الإنساني. هو يُجري عمليات رياضية معقدة جداً على الـTokens لإنتاج المخرج الأكثر ملاءمةً. ما يبدو أنه "فهم" هو في الواقع أنماط إحصائية دقيقة تعلّمها النموذج من مليارات النصوص. النتائج قد تبدو مذهلة — وهي كذلك من الناحية الهندسية — لكن الآلية تختلف جوهرياً عن الفهم البشري.

ما هو LLM والفرق بينه وبين Generative AI العام؟

LLM اختصار لـ Large Language Model أي نموذج لغوي كبير. هو نوع محدد من نماذج Generative AI يُركّز على معالجة اللغة البشرية — قراءتها وفهمها وإنشاؤها.

الجانب Generative AI العام LLM
النطاق أشمل — يشمل النصوص والصور والصوت والفيديو أضيق — متخصص في اللغة النصية
أمثلة DALL·E (صور)، Sora (فيديو)، Whisper (صوت) GPT-4، Gemini، Claude، Llama
مدخلاته الأساسية يتنوع حسب النوع نص أساساً (مع بعض النماذج متعددة الوسائط)
الاستخدام الشائع إنشاء محتوى متنوع محادثة، تلخيص، تحليل، كتابة كود

كل LLM هو نوع من Generative AI، لكن ليس كل Generative AI هو LLM. مثلاً، DALL·E يُولّد صوراً — وهو Generative AI لكنه ليس LLM.

ما هي المعاملات (Parameters)؟

المعاملات (Parameters) هي الأرقام التي تُحدّد سلوك النموذج — وهي ما يتعلّمه النموذج خلال التدريب. فكّر فيها كـ"إعدادات دقيقة" مليارية تحدد كيف يتعامل النموذج مع كل Tokenو علاقته بالآخرين.

النماذج الكبيرة تحتوي على مئات المليارات من المعاملات:

  • GPT-3: ~175 مليار معامل
  • نماذج GPT-4 وما يليها: تحتوي على تريليونات المعاملات وفق بعض التقديرات
  • نماذج مفتوحة المصدر مثل Llama: تتراوح من 7 مليار إلى 70+ مليار معامل
هل أكثر معاملات يعني دائماً نموذجاً أفضل؟
ليس بالضرورة. جودة بيانات التدريب وتقنيات التدريب والبنية المعمارية تُؤثر بشكل كبير على الأداء. بعض النماذج الأصغر تتفوق على نماذج أكبر منها في مهام محددة.

Pre-training وFine-tuning — ما الفرق؟

Pre-training (التدريب المسبق)

هو مرحلة التدريب الأولى والكبرى — حيث يتعلم النموذج من كميات ضخمة جداً من البيانات العامة. هذه المرحلة تستغرق أسابيع أو أشهراً، وتكلّف ملايين الدولارات، وتحتاج آلاف الـGPUs. الهدف: بناء نموذج عام يفهم اللغة ويعرف الكثير عن العالم.

Fine-tuning (الضبط الدقيق)

بعد Pre-training، يمكن أخذ النموذج وتدريبه إضافياً على بيانات متخصصة لتحسين أدائه في مجال معين. مثلاً:

  • Fine-tuning على بيانات قانونية → نموذج متخصص في الاستشارات القانونية
  • Fine-tuning على محادثات خدمة العملاء → روبوت محادثة أكثر تخصصاً
  • Fine-tuning على كود برمجي → نموذج أفضل في البرمجة
متى نحتاج Fine-tuning؟
في كثير من الحالات، Prompt Engineering الجيد (الدرس الثالث) يُغني عن Fine-tuning. Fine-tuning مفيد عندما تحتاج النموذج لأسلوب أو مصطلحات متخصصة جداً، أو عندما تريد تحسين الأداء على مهمة بعينها بكفاءة عالية. سنتناول هذا بالتفصيل في الدرس الخامس.

ما دور GPU ولماذا تحتاج النماذج موارد حوسبة ضخمة؟

GPU اختصار لـ Graphics Processing Unit — بطاقة معالجة الرسومات. رُصدت أصلاً لمعالجة الرسومات في الألعاب، لكنها أصبحت العمود الفقري لتدريب نماذج الذكاء الاصطناعي.

لماذا GPU وليس CPU العادي؟

CPU تُعالج عمليات معقدة بالتسلسل — واحدة تلو الأخرى — وهي رائعة في المهام المعقدة المتسلسلة. GPU تُعالج آلاف العمليات البسيطة في آنٍ واحد — وهو بالضبط ما تحتاجه العمليات الرياضية لتدريب الشبكات العصبية.

الجانب CPU GPU
عدد النوى الحسابية 8–64 نواة عادةً آلاف النوى (NVIDIA H100: ~16,000 نواة)
نوع العمليات معقدة ومتسلسلة بسيطة ومتوازية
الاستخدام في AI التحكم العام وتنسيق العمليات تدريب وتشغيل النماذج الكبيرة

لماذا تكلفة التدريب مرتفعة جداً؟

تدريب نموذج كبير مثل GPT-4 يحتاج إلى:

  • آلاف الـGPUs تعمل في الوقت ذاته
  • أسابيع أو أشهراً من التشغيل المستمر
  • استهلاك طاقة كهربائية هائل
  • بنية تحتية سحابية (Cloud) متطورة

لذلك لا تستطيع إلا شركات كبرى مثل OpenAI وGoogle وMicrosoft وMeta تدريب هذه النماذج من الصفر. لكن الاستخدام (Inference) أرخص بكثير — وهو ما يدفعه المستخدمون في الاشتراكات الشهرية.

مثال واقعي مبسط

كيف يُولّد النموذج إجابة على سؤالك؟

أنت تكتب: "ما هي عاصمة الإمارات؟"

  1. النص يُحوَّل إلى Tokens
  2. كل Token يُحوَّل إلى Embedding (متجه رقمي)
  3. تمر الـEmbeddings عبر طبقات الـTransformer التي تُحلل العلاقات بين الـTokens
  4. ينتج النموذج توزيعاً احتمالياً: "أبوظبي" الأعلى احتمالية، ثم "دبي"، إلخ
  5. يُختار "أبوظبي" ويُضاف للسياق
  6. تتكرر العملية لتوليد بقية الإجابة

كل هذا يحدث في أجزاء من الثانية — بفضل المعالجة المتوازية على GPU.

تمرين عملي

استكشاف Tokens

زر أداة Tokenizer التفاعلية من OpenAI على: platform.openai.com/tokenizer

أدخل جملة عربية وانظر كيف تُقسَّم إلى Tokens. ستلاحظ أن الكلمات الطويلة أو النادرة تُقسَّم إلى أجزاء أصغر. هذا يُساعدك على فهم لماذا يُحسب حجم السياق بالـTokens وليس بالكلمات.

✅ أهم ما تعلمته في هذا الدرس

  • الشبكات العصبية تعالج البيانات عبر طبقات متعددة وتتعلم من الأخطاء
  • Transformer هو البنية الجوهرية لنماذج Generative AI الحديثة — وآلية Self-Attention هي سرّها
  • Tokens هي الوحدات الأساسية التي يُعالجها النموذج، وليست كلمات بالضرورة
  • Embeddings تُحوّل المعنى إلى أرقام يُمكن للنموذج معالجتها ومقارنتها
  • السياق (Context Window) هو كل ما يراه النموذج عند توليد الإجابة
  • LLM هو نوع من Generative AI متخصص في اللغة
  • Parameters هي ما يتعلمه النموذج — كلما كانت الجودة أفضل، كان الأداء أعلى
  • Pre-training يبني القدرة العامة؛ Fine-tuning يُخصّصها لمجال معين
  • GPU ضروري لمعالجة العمليات الرياضية المتوازية في تدريب النماذج

⚠️ أخطاء شائعة

  • الاعتقاد بأن النموذج "يعرف" بمعنى التخزين: النموذج لا يحتوي على قاعدة بيانات — بل أنماط مُشفّرة في معاملاته
  • الخلط بين LLM وGenerative AI: LLM متخصص في اللغة؛ Generative AI أشمل منه
  • الاعتقاد بأن أكثر Parameters يعني دائماً أفضل: جودة البيانات والتدريب أهم
  • ظن أن Fine-tuning حل لكل مشكلة: أحياناً Prompt Engineering الجيد أكثر كفاءة وأقل تكلفة

قاموس المصطلحات

المصطلح الإنجليزي العربي الشرح المختصر
Neural Network شبكة عصبية اصطناعية نظام حوسبي يعالج البيانات عبر طبقات من الوحدات الرياضية
Deep Learning التعلم العميق شبكات عصبية عميقة (متعددة الطبقات) لتعلم أنماط معقدة
Transformer محوّل بنية الشبكة العصبية التي تُشكّل أساس النماذج الكبيرة الحديثة
Self-Attention الانتباه الذاتي آلية تُساعد النموذج على فهم العلاقات بين الكلمات في الجملة
Token رمز / وحدة نصية الوحدة الأصغر التي يُقسَّم إليها النص لمعالجته
Embedding تضمين تمثيل رقمي (متجه) للكلمة أو المفهوم يُعبّر عن معناه
Context Window نافذة السياق الحد الأقصى من الـTokens التي يمكن للنموذج معالجتها في مرة واحدة
LLM نموذج لغوي كبير نوع من Generative AI متخصص في معالجة اللغة البشرية
Parameters معاملات الأرقام التي يتعلمها النموذج خلال التدريب وتُحدّد سلوكه
Pre-training التدريب المسبق التدريب الأولي على بيانات ضخمة عامة لبناء قدرات عامة
Fine-tuning الضبط الدقيق تدريب إضافي على بيانات متخصصة لتحسين الأداء في مجال معين
GPU وحدة معالجة الرسومات معالج متخصص قادر على تنفيذ آلاف العمليات الرياضية البسيطة في آنٍ واحد

اختبار الدرس الثاني

سؤال 1 — اختيار من متعدد
ما الذي يُميّز Transformer عن بنى الشبكات العصبية السابقة؟
  • يستخدم طبقات أقل مما كانت عليه النماذج السابقة
  • آلية Self-Attention تُساعده على فهم العلاقات بين الكلمات البعيدة
  • لا يحتاج إلى GPU للتدريب
  • يعمل فقط مع اللغة الإنجليزية
سؤال 2 — صح أو خطأ
كل LLM هو نوع من Generative AI، لكن ليس كل Generative AI هو LLM.
  • صح
  • خطأ
سؤال 3 — اختيار من متعدد
لماذا تُستخدم GPU وليس CPU في تدريب نماذج الذكاء الاصطناعي؟
  • لأن GPU أسرع في المعالجة التسلسلية
  • لأن GPU قادرة على معالجة آلاف العمليات البسيطة في وقت واحد
  • لأن CPU لا يدعم اللغة العربية
  • لأن GPU أرخص دائماً
سؤال 4 — إجابة قصيرة
ما الفرق بين Pre-training وFine-tuning؟
سؤال 5 — اختيار من متعدد
ما وظيفة Embedding في نماذج اللغة؟
  • تخزين الكلمات في قاعدة بيانات
  • تحويل الكلمات والمفاهيم إلى متجهات رقمية تُعبّر عن معناها
  • ترجمة النص بين اللغات
  • تقليل حجم النموذج
عرض الإجابات
1. الخيار الثاني: آلية Self-Attention
2. صح — LLM متخصص في اللغة وهو نوع من Generative AI الأشمل
3. الخيار الثاني: معالجة آلاف العمليات في آنٍ واحد
4. مثال على إجابة مقبولة: Pre-training هو التدريب الأولي على بيانات ضخمة عامة. Fine-tuning هو تدريب إضافي على بيانات متخصصة لتحسين الأداء في مجال بعينه.
5. الخيار الثاني: تحويل الكلمات إلى متجهات رقمية تُعبّر عن المعنى

أسئلة شائعة

ما هو LLM بكلمات بسيطة؟
LLM أو نموذج لغوي كبير هو نوع من نماذج Generative AI تعلّم من كميات ضخمة من النصوص، وأصبح قادراً على فهم اللغة البشرية وإنشاء نصوص جديدة. أمثلة: GPT-4، Gemini، Claude.
هل النموذج يتعلم من المحادثات التي أجريتها معه؟
في الغالب لا، للإصدارات القياسية. محادثاتك موجودة في Context Window أثناء الجلسة فقط. النموذج لا يتدرب من جديد على محادثاتك الفردية إلا في حالات محددة عبر برامج تحسين الجودة التي تشترك فيها بموافقة صريحة.
ما المقصود بحجم النموذج؟
يُقاس حجم النموذج عادةً بعدد معاملاته (Parameters). نموذج بـ7 مليار معامل أصغر من نموذج بـ70 مليار معامل. النماذج الأكبر تحتاج موارد أكثر لكنها لا تكون دائماً الأفضل في كل المهام.
هل يمكنني تشغيل نموذج AI على جهازي الشخصي؟
نعم، للنماذج الأصغر. هناك نماذج مفتوحة المصدر مثل Llama و Mistral يمكن تشغيلها على أجهزة بمواصفات جيدة. لكن النماذج الكبيرة مثل GPT-4 تحتاج بنية تحتية سحابية ضخمة.

الدرس التالي: Prompt Engineering

الآن بعد أن فهمت كيف يعمل النموذج من الداخل، سنتعلم كيف نتحدث معه بفاعلية. الدرس الثالث يُغطي فن صياغة الأوامر (Prompt Engineering) بأساليب تُعطيك إجابات أدق وأكثر فائدة.

الدرس 3: Prompt Engineering ←