الأسس الرياضية

نظرية المعلومات للذكاء الاصطناعي

نظرية المعلومات للذكاء الاصطناعي | الدرس الرابع — دليل مجاني
Lesson 4 · AI Engineering Foundations

نظرية المعلومات للذكاء الاصطناعي

لماذا Cross-Entropy هي خسارة التصنيف؟ وما معنى Perplexity لنماذج اللغة؟ هذا الدرس يشرح الإنتروبيا وتباعد KL والمعلومات المتبادلة Softmax — بلغة عملية تربط Shannon بشبكاتك العصبية.

14 محورًا
متوسط → تطبيقي
معادلات + رسوم
خسارة ولغة
00 نظرة عامة

لماذا نظرية المعلومات أساس هندسة الذكاء الاصطناعي؟

بعد أن تعلّمت في الدرس الثالث الاحتمالات ودوال الخسارة، حان وقت السؤال الأعمق: لماذا Cross-Entropy؟ نظرية المعلومات (Information Theory) — التي أسّسها Shannon — تقيس «كمية المفاجأة» في رسالة أو تنبؤ. في التعلم العميق تظهر في كل مكان: خسارة التصنيف، تقييم LLMs، تنظيم VAEs، واختيار الميزات.

الإنتروبيا — كم بتًا تحتاج لوصف عشوائية التوزيع؟
Cross-Entropy — كم تكلفة استخدام توزيع خاطئ للترميز؟
KL Divergence — ما مدى ابتعاد \(Q\) عن \(P\)؟
Mutual Information — كم معلومة يشترك فيها \(X\) و\(Y\)؟
من الاحتمال إلى الخسارة عبر نظرية المعلومات P(y|x) احتمال حقيقي H / H(P,Q) إنتروبيا Loss −log Softmax تدريب نفس الرياضيات تربط Shannon بـ PyTorch CrossEntropyLoss
نظرية المعلومات هي الجسر بين الاحتمالات ودوال الخسارة في الشبكات العصبية
متطلب سابق

يفترض هذا الدرس فهم الاحتمال الشرطي، Softmax كمخرجات احتمالية، ومتوسط الخسارة من الدرس الثالث. المستوى: متوسط.

01 الأساسيات

المعلومات الذاتية / المفاجأة (Self-Information)

المعلومات الذاتية \(I(x)\) تقيس كم «مفاجأة» يحمل حدث باحتمال \(p(x)\). الحدث النادر أكثر إفادةً (ومفاجأة) من الحدث الشائع.

التعريف

\[I(x) = -\log p(x)\]

إذا \(p(x)=1\) (مؤكد) فإن \(I(x)=0\). إذا \(p(x)\to 0\) فإن \(I(x)\to\infty\).

مثال محلول

رمي عملة عادلة: \(p=\tfrac{1}{2}\) ⇒ \(I = -\log_2(0.5) = 1\) بت. رمي نرد سداسي: \(I = -\log_2(1/6)\approx 2.585\) بت — أكثر مفاجأة.

صلة بالذكاء الاصطناعي

خسارة \(-\log\hat{y}_{y}\) لعينة مصنَّفة بشكل صحيح هي بالضبط المعلومات الذاتية للتنبؤ. النموذج الذي يعطي احتمالًا صغيرًا للصنف الصحيح يُعاقَب بشدة.

02 الإنتروبيا

الإنتروبيا (Entropy)

الإنتروبيا \(H(X)\) هي متوسط المعلومات الذاتية — مقياس عدم اليقين في التوزيع كاملًا.

صيغة Shannon

\[H(X) = -\sum_x p(x)\log p(x) = \mathbb{E}_{x\sim p}\bigl[-\log p(x)\bigr]\]

للمتصل: \(H(X)=-\int p(x)\log p(x)\,dx\) (إنتروبيا تفاضلية).

خصائص مهمة

  • \(H(X)\ge 0\) للتوزيعات المنفصلة، وتساوي 0 فقط إذا كان التوزيع حتميًا (Dirac)
  • للتوزيع المنتظم على \(K\) أصناف: \(H=\log K\) — أقصى إنتروبيا
  • التوزيع الأكثر تركزًا ⇒ إنتروبيا أصغر
حتمي — H≈0 منتظم — H=log K الإنتروبيا ترتفع كلما تساوت الاحتمالات
توزيع حتمي مقابل منتظم: الإنتروبيا تقيس «الانتشار»

حساب يدوي سريع

توزيع ثنائي

لتوزيع Bernoulli باحتمال نجاح \(p\): \(H = -p\log p -(1-p)\log(1-p)\). عند \(p=0.5\) نحصل على \(1\) بت (أقصى قيمة). عند \(p=0.9\): \(H\approx 0.469\) بت — أقل عدم يقين.

ربط بالتصنيف

نموذج واثق جدًا (\(\hat{y}\) حاد) له إنتروبيا تنبؤ منخفضة. النموذج المرتبك (قريب من المنتظم) له إنتروبيا عالية — وقد تحتاج معايرة (temperature scaling) قبل النشر.

03 الإنتروبيا

الإنتروبيا المشتركة والشرطية

المشتركة \(H(X,Y)\) تقيس عدم اليقين في الزوج \((X,Y)\). الشرطية \(H(Y|X)\) تقيس ما يبقى من عدم يقين حول \(Y\) بعد معرفة \(X\).

العلاقات الأساسية

\[H(X,Y) = -\sum_{x,y} p(x,y)\log p(x,y)\]

\[H(Y|X) = H(X,Y) - H(X) = \mathbb{E}_{x\sim p}\bigl[H(Y|X=x)\bigr]\]

قاعدة السلسلة: \(H(X,Y)=H(X)+H(Y|X)=H(Y)+H(X|Y)\).

\(H(Y|X)=0\) — \(Y\) دالة حتمية من \(X\)
\(H(Y|X)=H(Y)\) — استقلال تام
\(H(X,Y)\le H(X)+H(Y)\) — المساواة عند الاستقلال
\(H(Y|X)\le H(Y)\) — المعرفة لا تزيد الإنتروبيا
صلة بالذكاء الاصطناعي

في نماذج اللغة: \(H(w_t|w_{<t})\) هو عدم اليقين حول الرمز التالي بعد السياق — وهذا أساس Perplexity لاحقًا.

04 الخسارة

الإنتروبيا المتقاطعة (Cross-Entropy)

الإنتروبيا المتقاطعة \(H(P,Q)\) تقيس متوسط عدد البتات اللازمة لترميز عينات من \(P\) باستخدام شفرة مثالية لـ \(Q\).

التعريف

\[H(P,Q) = -\sum_x p(x)\log q(x) = \mathbb{E}_{x\sim P}\bigl[-\log q(x)\bigr]\]

دائمًا \(H(P,Q) \ge H(P)\)، والمساواة فقط عندما \(P=Q\).

مثال تصنيف

صنف صحيح one-hot: \(p=[0,1,0]\). النموذج يتوقع \(q=[0.1,0.7,0.2]\). إذن \(H(P,Q)=-\log 0.7\approx 0.357\) nat. لو توقّع \(0.2\) فقط للصنف الصحيح: \(-\log 0.2\approx 1.61\) — خسارة أعلى بكثير.

في PyTorch / TensorFlow

nn.CrossEntropyLoss = Softmax + \(-\log q_{y}\) على اللوجيتات. هذا هو \(H(P,Q)\) عندما يكون \(P\) one-hot.

لماذا لا نُصغّر الإنتروبيا وحدها؟

تدريب التصنيف لا يُصغّر \(H(P)\) (ثابتة للتسميات)، بل يُصغّر \(H(P,Q)\) أي يدفع \(Q\) نحو \(P\). ومن العلاقة \(H(P,Q)=H(P)+D_{\mathrm{KL}}(P\|Q)\) نرى أن تصغير Cross-Entropy = تصغير KL نحو التسميات.

الخسارةالهدف المعلوماتيملاحظة
CE متعددة الأصناف\(H(P,Q)\)\(P\) one-hot عادة
Label smoothing\(H(P_\epsilon,Q)\)\(P_\epsilon\) ليّن يمنع ثقة زائدة
Focal lossCE مرجّحةتركّز على الأمثلة الصعبة
05 المقارنة

تباعد كولباك–ليبلر (KL Divergence)

تباعد KL يقيس كم «معلومة إضافية» تحتاج عندما تستخدم \(Q\) بدل \(P\). ليس مسافة بالمعنى الهندسي (غير متماثل!).

التعريف والعلاقة

\[D_{\mathrm{KL}}(P\|Q) = \sum_x p(x)\log\frac{p(x)}{q(x)} = H(P,Q) - H(P)\]

\[D_{\mathrm{KL}}(P\|Q)\ge 0,\quad =0 \iff P=Q\]

اتجاهان مهمان في الذكاء الاصطناعي

الاتجاهالمعنىأين يظهر
\(D_{\mathrm{KL}}(P\|Q)\)فرض تغطية دعم \(P\)تقطير المعرفة، بعض الـ RL
\(D_{\mathrm{KL}}(Q\|P)\)وضع الكتلة حيث \(P\) كبيرVAEs (تقريب خلفي)
JS / Wassersteinبدائل متماثلة/هندسيةGANs
P Q KL(P∥Q) ≠ KL(Q∥P) غير متماثل — اختر الاتجاه بحذر H(P,Q) = H(P) + KL(P∥Q)
KL يقيس «المسافة المعلوماتية» بين توزيعين — لكنه غير متماثل

KL في ELBO للـ VAE

الحد الأدنى للأدلة

\[\mathcal{L} = \mathbb{E}_{q(z|x)}[\log p(x|z)] - D_{\mathrm{KL}}\bigl(q(z|x)\,\|\,p(z)\bigr)\]

الحد الأول يشجّع إعادة البناء؛ حد KL يدفع الخلفية التقريبية \(q\) نحو السابق \(p(z)\) (غالبًا \(\mathcal{N}(0,I)\)). بدون KL ينهار الفضاء الكامن.

تحذير عملي

وزن KL (\(\beta\)-VAE) يتحكم في المفاضلة. \(\beta\) كبير جدًا ⇒ تمثيل غير مُعبّر؛ صغير جدًا ⇒ تجاهل السابق.

06 الارتباط

المعلومات المتبادلة (Mutual Information)

المعلومات المتبادلة \(I(X;Y)\) تقيس كم معلومة عن \(Y\) تحصل عليها بمعرفة \(X\) (والعكس).

تعريفات مكافئة

\[I(X;Y) = H(X) - H(X|Y) = H(Y) - H(Y|X) = H(X)+H(Y)-H(X,Y)\]

\[I(X;Y) = D_{\mathrm{KL}}\bigl(p(x,y)\,\|\,p(x)p(y)\bigr)\]

صلة بالذكاء الاصطناعي

اختيار الميزات: اختر \(X\) الذي يعظّم \(I(X;Y)\) مع التسمية. في التمثيلات: نريد تمثيلًا \(Z\) غنيًا عن المهمة (\(I(Z;Y)\) كبير) ومضغوطًا عن الإدخال (\(I(Z;X)\) محدود) — فكرة Information Bottleneck.

07 Softmax

Softmax ومبدأ أقصى إنتروبيا

Softmax يحوّل لوجيتات \(z\in\mathbb{R}^K\) إلى توزيع احتمالي. وهو التوزيع ذو أقصى إنتروبيا تحت قيود على التوقعات (مبدأ MaxEnt).

الصيغة

\[\mathrm{softmax}(z)_i = \frac{e^{z_i}}{\sum_{j=1}^{K} e^{z_j}}\]

مع درجة حرارة \(T\): \(\mathrm{softmax}(z/T)\). \(T\to 0\) ⇒ توزيع حاد؛ \(T\to\infty\) ⇒ منتظم (أقصى إنتروبيا).

تصنيف — طبقة أخيرة Softmax + CE
انتباه — Softmax على درجات Attention
توليد — عيّنة من Softmax الرموز
تقطير — Softmax بدرجة حرارة عالية
08 نماذج اللغة

الحيرة Perplexity لنماذج اللغة

الحيرة (Perplexity) هي أُسّ الإنتروبيا المتقاطعة — مقياس بديهي: «كم خيارًا فعّالًا يحتار النموذج بينها؟»

التعريف

\[\mathrm{PPL} = \exp\bigl(H(P,Q)\bigr) = \exp\Bigl(-\frac{1}{N}\sum_{t=1}^{N}\log q(w_t\mid w_{<t})\Bigr)\]

PPL أقل ⇒ نموذج أفضل (على نفس مجموعة الاختبار ونفس الـ tokenizer).

تفسير بديهي

إذا كان متوسط \(-\log q = \ln 100\) فإن PPL \(=100\): كأن النموذج يختار بين 100 رمز متساوٍ في كل خطوة. نماذج اللغة الحديثة تهدف إلى PPL منخفضة جدًا على نصوص طبيعية.

مقارنة عادلة لـ Perplexity

  • نفس مجموعة الاختبار ونفس الـ tokenization ضروريان
  • Byte-level vs BPE يغيّران مقياس PPL جذريًا
  • بعض الأوراق تبلّغ bits-per-byte بدل PPL لتسهيل المقارنة
حساب مصغّر

جملة من 4 رموز باحتمالات نموذج \(0.5,0.25,0.5,0.25\). متوسط \(-\ln\): \(\tfrac{1}{4}(\ln2+\ln4+\ln2+\ln4)=\ln2\). إذن \(\mathrm{PPL}=e^{\ln 2}=2\).

09 الوحدات

Bits مقابل Nats

قاعدة اللوغاريتم تحدد وحدة القياس:

القاعدةالوحدةالاستخدام
\(\log_2\)بت (bit / shannon)ضغط، نظرية الاتصالات
\(\ln = \log_e\)نات (nat)التعلم الآلي، PyTorch
\(\log_{10}\)ديت / هارتلينادر في الذكاء الاصطناعي

التحويل: \(1\,\mathrm{nat} = \log_2 e \approx 1.443\) بت. في التدريب لا يهم الفرق طالما أنت متسق — التدرج يتأثر بعامل ثابت فقط.

10 الاشتقاق

اشتقاق خسارة Cross-Entropy من Softmax

لنموذج تصنيف بـ Softmax: \(\hat{y}_i = e^{z_i}/\sum_j e^{z_j}\)، والخسارة للعينة ذات الصنف الصحيح \(c\):

من اللوجيت إلى التدرج

\[L = -\log\hat{y}_c = -z_c + \log\sum_j e^{z_j}\]

\[\frac{\partial L}{\partial z_i} = \hat{y}_i - \mathbf{1}[i=c]\]

لماذا هذا أنيق؟

التدرج بسيط: خطأ الاحتمال \((\hat{y}-y)\). لا حاجة لاشتقاق Softmax و\(\log\) يدويًا في الكود — الإطار يدمجهما لاستقرار عددي (log_softmax).

استقرار عددي: log-sum-exp

خدعة شائعة

\[\log\sum_j e^{z_j} = m + \log\sum_j e^{z_j-m},\quad m=\max_j z_j\]

تمنعoverflow عند أسّ اللوجيتات الكبيرة. أطر التعلم العميق تطبقها داخل log_softmax.

مسار التدرج لـ Softmax+CE logits z softmax −log ŷ_c δ=ŷ−y الدمج يختصر المسار إلى خطأ احتمال بسيط
من اللوجيتات إلى تدرج مغلق الشكل دون بناء يعقوبي Softmax صراحة
11 التمثيلات

حدس عنق الزجاجة المعلوماتي (Information Bottleneck)

الفكرة: تعلّم تمثيل مضغوط \(Z\) من الإدخال \(X\) يحافظ على المعلومات المفيدة للمهمة \(Y\).

الهدف

\[\min_{p(z|x)}\; I(X;Z) - \beta\, I(Z;Y)\]

\(\beta\) يوازن بين الضغط والفائدة. في الشبكات العميقة، الطبقات العميقة تميل طبيعيًا لضغط التفاصيل غير المفيدة — تفسير IB شائع (مع جدل علمي).

12 التطبيقات

تطبيقات عملية في الذكاء الاصطناعي

المجالالمفهومالاستخدام
التصنيفCross-Entropyخسارة Softmax القياسية
نماذج اللغةPerplexity / CEتدريب وتقييم LLMs
VAEKL(\(q\|p\))تنظيم الفضاء الكامن
التقطيرKL / CE بدرجة حرارةنقل معرفة المعلم للطالب
الانتباهSoftmaxتوزيع أوزان على المفاتيح
اختيار الميزاتMutual Informationتصفية المتغيرات
تصنيف CE Loss LLM PPL / CE VAE KL term Transformer Softmax Attn
نفس أدوات نظرية المعلومات عبر معماريات مختلفة

دراسة حالة: تقطير المعرفة

المعلم يُنتج توزيعًا ليّنًا \(q_T=\mathrm{softmax}(z_T/T)\). الطالب يُصغّر خليطًا من CE مع التسميات الصلبة و\(T^2\mathrm{KL}(q_T\|q_S)\). درجة الحرارة العالية تكشف «البنية المظلمة» بين الأصناف التي لا تظهر في one-hot.

صلب — تعلّم الصنف الصحيح فقط
ليّن — تعلّم التشابه بين الأصناف
\(T^2\) — يعوّض تدرّج Softmax المخفّف
α — يوازن الصلب والليّن
13 الخلاصة

خلاصة الدرس الرابع

\(I(x)=-\log p\) — المفاجأة
\(H(P)\) — متوسط المفاجأة
\(H(P,Q)\) — خسارة التصنيف
\(H(P,Q)=H(P)+\mathrm{KL}\) — العلاقة الذهبية
التالي

بعد فهم ماذا نُحسّن (الخسارة المعلوماتية)، الدرس الخامس يغطي كيف نُحسّن: Adam، الزخم، جداول معدّل التعلم، والتنظيم.

مرجع سريع

بطاقة معادلات نظرية المعلومات

ملخص الصيغ

\[I(x)=-\log p(x)\]

\[H(X)=-\sum p\log p\]

\[H(P,Q)=-\sum p\log q\]

\[D_{\mathrm{KL}}(P\|Q)=H(P,Q)-H(P)\]

\[I(X;Y)=H(X)-H(X|Y)=D_{\mathrm{KL}}(p(x,y)\|p(x)p(y))\]

\[\mathrm{PPL}=\exp(H(P,Q))\]

\[\frac{\partial L_{\mathrm{CE}}}{\partial z}=\hat{y}-y\]

تمارين للتحقق من الفهم

تمرين 1

وزّع \(p=(0.5,0.5)\) و\(q=(0.9,0.1)\). احسب \(H(P)\) و\(H(P,Q)\) و\(D_{\mathrm{KL}}(P\|Q)\) بالـ nats. تحقق أن \(H(P,Q)=H(P)+\mathrm{KL}\).

تمرين 2

نموذج لغة أعطى لـ 3 رموز احتمالات شرطية \(0.8,0.5,0.4\). ما هي Perplexity؟

تمرين 3

لماذا Label smoothing يرفع أحيانًا CE على التدريب لكنه يُحسّن المعايرة على الاختبار؟ اربط إجابتك بـ \(H(P_\epsilon,Q)\).

أخطاء شائعة

  • الخلط بين \(D_{\mathrm{KL}}(P\|Q)\) و\(D_{\mathrm{KL}}(Q\|P)\)
  • مقارنة PPL عبر tokenizers مختلفة
  • نسيان أن CE مع one-hot = \(-\log\hat{y}_c\) فقط
  • استخدام Softmax ثم CE منفصلتين بدل الدمج المستقر
H(X) H(Y) I(X;Y) مخطط فن للمعلومات التقاطع = معلومات متبادلة الأهلة = إنتروبيا شرطية
H(X)، H(Y)، I(X;Y)، H(X|Y) في صورة مجموعات
السلسلة

دروس سلسلة الرياضيات للذكاء الاصطناعي

#الدرسالرابط
1الرياضيات للذكاء الاصطناعيmath-for-ai-ar.html
2الجبر الخطيlinear-algebra-for-ai-ar.html
3حساب التفاضل والاحتمالاتcalculus-probability-statistics-for-ai-ar.html
4نظرية المعلوماتinformation-theory-for-ai-ar.html
5رياضيات التحسينoptimization-for-deep-learning-ar.html
6حساب المصفوفات والانتشار العكسيmatrix-calculus-backprop-ar.html

الأسئلة الشائعة

لماذا نظرية المعلومات مهمة للذكاء الاصطناعي؟
تفسّر Cross-Entropy، تقيس جودة نماذج اللغة عبر Perplexity، تظهر في VAEs عبر KL، وفي اختيار الميزات عبر Mutual Information.
ما الفرق بين الإنتروبيا والإنتروبيا المتقاطعة؟
الإنتروبيا تقيس عدم يقين \(P\). المتقاطعة تقيس تكلفة ترميز أحداث من \(P\) بشفرات مصممة لـ \(Q\) — وهي خسارة التصنيف.
هل KL مسافة؟
لا. غير متماثل ولا يحقق متباينة المثلث. استخدمه كمقياس تباعد معلوماتي مع الانتباه لاتجاه \(P\|Q\) مقابل \(Q\|P\).
هل هذا الدرس مجاني؟
نعم. كامل ومجاني بالعربية والإنجليزية دون تسجيل.