الرياضيات للذكاء الاصطناعي
كل نموذج ذكاء اصطناعي هو أرقام تتحرك عبر معادلات. هذا الدرس يبني ذلك الأساس من الصفر — بحيث تقرأ المعادلات في أبحاث التعلم الآلي كجمل مفهومة لا كجدار من الرموز.
لماذا الرياضيات مهمة في الذكاء الاصطناعي؟
نظام الذكاء الاصطناعي لا "يفهم" صورة قطة، أو جملة، أو أغنية. هو يستقبل أرقامًا، يحوّل هذه الأرقام عبر معادلات، وينتج أرقامًا جديدة نُفسّرها نحن كتنبؤ. الرياضيات ليست شرطًا نتحمّله قبل "العمل الحقيقي" — هي العمل الحقيقي نفسه. بنية النموذج، وعملية التدريب، وتقييم النتائج، كلها عمليات رياضية ترتدي زي الهندسة.
الركائز الأربع التي يعتمد عليها مهندس الذكاء الاصطناعي
| الفرع | ماذا يمنح الذكاء الاصطناعي |
|---|---|
| الجبر والدوال | لغة النماذج — كل شبكة عصبية هي دالة تُحوّل مُدخلًا إلى مُخرج |
| الجبر الخطي | المتجهات والمصفوفات — الطريقة الفعلية لتخزين البيانات والصور والكلمات ومعالجتها |
| حساب التفاضل | المشتقات — كيف يتعلّم النموذج من أخطائه (الانحدار التدريجي) |
| الاحتمالات والإحصاء | كيف يُعبّر النموذج عن عدم اليقين ويتخذ قرارات من الأنماط في البيانات |
هذا الدرس يبني الطابق الأرضي تحت هذه الركائز الأربع: كيف تتصرف الأرقام، كيف تُقرأ المعادلات وتُكتب، وكيف تُفكّر بلغة الدوال والرسوم البيانية. لا شيء هنا "بسيط جدًا" — هذه هي نفس الأدوات المستخدمة، بأقصى سرعة، داخل كل شبكة عصبية.
لا يمكنك فهم دالة الخسارة دون اللوغاريتمات، ولا فهم تحديث الأوزان دون المعادلات، ولا فهم تنشيط الخلية العصبية دون الدوال والرسوم البيانية. رُتّب هذا الدرس بحيث يفتح كل محور الطريق للمحور الذي يليه.
أنواع البيانات
قبل أن تبدأ أي عملية رياضية، يجب أن تتحول المعلومات الخام إلى أرقام. في الذكاء الاصطناعي، نصنّف البيانات إلى عائلات أساسية، لأن كل عائلة تُعالَج بطريقة مختلفة.
تحويل التصنيفات إلى أرقام
لا يستطيع النموذج ضرب كلمة "أحمر". لذلك تُحوَّل البيانات التصنيفية — مثلًا عبر الترميز الأحادي (one-hot): تصبح كل فئة موقعًا في قائمة من الأصفار مع رقم واحد فقط.
الألوان = {أحمر، أخضر، أزرق}
أحمر \(\rightarrow (1,0,0)\) أخضر \(\rightarrow (0,1,0)\) أزرق \(\rightarrow (0,0,1)\)
بيانات منظمة مقابل غير منظمة
البيانات المنظمة تنسجم بدقة في صفوف وأعمدة، كجدول بيانات (عمر الزبون، دخله، عدد مشترياته). أما البيانات غير المنظمة — كالصور والصوت والنصوص الحرة — فليس لها شكل ثابت من الأعمدة، لذا تحتاج معالجة إضافية قبل أن تصبح مُدخلًا رقميًا نظيفًا.
أول مهمة لأي شبكة عصبية هي دومًا هذا التحويل. الصورة تصبح شبكة من الأرقام بين 0 و1 (سطوع البكسل)؛ والكلمة تصبح متجهًا من الأرقام يُسمّى Embedding. من هذه اللحظة، كل شيء عبارة عن عمليات حسابية.
الأعداد
تأتي الأعداد في عائلات متداخلة — كل عائلة تتعلّمها تحتوي على العائلات السابقة لها، مضافًا إليها شيء جديد.
| المجموعة | الرمز | تحتوي على | مثال |
|---|---|---|---|
| الأعداد الطبيعية | \(\mathbb{N}\) | أعداد العدّ | 1, 2, 3, 4... |
| الأعداد الصحيحة الموجبة (الكلية) | — | الطبيعية + الصفر | 0, 1, 2, 3... |
| الأعداد الصحيحة | \(\mathbb{Z}\) | الكلية + السالبة | ..., -2, -1, 0, 1, 2... |
| الأعداد النسبية | \(\mathbb{Q}\) | أي كسر من عددين صحيحين | \( \tfrac12, -\tfrac34, 5\) |
| الأعداد غير النسبية | — | لا يمكن كتابتها ككسر | \(\pi,\ \sqrt2\) |
| الأعداد الحقيقية | \(\mathbb{R}\) | النسبية + غير النسبية | كل نقطة على خط الأعداد |
"الأوزان" داخل الشبكة العصبية هي أعداد حقيقية، تُخزَّن عادة كأعداد عشرية مثل 0.3821. قيم البكسل أعداد صحيحة من 0 إلى 255. والاحتمالات التي يُخرجها النموذج أعداد حقيقية محصورة بين 0 و1. معرفة "عائلة" العدد تخبرك بالعمليات المسموحة عليه أصلًا.
الكسور
الكسر \(\dfrac{a}{b}\) يعني "قسّم شيئًا إلى \(b\) جزءًا متساويًا وخذ منه \(a\) جزءًا." الرقم العلوي هو البسط، والرقم السفلي هو المقام.
العمليات الأربع
الضرب: \(\dfrac{a}{b}\times\dfrac{c}{d}=\dfrac{a\times c}{b\times d}\)
القسمة: \(\dfrac{a}{b}\div\dfrac{c}{d}=\dfrac{a}{b}\times\dfrac{d}{c}\)
الجمع / الطرح (بعد توحيد المقام): \(\dfrac{a}{b}+\dfrac{c}{b}=\dfrac{a+c}{b}\)
كعدد عشري: \(\dfrac{3}{4}=0.75\)
مجموعة بيانات من 1200 صورة تُقسَّم بحيث يذهب \(\tfrac{3}{4}\) منها للتدريب والباقي للاختبار. حجم التدريب \(=1200\times\tfrac34=900\) صورة. حجم الاختبار \(=1200-900=300\) صورة.
الكسور موجودة في كل قرارات سير عمل الذكاء الاصطناعي: تقسيم بيانات 80/20 بين التدريب والاختبار، أو معدّل إسقاط (Dropout) قدره \(\tfrac{1}{5}\) يُطفئ عشوائيًا خلايا عصبية أثناء التدريب، أو مُخرج النموذج نفسه الذي هو احتمال — أي كسر بين 0 و1 في الحقيقة.
القوى والجذور
القوة (الأس) هي ضرب متكرر: \(a^n\) تعني ضرب \(a\) في نفسه \(n\) مرة.
\(2^4 = 2\times2\times2\times2 = 16\)
\(a^0 = 1\) \(a^{-n}=\dfrac{1}{a^n}\) \(a^{m}\times a^{n}=a^{m+n}\) \(\left(a^m\right)^n=a^{mn}\)
الجذر يعكس عملية القوة. الجذر التربيعي يسأل: "أي عدد إذا ضُرب في نفسه أعطانا هذا الرقم؟"
\(\sqrt{16}=4\) لأن \(4\times4=16\)
الجذر العام: \(\sqrt[n]{a}=a^{1/n}\)
المسافة بين نقطتين \((1,2)\) و \((4,6)\): \(d=\sqrt{(4-1)^2+(6-2)^2}=\sqrt{9+16}=\sqrt{25}=5\)
التربيع هو جوهر قياس الخطأ: متوسط مربع الخطأ (MSE) يربّع كل خطأ قبل حساب المتوسط، بحيث تُعاقَب الأخطاء الكبيرة بشدة أكبر نسبيًا. أما الجذور التربيعية فتظهر في قياس "طول" المتجهات (المقدار)، وفي الانحراف المعياري المستخدم لتوحيد مقياس البيانات قبل تغذيتها للنموذج.
اللوغاريتمات
اللوغاريتم يجيب عن السؤال العكسي للقوة: "أي أُسّ أحتاجه للوصول إلى هذا العدد؟"
\(\log_b(x) = y \iff b^y = x\)
\(\log_2(8) = 3\) لأن \(2^3=8\)
اللوغاريتم الطبيعي (أساسه \(e\approx2.718\)): \(\ln(x)=\log_e(x)\)
الخصائص الأساسية
\(\log(ab)=\log a + \log b\)
\(\log\!\left(\dfrac{a}{b}\right)=\log a - \log b\)
\(\log(a^n)=n\log a\)
اللوغاريتمات ضرورية لطريقة تدريب النماذج. أكثر دالة خسارة شيوعًا في التصنيف، الإنتروبيا المتقاطعة (Cross-Entropy)، مبنية حرفيًا من \(-\log(p)\)، حيث \(p\) هو الاحتمال الذي أعطاه النموذج للإجابة الصحيحة. ولأن \(-\log(p)\) يتضخم كلما اقترب \(p\) من الصفر، يُعاقَب النموذج بشدة عندما يكون واثقًا وخاطئًا في آنٍ واحد.
إذا تنبأ النموذج باحتمال \(p=0.9\) للفئة الصحيحة، فخسارته \(-\log(0.9)\approx0.105\) — صغيرة. وإذا تنبأ بـ \(p=0.1\) للفئة الصحيحة، فخسارته \(-\log(0.1)\approx2.303\) — أكبر بكثير. الثقة في الاتجاه الخاطئ مُكلفة.
الدوال (Functions)
الدالة هي قاعدة: تُدخل رقمًا وتحصل على رقم واحد بالضبط. تخيّلها كآلة.
المجال والمدى
المجال هو كل قيمة مُدخلة صالحة؛ المدى هو كل قيمة مُخرجة ممكنة. بالنسبة لـ \(f(x)=\sqrt{x}\)، المجال هو \(x\geq0\) — لا يمكنك إدخال عدد سالب والحصول على نتيجة حقيقية.
عائلات الدوال التي ستراها باستمرار في الذكاء الاصطناعي
| الدالة | الصيغة | أين تظهر |
|---|---|---|
| الخطية | \(f(x)=wx+b\) | اللبنة الأساسية لكل خلية عصبية |
| سيغمويد (Sigmoid) | \(f(x)=\dfrac{1}{1+e^{-x}}\) | تضغط أي رقم إلى احتمال بين 0 و1 |
| ReLU | \(f(x)=\max(0,x)\) | أكثر دالة تنشيط شيوعًا في الشبكات العميقة |
| Softmax | تُحوّل قائمة أرقام إلى احتمالات مجموعها 1 | الطبقة الأخيرة في نموذج التصنيف |
الشبكة العصبية هي، رياضيًا، دالة عملاقة واحدة مبنية من تركيب دوال صغيرة داخل بعضها: \(f(x) = f_3(f_2(f_1(x)))\). كل "طبقة" تسمع عنها هي واحدة من هذه الدوال.
الرسوم البيانية
الرسم البياني هو صورة لدالة أو علاقة، تُرسم على المستوى الإحداثي — خطّا أعداد يتقاطعان في نقطة تُسمّى نقطة الأصل \((0,0)\). الخط الأفقي هو محور \(x\)؛ الخط الرأسي هو محور \(y\). كل نقطة تُكتب على شكل \((x,y)\).
قراءة الرسم البياني
- الميل — مدى انحدار الخط، أي كم يتغيّر \(y\) مقابل كل وحدة من \(x\).
- نقطة التقاطع — أين يقطع الخط محور \(y\) (قيمة \(y\) عند \(x=0\)).
- الاتجاه العام — هل العلاقة صاعدة، هابطة، منحنية، أم مسطّحة؟
منحنى التدريب — انخفاض الخسارة مع الوقت — هو رسم بياني. حدود القرار (Decision Boundary) التي تفصل بين فئتين على مخطط نقاط هي رسم بياني. حتى أوزان الشبكة العصبية، عند رسمها، تكشف أنماطًا يستخدمها المهندسون لتشخيص النموذج وفهمه.
المتغيرات والثوابت
المتغيّر هو رمز يمثّل عددًا قابلًا للتغيّر — عادة حروف مثل \(x\)، \(y\)، \(w\). أما الثابت فهو قيمة محددة لا تتغيّر ضمن المسألة، مثل \(2\)، \(\pi\)، أو أي رقم معروف محدد.
في \(f(x) = 3x + 5\): \(x\) هو المتغيّر، \(3\) و\(5\) ثابتان.
تدريب شبكة عصبية يعني البحث عن أفضل قيم لمتغيراتها — الأوزان والإزاحات — بحيث تطابق تنبؤات النموذج الواقع قدر الإمكان. كل ما "يتعلّمه" النموذج يعيش داخل هذه الأرقام القابلة للتعديل.
المعادلات
المعادلة هي جملة تقول إن تعبيرين متساويان. حلّها يعني إيجاد قيمة المتغيّر التي تجعل الجملة صحيحة.
\(2x + 3 = 11\)
نطرح 3 من الطرفين: \(2x = 8\)
نقسم الطرفين على 2: \(x = 4\)
أنظمة المعادلات
أحيانًا يجب أن تكون عدة معادلات صحيحة في آنٍ واحد — مثلًا إيجاد النقطة التي يتقاطع فيها خطّان. هذه هي الفكرة الأساسية وراء حلّ معادلات صغيرة كثيرة في وقت واحد، وهو بالضبط ما يحدث (بمقياس هائل) داخل شبكة مُدرَّبة.
تدريب نموذج ذكاء اصطناعي يعني حرفيًا حلّ معادلة عملاقة (تقريبيًا): تعديل الأوزان \(w\) بحيث يقترب مُخرج النموذج \(f(x)\) قدر الإمكان من الإجابة الصحيحة \(y\). القاعدة المستخدمة لتقريب كل وزن أكثر فأكثر، مرارًا وتكرارًا، تُسمّى معادلة تحديث الأوزان: \(w_{\text{جديد}} = w_{\text{قديم}} - \eta\dfrac{\partial L}{\partial w}\).
المتباينات
المتباينة تقارن بين تعبيرين دون الادّعاء أنهما متساويان — تقول إن أحدهما أكبر أو أصغر أو على الأقل/على الأكثر من الآخر.
\(x > 5\) (أكبر تمامًا) \(x \geq 5\) (أكبر من أو يساوي)
\(x < 5\) (أصغر تمامًا) \(x \leq 5\) (أصغر من أو يساوي)
حلّ \(3x - 4 \leq 11\): نضيف 4 للطرفين ← \(3x \leq 15\)؛ نقسم على 3 ← \(x \leq 5\). نقلب اتجاه المتباينة فقط عند الضرب أو القسمة على عدد سالب.
المتباينات تحدد عتبات القرار (Thresholds). قد يُصنّف مُرشّح البريد المزعج رسالة كسبام إذا حقّق الاحتمال المتنبَّأ به \(p \geq 0.5\). كما تُكتب قيود التحسين ("أبقِ هذا الوزن ضمن نطاق معيّن") على شكل متباينات أيضًا.
حل مسائل عملية
كل مسألة حقيقية — بما فيها مسائل الذكاء الاصطناعي — تمرّ بأربع خطوات ثابتة.
المسألة: نموذج صنّف بشكل صحيح 850 صورة من أصل 1000 صورة اختبار. ما دقّته كنسبة مئوية، وكم عدد الأخطاء التي ارتكبها؟
الفهم: نحتاج تحويل كسر إلى نسبة مئوية، إضافة إلى عملية طرح.
الترجمة: الدقة \(=\dfrac{850}{1000}\times100\)؛ الأخطاء \(=1000-850\).
الحلّ: الدقة \(=85\%\)؛ الأخطاء \(=150\).
التحقق: \(85\%\) من 1000 تساوي 850 ✓، و\(850+150=1000\) ✓.
هذه العادة المكوّنة من أربع خطوات بالضبط هي ما يمارسه المهندس، ذهنيًا، عشرات المرات يوميًا: قراءة مقياس، ترجمة متطلب عملي إلى دالة خسارة، تنفيذ الحسابات، والتحقق من منطقية النتيجة قبل الوثوق بها.
أمثلة من الذكاء الاصطناعي
هكذا يجتمع كل محور في هذا الدرس داخل قطعة حقيقية وعاملة من الذكاء الاصطناعي.
1 · خلية عصبية واحدة
\(z = w_1x_1 + w_2x_2 + b\)
\(\hat{y} = \sigma(z) = \dfrac{1}{1+e^{-z}}\)
هذا يستخدم متغيرات (\(x_1,x_2\))، وثوابت تُتعلَّم (\(w_1,w_2,b\))، ودالة (\(\sigma\))، والعدد \(e\) المرتبط باللوغاريتمات.
2 · قياس مدى خطأ النموذج
متوسط مربع الخطأ: \(L = \dfrac{1}{n}\sum_{i=1}^n (y_i - \hat{y}_i)^2\)
خسارة الإنتروبيا المتقاطعة: \(L = -\log(\hat{y}_{\text{الفئة الصحيحة}})\)
هذا يستخدم القوى (التربيع)، والكسور (المتوسط)، واللوغاريتمات.
3 · تحسين النموذج — الانحدار التدريجي
\(w_{\text{جديد}} = w_{\text{قديم}} - \eta \cdot \dfrac{\partial L}{\partial w}\)
هذه معادلة حرفيًا تُحلّ مرارًا وتكرارًا، حيث \(\eta\) (معدّل التعلّم) ثابت صغير يتحكّم بحجم كل خطوة — ويجب أن يحقّق حجم الخطوة متباينة \(0 < \eta < 1\) لتجنّب تجاوز النموذج للهدف.
نموذج الذكاء الاصطناعي ليس سحرًا. هو أرقام تتدفّق عبر دوال، تُقاس بمعادلة تتضمّن لوغاريتمات، وتُصحَّح بمعادلة أخرى مقيّدة بمتباينة — تتكرر حتى تتقلّص الأخطاء. كل محور في هذا الدرس هو ترس في هذه الآلة.