الفارق الحاسم.. ما الذي تستطيع أدمغتنا فعله ويعجز عنه أقوى ذكاء اصطناعي؟

حين ننظر إلى الشاطئ، هل نرى رمالا وماء فقط، أم نرى أيضا مكانا للسباحة وبناء القصور الرملية؟ هذا هو جوهر فكرة “إمكانات الفعل” التي طرحها عالم النفس الأمريكي جيمس جيبسون في القرن العشرين، فنحن ندرك الأماكن من خلال ما يمكننا فعله فيها، وليس من خلال شكلها وحده.
لكن كيف يعبّر الدماغ عن هذه الفرص؟ وهل يتعامل الذكاء الاصطناعي مع الأماكن بالطريقة نفسها؟ بحثت دراسة نُشرت في دورية “بي إن إيه إس” هذه الأسئلة، باستخدام تجارب سلوكية وتصوير الدماغ بالرنين المغناطيسي.
وتشير النتائج، بحسب الدراسة، إلى أن الدماغ يمثل الأنشطة والحركات التي يتيحها المكان، وأن هذا التمثيل لا يمكن تفسيره بمجرد الأشياء والمواد التي نراها فيه.
بمعنى أبسط، لا يكتفي دماغك بالتعرف على ما أمامك، بل يدرك أيضا ما يمكنك فعله هناك. فكيف يساعدنا ذلك على فهم الطريقة التي نرى بها العالم؟ وإلى أي مدى تستطيع نماذج الذكاء الاصطناعي محاكاة هذه القدرة؟
توضح مي مبروك، أستاذة المعلوماتية الطبية الحيوية، في كلية تكنولوجيا المعلومات وعلوم الحاسوب، في جامعة النيل المصرية، وهي غير مشاركة في هذه الدراسة، في تصريحات صحفية: “الفرق بين ‘رؤية الشاطئ كمكان للسباحة’ ورؤيته كمجرد ‘رمال وماء’ يكمن في أن الدماغ لا يصف المشهد فحسب، بل تُشتق منه إمكانية الحركة الفعلية فيه، وهي عملية عصبية متميزة عن مجرد التعرف على العناصر أو المواد”.
ما وراء الصورة
عرض الباحثون 231 صورة لأماكن مختلفة، داخلية وخارجية، طبيعية وصناعية، على مجموعة من المتطوعين. ثم طُلب من المشاركين تحديد الفعل الذي بإمكانهم القيام به في تلك البيئات مثل المشي، أو ركوب الدراجة، أو السباحة، أو القيادة، أو التسلق، أو الإبحار، وذلك بناء على كل صورة.
أثناء مشاهدة المتطوعين للصور، صوّر الباحثون نشاط دماغ المتطوعين باستخدام أجهزة الرنين المغناطيسي الوظيفي لمعرفة أي مناطق في الدماغ تنشط عند رؤية مشاهد تسمح بحركات معينة. ثم استخدموا شبكات عصبية مدربة على تصنيف الصور لمعرفة هل هذه النماذج “تفهم” المشهد كما يفهمه البشر.
أظهرت مناطق محددة في أدمغة المشاركين نشاطا قويا عند رؤية مشاهد معينة، ليس بسبب محتواها، بل بسبب إمكانات الحركة فيها. فمثلا، حفّزت صورة البحر الدماغ، لأنه فهم إمكانية السباحة، لا لأن فيه ماء فقط.
هذا يعني أن أدمغتنا لا تكتفي بالتعرف على العناصر البصرية في المشهد كالهواء أو الصخور أو الأرضيات، بل تبني بشكل تلقائي تمثيلات لإمكانات الفعل الحركي الممكنة في كل بيئة، مثل المشي أو السقوط أو التسلق.
وبحسب الدراسة، يحدث هذا التمثيل الحركي في منطقتين بصريتين متخصصتين داخل الدماغ. المنطقة الأولى هي المنطقة المجاورة للحُصين، والثانية هي المنطقة القفوية البصرية.
يحدث ذلك حتى دون توجيه الانتباه أو إعطاء مهمة إدراكية للإنسان. ببساطة، تبني أدمغتنا خرائط حركة تلقائيا بمجرد النظر. وتعلق مبروك: “الدماغ يكوّن خرائط حركية بشكل مستمر، وهي ضرورية لتحقيق التفاعل اللحظي والفعال مع البيئة، مما يدعم وظيفة الإدراك الموجه نحو العمل”.
فجوة بين الذكاء الاصطناعي والعقل البشري
أظهرت الدراسة أن التمثيل العصبي لإمكانات الفعل الحركي لا يعتمد على المهمة التي يُطلب من الفرد القيام بها، سواء طُلب من المشاركين وصف الأشياء أو مجرد التحديق في نقطة، كانت مناطق المخ نشطة بطريقة توحي بأن الدماغ يرى البيئة كفرصة لحركة معينة.
هذا يعني أن تمثيل إمكانات الفعل الحركي جزء لا يتجزأ من إدراكنا للعالم، وهو ما يفسر سهولة اتخاذنا لقرارات حركية في بيئات جديدة دون وعي أو تحليل واعٍ لكل عنصر في المشهد.
وتضيف أستاذة المعلوماتية الطبية الحيوية: “بينت الدراسة أن هذه الإمكانات لا تُستخلص من مكونات المشهد كالسطوح أو المواد فقط، بل يُمثلها الدماغ في فضاء تمثيلي مستقل يُعالج بشكل مباشر في القشرة البصرية”.
أي أن هذه التمثيلات الحركية لا تتطابق مع تصنيفات المشاهد التقليدية كالبيئات المغلقة أو المفتوحة، ولا مع المواد (خشب، حجر، ماء) أو حتى مع الأجسام الموجودة (أشجار، مبان، شوارع). بل كوّنت هذه الإمكانات خريطة تمثيلية ثلاثية الأبعاد متميزة تربط بين عناصر محددة وإمكانات فعل حركي مرتبطة بها، مثل البحر والسباحة، أو القارب والتجديف، أو الصخور والتسلق.
يرى ولا يفهم
عندما قارن الباحثون تمثيلات الدماغ مع استجابات أشهر نماذج الذكاء الاصطناعي، مثل شبكات مدربة على تصنيف الصور أو المشاهد أو حتى مقاطع الفيديو، جاءت النتائج صادمة.
وتقول مي مبروك: “رغم أن الشبكات العصبية العميقة المدربة على تصنيف الصور تُظهر دقة في التعرف على العناصر، فإنها تُظهر ضعفا في محاكاة تمثيل إمكانات الفعل الحركي. السبب، بحسب الدراسة، هو أن هذه النماذج تفتقر إلى التجربة المجسدة”، أي أن الذكاء الاصطناعي يفتقر إلى “الجسد” الذي يتحرك ويتفاعل مع البيئة، ومن ثم يفتقر إلى مدخلات حسية حركية تغذي تمثيل الفعل. النماذج الحالية تدربت على “تسمية الأشياء” وليس على “القدرة على استخدامها أو التفاعل معها”، فلا يكفي أن تتعرف النماذج على ما تراه، بل يجب أن “تعيش” ما تراه.
وتوضح أن “الدراسة تقترح أن تقليص الفجوة يتطلب دمج الجسم في عملية التعلم الحسي الحركي، أي أن يتعلم الذكاء الاصطناعي من خلال الفعل الفعلي في البيئة، كما هي الحال في الروبوتات المتنقلة”. وتضيف: “الخطوة الحاسمة هي التعلم المجسد في بيئات طبيعية، مما يُمكّن النماذج من تطوير تمثيلات وظيفية مشابهة للدماغ البشري”.
يطرح هذا الاكتشاف آفاقا واسعة لتطبيقات عملية، مثل ضرورة تحسين خوارزميات السيارات ذاتية القيادة لتتمكن من التنبؤ بسلوك المشاة أو تمييز الأماكن القابلة للعبور. كما يمكن تعزيز واقعية بيئات الواقع الافتراضي والمعزز من خلال تضمين تمثيلات ديناميكية لإمكانات الحركة. بالإضافة إلى طرح أهمية تطوير ذكاء اصطناعي متجسد يتعلم من التجربة الحسية الحركية لا من الصور وحدها.
في زمن تحاول فيه النماذج الاصطناعية محاكاة الإدراك البشري، يذكّرنا هذا البحث بأننا لا نرى كما ترى الآلة، بل نرى لنفعل، وندرك لنقرر. الإدراك البشري، كما توضحه الخريطة العصبية لإمكانات الفعل، لا ينفصل عن الحركة، ولا ينفصل عن الجسد. فهل مستقبل الذكاء الاصطناعي مرهون حقا بأن “يتجسد”؟ هذا ما سيكشفه الزمن، وربما نحن أقرب إليه مما نتوقع.
