الذكاء الاصطناعي قد ينجح في الامتحان.. لكن الامتحان الحقيقي يبدأ بعده
أحدث الجدل حول Gemini 4 يُعيد فتح مشكلة أكبر في صناعة الذكاء الاصطناعي: هل أصبحت نتائج الاختبارات المعيارية تقيس قدرة النموذج فعلًا، أم أصبحت جزءًا من السباق نفسه؟
Google قدّمت Gemini 4 باعتباره نموذجًا متقدمًا، وحقّق نتائج قوية في عدد من الاختبارات المعيارية. لكن Bloomberg نقلت عن أشخاص مطلعين على العمل داخل الشركة أن بعض الموظفين وجدوا أداء النموذج أقل إقناعًا عند استخدامه في مهام برمجة حقيقية، خصوصًا في بعض المهام التي لا تُشبه الاختبارات المصمَّمة مسبقًا.
المفارقة أن المشكلة لا تعني بالضرورة أن الاختبارات خاطئة أو أن النموذج ضعيف. المشكلة أن الاختبار يطلب من النموذج تنفيذ مهمة محددة، بينما العمل الحقيقي أكثر فوضى: كود قديم، متطلبات تتغير، أخطاء غير متوقعة، وقرارات يجب أن تكون عملية وليست صحيحة على الورق فقط.
وهنا يصبح التفوق في الـbenchmarks غير كافٍ لقياس القيمة التجارية. الشركة لا تدفع للنموذج كي يحصل على درجة مرتفعة، بل كي يُوفّر وقتًا، ويكتب كودًا قابلًا للاستخدام، ويحل مشكلة حقيقية من البداية إلى النهاية.
Google من جانبها تدافع عن أداء Gemini 4، وتقول: إن نتائج الاختبارات والاستخدام الفعلي متَّسقان.
لذلك، قد يكون الاختبار الحقيقي للجيل الجديد من الذكاء الاصطناعي خارج المختبر تمامًا: عندما ينتقل النموذج من ورقة الامتحان إلى مكتب الموظف.. هل يبقى متفوقًا؟
