دراسة على 182 مستودعاً: الكود المكتوب بالذكاء الاصطناعي يحتاج تنظيفاً أكثر من كود المبرمجين البشر

الزبدة
- دراسة رصدت 182 مستودع كود على مدى فترة طويلة توصلت إلى أن الكود الذي يكتبه الذكاء الاصطناعي يحتاج صيانة وتصحيحاً أكبر بكثير من كود المبرمجين البشر بعد دمجه في المشاريع
- الكود الوكيلي لا يحمل أخطاء برمجية أكثر فقط، بل ثغرات أمنية ومشكلات تبعيات أكثر أيضاً، وهي مشكلات غالباً لا تظهر إلا بعد فترة من التشغيل الفعلي
- كل 10 نقاط زيادة في نسبة تجاوز مراجعة الكود بشرياً ترفع عبء صيانة كود الذكاء الاصطناعي بنحو 6%، وهذا يعني أن تسريع اعتماد كود الوكلاء بلا تدقيق يكلّف الفرق أكثر مما توفره من وقت
كشفت دراسة طولية جديدة رصدت المساهمات البرمجية عبر 182 مستودعاً (Repositories) عن نتيجة مثيرة للقلق لدى الفرق التي تعتمد بكثافة على وكلاء البرمجة بالذكاء الاصطناعي (AI Coding Agents): الكود الذي يكتبه هؤلاء الوكلاء ويتم دمجه (Merge) في المشاريع يحتاج إلى قدر أكبر بكثير من أعمال التصحيح اللاحقة مقارنة بالكود الذي يكتبه المبرمجون البشر.
قُدّم البحث في 10 يوليو 2026، واعتمد على تتبع سلوك الكود بعد الدمج على مدى فترة زمنية، بدلاً من الاعتماد على لقطة واحدة في وقت محدد. هذا المنهج سمح للباحثين برصد كيف "تتقادم" المساهمات الوكيلية (Agentic Contributions) والبشرية بشكل مختلف بعد دخولها إلى قاعدة الكود (Codebase). النتيجة الجوهرية: المساهمات التي كتبها الذكاء الاصطناعي تتطلب معدلات أعلى بشكل ملحوظ من أعمال الصيانة اللاحقة، أي الأخطاء البرمجية (Bugs) والتصحيحات (Patches) التي يمكن ردّها إلى كود كتبه نظام ذكاء اصطناعي في الأصل. كما تبيّن أن هذه المساهمات نفسها تحمل عدداً أكبر من الثغرات الأمنية (Security Vulnerabilities) ومشكلات التبعيات البرمجية (Dependency Vulnerabilities) مقارنة بنظيراتها البشرية.
المراجعة أهم مما كان متوقعاً
من أكثر النتائج القابلة للتطبيق عملياً هي الربط المباشر بين عبء الصيانة وكيفية مراجعة الكود قبل دمجه. وجدت الدراسة أن كل ارتفاع بمقدار 10 نقاط في نسبة "عدم المراجعة" في مشروع ما (أي حصة التغييرات التي تُدمج دون خطوة مراجعة بشرية) يرفع عبء صيانة الكود الوكيلي بنسبة تقارب 6% في المتوسط. هذا الترابط يشير إلى أن المشكلة ليست فقط أن وكلاء الذكاء الاصطناعي يكتبون كوداً معيباً في بعض الأحيان، بل أن هذه العيوب تتضخم عندما يتراخى الانضباط في المراجعة، وهو تحديداً السيناريو الذي تخلقه فرق كثيرة عندما تتعامل مع طلبات الدمج (Pull Requests) المُولّدة بالذكاء الاصطناعي بثقة كافية لتسريع اعتمادها دون تدقيق كافٍ.
هذه نقطة لافتة لمؤسسات هندسية تبنّت وكلاء البرمجة بالذكاء الاصطناعي جزئياً لتسريع دورات المراجعة. فإذا كان تجاوز خطوة المراجعة نفسه يضخّم العيوب التي يميل هؤلاء الوكلاء إلى إدخالها أصلاً، فإن مكاسب الإنتاجية التي تعد بها أدوات البرمجة الوكيلية قد تتقلص جزئياً، أو تتبخر بالكامل، بفعل التكلفة الخفية للتنظيف اللاحق.
لماذا يهم هذا قادة الهندسة التقنية؟
لا تحدد الورقة البحثية سبباً واحداً لهذه النقاط الضعيفة في الكود الوكيلي، لكن النمط الذي توثقه يتوافق مع قلق متزايد في قطاع أدوات المطورين: وكلاء الذكاء الاصطناعي قادرون على توليد كود يبدو معقولاً وبسرعة كبيرة، لكن "المعقولية" ليست بديلاً عن الصحة أو الأمان. الثغرات الأمنية ومشكلات التبعيات هي بالضبط النوع من العيوب التي تظهر عادة فقط بعد أن يعمل الكود في بيئة الإنتاج (Production) لفترة، وهو ما يتماشى تماماً مع تصميم دراسة تتابع السلوك عبر الزمن بدل رصده لحظة الدمج فقط.
بالنسبة لمديري التقنية (CTOs) والمدراء الهندسيين الذين يوسّعون استخدام مساعدي البرمجة بالذكاء الاصطناعي، تقدّم النتائج حجة ملموسة للحفاظ على متطلبات المراجعة البشرية، أو حتى تشديدها، خصوصاً على التغييرات المُولّدة عبر الوكلاء. تشير البيانات إلى أن تكلفة تجاوز المراجعة لا تتوزع بالتساوي بين المساهمات البشرية والآلية، بل تعاقب الأخيرة بشكل غير متناسب. ومع اندماج المزيد من المؤسسات مع وكلاء البرمجة داخل خطوط عملها، من المرجح أن يشكّل هذا النوع من المحاسبة التجريبية لديون الصيانة التي يخلّفونها وراءهم مدى الاستقلالية الفعلية التي ستُمنح لهؤلاء الوكلاء مستقبلاً.
التغطيات والأبحاث الأصلية التي استند إليها هذا المقال.
- 1The Patchwork Problem in LLM-Generated Codearxiv.org
- 2Mitigating LLM Sycophancy in Code Smell Detection Using Evidence-Guided Reasoning Promptsarxiv.org
- 3What Do AI Agents Actually Change? An Empirical Taxonomy of Mutation Patterns in Performance-Improving Pull Requestsarxiv.org
- 4In defense of not understanding your codebaseseangoedecke.com
- 5SWE-MERA: A Dynamic Benchmark for Agenticly Evaluating Large Language Models on Software Engineering Tasksarxiv.org
- 6A Large-Scale Dataset of MCP Implementations on GitHubarxiv.org
- 7Prompt Coach: An Empirical Evaluation of an Agentic Tutor for Learning Prompt Engineering in Software Developmentarxiv.org
- 8RuBench: A Repository-Level Agentic Coding Benchmark with Natively Authored Russian Task Specificationsarxiv.org
- 9Do These Violent Delights Have Violent Ends? Measuring the Post-Merge Fate of Agentic Codearxiv.org
- 10How Do Practitioners Build SE Agents? Insights from a Mixed-Methods Studyarxiv.org
- 11TENET: One Step Toward Test-Driven Development for Repository-Level Code Generationarxiv.org
- 12Partial Contracts Suffice: Sound, LLM-Inferred Regression Verificationarxiv.org
فريق تحرير واكب
تم إعداد هذه المراجعة وتلخيصها بواسطة محرك الذكاء الاصطناعي الخاص بواكب ومراجعتها وتدقيقها من قبل فريقنا التحريري لضمان الدقة والموثوقية.
اشترك في النشرة البريدية
احصل على ملخص أسبوعي لأبرز أبحاث وأدوات الذكاء الاصطناعي مباشرة في بريدك.
قناة التليجرام
تابع تغطيتنا اللحظية ونقاشاتنا حول آخر مستجدات وأنظمة الذكاء الاصطناعي.
