benchr

ماذا يصنع الناس بالذكاء الاصطناعي

أشياء بناها أحدهم أو شغّلها أو نشرها، كل واحدة موصولة بمن فعلها. لم يُعِد benchr إنتاج أي منها، وكل سجل يقول ذلك.

الموضوع

ما الذي حدث

57 عرضًا تفاعليًا على الويب، بنتها أساطيل وكلاء في يوم واحد

نقلًا عن elder-pliniusأسبوع إطلاق 1 سبتمبر 2026لم يختبره benchr

يجمع معرض عام 57 عرضًا تفاعليًا مستقلًا موزّعة على ست مجموعات: فن توليدي، ومحاكيات، وآلات، وعوالم قابلة للاستكشاف. تذكر الصفحة أن كل عمل صُمّم وبُني وفُحص من طرف إلى طرف بأسطول من وكلاء Claude Fable 5، خلال يوم واحد، وأن كل عرض ملف HTML واحد بلا أي اعتماديات.

لماذا يهم هذا خطوة المراجعة نفسها تولّاها الوكلاء، وهي عادةً أول ما يسقط عند ضيق الوقت.

المصدر الأصلي: elder-plinius.github.io

كيف أُنجز

  1. الداخلستة محاور: فن توليدي، محاكيات، آلات، عوالم
  2. ثمأساطيل من الوكلاء صمّمت كل عمل وبنته وراجعته
  3. القيدملف HTML واحد لكل عرض، بلا اعتماديات
  4. الخارج57 عرضًا، نُشرت في يوم واحد

من صورة أرض فارغة إلى جولة مصوّرة داخل منزل

نقلًا عن @alexalbert__أسبوع إطلاق 1 سبتمبر 2026لم يختبره benchr

أعطى Alex Albert نموذج Claude Fable 5.1 صورة واحدة لأرض فارغة. صمّم النموذج منزلًا يناسب الأرض، ثم أخرجه صورةً، ثم أنتج فيديو جولة سينمائية داخله. أُنجز العمل بالكود لا داخل برنامج تصميم.

  1. الداخلصورة واحدة لأرض فارغة
  2. ثمكتب النموذج كودًا بدل فتح برنامج تصميم
  3. ثمصمّم منزلًا يناسب الأرض ثم أخرجه صورةً
  4. الخارجفيديو جولة سينمائية

وكيل تخاطبه على واتساب صار من أكثر المشاريع نجومًا على GitHub

نقلًا عن Peter Steinberger30 أغسطس 2026لم يختبره benchr

OpenClaw وكيل مستقل حرّ ومفتوح المصدر واجهته تطبيق مراسلة: تخاطبه على Signal أو Telegram أو Discord أو WhatsApp فينفّذ المهام عبر النموذج الذي توجّهه إليه. أطلقه المبرمج النمساوي Peter Steinberger في 24 نوفمبر 2025 باسم Warelay، ثم غيّر اسمه مرتين، وأصدر النسخة 2.0 في 30 أغسطس 2026. قرأ benchr واجهة المستودع مباشرةً في 2026-09-04: 388,822 نجمة و81,662 تفريعة، وتاريخ إنشاء 2025-11-24، وهو التاريخ الذي يذكره مدخل الموسوعة مستقلًّا.

  1. الداخلرسالة في Signal أو Telegram أو Discord أو WhatsApp
  2. ثمنظام مهارات يقرّر ما الذي يُشغَّل
  3. ثمالنموذج الذي أعددته ينفّذ العمل، والإعدادات تبقى محليًا
  4. الخارجيعود الرد في المحادثة نفسها

المزيد ممّا فعله الناس

في أصعب مهام الويب، ينهي البشر 10%. وأفضل وكيل ينهي 8%.

نقلًا عن Zejun Xu and colleagues9 أغسطس 2026لم يختبره benchr

اختبار CAP، المنشور على arXiv يوم 9 أغسطس 2026، يضم 420 مهمة عابرة للمواقع على 108 مواقع حقيقية في 24 مجالًا، مبنية حول تفاعلات تتطلب فهمًا بصريًا حقيقيًا لا مجرد ملء نماذج. نسب النجاح الكامل: Manus 8.0%، و Fellou 7.0%، و Comet 6.0%، و Genspark 5.0%، و Claude-4.5-Sonnet 5.0%، و Dia 4.0%، و DeepSeek-V4-Flash 2.9%، و GPT-5 2.0%، مقابل خط أساس بشري 10.0%. أما في الإنجاز الجزئي فتتّسع الصورة: البشر 35.0%، و Comet 48.0%، و Manus 23.0%.

  1. الداخل420 مهمة، و108 مواقع حقيقية، و24 مجالًا
  2. ثممقسّمة إلى أفعال معقّدة وإدراك معقّد
  3. ثمثمانية وكلاء وخط أساس بشري على المجموعة نفسها
  4. الخارجالإدراك لا التحكّم هو الفشل الغالب

16 فيروسًا فعّالًا صمّمها نموذج لغة جينية

نقلًا عن Samuel King and Brian Hie (Stanford / Arc Institute)6 أغسطس 2026لم يختبره benchr

استخدم فريق من جامعة Stanford ومعهد Arc نموذجَي اللغة الجينية Evo 1 و Evo 2 لتوليد نحو 700,000 جينوم مرشّح لعاثيات بكتيرية. اختاروا 302 منها للتصنيع، ونجحوا في بناء 285، وأدخلوها في بكتيريا E. coli. أنتجت ستة عشر منها عاثيات حيّة. ومجتمعةً في خليط واحد، قضت هذه الستة عشر على سلالتين من E. coli كانتا قد اكتسبتا مقاومة لعاثية طبيعية. واستُثنيت من بيانات التدريب، عن قصد، الفيروسات القادرة على إصابة البشر أو الحيوان أو النبات.

  1. الداخلنموذجا اللغة الجينية Evo 1 و Evo 2
  2. ثمتوليد نحو 700,000 جينوم مرشّح
  3. ثماختيار 302 وتصنيع 285 بنجاح
  4. الخارج16 أنتجت عاثيات حيّة قضت على E. coli مقاومة

الوكلاء ينفقون عشرة ملايين توكن و85 دقيقة على مهمة واحدة. وأفضلهم ينهي 15% منها.

نقلًا عن Zongxia Li and colleagues9 يوليو 2026لم يختبره benchr

اختبار Long-Horizon-Terminal-Bench، المنشور على arXiv في 9 يوليو 2026، يقيّم الوكلاء على 46 مهمة طرفية في تسع فئات بدرجات جزئية لا بنجاح أو رسوب. شُغِّل خمسة عشر نموذجًا متقدّمًا. وعند عتبة مكافأة 0.95 يجتاز أقوى نموذج 15.2% من المهام من المحاولة الأولى، و10.9% عند الدرجة الكاملة. والمتوسط عبر الخمسة عشر 4.3% و1.7%. وتستهلك المهمة الواحدة في المتوسط 9.9 مليون توكن، ونحو 231 حلقة، و85.3 دقيقة تشغيل.

  1. الداخل46 مهمة طرفية في تسع فئات
  2. ثمتقييم بدرجات جزئية كثيفة لا بنجاح أو رسوب
  3. ثم15 نموذجًا متقدّمًا، نحو 231 حلقة و85 دقيقة لكل مهمة
  4. الخارجالأفضل 15.2% من أول محاولة، والمتوسط 4.3%

فيلم طويل 95 دقيقة، خمسة عشر شخصًا، أسبوعان

نقلًا عن Aitore Zholdaskali16 مايو 2026لم يختبره benchr

فيلم Hell Grind، وهو فيلم أكشن وفانتازيا أخرجه Aitore Zholdaskali وشارك في كتابته مع Adilkhan Yerzhanov، صنعه فريق من خمسة عشر شخصًا باستخدام Soul Cinema و Soul Cast من Higgsfield إلى جانب مولّد الفيديو Dreamina Seedance 2.0. بلغت الميزانية 500,000 دولار، ذهب منها 400,000 إلى الحوسبة. استغرق الإنتاج أسبوعين. مدة الفيلم 95 دقيقة، وعُرض لأهل الصناعة في كان يوم 16 مايو 2026، في أثناء المهرجان لا ضمنه.

  1. الداخلأمر نصي لكل لقطة، بمعدل 3000 كلمة
  2. ثمكل أمر يحدّد التصوير وقيود الفيزياء
  3. ثميعيد المولّد مقاطع من 15 ثانية، تُكرَّر مرة بعد مرة
  4. ثميختار إنسان اللقطات، ووصف المدير التنفيذي الأمر بأنه «إحساس ماكينة قمار»
  5. الخارج95 دقيقة، جُمعت من أسبوعين من اللقطات

أعطوا وكيل البرمجة منصّة التقييم وتركوه يضبط الوكيل الآخر

نقلًا عن Magnus Müller, Browser Use25 مارس 2026لم يختبره benchr

يصف Magnus Müller من Browser Use كيف سلّموا Claude Code واجهة سطر أوامر لمنصّة التقييم الخاصة بهم مع أمر يعمل في حلقة، عشرين دورة، بالتوازي، ووصفوها بأنها «شجرة بحث في فضاء الوكلاء الممكنين». حقّق الوكيل الناتج 97% على Online-Mind2Web، وهو اختبار من 300 مهمة على 136 موقعًا حقيقيًا (83 سهلة، 143 متوسطة، 74 صعبة). ويصفها المنشور بأنها أعلى نتيجة سُجّلت عليه.

  1. الداخلوكيل متصفّح يعمل أصلًا، ومنصّة التقييم الخاصة به
  2. ثمأُعطي Claude Code واجهة أوامر للتقييمات وأمرًا يعمل في حلقة
  3. ثمعشرون دورة بالتوازي، مقسّمة إلى مجموعتَي تدريب وتحقّق
  4. الخارج97% على Online-Mind2Web

وأيضًا هذا الشهر

فحصها benchr

نتائج منشورة

ما بناه الناس

حين لا يعمل

الأعطال التي يصادفها الناس فعلًا، وأسبابها، وما تفعله بدلًا منها.

شاهد الكل

حركات تستطيع نسخها

كل واحدة تسمّي ما يدخل، وما الحركة، وما الذي يخرج مختلفًا.

شاهد الكل

ادعاءات فحصناها

مضلّل

العاثيات التي صمّمها الذكاء الاصطناعي كائنات جديدة فعلًا، تحمل جينات لم يكتبها شيء في الطبيعة.

ما الصحيح فعلًا

الجينومات ولّدها نموذج، وأنتجت 16 منها عاثيات فعّالة — هذا الجزء صحيح. لكن تحليلًا مستقلًا أجراه Oliver Crook في أوكسفورد وجد أن الجينومات الحيّة الستة عشر تتطابق بنسبة 97 بالمئة وسطيًا مع قالبها ΦX174، أي أنها تقع داخل التنوّع القائم للعاثيات لا خارجه. وخلاصته أنها "أشقّاء الفيروس الأصلي". أما النتيجة الجديدة فعلًا فهي إعادة التركيب لا الابتكار: أخذ أحد التصاميم بروتينًا مقتطعًا بصورة غير مألوفة من نوع عاثية بعيد وجعله يعمل على هيكل ΦX174، وهو ما فشلت فيه الهندسة الجينية التقليدية.

أين انتشر

  • تغطية التبسيط العلمي وملخّصات المجمِّعات لورقة Science الصادرة في آب 2026
  • منشورات على الشبكات الاجتماعية تصوّر النتيجة أول حياة اصطناعية يكتبها ذكاء اصطناعي

فُحص

3 سبتمبر 2026 · Science · IEEE Spectrum