Skip to main content
تجيب حلبة النماذج اللغوية لـ ComfyUI عن سؤال واحد بصدق: هل يستطيع هذا النموذج قيادة ComfyUI فعلًا؟ لا «هل يبدو واثقًا» — فنتيجة كل سيناريو تُتحقَّق مقابل خادم ComfyUI نفسه (سجل المهام، ومعاملات المخطط المنفَّذ، وملفات المخرجات الحقيقية وأحجامها بالبكسل). وتعمل عبر موجّه الأدوات المضغوط نفسه الذي تستخدمه اللوحة وعملاء MCP، فدرجة الحلبة تتنبّأ بسلوك الوكيل الحقيقي.

سلّم المهام

عشرة سيناريوهات، وثلاثة نطاقات صعوبة، PASS = 2 (أُنجز وتُحقِّق منه الخادم)، PARTIAL = 1 (عائلة الأدوات صحيحة، والنتيجة ناقصة)، FAIL = 0 — الحد الأقصى 20: تُكسر التعادلات على التنبيهات → جولات الأدوات → زمن الجدار، فالنموذج الذي ينجز مهمة من المحاولة الأولى يتقدّم على من تخبّط إلى الدرجة نفسها.

أحضر نموذجك

تتحدث الحلبة لهجتين — Ollama المحلي وأي شيء متوافق مع OpenAI:
تُدمَج النتائج عبر الاستدعاءات (شغّل نموذجًا واحدًا في كل مرة إن شئت) في arena-results/: ملف JSON، ونصوص كاملة لكل سيناريو، وarena-report.md جاهز للمشاركة. ولّد رسم لوحة المتصدّرين بـ:
مقابض مفيدة: ARENA_TIER يسمّي نماذج التشغيل (SoTA / B-tier / local)؛ وARENA_OUT يعيد توجيه المخرجات؛ وARENA_MAX_ROUNDS و ARENA_SCENARIO_TIMEOUT_MS يحدّان النماذج الجامحة؛ وCOMFYUI_DEFAULT_CHECKPOINT يثبّت ملف Checkpoint للمعالجة (افعل هذا إن كان مجلد ملفات Checkpoint يبدأ بنموذج ليس txt2img). المتطلبات: نسخة ComfyUI قيد التشغيل مع ملف Checkpoint لـ txt2img (يكفي SD 1.5 — فالسيناريوهات تُتحقَّق على المحتوى لا الجودة)، وnpm run build مرة واحدة، وإمّا Ollama أو مفتاح API.

ما الذي تسجّله كل عملية تشغيل

إلى جانب الدرجة، يحمل كل مدخل في لوحة المتصدّرين المحاور التي تجعل النتيجة قابلة للتنفيذ (#792):
  • التكميم وحجم المعاملات (Ollama /api/show) وذاكرة VRAM المقيمة (/api/ps، تُؤخذ العينة والنموذج ما يزال محمَّلًا) — حتى يصير «ما الذي تستطيع بطاقتي ذات 8 غيغابايت تشغيله فعلًا، وهل يكفي q4؟» قابلًا للإجابة من الجدول. وتشغيل النموذج نفسه عند q4 / q8 / fp16 عبر السلّم يُظهر أين تسقط الدرجة فعلًا. وتبقى هذه الحقول فارغة حين يعجز المسبار عن الإجابة (فنقاط النهاية المستضافة لا معادل لها) — ولا تُخمَّن أبدًا.
  • إصدار comfyui-mcp، موسوم على كل مدخل استطاع تشغيله قراءته (وتُسجَّل عملية تشغيل لا تستطيع قراءة إصدار حزمتها بلا إصدار، تمامًا مثل تشغيل قبل الوسم). تتحرّك الدرجات المطلقة عندما تتغيّر مجموعة الأدوات، لذا يعلّم التقرير أي لوحة متصدّرين تخلط إصدارات (أو تشغيلات بلا إصدار) بأنها غير قابلة للمقارنة مباشرة.
  • كل أداة مدّ النموذج يده إليها عند الفشل، لا الناجحة فحسب. وعندما يفشل نموذجان أو أكثر في السيناريو نفسه بعد اختيار الأداة الخاطئة نفسها (ولم يستخدمها أي تشغيل ناجح)، يعلّم التقرير سيناريوًا مشتبهًا — فاختيار خاطئ على مستوى الحقل مشتبه في وصف الأداة، لا فجوة قدرات (سابقة: #557/#654، حيث كان صياغتنا نحن، لا النماذج، هي الخاطئة). تحقّق من الوصف قبل الوثوق بدرجات ذلك السيناريو.

لوحة المتصدّرين الحالية

لوحة المتصدّرين في حلبة النماذج اللغوية لـ ComfyUI 14 نموذجًا، أفضل من 3 على العنقود العلوي. أبرز النتائج:
  • gemini-3.1-pro-preview هو النموذج الوحيد المثالي في كل تشغيل (20-20-20).
  • يصل claude-opus-4.8 وgpt-5.5 كلاهما إلى 20 لكن أسقطا نقطة في تشغيلات أخرى.
  • فئة B تبعد نقطة واحدة عن الطليعة — GLM-5.1 (19-19-19، أكثر نموذج ثباتًا في الحقل)، وKimi-k2.5 وMiMo-v2.5 عند 19 — بجزء صغير من تسعير الطليعة.
  • تتجاوز النماذج المحلية الصغيرة الأساسيات وأجزاءً من gauntlet لكنها تتعثّر في تركيب مخطط crucible؛ ولا يستطيع llama3.1:8b الإمساك بتنسيق الأدوات أصلًا.
نرحّب بتشغيلات مجتمعية لنماذج لم نغطّها — انشر arena-report.md (والرسم) في نقاش GitHub أو مشكلة، مع وحدة GPU + وسوم النماذج حتى تكون النتائج قابلة للمقارنة.

اختبار الدخان للوحة

تثبت درجة الحلبة قيادة الأدوات بلا واجهة؛ ويثبت npm run smoke:panel أن النموذج نفسه ينجو من اللوحة الجانبية الحيّة (البث، وبوابة الأدوار، وموجّه الأدوات الستة عبر الجسر). يشغّل منسّقًا معزولًا لكل نموذج على منفذه ويقود دورًا حقيقيًا واحدًا: