> ## Documentation Index
> Fetch the complete documentation index at: https://comfyui-mcp.artokun.io/docs/llms.txt
> Use this file to discover all available pages before exploring further.

# حلبة النماذج اللغوية

> قيّم أي نموذج لغوي وكيلاً على مهام ComfyUI حقيقية — محليًا (Ollama)، أو مستضافًا (OpenRouter/DeepSeek/GLM/MiMo)، أو في الطليعة. كل درجة تُتحقَّق مقابل خادم ComfyUI، لا ادّعاءات النموذج. أمر واحد، وتقارير جاهزة للمشاركة.

تجيب **حلبة النماذج اللغوية لـ ComfyUI** عن سؤال واحد بصدق: *هل يستطيع هذا
النموذج قيادة ComfyUI فعلًا؟* لا «هل يبدو واثقًا» — فنتيجة كل سيناريو
**تُتحقَّق مقابل خادم ComfyUI نفسه** (سجل المهام، ومعاملات المخطط المنفَّذ،
وملفات المخرجات الحقيقية وأحجامها بالبكسل). وتعمل عبر [موجّه الأدوات
المضغوط](/docs/docs/ar/local-llms) نفسه الذي تستخدمه اللوحة وعملاء MCP، فدرجة
الحلبة تتنبّأ بسلوك الوكيل الحقيقي.

```bash theme={null}
npm run arena          # scores the default local field via Ollama
```

## سلّم المهام

عشرة سيناريوهات، وثلاثة نطاقات صعوبة، PASS = 2 (أُنجز وتُحقِّق منه الخادم)،
PARTIAL = 1 (عائلة الأدوات صحيحة، والنتيجة ناقصة)، FAIL = 0 — الحد الأقصى
**20**:

| النطاق    | السيناريو                                                                                                                                                                                                                                           | ما الذي يثبته                                              |
| --------- | --------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------- | ---------------------------------------------------------- |
| الأساسيات | `health` · `models` · `registry` · `queue`                                                                                                                                                                                                          | اكتشاف الأدوات + مهام باستدعاء واحد                        |
| Gauntlet  | `generate` (معالجة غير متزامنة + استطلاع) · `precision` (تهبط الخطوات/الحجم بدقة في المخطط المنفَّذ) · `breakfix` (فشل متعمَّد → تشخيص → تعافٍ) · `provenance` (اعثر على سجل الأصول، وأعد توليدها عبر generate\_image (action:"regenerate") بتجاوز) | سلاسل متعدّدة القفزات، وصدق المعاملات، والتعافي من الأخطاء |
| Crucible  | `multiout` (مخطط واحد يحفظ مخرجات 512px + 1024px — يُتحقَّق بقراءة ترويسات PNG) · `pipeline` (img2img على مرحلتين متسلسل عبر `upload_image (action:"stage")`)                                                                                       | تركيب المخطط الخام — لا يغطّي أي قالب هذين                 |

تُكسر التعادلات على **التنبيهات → جولات الأدوات → زمن الجدار**، فالنموذج الذي
ينجز مهمة من المحاولة الأولى يتقدّم على من تخبّط إلى الدرجة نفسها.

## أحضر نموذجك

تتحدث الحلبة لهجتين — Ollama المحلي وأي شيء متوافق مع OpenAI:

```bash theme={null}
# Local models (Ollama)
ARENA_MODELS="gemma4:e4b,qwen3:4b" npm run arena

# Any hosted model — one OpenRouter key covers most of the market
ARENA_API=openai ARENA_BASE_URL=https://openrouter.ai/api/v1 \
ARENA_API_KEY=sk-or-... ARENA_TIER=B-tier \
ARENA_MODELS="deepseek/deepseek-v3.2,z-ai/glm-5.1,xiaomi/mimo-v2.5" \
npm run arena

# Direct providers work too (any /v1/chat/completions endpoint):
#   DeepSeek:  ARENA_BASE_URL=https://api.deepseek.com/v1
#   vLLM/LM Studio: point ARENA_BASE_URL at your server
```

ت**ُدمَج النتائج عبر الاستدعاءات** (شغّل نموذجًا واحدًا في كل مرة إن شئت) في
`arena-results/`: ملف JSON، ونصوص كاملة لكل سيناريو، و`arena-report.md` جاهز
للمشاركة. ولّد رسم لوحة المتصدّرين بـ:

```bash theme={null}
node scripts/arena-graphic.mjs    # light + dark SVGs from your own results
```

مقابض مفيدة: `ARENA_TIER` يسمّي نماذج التشغيل (SoTA / B-tier / local)؛
و`ARENA_OUT` يعيد توجيه المخرجات؛ و`ARENA_MAX_ROUNDS` و
`ARENA_SCENARIO_TIMEOUT_MS` يحدّان النماذج الجامحة؛
و`COMFYUI_DEFAULT_CHECKPOINT` يثبّت ملف Checkpoint للمعالجة (افعل هذا إن كان
مجلد ملفات Checkpoint يبدأ بنموذج ليس txt2img).

**المتطلبات**: نسخة ComfyUI قيد التشغيل مع ملف Checkpoint لـ txt2img (يكفي
SD 1.5 — فالسيناريوهات تُتحقَّق على المحتوى لا الجودة)، و`npm run build`
مرة واحدة، وإمّا Ollama أو مفتاح API.

## ما الذي تسجّله كل عملية تشغيل

إلى جانب الدرجة، يحمل كل مدخل في لوحة المتصدّرين المحاور التي تجعل النتيجة
قابلة للتنفيذ (#792):

* **التكميم وحجم المعاملات** (Ollama `/api/show`) و**ذاكرة VRAM المقيمة**
  (`/api/ps`، تُؤخذ العينة والنموذج ما يزال محمَّلًا) — حتى يصير «ما الذي
  تستطيع بطاقتي ذات 8 غيغابايت تشغيله فعلًا، وهل يكفي q4؟» قابلًا للإجابة من
  الجدول. وتشغيل النموذج نفسه عند q4 / q8 / fp16 عبر السلّم يُظهر أين تسقط
  الدرجة فعلًا. وتبقى هذه الحقول فارغة حين يعجز المسبار عن الإجابة (فنقاط
  النهاية المستضافة لا معادل لها) — ولا تُخمَّن أبدًا.
* **إصدار comfyui-mcp**، موسوم على كل مدخل استطاع تشغيله قراءته (وتُسجَّل
  عملية تشغيل لا تستطيع قراءة إصدار حزمتها *بلا إصدار*، تمامًا مثل تشغيل قبل
  الوسم). تتحرّك الدرجات المطلقة عندما تتغيّر مجموعة الأدوات، لذا يعلّم التقرير
  أي لوحة متصدّرين تخلط إصدارات (أو تشغيلات بلا إصدار) بأنها **غير قابلة
  للمقارنة مباشرة**.
* **كل أداة مدّ النموذج يده إليها** عند الفشل، لا الناجحة فحسب. وعندما يفشل
  نموذجان أو أكثر في السيناريو نفسه بعد اختيار الأداة الخاطئة نفسها (ولم
  يستخدمها أي تشغيل ناجح)، يعلّم التقرير **سيناريوًا مشتبهًا** — فاختيار خاطئ
  على مستوى الحقل مشتبه في *وصف* الأداة، لا فجوة قدرات (سابقة: #557/#654، حيث
  كان صياغتنا نحن، لا النماذج، هي الخاطئة). تحقّق من الوصف قبل الوثوق بدرجات
  ذلك السيناريو.

## لوحة المتصدّرين الحالية

<img className="block dark:hidden" src="https://mintcdn.com/artokun/5H8lTKcgPKI2HLeL/images/arena-leaderboard-light.svg?fit=max&auto=format&n=5H8lTKcgPKI2HLeL&q=85&s=53c8899647453e90103622a7d841e926" alt="لوحة المتصدّرين في حلبة النماذج اللغوية لـ ComfyUI" width="860" height="734" data-path="images/arena-leaderboard-light.svg" />

<img className="hidden dark:block" src="https://mintcdn.com/artokun/5H8lTKcgPKI2HLeL/images/arena-leaderboard-dark.svg?fit=max&auto=format&n=5H8lTKcgPKI2HLeL&q=85&s=b8a4133c1fa471ebb48396bf91e81156" alt="لوحة المتصدّرين في حلبة النماذج اللغوية لـ ComfyUI" width="860" height="734" data-path="images/arena-leaderboard-dark.svg" />

14 نموذجًا، أفضل من 3 على العنقود العلوي. أبرز النتائج:

* **gemini-3.1-pro-preview هو النموذج الوحيد المثالي في كل تشغيل** (20-20-20).
* يصل claude-opus-4.8 وgpt-5.5 كلاهما إلى 20 لكن أسقطا نقطة في تشغيلات أخرى.
* **فئة B تبعد نقطة واحدة عن الطليعة** — GLM-5.1 (19-19-19، أكثر نموذج ثباتًا
  في الحقل)، وKimi-k2.5 وMiMo-v2.5 عند 19 — بجزء صغير من تسعير الطليعة.
* تتجاوز النماذج المحلية الصغيرة الأساسيات وأجزاءً من gauntlet لكنها تتعثّر
  في تركيب مخطط crucible؛ ولا يستطيع llama3.1:8b الإمساك بتنسيق الأدوات أصلًا.

نرحّب بتشغيلات مجتمعية لنماذج لم نغطّها — انشر `arena-report.md` (والرسم) في
[نقاش GitHub](https://github.com/artokun/comfyui-mcp/discussions) أو مشكلة، مع
وحدة GPU + وسوم النماذج حتى تكون النتائج قابلة للمقارنة.

## اختبار الدخان للوحة

تثبت درجة الحلبة قيادة الأدوات بلا واجهة؛ ويثبت `npm run smoke:panel` أن
النموذج نفسه ينجو من **اللوحة الجانبية الحيّة** (البث، وبوابة الأدوار، وموجّه
الأدوات الستة عبر الجسر). يشغّل منسّقًا معزولًا لكل نموذج على منفذه ويقود دورًا
حقيقيًا واحدًا:

```bash theme={null}
SMOKE_MODELS="gemma4:e4b,xiaomi/mimo-v2.5" npm run smoke:panel
```
