Görev merdiveni
On senaryo, üç zorluk bandı, PASS = 2 (bitti ve sunucu doğrulamalı), PARTIAL = 1 (doğru araç ailesi, eksik sonuç), FAIL = 0 — azami 20:
Beraberlikler dürtme → araç turu → duvar saati ile bozulur; böylece bir
görevi ilk denemede çözen bir model, aynı puana savrularak gelen birinin
önüne geçer.
Kendi modelinizi getirin
Arena iki lehçe konuşur — yerel Ollama ve OpenAI uyumlu her şey:arena-results/ altına: bir JSON, tam senaryo başına dökümler ve
paylaşmaya hazır bir arena-report.md. Sıralama grafiğini şununla üretin:
ARENA_TIER bir çalıştırmanın modellerini etiketler
(SoTA / B-tier / local); ARENA_OUT çıktıyı yönlendirir;
ARENA_MAX_ROUNDS ve ARENA_SCENARIO_TIMEOUT_MS kaçan modelleri sınırlar;
COMFYUI_DEFAULT_CHECKPOINT işleme checkpoint’ini sabitler (checkpoint
klasörünüz txt2img olmayan bir modelle başlıyorsa bunu yapın).
Gereksinimler: txt2img checkpoint’li çalışan bir ComfyUI (SD 1.5 yeter —
senaryolar nitelik değil içerik üzerinde doğrulanır), bir kez npm run build
ve ya Ollama ya da bir API anahtarı.
Her çalıştırmanın kaydettikleri
Puanın ötesinde her sıralama girdisi bir sonucu eyleme geçirilebilir kılan eksenleri taşır (#792):- Nicemleme ve parametre boyutu (Ollama
/api/show) ve oturmuş VRAM (/api/ps, model hâlâ yüklüyken örneklenir) — böylece “8 GB kartım gerçekten ne çalıştırabilir ve bir q4 yeterince iyi mi?” tablodan yanıtlanır. Aynı modeli merdivenden q4 / q8 / fp16 ile geçirmek puanın gerçekten nerede düştüğünü gösterir. Bu alanlar sonda yanıt veremediğinde boştur (barındırılan uç noktaların dengi yoktur) — asla tahmin edilmez. - comfyui-mcp sürümü, okuyabilen her girdinin üzerine damgalanır (kendi paket sürümünü okuyamayan bir çalıştırma sürümsüz kaydedilir, tıpkı damgalama öncesi bir çalıştırma gibi). Mutlak puanlar araç yüzeyi değişince hareket eder, bu yüzden rapor sürümleri (ya da sürümsüz çalıştırmaları) karıştıran herhangi bir sıralamayı doğrudan karşılaştırılamaz olarak işaretler.
- Bir başarısızlıkta modelin uzandığı her araç, yalnızca başarılı olanlar değil. 2+ model aynı senaryoda aynı yanlış aracı seçtikten sonra başarısız olursa (ve geçen hiçbir çalıştırma onu kullanmadıysa) rapor bir kuşkulu senaryo işaretler — alan çapında yanlış bir seçim bir yetenek boşluğu değil bir araç-açıklaması kuşkusudur (emsal: #557/#654, yanlış olan modeller değil bizim kendi ifademizdi). O senaryonun puanlarına güvenmeden önce açıklamayı denetleyin.
Güncel sıralama
- gemini-3.1-pro-preview her çalıştırmada kusursuz olan tek modeldir (20-20-20).
- claude-opus-4.8 ve gpt-5.5 ikisi de 20’ye ulaşır ama diğer çalıştırmalarda bir puan düşürdü.
- B katmanı öncüden bir puan geridedir — GLM-5.1 (19-19-19, alandaki en kararlı model), Kimi-k2.5 ve MiMo-v2.5 19’da — öncü fiyatlandırmasının küçük bir kesrinde.
- Küçük yerel modeller temelleri ve arenanin bir kısmını geçer ama crucible’ın grafik kompozisyonunda takılır; llama3.1:8b araç biçimini hiç tutamaz.
arena-report.md (ve grafiği) bir
GitHub tartışmasında
ya da issue’da yayımlayın, GPU + model etiketlerinizle; böylece sonuçlar
karşılaştırılabilir olur.
Panel duman testi
Bir arena puanı başsız araç sürmeyi kanıtlar;npm run smoke:panel aynı
modelin canlı kenar çubuğu panelinde (akış, tur kapısı, köprü üzerindeki
6 araçlı yönlendirici) ayakta kaldığını kanıtlar. Model başına kendi
portunda yalıtılmış bir orkestratör başlatır ve gerçek bir tur sürer: