Лестница задач
Десять сценариев, три полосы сложности, PASS = 2 (сделано и проверено сервером), PARTIAL = 1 (правильное семейство инструментов, неполный исход), FAIL = 0 — максимум 20:
Ничьи разбиваются по подталкиваниям → кругам инструментов → стенному
времени, поэтому модель, которая берёт задачу с первой попытки, выше той,
которая барахталась до того же балла.
Принесите свою модель
Арена говорит на двух диалектах — локальная Ollama и всё OpenAI-совместимое:arena-results/: JSON, полные транскрипты по сценариям и готовый
к публикации arena-report.md. Графику таблицы лидеров соберите так:
ARENA_TIER помечает модели запуска (SoTA / B-tier / local);
ARENA_OUT перенаправляет вывод; ARENA_MAX_ROUNDS и
ARENA_SCENARIO_TIMEOUT_MS ограничивают разбежавшиеся модели;
COMFYUI_DEFAULT_CHECKPOINT фиксирует чекпоинт рендера (сделайте это, если
папка чекпоинтов начинается с модели не-txt2img).
Требования: работающий ComfyUI с чекпоинтом txt2img (SD 1.5 достаточно —
сценарии проверяются по содержанию, не по качеству), один раз npm run build
и либо Ollama, либо API-ключ.
Что записывает каждый запуск
Помимо балла, каждая запись таблицы лидеров несёт оси, которые делают результат действенным (#792):- Квантизация и размер параметров (Ollama
/api/show) и резидентная VRAM (/api/ps, снимается, пока модель ещё загружена) — чтобы «что реально потянет моя карта на 8 ГБ и хватит ли q4?» можно было ответить по таблице. Прогон той же модели на q4 / q8 / fp16 по лестнице показывает, где балл реально падает. Эти поля пусты, когда зонд не может ответить (у размещённых эндпоинтов нет эквивалента) — никогда не угаданы. - Версия comfyui-mcp, проштампованная на каждой записи, чей запуск смог её прочитать (запуск, который не может прочитать версию своего пакета, записывается unversioned, ровно как запуск до штамповки). Абсолютные баллы двигаются, когда меняется поверхность инструментов, поэтому отчёт помечает любую таблицу лидеров, смешивающую версии (или unversioned запуски), как не напрямую сравнимую.
- Каждый инструмент, за которым потянулась модель при провале, а не только те, что удались. Когда 2+ модели проваливают один сценарий, выбрав один и тот же неверный инструмент (и ни один успешный прогон его не использовал), отчёт помечает подозрительный сценарий — полевой неверный выбор подозревает описание инструмента, а не пробел в способностях (прецедент: #557/#654, где неверной была наша формулировка, а не модели). Проверьте описание, прежде чем доверять баллам этого сценария.
Текущая таблица лидеров
- gemini-3.1-pro-preview — единственная модель, которая идеальна каждый прогон (20-20-20).
- claude-opus-4.8 и gpt-5.5 оба доходят до 20, но в других прогонах теряли балл.
- B-tier в одном балле от передовых — GLM-5.1 (19-19-19, самая стабильная модель в поле), Kimi-k2.5 и MiMo-v2.5 на 19 — за малую долю цены передовых.
- Небольшие локальные модели закрывают basics и части gauntlet, но спотыкаются на композиции графа crucible; llama3.1:8b вообще не держит формат инструментов.
arena-report.md (и графику) в
GitHub discussion или
issue, с GPU + тегами моделей, чтобы результаты были сравнимы.
Дымовой тест панели
Балл арены доказывает headless-управление инструментами;npm run smoke:panel
доказывает, что та же модель выживает в живой боковой панели (стриминг,
гейтинг ходов, 6-инструментный роутер через мост). Он поднимает изолированный
оркестратор на каждую модель на своём порту и проводит один настоящий ход: