La escala de tareas
Diez escenarios, tres bandas de dificultad, PASS = 2 (hecho y verificado por el servidor), PARTIAL = 1 (familia de herramientas correcta, resultado incompleto), FAIL = 0 — máximo 20:
Los empates se deshacen por empujones → rondas de herramientas → tiempo
de reloj, así que un modelo que clava una tarea a la primera queda por
encima de uno que se revolvió hasta la misma puntuación.
Trae tu propio modelo
La arena habla dos dialectos — Ollama local y cualquier cosa compatible con OpenAI:arena-results/: un JSON, transcripciones completas por
escenario y un arena-report.md listo para compartir. Genera el gráfico de
clasificación con:
ARENA_TIER etiqueta los modelos de una ejecución (SoTA /
B-tier / local); ARENA_OUT redirige la salida; ARENA_MAX_ROUNDS y
ARENA_SCENARIO_TIMEOUT_MS acotan los modelos desbocados;
COMFYUI_DEFAULT_CHECKPOINT fija el checkpoint de render (hazlo si tu
carpeta de checkpoints empieza por un modelo que no es txt2img).
Requisitos: un ComfyUI en ejecución con un checkpoint txt2img (SD 1.5
basta — los escenarios se verifican por contenido, no por calidad),
npm run build una vez, y o bien Ollama o una clave API.
Lo que registra cada ejecución
Más allá de la puntuación, cada entrada de la clasificación lleva los ejes que hacen un resultado accionable (#792):- Cuantización y tamaño de parámetros (Ollama
/api/show) y VRAM residente (/api/ps, muestreada mientras el modelo sigue cargado) — así «¿qué puede ejecutar de verdad mi tarjeta de 8 GB, y vale un q4?» se responde desde la tabla. Ejecutar el mismo modelo en q4 / q8 / fp16 por la escala muestra dónde cae de verdad la puntuación. Estos campos quedan en blanco cuando la sonda no puede responder (los endpoints alojados no tienen equivalente) — nunca se adivinan. - La versión de comfyui-mcp, sellada en cada entrada cuya ejecución pudo leerla (una ejecución que no puede leer su propia versión de paquete se registra sin versión, exactamente como una ejecución anterior al sello). Las puntuaciones absolutas se mueven cuando cambia la superficie de herramientas, así que el informe marca cualquier clasificación que mezcle versiones (o ejecuciones sin versión) como no directamente comparable.
- Cada herramienta a la que el modelo tendió la mano en un fallo, no solo las que acertaron. Cuando 2+ modelos fallan el mismo escenario después de elegir la misma herramienta incorrecta (y ninguna ejecución que pasó la usó), el informe marca un escenario sospechoso — una selección incorrecta en todo el campo es un sospechoso de descripción de herramienta, no un hueco de capacidad (precedente: #557/#654, donde era nuestro propio texto, no los modelos, el que estaba mal). Comprueba la descripción antes de fiarte de las puntuaciones de ese escenario.
Clasificación actual
- gemini-3.1-pro-preview es el único modelo perfecto en cada ejecución (20-20-20).
- claude-opus-4.8 y gpt-5.5 llegan ambos a 20 pero perdieron un punto en otras ejecuciones.
- El B-tier está a un punto del frontier — GLM-5.1 (19-19-19, el modelo más regular del campo), Kimi-k2.5 y MiMo-v2.5 a 19 — por una pequeña fracción del precio frontier.
- Los modelos locales pequeños superan lo básico y partes del gauntlet pero se atascan en la composición de grafo del crucible; llama3.1:8b no puede sostener el formato de herramientas en absoluto.
arena-report.md (y el gráfico) en una
discusión de GitHub o
una incidencia, con tu GPU + las etiquetas de modelo para que los resultados
sean comparables.
Prueba de humo del panel
Una puntuación de arena demuestra el control headless de herramientas;npm run smoke:panel demuestra que el mismo modelo sobrevive al panel
lateral en vivo (streaming, gating de turnos, el router de 6 herramientas
sobre el puente). Lanza un orquestador aislado por modelo en su propio
puerto y conduce un turno real: