A escada de tarefas
Dez cenários, três faixas de dificuldade, PASS = 2 (feito e verificado no servidor), PARTIAL = 1 (família de ferramenta certa, desfecho incompleto), FAIL = 0 — máximo 20:
Empates quebram em nudges → rodadas de ferramenta → tempo de parede,
então um modelo que crava uma tarefa de primeira fica acima de um que se
debated até a mesma pontuação.
Traga o seu próprio modelo
A arena fala dois dialetos — Ollama local e qualquer coisa compatível com a OpenAI:arena-results/: um JSON, transcrições completas por cenário,
e um arena-report.md pronto para compartilhar. Gere o gráfico do
ranking com:
ARENA_TIER rotula os modelos de uma execução (SoTA /
B-tier / local); ARENA_OUT redireciona a saída; ARENA_MAX_ROUNDS e
ARENA_SCENARIO_TIMEOUT_MS limitam modelos descontrolados;
COMFYUI_DEFAULT_CHECKPOINT pina o checkpoint de renderização (faça isso
se a sua pasta de checkpoints começa com um modelo que não é txt2img).
Requisitos: um ComfyUI rodando com um checkpoint txt2img (SD 1.5 dá
conta — os cenários são verificados no conteúdo, não na qualidade),
npm run build uma vez, e ou o Ollama ou uma chave de API.
O que cada execução registra
Além da pontuação, cada entrada do ranking carrega os eixos que tornam um resultado acionável (#792):- Quantização e tamanho de parâmetros (Ollama
/api/show) e VRAM residente (/api/ps, amostrada enquanto o modelo ainda está carregado) — então “o que a minha placa de 8 GB de fato consegue rodar, e um q4 é bom o bastante?” dá para responder a partir da tabela. Rodar o mesmo modelo em q4 / q8 / fp16 pela escada mostra onde a pontuação de fato cai. Esses campos ficam em branco quando a sonda não consegue responder (endpoints hospedados não têm equivalente) — nunca adivinhados. - A versão do comfyui-mcp, carimbada em cada entrada cuja execução conseguiu lê-la (uma execução que não consegue ler a própria versão de pacote é registrada sem versão, exatamente como uma execução de antes do carimbo). Pontuações absolutas se movem quando a superfície de ferramentas muda, então o relatório marca qualquer ranking que misture versões (ou execuções sem versão) como não diretamente comparável.
- Cada ferramenta que o modelo foi atrás numa falha, não só as que deram certo. Quando 2+ modelos falham o mesmo cenário depois de escolher a mesma ferramenta errada (e nenhuma execução que passou a usou), o relatório marca um cenário suspeito — uma escolha errada em todo o campo é um suspeito de descrição de ferramenta, não um buraco de capacidade (precedente: #557/#654, em que era o nosso próprio texto, não os modelos, que estava errado). Confira a descrição antes de confiar nas pontuações daquele cenário.
Ranking atual
- gemini-3.1-pro-preview é o único modelo perfeito em todas as execuções (20-20-20).
- claude-opus-4.8 e gpt-5.5 ambos chegam a 20 mas perderam um ponto em outras execuções.
- O B-tier está a um ponto da fronteira — GLM-5.1 (19-19-19, o modelo mais estável do campo), Kimi-k2.5 e MiMo-v2.5 em 19 — a uma fração pequena do preço de fronteira.
- Modelos locais pequenos passam o básico e partes do gauntlet mas emperram na composição de grafo do crucible; llama3.1:8b não consegue segurar o formato de ferramenta de jeito nenhum.
arena-report.md (e o gráfico) numa
discussão do GitHub
ou numa issue, com a sua GPU + as tags dos modelos para os resultados
serem comparáveis.
Teste de fumaça do painel
Uma pontuação da arena prova condução headless de ferramentas;npm run smoke:panel prova que o mesmo modelo sobrevive ao painel
lateral ao vivo (streaming, gating de turno, o roteador de 6
ferramentas pela ponte). Ele sobe um orquestrador isolado por modelo na
própria porta e conduz um turno de verdade: