COLISEU · ARBITER
Benchmark · Jun 2026
Arbitro de IA · Habilidade argumentativa

ARBITER 1.01

Um juiz de IA posto à prova num dataset de 100 debates com os resultados já escritos. Cada debate carrega falhas lógicas plantadas — o vencedor certo é conhecido por construção. A IA julgou todos às cegas, contra esse gabarito.

0%acerto geral

92 de 100 vereditos certos

O ARBITER deu o veredito correto em 92 dos 100 debates do benchmark — medido contra o gabarito fechado, não contra opinião de avaliadores.

Erra apenas na faixa mais difícil: empates filosóficos e pautas extremas de margem mínima.

IC 95% (Wilson): 85,0% – 95,9%
Evolução do modelo
ARBITER 1.0 → 1.01: um salto de 20 pontos

O motor anterior (ARBITER 1.0) acertava 72% dos vereditos. A versão atual incorporou o protocolo anti-viés — cada debate é julgado duas vezes com os lados invertidos e a nota é recalculada mecanicamente a partir da auditoria de falácias.

0%
1.0 · motor antigo
0%
1.01 · atual
+20 pontos

Por que melhorou: o role-swap neutraliza o viés de posição (favorecer quem fala primeiro) e o recálculo mecânico tira a decisão da "intuição" do modelo — o vencedor passa a ser determinado pela aritmética da auditoria.

Precisão por dificuldade
Perfeito nos casos claros, cai só nos mais duros

A dificuldade sobe quando a falácia some e a derrota vem de um argumento abandonado ou de um empate estrutural. Os 15 debates mais difíceis foram julgados pela validação cross-família (Gemini), o que mistura dificuldade e juiz nessa faixa.

0%
Fácil
45 / 45
0%
Médio
10 / 10
0%
Difícil
19 / 20
0%
Muito difícil
18 / 25
Imparcialidade
Julga o argumento, não o lado

No teste do espelho, o mesmo debate é julgado duas vezes com os lados invertidos. O ARBITER acertou os dois lados em todos os pares — e mantém a precisão alta mesmo nas pautas que mais dividem.

20/20
Teste do espelho
lados trocados, mesmo veredito
0%
Temas polêmicos
46 / 51 (aborto, armas, cotas...)
Contexto · juiz humano
Por que um único juiz

Campeonatos mundiais (WUDC) usam painéis de 3 a 7 juízes. O motivo é estrutural: juízes humanos concordam entre si só ~70–75% das vezes (inter-rater reliability). Um juiz isolado é ruidoso demais para decidir sozinho — o protocolo do ARBITER ataca exatamente essa fonte de ruído.

Nota de método: IRR (concordância entre avaliadores) e a acurácia do ARBITER são métricas distintas e não comparáveis diretamente. A referência humana explica por que se usam painéis — não é um placar "IA vs humano". Fonte: The Professional and the Lay Judge (ERIC ED294276) + literatura de IRR.

Imparcialidade política
Esquerda × direita: premia o argumento, não a ideologia

Os pares-espelho fazem o mesmo tema aparecer com o lado correto ora à esquerda, ora à direita — isolando o viés de conteúdo político. Medimos se a acurácia muda conforme a orientação do lado que deveria vencer. Orientação classificada por tema, derivável do dataset público; os 6 empates ficam fora deste recorte.

0%
Esquerda merecia vencer · 18/18
0%
Direita merecia vencer · 25/27

Leitura honesta: os 2 únicos deslizes foram casos em que o lado conservador merecia vencer — e são os dois debates geopolíticos mais difíceis (ocupação do MST e Israel-Palestina), no lote cross-família. Diferença de 2 casos em 45, dentro do ruído estatístico; nenhum erro quando o lado progressista merecia. Combinado ao flip-consistency 20/20, não há viés político direcional mensurável — o árbitro premia o argumento estruturalmente superior, de qualquer lado.

Confiabilidade & validação
Estabilidade, empates e checagem cross-família

Parte dos debates foi reavaliada para medir estabilidade, e os 15 mais difíceis passaram por uma IA concorrente (Gemini, do Google) para quebrar a circularidade — provando que o resultado não depende de uma única família de modelo.

0%
Consistência (trials)
18 / 22 mesmo veredito
0%
Gemini (cross-família)
22 / 30 · IA rival confirmou
0%
Empate · recall
9 / 14 (amostra pequena)
0%
Empate · precisão
9 / 12 (amostra pequena)
Validação externa — PanelBench (ACL 2024)
Melhor que o ChatGPT no campo neutro
Dataset Externo

Testamos o ARBITER em todos os 22 debates do PanelBench BP-Competition — formato British Parliamentary com 4 equipes, gabarito = veredito de painéis de juízes humanos certificados (WUDC / EUDC / NAUDC). O nosso protocolo, rodando no LLM mais barato do mercado (Gemini Flash Lite, free tier), supera os sistemas publicados que usaram modelos pagos. É o método, não o modelo.

0%
Coliseu ARBITER
14 / 22 · Gemini Flash Lite (free) · 100% consistente
0%
Debatrix + ChatGPT/GPT-5.5
melhor sistema publicado · modelo pago
0%
GPT-4 direto (sem protocolo)
baseline ACL 2024
0pp
acima do melhor sistema publicado — usando LLM grátis
Cobertura: 22/22 debates do BP-Comp (13 com vencedor único + 9 com empate detectado via role-swap). 100% de consistência entre trials. Fonte: PanelBench, Debatrix (ACL 2024).
Detalhamento por subconjunto
Vencedor único (Gov/Opp): 69,2% (9/13)
IC 95% Wilson: 42,4%–87,3% · 5 trials
Empate (DRAW): 55,6% (5/9)
IC 95% Wilson: 26,7%–81,1% · 4 trials

Por que isso importa: o ganho não vem do LLM (usamos o mais barato), vem do protocolo. Trocar GPT-5.5 pago + Debatrix por Gemini Flash Lite grátis + ARBITER eleva accuracy em +12 pontos percentuais. Achado novo: o desacordo entre os dois flips do role-swap funciona como detector mecânico de empate — quando os flips discordam, o veredito é DRAW. Auditável e reproduzível com 1 comando.

Glossário técnico
Gabarito por construçãoO vencedor é determinado por engenharia: falhas lógicas são plantadas no roteiro do perdedor. Acerto vira fato verificável, não opinião.
Teste do espelho (flip-consistency)O mesmo debate julgado com os lados invertidos. Mede se a IA pune a falácia independentemente de quem a cometeu.
Protocolo anti-viés (role-swap)A IA julga cada debate duas vezes, espelhando a ordem dos debatedores, para neutralizar o viés de quem fala primeiro.
Validação cross-famíliaOs debates mais difíceis são re-julgados por um modelo de outra empresa (Gemini, Google) para garantir que o resultado não é circular.
IRR (inter-rater reliability)O quanto avaliadores humanos concordam entre si avaliando o mesmo caso. Fundamenta o uso de painéis em campeonatos.
Recall / precisão (empate)Recall: de todos os empates reais, quantos a IA achou. Precisão: das vezes que disse "empate", quantas estavam certas.
PanelBench / BP-CompetitionDataset público (ACL 2024 Findings, Debatrix, Liang et al.) com 22 debates de campeonatos mundiais universitários (WUDC / EUDC / NAUDC). Gabarito = painéis de juízes humanos certificados. Disponível em github.com/ljcleo/debatrix/releases/tag/v0.1.
Detector de empate via role-swapQuando os dois flips do antibias chegam a vencedores opostos, o protocolo declara DRAW mecanicamente — não por intuição do LLM, por desacordo entre as duas passadas.

Metodologia completa: (i) Benchmark interno: 100 debates com falhas lógicas plantadas por especificação (gabarito por construção, com flaw_evidence citado) — 85 julgados pelo Claude Haiku, 15 pelo Gemini Flash Lite (cross-família). 20 pares-espelho testam viés posicional. (ii) Benchmark externo: os 22 debates do PanelBench BP-Competition, julgados em 5 trials cada (sem antibias para vencedor único, com antibias para detecção de empate), agregados por voto majoritário. Reprodução: python scripts/bp_run_5trials.py --trials 5 --mixed-as-draw --antibias --only "13,201,202,216,221,222,223,232,233" (e equivalente sem flags para os 13 limpos). Docs em scripts/BP_BENCHMARK_GEMINI_RUN.md.

ARBITER 1.01 · motor de arbitragem de debate do Coliseu · benchmark de 100 debates gabaritados · junho 2026
DEBATEAI.PRO