Um juiz de IA posto à prova num dataset de 100 debates com os resultados já escritos. Cada debate carrega falhas lógicas plantadas — o vencedor certo é conhecido por construção. A IA julgou todos às cegas, contra esse gabarito.
O ARBITER deu o veredito correto em 92 dos 100 debates do benchmark — medido contra o gabarito fechado, não contra opinião de avaliadores.
Erra apenas na faixa mais difícil: empates filosóficos e pautas extremas de margem mínima.
IC 95% (Wilson): 85,0% – 95,9%O motor anterior (ARBITER 1.0) acertava 72% dos vereditos. A versão atual incorporou o protocolo anti-viés — cada debate é julgado duas vezes com os lados invertidos e a nota é recalculada mecanicamente a partir da auditoria de falácias.
Por que melhorou: o role-swap neutraliza o viés de posição (favorecer quem fala primeiro) e o recálculo mecânico tira a decisão da "intuição" do modelo — o vencedor passa a ser determinado pela aritmética da auditoria.
A dificuldade sobe quando a falácia some e a derrota vem de um argumento abandonado ou de um empate estrutural. Os 15 debates mais difíceis foram julgados pela validação cross-família (Gemini), o que mistura dificuldade e juiz nessa faixa.
No teste do espelho, o mesmo debate é julgado duas vezes com os lados invertidos. O ARBITER acertou os dois lados em todos os pares — e mantém a precisão alta mesmo nas pautas que mais dividem.
Campeonatos mundiais (WUDC) usam painéis de 3 a 7 juízes. O motivo é estrutural: juízes humanos concordam entre si só ~70–75% das vezes (inter-rater reliability). Um juiz isolado é ruidoso demais para decidir sozinho — o protocolo do ARBITER ataca exatamente essa fonte de ruído.
Nota de método: IRR (concordância entre avaliadores) e a acurácia do ARBITER são métricas distintas e não comparáveis diretamente. A referência humana explica por que se usam painéis — não é um placar "IA vs humano". Fonte: The Professional and the Lay Judge (ERIC ED294276) + literatura de IRR.
Os pares-espelho fazem o mesmo tema aparecer com o lado correto ora à esquerda, ora à direita — isolando o viés de conteúdo político. Medimos se a acurácia muda conforme a orientação do lado que deveria vencer. Orientação classificada por tema, derivável do dataset público; os 6 empates ficam fora deste recorte.
Leitura honesta: os 2 únicos deslizes foram casos em que o lado conservador merecia vencer — e são os dois debates geopolíticos mais difíceis (ocupação do MST e Israel-Palestina), no lote cross-família. Diferença de 2 casos em 45, dentro do ruído estatístico; nenhum erro quando o lado progressista merecia. Combinado ao flip-consistency 20/20, não há viés político direcional mensurável — o árbitro premia o argumento estruturalmente superior, de qualquer lado.
Parte dos debates foi reavaliada para medir estabilidade, e os 15 mais difíceis passaram por uma IA concorrente (Gemini, do Google) para quebrar a circularidade — provando que o resultado não depende de uma única família de modelo.
Testamos o ARBITER em todos os 22 debates do PanelBench BP-Competition — formato British Parliamentary com 4 equipes, gabarito = veredito de painéis de juízes humanos certificados (WUDC / EUDC / NAUDC). O nosso protocolo, rodando no LLM mais barato do mercado (Gemini Flash Lite, free tier), supera os sistemas publicados que usaram modelos pagos. É o método, não o modelo.
Por que isso importa: o ganho não vem do LLM (usamos o mais barato), vem do protocolo. Trocar GPT-5.5 pago + Debatrix por Gemini Flash Lite grátis + ARBITER eleva accuracy em +12 pontos percentuais. Achado novo: o desacordo entre os dois flips do role-swap funciona como detector mecânico de empate — quando os flips discordam, o veredito é DRAW. Auditável e reproduzível com 1 comando.
Metodologia completa: (i) Benchmark interno: 100 debates com falhas lógicas plantadas por especificação (gabarito por construção, com flaw_evidence citado) — 85 julgados pelo Claude Haiku, 15 pelo Gemini Flash Lite (cross-família). 20 pares-espelho testam viés posicional. (ii) Benchmark externo: os 22 debates do PanelBench BP-Competition, julgados em 5 trials cada (sem antibias para vencedor único, com antibias para detecção de empate), agregados por voto majoritário. Reprodução: python scripts/bp_run_5trials.py --trials 5 --mixed-as-draw --antibias --only "13,201,202,216,221,222,223,232,233" (e equivalente sem flags para os 13 limpos). Docs em scripts/BP_BENCHMARK_GEMINI_RUN.md.