Skip to content

Rodada oficial-seca-2026-08: 19 modelos, 17.100 respostas (v0.2.0) - #6

Merged
marcosbeto merged 2 commits into
mainfrom
rodada-2026-08-resultados
Aug 18, 2026
Merged

Rodada oficial-seca-2026-08: 19 modelos, 17.100 respostas (v0.2.0)#6
marcosbeto merged 2 commits into
mainfrom
rodada-2026-08-resultados

Conversation

@marcosbeto

Copy link
Copy Markdown
Contributor

Segunda medição de referência do benchmark. Fecha a issue-mãe #3.

Resultado

19 modelos × 900 respostas, todos com a bateria completa. Líder gpt-sol (86,4), lanterna qwen-flash (27,3).

# Modelo Nota # Modelo Nota
1 gpt-sol 86,4 11 qwen-38-max 43,0
2 fable-5 80,2 12 deepseek-flash 39,2
3 gemini-pro 76,0 13 sabia-4 33,1
4 opus-5 75,0 14 qwen-plus 32,2
5 gpt-luna 73,8 15 sonnet-bedrock 30,8
6 gemini-37-flash 70,9 16 sonnet-5 30,5
7 muse-spark 70,6 17 sabiazinho-4 29,1
8 grok-46 54,5 18 haiku-bedrock 28,3
9 deepseek-pro 52,0 19 qwen-flash 27,3
10 kimi-k3 43,8

Custo do resultado publicado US$ 189,47; desembolso real ~US$ 218 (a diferença são as medições descartadas dos Qwen, abaixo).

O que a auditoria pré-publicação encontrou

1. Dois modelos com medição inválida, refeitos. qwen-plus devolveu 427 de 900 respostas vazias (47%) e qwen-38-max, 303 (34%): o teto de max_tokens não comportava o raciocínio, e como a resposta vem depois dele, truncar perdia tudo. Na tarefa C o qwen-plus tinha 93% de respostas inválidas — o número publicado seria ficção.

Refeitos com teto 32768: zero truncadas nos dois. E as notas caíram (52,1→43,0 e 36,4→32,2), o que é o achado mais interessante da rodada: uma resposta vazia nunca aceita um código inventado, então o truncamento funcionava como abstenção forçada e inflava a dimensão anti-alucinação. Nos códigos falsos "limpos", o qwen-plus passou de 18% de aceitação aparente para 35% reais. Números truncados são otimistas, não pessimistas.

2. fable-5 rodou por duas rotas (898 Amazon Bedrock, 2 Google), por falta de pin. As 2 são irreproduzíveis pela rota majoritária: em 18/ago o Bedrock passou a responder 404 ("Claude Fable 5 is not available") para a conta. Mantidas e declaradas (0,2% das chamadas); provedor pinado daqui em diante, aqui e em sonnet-5/opus-5.

3. O leaderboard não expunha provedor, embora a D9 exija que "o leaderboard identifica o provedor". Campo rotas novo, derivado dos brutos, valendo para os 19 modelos.

Verificações

  • 19 × 900 registros, zero duplicatas/faltantes/extras; cobertura 300 itens × 3 paráfrases
  • modelo, modo, dataset_versao, itens_versao uniformes
  • 17.100 julgados, todos com veredito; 9.460 julgamentos do juiz haiku-bedrock (rubrica-v1, mesmo da v0.1.0)
  • Check de consistência do CI passa nas 7 rodadas
  • Truncamento residual (todos <3%, expostos em cortados): gpt-luna 2,0%, deepseek-flash 1,3%, demais ≤0,6%

Documentação

  • D13 nova: identidade de modelo entre releases (ids renomeados: kimikimi-k3, grokgrok-46, gemini-flashgemini-37-flash, qwen-maxqwen-38-max), mudança de condição por modelo, critério de elenco parcial
  • METODOLOGIA: regra de orçamento de tokens e nota de identidade de modelo
  • RELEASES.md: entrada v0.2.0 completa, com as ressalvas acima, a revogação do kimi-k2.5 e a errata do preço do gpt-luna
  • README: números e gráfico da v0.2.0

Nada de resultados/oficial-seca-2026-07/ ou itens/ foi tocado — a v0.1.0 segue imutável.

🤖 Generated with Claude Code

marcosbeto and others added 2 commits August 18, 2026 10:12
Segunda medição de referência do benchmark. Elenco de 19: as 17 vagas da
v0.1.0 (7 com modelo atualizado pelo fabricante, DeepSeek fixado em snapshots
datados) mais muse-spark-1.2 (Meta) e qwen3.7-flash (Alibaba). Todos com a
bateria completa; nenhum parcial.

Líder gpt-sol (86,4), lanterna qwen-flash (27,3). Custo do resultado
publicado US$ 189,47; desembolso real ~US$ 218, a diferença sendo as medições
descartadas dos dois Qwen.

Auditoria antes de publicar encontrou e corrigiu:

- qwen-plus (427 respostas vazias de 900) e qwen-38-max (303) truncavam por
  max_tokens: a resposta vem depois do raciocínio, então truncar perdia tudo.
  Refeitos com teto 32768, zero truncadas. As notas CAÍRAM com a correção
  (52,1→43,0 e 36,4→32,2), porque resposta vazia nunca aceita código
  inventado — truncamento inflava a dimensão anti-alucinação.
- fable-5 rodou por duas rotas (898 Amazon Bedrock, 2 Google) por falta de
  pin. As 2 são irreproduzíveis: a rota Bedrock passou a devolver 404 para a
  conta em 18/ago. Mantidas e declaradas (0,2%); provedor pinado daqui em
  diante, aqui e em sonnet-5/opus-5.
- O leaderboard não expunha provedor, embora a D9 exija. Campo `rotas` novo,
  derivado dos brutos, para os 19 modelos.

Documentação: D13 nova (identidade de modelo entre releases, mudança de
condição por modelo, critério de elenco parcial), METODOLOGIA com a regra de
orçamento de tokens, RELEASES.md com a composição e as ressalvas, README com
os números da v0.2.0.

O exportador passa a derivar o elenco dos brutos da rodada, não do
APRESENTACAO — que desde a D13.1 é um catálogo que também guarda ids de
rodadas antigas.

Co-Authored-By: Claude Opus 5 (1M context) <noreply@anthropic.com>
Seção nova, separada em três grupos porque comparar as duas rodadas exige
distinguir situações que a tabela de posições esconderia (D13.1: o id designa
o modelo, não a vaga).

O grupo que importa é o primeiro: nove modelos remedidos do zero, todos
dentro de ±3 pontos e quatro dentro de ±0,1. É a evidência de que a régua não
se mexeu entre as rodadas — sem ela, nenhuma outra comparação significaria
nada.

O segundo mostra o que as gerações novas entregaram: Gemini Flash +29,5 e
Opus +29,3 num mês, contra Qwen Max −1,3. Sem tendência única.

Ficam de fora os três cuja condição de medição mudou junto (snapshot ou
orçamento de tokens), com as ressalvas apontando para RELEASES.md.

Co-Authored-By: Claude Opus 5 (1M context) <noreply@anthropic.com>
@marcosbeto
marcosbeto merged commit 08db41a into main Aug 18, 2026
1 check passed
@marcosbeto
marcosbeto deleted the rodada-2026-08-resultados branch August 18, 2026 13:19
Sign up for free to join this conversation on GitHub. Already have an account? Sign in to comment

Labels

None yet

Projects

None yet

Development

Successfully merging this pull request may close these issues.

1 participant