Rodada oficial-seca-2026-08: 19 modelos, 17.100 respostas (v0.2.0) - #6
Merged
Conversation
Segunda medição de referência do benchmark. Elenco de 19: as 17 vagas da v0.1.0 (7 com modelo atualizado pelo fabricante, DeepSeek fixado em snapshots datados) mais muse-spark-1.2 (Meta) e qwen3.7-flash (Alibaba). Todos com a bateria completa; nenhum parcial. Líder gpt-sol (86,4), lanterna qwen-flash (27,3). Custo do resultado publicado US$ 189,47; desembolso real ~US$ 218, a diferença sendo as medições descartadas dos dois Qwen. Auditoria antes de publicar encontrou e corrigiu: - qwen-plus (427 respostas vazias de 900) e qwen-38-max (303) truncavam por max_tokens: a resposta vem depois do raciocínio, então truncar perdia tudo. Refeitos com teto 32768, zero truncadas. As notas CAÍRAM com a correção (52,1→43,0 e 36,4→32,2), porque resposta vazia nunca aceita código inventado — truncamento inflava a dimensão anti-alucinação. - fable-5 rodou por duas rotas (898 Amazon Bedrock, 2 Google) por falta de pin. As 2 são irreproduzíveis: a rota Bedrock passou a devolver 404 para a conta em 18/ago. Mantidas e declaradas (0,2%); provedor pinado daqui em diante, aqui e em sonnet-5/opus-5. - O leaderboard não expunha provedor, embora a D9 exija. Campo `rotas` novo, derivado dos brutos, para os 19 modelos. Documentação: D13 nova (identidade de modelo entre releases, mudança de condição por modelo, critério de elenco parcial), METODOLOGIA com a regra de orçamento de tokens, RELEASES.md com a composição e as ressalvas, README com os números da v0.2.0. O exportador passa a derivar o elenco dos brutos da rodada, não do APRESENTACAO — que desde a D13.1 é um catálogo que também guarda ids de rodadas antigas. Co-Authored-By: Claude Opus 5 (1M context) <noreply@anthropic.com>
Seção nova, separada em três grupos porque comparar as duas rodadas exige distinguir situações que a tabela de posições esconderia (D13.1: o id designa o modelo, não a vaga). O grupo que importa é o primeiro: nove modelos remedidos do zero, todos dentro de ±3 pontos e quatro dentro de ±0,1. É a evidência de que a régua não se mexeu entre as rodadas — sem ela, nenhuma outra comparação significaria nada. O segundo mostra o que as gerações novas entregaram: Gemini Flash +29,5 e Opus +29,3 num mês, contra Qwen Max −1,3. Sem tendência única. Ficam de fora os três cuja condição de medição mudou junto (snapshot ou orçamento de tokens), com as ressalvas apontando para RELEASES.md. Co-Authored-By: Claude Opus 5 (1M context) <noreply@anthropic.com>
This file contains hidden or bidirectional Unicode text that may be interpreted or compiled differently than what appears below. To review, open the file in an editor that reveals hidden Unicode characters.
Learn more about bidirectional Unicode characters
Sign up for free
to join this conversation on GitHub.
Already have an account?
Sign in to comment
Add this suggestion to a batch that can be applied as a single commit.This suggestion is invalid because no changes were made to the code.Suggestions cannot be applied while the pull request is closed.Suggestions cannot be applied while viewing a subset of changes.Only one suggestion per line can be applied in a batch.Add this suggestion to a batch that can be applied as a single commit.Applying suggestions on deleted lines is not supported.You must change the existing code in this line in order to create a valid suggestion.Outdated suggestions cannot be applied.This suggestion has been applied or marked resolved.Suggestions cannot be applied from pending reviews.Suggestions cannot be applied on multi-line comments.Suggestions cannot be applied while the pull request is queued to merge.Suggestion cannot be applied right now. Please check back later.
Segunda medição de referência do benchmark. Fecha a issue-mãe #3.
Resultado
19 modelos × 900 respostas, todos com a bateria completa. Líder gpt-sol (86,4), lanterna qwen-flash (27,3).
Custo do resultado publicado US$ 189,47; desembolso real ~US$ 218 (a diferença são as medições descartadas dos Qwen, abaixo).
O que a auditoria pré-publicação encontrou
1. Dois modelos com medição inválida, refeitos.
qwen-plusdevolveu 427 de 900 respostas vazias (47%) eqwen-38-max, 303 (34%): o teto demax_tokensnão comportava o raciocínio, e como a resposta vem depois dele, truncar perdia tudo. Na tarefa C o qwen-plus tinha 93% de respostas inválidas — o número publicado seria ficção.Refeitos com teto 32768: zero truncadas nos dois. E as notas caíram (52,1→43,0 e 36,4→32,2), o que é o achado mais interessante da rodada: uma resposta vazia nunca aceita um código inventado, então o truncamento funcionava como abstenção forçada e inflava a dimensão anti-alucinação. Nos códigos falsos "limpos", o qwen-plus passou de 18% de aceitação aparente para 35% reais. Números truncados são otimistas, não pessimistas.
2. fable-5 rodou por duas rotas (898 Amazon Bedrock, 2 Google), por falta de pin. As 2 são irreproduzíveis pela rota majoritária: em 18/ago o Bedrock passou a responder 404 ("Claude Fable 5 is not available") para a conta. Mantidas e declaradas (0,2% das chamadas); provedor pinado daqui em diante, aqui e em sonnet-5/opus-5.
3. O leaderboard não expunha provedor, embora a D9 exija que "o leaderboard identifica o provedor". Campo
rotasnovo, derivado dos brutos, valendo para os 19 modelos.Verificações
modelo,modo,dataset_versao,itens_versaouniformescortados): gpt-luna 2,0%, deepseek-flash 1,3%, demais ≤0,6%Documentação
kimi→kimi-k3,grok→grok-46,gemini-flash→gemini-37-flash,qwen-max→qwen-38-max), mudança de condição por modelo, critério de elenco parcialNada de
resultados/oficial-seca-2026-07/ouitens/foi tocado — a v0.1.0 segue imutável.🤖 Generated with Claude Code