Estudo de intervenção 'acesso à fonte' (estudo-fonte-v0.1.0): harness, decisões e resultados - #10
Merged
Conversation
…vos e cliente MCP robusto - lib/contexto.ts: condição de controle (listagem do escopo do item no prompt); modo 'contexto' no executar/execucao. - lib/estudo.ts + exportar-estudo/relatorio-estudo: deltas pareados com IC por bootstrap por item, métricas de uso da fonte, relatório HTML autocontido. - Adapters: openai-responses (OpenAI/xAI, tool mcp), google-interactions (mcp_server); anthropic com beta mcp-client-2025-11-20 + mcp_toolset; loop reenvia a mensagem do assistente como veio (reasoning_content, thought_signature). - mcp-cliente: versão dos dados e hash das tools na chave de cache e no manifesto; retry com backoff e pacing (55/min) para 429/5xx/rede; isError e erros de argumentos voltam ao modelo, só transporte invalida. - Brutos: tools_erros, tools_erro_exemplo, voltas; avaliador invalida resposta com erro de transporte; agregação com bloco 'fonte'. - env: .env vence variáveis de shell. Registro: entradas de rota direta (-direto) e connector (-mcp), semTemperatura, parametroMaxTokens. Co-Authored-By: Claude Fable 5 <noreply@anthropic.com> Claude-Session: https://claude.ai/code/session_01LtfqgC8xbnRF55aT6v3CKR
…é-registro do estudo Pré-registro fechado em 24/ago/2026 antes da primeira chamada da bateria, com emendas datadas (cache do piloto, Gemini via OpenRouter, tools_erros, semântica de isError, rate limit). METODOLOGIA aponta para o estudo. Co-Authored-By: Claude Fable 5 <noreply@anthropic.com> Claude-Session: https://claude.ai/code/session_01LtfqgC8xbnRF55aT6v3CKR
…dos, relatório e release notes Rodadas estudo-fonte-2026-08 (8 modelos × seca/contexto/MCP + connector nativo em 3) e estudo-fonte-2026-08-buscar-v2 (Sabiá após correção do bncc_buscar), piloto e smokes de rota. Seca 31,9% → contexto 0,2% → MCP 2,3%. Entrada em RELEASES.md (série própria) e seção no README. Co-Authored-By: Claude Fable 5 <noreply@anthropic.com> Claude-Session: https://claude.ai/code/session_01LtfqgC8xbnRF55aT6v3CKR
This file contains hidden or bidirectional Unicode text that may be interpreted or compiled differently than what appears below. To review, open the file in an editor that reveals hidden Unicode characters.
Learn more about bidirectional Unicode characters
Sign up for free
to join this conversation on GitHub.
Already have an account?
Sign in to comment
Add this suggestion to a batch that can be applied as a single commit.This suggestion is invalid because no changes were made to the code.Suggestions cannot be applied while the pull request is closed.Suggestions cannot be applied while viewing a subset of changes.Only one suggestion per line can be applied in a batch.Add this suggestion to a batch that can be applied as a single commit.Applying suggestions on deleted lines is not supported.You must change the existing code in this line in order to create a valid suggestion.Outdated suggestions cannot be applied.This suggestion has been applied or marked resolved.Suggestions cannot be applied from pending reviews.Suggestions cannot be applied on multi-line comments.Suggestions cannot be applied while the pull request is queued to merge.Suggestion cannot be applied right now. Please check back later.
O que entra
Estudo de intervenção "acesso à fonte" (DECISOES.md D14 e D14.1), em série própria
estudo-fonte-v0.1.0; o leaderboard não muda.Três commits, na ordem: (1) harness — modo
contexto, análise de delta pareado com IC, connectors MCP nativos (OpenAI/xAI Responses, Google Interactions, Anthropic), cliente MCP com retry/pacing e hash das tools na chave de cache,tools_errosnos brutos; (2) decisões e pré-registro (fechado antes da bateria, com emendas datadas); (3) resultados (estudo-fonte-2026-08,…-buscar-v2, piloto, smokes de rota), relatório HTML, entrada no RELEASES.md e seção no README.Resultado
8 modelos × 300 itens × três condições pareadas: seca 31,9% de alucinação → contexto 0,2% → MCP 2,3%; queda média de 30,6 pp por modelo (IC 95% por bootstrap por item). Erros residuais nos dois Sabiá, no lookup inverso; após a correção do
bncc_buscarno servidor (achado deste estudo): Sabiá-4 4,0% → 1,0%, Sabiazinho-4 5,3% → 3,5%, falsos aceitos 0/180.Verificação
pnpm typecheckepnpm test(104 testes) verdes;pnpm agregar --verificarOK em todas as rodadas.Após o merge: tag
estudo-fonte-v0.1.0+ Release do GitHub comestudo.htmlanexado.🤖 Generated with Claude Code
https://claude.ai/code/session_01LtfqgC8xbnRF55aT6v3CKR