Pipeline de Embeddings para Retrieval Semântico
Base: Issues destaquesgovbr/data-science#1 + destaquesgovbr/data-science#2 (concluídas)
Tipo: Implementação / Engenharia de Produção
Prioridade: Alta
Complexidade: 5 semanas + 30 dias migração automática
Contexto
Issues destaquesgovbr/data-science#1 e destaquesgovbr/data-science#2 validaram:
Situação Especial
Sistema legado já possui embeddings antigos. Migração gradual permite:
- Zero downtime
- Novos docs usam modelo melhor desde dia 1
- Migração de 300k docs em background (30 dias, 10k/dia)
Objetivo
Pipeline completo de embeddings:
- ✅ Gerar embeddings com BGE-M3
- ✅ Indexar em vector database (FAISS HNSW)
- ✅ API de busca semântica (< 100ms)
- ✅ Dual index durante migração (30 dias)
- ✅ Atualização incremental
Arquitetura Dual Index
DualIndexManager
├─ NEW INDEX (BGE-M3)
│ ├─ Novos docs (100%)
│ └─ Antigos migrados (N%)
└─ LEGACY INDEX
└─ Antigos pendentes
Busca híbrida: NEW (migrados) + LEGACY (não migrados)
Capacidade GPU L4
- Throughput: 10-15 docs/seg
- Batch size: 64 (vs 32 em GPUs menores)
- Capacidade diária: 10k docs (conservador)
- Migração completa: 300k ÷ 10k/dia = 30 dias
Priorização Inteligente
- P1 (Urgent): Novos documentos → imediato
- P2 (High): Docs acessados recentemente
- P3 (Medium): Categorias importantes
- P4 (Low): Long tail
Stack Tecnológica
- Modelo: BGE-M3 (sentence-transformers)
- Vector DB: FAISS HNSW (300k-1M docs)
- GPU: NVIDIA L4 24GB (EC2)
- API: FastAPI
- Cache: Redis (opcional)
Sub-Tasks
Ver documentos de implementação:
ISSUES_IMPLEMENTACAO_EMBEDDINGS.md
ISSUES_IMPLEMENTACAO_EMBEDDINGS_MIGRACAO_GRADUAL.md
Principais tasks:
- Setup GPU L4 + BGE-M3
- Implementar DualIndexManager
- API de busca semântica
- Loop de migração contínua (10k/dia)
- Dashboard de progresso
- Busca híbrida (semantic + keyword)
Métricas de Sucesso
Qualidade:
Performance:
- Latência busca < 100ms P95
- Throughput migração: 10k/dia
- Disponibilidade: 100% (dual index)
Migração:
- Progresso: 100% em 30 dias
- Zero downtime
- Novos docs processados imediatamente
Cronograma
Fase 1: Sistema dual (4 semanas)
- Setup + dual index + API + migração automatizada
Fase 2: Migração automática (30 dias)
- Pipeline roda em background (10k/dia)
- Monitoramento diário
Fase 3: Cleanup (1 semana)
- 100% migrado → remover index legado
Total: 5 semanas + 30 dias background
Benefícios Migração Gradual
✅ Zero downtime - Sistema nunca para
✅ Priorização - Novos docs primeiro
✅ Flexibilidade - Pausar/retomar conforme necessário
✅ Custo controlado - GPU 3-4h/dia (~$70 total)
Referências
Pipeline de Embeddings para Retrieval Semântico
Base: Issues destaquesgovbr/data-science#1 + destaquesgovbr/data-science#2 (concluídas)
Tipo: Implementação / Engenharia de Produção
Prioridade: Alta
Complexidade: 5 semanas + 30 dias migração automática
Contexto
Issues destaquesgovbr/data-science#1 e destaquesgovbr/data-science#2 validaram:
Situação Especial
Sistema legado já possui embeddings antigos. Migração gradual permite:
Objetivo
Pipeline completo de embeddings:
Arquitetura Dual Index
Capacidade GPU L4
Priorização Inteligente
Stack Tecnológica
Sub-Tasks
Ver documentos de implementação:
ISSUES_IMPLEMENTACAO_EMBEDDINGS.mdISSUES_IMPLEMENTACAO_EMBEDDINGS_MIGRACAO_GRADUAL.mdPrincipais tasks:
Métricas de Sucesso
Qualidade:
Performance:
Migração:
Cronograma
Fase 1: Sistema dual (4 semanas)
Fase 2: Migração automática (30 dias)
Fase 3: Cleanup (1 semana)
Total: 5 semanas + 30 dias background
Benefícios Migração Gradual
✅ Zero downtime - Sistema nunca para
✅ Priorização - Novos docs primeiro
✅ Flexibilidade - Pausar/retomar conforme necessário
✅ Custo controlado - GPU 3-4h/dia (~$70 total)
Referências
ISSUES_IMPLEMENTACAO_EMBEDDINGS.mdISSUES_IMPLEMENTACAO_EMBEDDINGS_MIGRACAO_GRADUAL.md