Avaliações e experimentos
Snapshot público documentado. Esta página mostra estratégia principal, experimentos, trade-offs e Human-in-the-Loop sem executar runners pelo navegador.
Comparação offline de estratégias de moderação. Estes resultados orientam decisões técnicas, mas não substituem a revisão humana.
Estratégia atual do projeto
A decisão registrada no ADR-001 separa operação, pesquisa e experimento.
Fluxo principal
Heuristico + Human-in-the-Loop
Pesquisa principal
Baseline LLM
Experimentos
Dynamic few-shot e guardrail R-004
Metricas principais
Dataset selecionado: Blind. Estratégia exibida: Dynamic few-shot.
Action accuracy
96.88%
Acerto da ação recomendada no snapshot documentado.
Risk accuracy
90.62%
Acerto do nivel de risco no dataset selecionado.
Category accuracy
87.50%
Acerto da categoria de moderação.
Policy match rate
96.88%
Aderencia da regra/policy esperada.
Average latency
Não avaliado
Latencia media quando documentada.
Tabela comparativa de estrategias
Lacunas aparecem como Não avaliado. A variante guardrailed não é tratada como melhor modelo geral.
| Estratégia | Action | Risk | Category | Policy | Latencia | Failed runs | Leitura |
|---|---|---|---|---|---|---|---|
HeuristicoFluxo principalFluxo principal atual: rápido, determinístico, auditável e sempre seguido de HITL. | 68.75% | 68.75% | 71.88% | 100% | 5ms | 0 | Generalização parcial fora dos conjuntos conhecidos. (docs/evaluation.md, Etapa 018) |
Baseline LLMBaseline de pesquisaReferência principal de pesquisa para medir generalização sem exemplos few-shot. | 93.75% | 87.50% | 87.50% | 93.75% | Não avaliado | 0 | Baseline LLM usado como referencia comparativa na etapa de calibragem posterior. (docs/evaluation.md, Etapa 039 compare-ablation) |
Few-shot estaticoExperimento históricoExperimento com exemplos humanos fixos; não trouxe ganho consistente. | 93.75% | 87.50% | 87.50% | 93.75% | 6721ms | 0 | Few-shot estatico empatou com baseline LLM na rodada simples. (docs/evaluation.md, Etapa 035) |
Dynamic few-shotExperimentoExperimento com selecao deterministica de exemplos; ajudou cenarios especificos. | 96.88% | 90.62% | 87.50% | 96.88% | Não avaliado | 0 | Rodada simples após calibragem de spam explícito e fronteira de alvo. (docs/evaluation.md, Etapa 039) |
Dynamic few-shot guardrailedExperimentoVariante com guardrail R-004; forte no safety, sem superioridade universal. | 96.88% | 90.62% | 87.50% | 96.88% | Não avaliado | 0 | Guardrail manteve action/risk, mas não foi melhor que a variante base no blind. (docs/evaluation.md, Etapa 039 compare-ablation) |
Datasets e metodologia
Cada conjunto tem função diferente. Feedback examples não é benchmark, e adversarial pós-tuning não deve virar fonte imediata de novo tuning.
Main
Benchmark documentado.Conjunto principal com 75 exemplos apos retuning do baseline heuristico.
- Funcao
- Baseline principal de tuning heuristico.
- Uso em tuning
- Já foi usado para tuning do baseline heurístico; não mede generalização externa.
Holdout
Benchmark documentado.Conjunto de 35 exemplos usado para validar ganho fora do main.
- Funcao
- Verificação separada durante tuning heurístico.
- Uso em tuning
- Não deve virar alvo de iteração indefinida.
Blind
Benchmark documentado.Conjunto com 32 exemplos que expõe variacoes lexicais e fronteiras semanticas.
- Funcao
- Generalização fora dos conjuntos conhecidos.
- Uso em tuning
- Usado para comparacoes offline entre heuristico, LLM e few-shot.
Safety regression
Benchmark documentado.Conjunto focado em hate_or_discrimination, R-004 e fronteiras de personal_attack.
- Funcao
- Regressão sensível para R-004 e discriminação.
- Uso em tuning
- Deve proteger casos de segurança, sem decidir sozinho a estratégia geral.
Adversarial pos-tuning
Benchmark documentado.Conjunto novo com 30 exemplos sintéticos para auditoria externa da versão atual.
- Funcao
- Validação independente após ciclos de tuning.
- Uso em tuning
- Não deve virar fonte imediata de novo tuning.
Feedback examples
Não é benchmark.Exemplos humanos ajudam a construir prompts e cenarios, sem substituir datasets separados.
- Funcao
- Fonte curada de exemplos humanos para experimentos few-shot.
- Uso em tuning
- Pode orientar experimentos, mas não deve ser usado como métrica de avaliação.
Principais aprendizados
Leitura consolidada do ADR e das avaliações offline.
- O heurístico é rápido, determinístico e auditável.
- O baseline LLM generalizou bem em validação adversarial.
- Few-shot estático não trouxe ganho consistente.
- Dynamic few-shot ajudou em alguns cenários, mas não mostrou ganho universal.
- O guardrail R-004 melhorou o dataset safety, com trade-offs fora dele.
- Human-in-the-Loop continua obrigatório.
Padroes observados
Resumo da taxonomia offline de erros, sem reproduzir o runner.
Esses padrões vêm da análise offline e ajudam a orientar calibração futura. Eles não promovem uma estratégia automaticamente nem removem a revisão humana.