ModerationFlow AIModerationFlow AI
Demonstração somente leitura

Avaliações e experimentos

Snapshot público documentado. Esta página mostra estratégia principal, experimentos, trade-offs e Human-in-the-Loop sem executar runners pelo navegador.

Snapshot de avaliação

Comparação offline de estratégias de moderação. Estes resultados orientam decisões técnicas, mas não substituem a revisão humana.

snapshot_documented

Estratégia atual do projeto

A decisão registrada no ADR-001 separa operação, pesquisa e experimento.

Fluxo principal

Heuristico + Human-in-the-Loop

Pesquisa principal

Baseline LLM

Experimentos

Dynamic few-shot e guardrail R-004

Referência técnica: docs/architecture/adr-001-moderation-strategy-decision.md. A regra central permanece: o modelo recomenda; o moderador decide.

Metricas principais

Dataset selecionado: Blind. Estratégia exibida: Dynamic few-shot.

Action accuracy

96.88%

Acerto da ação recomendada no snapshot documentado.

Risk accuracy

90.62%

Acerto do nivel de risco no dataset selecionado.

Category accuracy

87.50%

Acerto da categoria de moderação.

Policy match rate

96.88%

Aderencia da regra/policy esperada.

Average latency

Não avaliado

Latencia media quando documentada.

Dynamic few-shot: Rodada simples após calibragem de spam explícito e fronteira de alvo. Fonte: docs/evaluation.md, Etapa 039.

Tabela comparativa de estrategias

Lacunas aparecem como Não avaliado. A variante guardrailed não é tratada como melhor modelo geral.

EstratégiaActionRiskCategoryPolicyLatenciaFailed runsLeitura
HeuristicoFluxo principalFluxo principal atual: rápido, determinístico, auditável e sempre seguido de HITL.
68.75%68.75%71.88%100%5ms0Generalização parcial fora dos conjuntos conhecidos. (docs/evaluation.md, Etapa 018)
Baseline LLMBaseline de pesquisaReferência principal de pesquisa para medir generalização sem exemplos few-shot.
93.75%87.50%87.50%93.75%Não avaliado0Baseline LLM usado como referencia comparativa na etapa de calibragem posterior. (docs/evaluation.md, Etapa 039 compare-ablation)
Few-shot estaticoExperimento históricoExperimento com exemplos humanos fixos; não trouxe ganho consistente.
93.75%87.50%87.50%93.75%6721ms0Few-shot estatico empatou com baseline LLM na rodada simples. (docs/evaluation.md, Etapa 035)
Dynamic few-shotExperimentoExperimento com selecao deterministica de exemplos; ajudou cenarios especificos.
96.88%90.62%87.50%96.88%Não avaliado0Rodada simples após calibragem de spam explícito e fronteira de alvo. (docs/evaluation.md, Etapa 039)
Dynamic few-shot guardrailedExperimentoVariante com guardrail R-004; forte no safety, sem superioridade universal.
96.88%90.62%87.50%96.88%Não avaliado0Guardrail manteve action/risk, mas não foi melhor que a variante base no blind. (docs/evaluation.md, Etapa 039 compare-ablation)

Datasets e metodologia

Cada conjunto tem função diferente. Feedback examples não é benchmark, e adversarial pós-tuning não deve virar fonte imediata de novo tuning.

Main

Benchmark documentado.

Conjunto principal com 75 exemplos apos retuning do baseline heuristico.

Funcao
Baseline principal de tuning heuristico.
Uso em tuning
Já foi usado para tuning do baseline heurístico; não mede generalização externa.

Holdout

Benchmark documentado.

Conjunto de 35 exemplos usado para validar ganho fora do main.

Funcao
Verificação separada durante tuning heurístico.
Uso em tuning
Não deve virar alvo de iteração indefinida.

Blind

Benchmark documentado.

Conjunto com 32 exemplos que expõe variacoes lexicais e fronteiras semanticas.

Funcao
Generalização fora dos conjuntos conhecidos.
Uso em tuning
Usado para comparacoes offline entre heuristico, LLM e few-shot.

Safety regression

Benchmark documentado.

Conjunto focado em hate_or_discrimination, R-004 e fronteiras de personal_attack.

Funcao
Regressão sensível para R-004 e discriminação.
Uso em tuning
Deve proteger casos de segurança, sem decidir sozinho a estratégia geral.

Adversarial pos-tuning

Benchmark documentado.

Conjunto novo com 30 exemplos sintéticos para auditoria externa da versão atual.

Funcao
Validação independente após ciclos de tuning.
Uso em tuning
Não deve virar fonte imediata de novo tuning.

Feedback examples

Não é benchmark.

Exemplos humanos ajudam a construir prompts e cenarios, sem substituir datasets separados.

Funcao
Fonte curada de exemplos humanos para experimentos few-shot.
Uso em tuning
Pode orientar experimentos, mas não deve ser usado como métrica de avaliação.

Principais aprendizados

Leitura consolidada do ADR e das avaliações offline.

  • O heurístico é rápido, determinístico e auditável.
  • O baseline LLM generalizou bem em validação adversarial.
  • Few-shot estático não trouxe ganho consistente.
  • Dynamic few-shot ajudou em alguns cenários, mas não mostrou ganho universal.
  • O guardrail R-004 melhorou o dataset safety, com trade-offs fora dele.
  • Human-in-the-Loop continua obrigatório.

Padroes observados

Resumo da taxonomia offline de erros, sem reproduzir o runner.

offensive_language -> personal_attack
medium -> high em spam explícito
hate_or_discrimination -> personal_attack

Esses padrões vêm da análise offline e ajudam a orientar calibração futura. Eles não promovem uma estratégia automaticamente nem removem a revisão humana.