Sete repositórios abertos, com o código e as métricas publicados, inclusive os resultados que não fecharam.
MRR 0,361 → 0,644
Avaliação de um RAG sobre 294 normativos do Banco Central a respeito do Pix. A recuperação híbrida com fusão RRF levou o MRR de 0,361 para 0,644 e o recall@1 de 0,133 para 0,533. A auditoria de vigência mostrou o que a similaridade não vê: 44,6% do corpus está revogado e 80% das perguntas recebiam contexto sem validade. As duas camadas que sustentam o resultado não usam LLM.
sentence-transformersrank-bm25RRFGemini47 testes
US$ 0,028 por edital
Triagem de editais públicos do PNCP. Extrai prazo, valor estimado e exigências de habilitação com citação verificável, e ordena a fila de leitura por valor esperado dentro da capacidade do time. O verificador não usa LLM: o campo só é aceito se o trecho citado existir literalmente no PDF e o valor bater com ele. 300 editais ingeridos, 96,7% com texto extraível sem OCR, 61 testes offline e latência p50 de 12,1 s.
PythonGeminiFastAPIDockerGitHub ActionsPNCP API
+24% na carteira de teste
Trocar o corte de 0,50 pelo break-even econômico rendeu 24,0% a mais na carteira de teste, com o mesmo modelo e a mesma AUC. O corte sai de duas constantes de negócio e não olha uma linha do dataset, e ainda assim ganhou do ótimo procurado por varredura. Reason codes por TreeSHAP exato e auditoria de paridade publicada inclusive onde reprova, com 0,767 no grupo até 25 anos.
LightGBMTreeSHAPPSI e CSI16 testes
77% do valor barrado
Uma regra de duas linhas, sem modelo nenhum, pega 97,70% das fraudes do PaySim. O projeto audita o benchmark e refaz a avaliação sem os atalhos: a PR-AUC honesta cai de 1,000 para 0,406 enquanto a ROC quase não se move. Sob capacidade finita, ordenar por valor em risco barra 77% do valor fraudado revisando 0,11% do tráfego.
LightGBMmétricas de evento raro18 testes
25x mais rápido
Ranqueia defeitos de dados pelo quanto mudam a decisão, não pela frequência, e emite o contrato executável que impede o defeito de voltar. O defeito em 7º por prevalência sobe para 3º por impacto, e o 4º não inverte nenhuma decisão. 25x mais rápido e 24x mais econômico em memória que o ydata-profiling, sem nenhum falso positivo em 100 colunas limpas.
DuckDBPyArrowParquetCLI empacotada
em operação
Sistema full-stack de alocação docente com CP-SAT: validação de entrada, dois solvers isolados por desenho, de modo que a aba de cenários não sobrescreve a rodada publicada, auditoria por rodada e painel em React. Suíte de testes, SBOM CycloneDX e inventário de licenças de terceiros. Os exemplos do repositório são sintéticos, sem dado institucional real.
OR-Tools CP-SATFastAPIReact 19TypeScriptSBOM
30+ tipos de gráfico
BI self-service em que o Gemini explora o dataset, recomenda KPIs e responde perguntas de negócio em linguagem natural. Um modo de fallback mantém os gráficos funcionando quando a API fica indisponível.
GeminiStreamlitPlotlyPandasMySQL