Saltar al contenido principal

Informe de evaluación y costes (MLflow)

Resultados de las evaluaciones registradas en MLflow (experimento asesoria-rag, almacén sqlite:///mlflow.db). Esta página se genera automáticamente; para ver la UI viva en local:

python -m mlflow ui --backend-store-uri sqlite:///mlflow.db --port 5001

Evaluación end-to-end (RAG completo)​

Runs rag-eval sobre el benchmark revisado: aciertos de evidencia (documento/página esperados), latencia media total, consumo de tokens del LLM y coste estimado. El juez LLM puntúa faithfulness / relevance de 1 a 5 cuando la evaluación se ejecuta con --judge.

FechaPreguntasDocumentoPáginaLatencia mediaTokens (entrada / salida)CosteJuez F / R
2026-10-08 12:40 UTC1100% (1/1)100% (1/1)34217 ms4338 / 480$0.0009—
2026-10-08 12:31 UTC3100% (3/3)100% (3/3)31014 ms30300 / 8157$0.00944.00 / 4.33

Suite de pruebas​

Run test-suite generado desde el informe JUnit de pytest (python -m pytest tests/ -q --junitxml=results.xml + python -m scripts.log_test_results).

FechaTotalPasadasFallidasSkippedDuraciónCommit
2026-10-08 12:30 UTC51551005118 sdc8f120

Método y límites​

  • Coste = tokens × precio publicado por Groq para openai/gpt-oss-120b: $0,15 / M tokens de entrada y $0,60 / M tokens de salida (tags eval.price_* del run y atributo mlflow.llm.cost en cada span de las trazas).
  • El detalle pregunta a pregunta queda como artefacto results.json de cada run (MLflow → run → Artifacts).
  • La demo pública usa el free tier de Groq (≈ 200.000 tokens/día, unas 46 consultas/día); los costes de esta tabla corresponden a las evaluaciones, no a la demo desplegada.
  • Página generada: 2026-10-08 13:28 UTC · runs finalizados: 4.