modelduelResultados versionados en el repositoriov0.7.0

Clasificación pública

3 modelos · 3 duelos publicados · último: 1 oct 2026

Primero: replay:alfa · 6/9 tareas (67 %)

Modelos

Orden: proporción de tareas resueltas, después de tests superados y después coste por intento (menos es mejor). Los empates comparten posición.
Pos.ModeloTareas resueltasTests superadosDuelosCoste
1(primero)replay:alfa67 %replay:alfa: 6 de 9 tareas resueltas (67 %)6/9 tareas97 %124/12830,0067 USD (ficticio)
2replay:gamma67 %replay:gamma: 4 de 6 tareas resueltas (67 %)4/6 tareas94 %90/9620,0009 USD (ficticio)
3replay:beta67 %replay:beta: 4 de 6 tareas resueltas (67 %)4/6 tareas94 %60/6420,0495 USD (ficticio)

Histórico de duelos

Del más reciente al más antiguo. Cada informe se genera desde el results.json versionado en el repositorio.
FechaDueloContendientesPrimeroInforme
1 oct 2026v0.3.02026-10-01-duelo-gamma-alfa-x2Dueloreplay:gamma, replay:alfareplay:alfaInforme de 2026-10-01-duelo-gamma-alfa-x2
1 oct 2026v0.3.02026-10-01-duelo-alfa-betaDueloreplay:alfa, replay:betareplay:alfaInforme de 2026-10-01-duelo-alfa-beta
1 oct 2026v0.3.02026-10-01-liga-alfa-beta-gammaLiga de 3replay:alfa, replay:beta, replay:gammareplay:alfaInforme de 2026-10-01-liga-alfa-beta-gamma

Cómo se calcula

Cada modelo suma sus tareas, tests y costes en todos los duelos donde aparece. Se compara la proporción, no el total, para que jugar más duelos no dé ventaja. Una sola ejecución es una señal débil: mira el nº de duelos.

Para añadir resultados reales: modelduel run mis-tareas --a PROVEEDOR:MODELO --b PROVEEDOR:MODELO --out runs/duelo y copia runs/duelo/results.json a results/ con un nombre como 2026-10-02-duelo-x-y.json.

Los costes de esta página son precios ficticios de demostración, no reales.