Duelos
Un Duelo enfrenta entre 2 y 5 modelos con el mismo prompt, en paralelo, y deja que un modelo juez —ciego a qué proveedor dio cada respuesta— elija un ganador. Es la forma más rápida de decidir qué modelo conviene para un tipo de tarea concreto, con evidencia en vez de intuición.
Cómo fluye un duelo
Un mismo prompt
Con system prompt opcional, compartido igual entre todos los contendientes.
Ve solo A/B/C…
Nunca el proveedor real ni la cadena de razonamiento — solo la respuesta final de cada uno.
Ganador + ranking
General y por criterio (precisión, completitud, claridad, utilidad).
Crear un duelo
Desde /chat, pestaña Duelo: escribís un prompt (y opcionalmente un system prompt, que se comparte igual entre todos los contendientes para que la comparación sea justa), elegís entre 2 y 5 modelos contendientes, y elegís qué modelo va a actuar de juez.
Elegí los contendientes
De 2 a 5 modelos. TokenGate calcula el costo estimado del duelo completo antes de arrancar y lo compara contra tu saldo disponible — si no alcanza, te avisa antes de gastar nada.
Elegí el juez
Puede ser cualquier modelo del catálogo, incluso uno que no sea contendiente.
Mandá el prompt
Cada contendiente recibe exactamente el mismo prompt y corre en paralelo. A cada uno se le asigna una etiqueta ciega (A, B, C…) que se mantiene fija durante todo el duelo.
Convocá al juez
Una vez que al menos dos contendientes respondieron con éxito, pedís veredicto. El juez ve las respuestas etiquetadas A/B/C… — nunca ve qué proveedor las generó, y nunca ve la cadena de razonamiento interna de ningún modelo, solo la respuesta final, para que un modelo no delate su identidad por "cómo piensa".
Qué evalúa el juez
El veredicto puntúa cada respuesta en cuatro criterios (precisión, completitud, claridad, utilidad, de 1 a 10), determina un ganador general, un ranking completo, y el ganador por cada criterio por separado — útil cuando un modelo es más preciso pero otro es más claro.
Si el juez devuelve algo que no se puede interpretar como veredicto, TokenGate reintenta una vez a temperatura 0 antes de darlo por fallido. El duelo queda facturado de todas formas — la llamada al juez cuesta real, se haya podido parsear o no.
Estados de un duelo
pendingrunningcompletedfailedjudgingjudgedDe running se pasa a failed directo si menos de 2 contendientes responden con éxito — no hay suficiente para comparar.
| Estado | Qué significa |
|---|---|
pending | Creado, esperando que los contendientes empiecen a responder |
running | Al menos un contendiente está generando su respuesta |
completed | Todos los contendientes terminaron — listo para pedir veredicto |
judging | El juez está evaluando |
judged | Hay veredicto — el duelo ya se puede compartir |
failed | Menos de 2 contendientes respondieron con éxito — no hay suficiente para comparar |
Cómo se factura
Cada contendiente se cobra por separado, a su propio precio (input/output según su tabla de modelos). La llamada al juez también se cobra por separado y se suma al costo total del duelo. Un duelo de 5 modelos, entonces, son 6 llamadas facturables: 5 contendientes + 1 juez.
Compartir un duelo
Un duelo con veredicto se puede compartir con un link público de solo lectura. La vista pública muestra las respuestas, tokens y latencia de cada contendiente — pero nunca el costo: los campos de precio se eliminan del lado del servidor antes de armar la página pública, no se ocultan solo con CSS. El link se puede revocar en cualquier momento desde el duelo original.