Duelos
Un Duelo enfrenta entre 2 y 5 modelos con el mismo prompt, en paralelo, y deja que un modelo juez —ciego a qué proveedor dio cada respuesta— elija un ganador. Es la forma más rápida de decidir qué modelo conviene para un tipo de tarea concreto, con evidencia en vez de intuición.
Cómo fluye un duelo
Un mismo prompt
Con system prompt opcional, compartido igual entre todos los contendientes.
Ve solo A/B/C…
Nunca el proveedor real ni la cadena de razonamiento — solo la respuesta final de cada uno.
Ganador + ranking
General y por criterio (precisión, completitud, claridad, utilidad).
El juez ve las respuestas etiquetadas, nunca qué proveedor las generó ni la cadena de razonamiento interna — para que un modelo no se delate por «cómo piensa».
Crear un duelo
Desde /chat, pestaña Duelo: escribís un prompt (y opcionalmente un system prompt, que se comparte igual entre todos los contendientes para que la comparación sea justa), elegís entre 2 y 5 modelos contendientes, y elegís qué modelo va a actuar de juez.
Elegí los contendientes
De 2 a 5 modelos. TokenGate calcula el costo estimado del duelo completo antes de arrancar y lo compara contra tu saldo disponible — si no alcanza, te avisa antes de gastar nada.
Elegí el juez
Puede ser cualquier modelo del catálogo, incluso uno que no sea contendiente.
Mandá el prompt
Cada contendiente recibe exactamente el mismo prompt y corre en paralelo. A cada uno se le asigna una etiqueta ciega (A, B, C…) que se mantiene fija durante todo el duelo.
Convocá al juez
Una vez que al menos dos contendientes respondieron con éxito, pedís veredicto. El juez ve las respuestas etiquetadas A/B/C… — nunca ve qué proveedor las generó, y nunca ve la cadena de razonamiento interna de ningún modelo, solo la respuesta final.
Qué evalúa el juez
El veredicto puntúa cada respuesta de 1 a 10 en cuatro criterios, determina un ganador general, un ranking completo, y el ganador por cada criterio por separado — útil cuando un modelo es más preciso pero otro es más claro.
Precisión
Qué tan correcta y verificable es la respuesta.
Completitud
Si cubre todo lo que el prompt pedía, sin dejar huecos.
Claridad
Qué tan fácil es de leer y de seguir el razonamiento.
Utilidad
Si resuelve el problema real de quien preguntó.
Si el juez devuelve algo que no se puede interpretar como veredicto, TokenGate reintenta una vez a temperatura 0 antes de darlo por fallido. El duelo queda facturado de todas formas — la llamada al juez cuesta real, se haya podido parsear o no.
Estados de un duelo
pendingCreado, esperando que los contendientes empiecen a responder.runningAl menos un contendiente está generando su respuesta.completedTodos terminaron — listo para pedir veredicto.failedMenos de 2 respondieron con éxito — no hay con qué comparar.judgingEl juez está evaluando.judgedHay veredicto — el duelo ya se puede compartir.De running se pasa a failed directo si menos de 2 contendientes responden con éxito.
Cómo se factura
Cada contendiente se cobra por separado, a su propio precio (input/output según su tabla de modelos). La llamada al juez también se cobra por separado. Un duelo de 5 modelos, entonces, son 6 llamadas facturables:
Cada segmento se cobra a su propio precio de modelo; el ancho es la cantidad de llamadas, no el costo.
Compartir un duelo
Un duelo con veredicto se puede compartir con un link público de solo lectura. La vista pública muestra las respuestas, tokens y latencia de cada contendiente — pero nunca el costo: los campos de precio se eliminan del lado del servidor antes de armar la página pública, no se ocultan solo con CSS. El link se puede revocar en cualquier momento desde el duelo original.