TokenGate
Documentación
docs / chat / duelos

Duelos

Un Duelo enfrenta entre 2 y 5 modelos con el mismo prompt, en paralelo, y deja que un modelo juez —ciego a qué proveedor dio cada respuesta— elija un ganador. Es la forma más rápida de decidir qué modelo conviene para un tipo de tarea concreto, con evidencia en vez de intuición.

Contendientes2–5
Juez1 ciego
Duelo de 56 llamadas
Criterios4

Cómo fluye un duelo

Prompt

Un mismo prompt

Con system prompt opcional, compartido igual entre todos los contendientes.

En paralelo — etiqueta ciega fija
A Contendiente 1
B Contendiente 2
hasta 5 contendientes
Juez

Ve solo A/B/C…

Nunca el proveedor real ni la cadena de razonamiento — solo la respuesta final de cada uno.

Veredicto

Ganador + ranking

General y por criterio (precisión, completitud, claridad, utilidad).

A · B · C etiquetas ciegas — fijas durante todo el duelo

El juez ve las respuestas etiquetadas, nunca qué proveedor las generó ni la cadena de razonamiento interna — para que un modelo no se delate por «cómo piensa».

Crear un duelo

Desde /chat, pestaña Duelo: escribís un prompt (y opcionalmente un system prompt, que se comparte igual entre todos los contendientes para que la comparación sea justa), elegís entre 2 y 5 modelos contendientes, y elegís qué modelo va a actuar de juez.

  1. Elegí los contendientes

    De 2 a 5 modelos. TokenGate calcula el costo estimado del duelo completo antes de arrancar y lo compara contra tu saldo disponible — si no alcanza, te avisa antes de gastar nada.

  2. Elegí el juez

    Puede ser cualquier modelo del catálogo, incluso uno que no sea contendiente.

  3. Mandá el prompt

    Cada contendiente recibe exactamente el mismo prompt y corre en paralelo. A cada uno se le asigna una etiqueta ciega (A, B, C…) que se mantiene fija durante todo el duelo.

  4. Convocá al juez

    Una vez que al menos dos contendientes respondieron con éxito, pedís veredicto. El juez ve las respuestas etiquetadas A/B/C… — nunca ve qué proveedor las generó, y nunca ve la cadena de razonamiento interna de ningún modelo, solo la respuesta final.

Qué evalúa el juez

El veredicto puntúa cada respuesta de 1 a 10 en cuatro criterios, determina un ganador general, un ranking completo, y el ganador por cada criterio por separado — útil cuando un modelo es más preciso pero otro es más claro.

Precisión

Qué tan correcta y verificable es la respuesta.

Completitud

Si cubre todo lo que el prompt pedía, sin dejar huecos.

Claridad

Qué tan fácil es de leer y de seguir el razonamiento.

Utilidad

Si resuelve el problema real de quien preguntó.

⚖️

Si el juez devuelve algo que no se puede interpretar como veredicto, TokenGate reintenta una vez a temperatura 0 antes de darlo por fallido. El duelo queda facturado de todas formas — la llamada al juez cuesta real, se haya podido parsear o no.

Estados de un duelo

pendingCreado, esperando que los contendientes empiecen a responder.
runningAl menos un contendiente está generando su respuesta.
completedTodos terminaron — listo para pedir veredicto.
failedMenos de 2 respondieron con éxito — no hay con qué comparar.
judgingEl juez está evaluando.
judgedHay veredicto — el duelo ya se puede compartir.

De running se pasa a failed directo si menos de 2 contendientes responden con éxito.

Cómo se factura

Cada contendiente se cobra por separado, a su propio precio (input/output según su tabla de modelos). La llamada al juez también se cobra por separado. Un duelo de 5 modelos, entonces, son 6 llamadas facturables:

contendientes
juez

Cada segmento se cobra a su propio precio de modelo; el ancho es la cantidad de llamadas, no el costo.

Compartir un duelo

Un duelo con veredicto se puede compartir con un link público de solo lectura. La vista pública muestra las respuestas, tokens y latencia de cada contendiente — pero nunca el costo: los campos de precio se eliminan del lado del servidor antes de armar la página pública, no se ocultan solo con CSS. El link se puede revocar en cualquier momento desde el duelo original.