TokenGate
Documentación
docs / chat / duelos

Duelos

Un Duelo enfrenta entre 2 y 5 modelos con el mismo prompt, en paralelo, y deja que un modelo juez —ciego a qué proveedor dio cada respuesta— elija un ganador. Es la forma más rápida de decidir qué modelo conviene para un tipo de tarea concreto, con evidencia en vez de intuición.

Cómo fluye un duelo

Prompt

Un mismo prompt

Con system prompt opcional, compartido igual entre todos los contendientes.

En paralelo — etiqueta ciega fija
A Contendiente 1
B Contendiente 2
hasta 5 contendientes
Juez

Ve solo A/B/C…

Nunca el proveedor real ni la cadena de razonamiento — solo la respuesta final de cada uno.

Veredicto

Ganador + ranking

General y por criterio (precisión, completitud, claridad, utilidad).

Crear un duelo

Desde /chat, pestaña Duelo: escribís un prompt (y opcionalmente un system prompt, que se comparte igual entre todos los contendientes para que la comparación sea justa), elegís entre 2 y 5 modelos contendientes, y elegís qué modelo va a actuar de juez.

  1. Elegí los contendientes

    De 2 a 5 modelos. TokenGate calcula el costo estimado del duelo completo antes de arrancar y lo compara contra tu saldo disponible — si no alcanza, te avisa antes de gastar nada.

  2. Elegí el juez

    Puede ser cualquier modelo del catálogo, incluso uno que no sea contendiente.

  3. Mandá el prompt

    Cada contendiente recibe exactamente el mismo prompt y corre en paralelo. A cada uno se le asigna una etiqueta ciega (A, B, C…) que se mantiene fija durante todo el duelo.

  4. Convocá al juez

    Una vez que al menos dos contendientes respondieron con éxito, pedís veredicto. El juez ve las respuestas etiquetadas A/B/C… — nunca ve qué proveedor las generó, y nunca ve la cadena de razonamiento interna de ningún modelo, solo la respuesta final, para que un modelo no delate su identidad por "cómo piensa".

Qué evalúa el juez

El veredicto puntúa cada respuesta en cuatro criterios (precisión, completitud, claridad, utilidad, de 1 a 10), determina un ganador general, un ranking completo, y el ganador por cada criterio por separado — útil cuando un modelo es más preciso pero otro es más claro.

⚖️

Si el juez devuelve algo que no se puede interpretar como veredicto, TokenGate reintenta una vez a temperatura 0 antes de darlo por fallido. El duelo queda facturado de todas formas — la llamada al juez cuesta real, se haya podido parsear o no.

Estados de un duelo

pending
running
completed
failed
judging
judged

De running se pasa a failed directo si menos de 2 contendientes responden con éxito — no hay suficiente para comparar.

EstadoQué significa
pendingCreado, esperando que los contendientes empiecen a responder
runningAl menos un contendiente está generando su respuesta
completedTodos los contendientes terminaron — listo para pedir veredicto
judgingEl juez está evaluando
judgedHay veredicto — el duelo ya se puede compartir
failedMenos de 2 contendientes respondieron con éxito — no hay suficiente para comparar

Cómo se factura

Cada contendiente se cobra por separado, a su propio precio (input/output según su tabla de modelos). La llamada al juez también se cobra por separado y se suma al costo total del duelo. Un duelo de 5 modelos, entonces, son 6 llamadas facturables: 5 contendientes + 1 juez.

Compartir un duelo

Un duelo con veredicto se puede compartir con un link público de solo lectura. La vista pública muestra las respuestas, tokens y latencia de cada contendiente — pero nunca el costo: los campos de precio se eliminan del lado del servidor antes de armar la página pública, no se ocultan solo con CSS. El link se puede revocar en cualquier momento desde el duelo original.