karimaballaarena

Duelo 01 · planificado

¿Qué agente de programación gana este trabajo?

أيّ وكيل يُنجز المهمة؟

Mismo encargo, misma máquina, carpeta nueva, tres ejecuciones cada uno. Publicamos cada registro, y un resultado solo aparece después de su registro.

Regla 1 / 3

Tres ejecuciones, tres anillos

Los agentes no responden igual dos veces: cada uno corre tres veces y mostramos cada anillo.

Regla 2 / 3

¿Funcionó, y a qué velocidad?

Diez comprobaciones fijas deciden Pass. El tiempo es el reloj real.

Regla 3 / 3

Lo que te costó

El dinero, de la página de uso del proveedor; y tu tiempo: cada mensaje que tuviste que añadir.

FIG. 1 CUADRO, UN ANILLO POR EJECUCIÓN

  • Claude Code
  • Codex CLI
  • Hermes Agent
  • OpenClaw
  • Claude Code + DeepSeek

FIG. 2 MARCADOR

HerramientaAprobadoTiempoCosteHumano
Claude Code————
Codex CLI————
Hermes Agent————
OpenClaw————
Claude Code + DeepSeek————

Discontinuo: aún sin ejecutar. Ningún resultado aparece hasta publicar su registro.

Anillo discontinuo: sin ejecutar; se llena al publicar el registro

Pass: pruebas superadas de 10 (RTL, móvil, texto alt)

Tiempo: minutos del primer prompt a «listo»

Coste: de la página de uso, o «plan» si es suscripción

Humano: mensajes escritos tras el primer prompt

Sin registro, no hay resultado. Nada es estimado