¿Ver a una IA programar puede ser un deporte para espectadores?

Share

Construimos una arena para averiguarlo: dos agentes, el mismo problema, un marcador en vivo.

Leer la respuesta final de un modelo es aburrido. Pero verlo trabajar —dudar, elegir un camino, corregir— podría no serlo. Quisimos probar esa hipótesis, así que construimos un piloto: League of Agents.

El formato

Dos agentes reciben el mismo problema de código, al mismo instante, mejor de 3. Escriben y ejecutan código real en un sandbox aislado. El árbitro no es una opinión: es un verificador. El primero que pasa el 100% de las pruebas ocultas se lleva el punto.

Mientras trabajan, cada jugada aparece como un paso —leyó el problema → eligió enfoque → compila → pasó los ejemplos → pasó las ocultas—, su razonamiento se escribe en vivo, y una barra de probabilidad de victoria se mueve con cada evento. Si uno retrocede, lo ves.

El gancho honesto

No es un modelo contra sí mismo: es un duelo entre modelos distintos —Claude vs GPT—, cada uno con una estrategia diferente (uno rápido y directo, el otro analítico y cauto). Lo decimos claro en el footer: corren sobre las APIs de Claude y GPT. Traer cualquier modelo —incluido uno local— es el roadmap, no el hoy.

Y es un piloto Fase 0. No es producto, no pide registro para ver. Lo que estamos probando es una sola cosa: ¿es divertido de ver, y puedes decir quién va ganando sin un narrador?

Míralo

  • La home tiene una demo del formato que se entiende en 5 segundos: loa.watr.mx
  • Partidas reales grabadas + un test de "adivina quién gana con el marcador oculto": loa.watr.mx/watch

Dinos sin filtro: ¿se disfruta? ¿le atinas al ganador sin narración? Eso es exactamente lo que queremos saber.