Aprendizaje · equipo
Se lee de corrido. La pregunta del equipo no es “¿cómo generamos video bonito?”, sino cómo simular un mundo útil para decidir — sin ensayar a ciegas en producción. Abajo, la idea central del paper de ancla (Oxford, 2026) y el mapa en ASCII.
Paper de ancla · SOTA 2026
Un world model es un sistema que, dado un estado y una acción, simula cómo evoluciona el entorno. Eso permite planificar en la imaginación — “si hago X, ¿qué pasa?” — en lugar de solo reaccionar a lo que se ve ahora.
El paper insiste en un error de época: confundir fidelidad visual (rollouts que se ven reales) con entender dinámica y causa. Un video plausible puede violar leyes del dominio: el vaso se rompe antes del golpe; el tumor “baja” sin tratamiento. En pantallas es un glitch; en decisión de alto riesgo es un fallo de razonamiento causal.
Error Qué es Riesgo ───── ──── ────── Alucinación perceptual textura, luz, blur estética Alucinación dinámica viola leyes / causas decisión peligrosa “Se ve bien” ≠ “sirve para decidir”
Chen y Zhu proponen dejar de tratar el world model como un motor de generación de píxeles y tratarlo como un simulador accionable: interfaz con estructura (no solo frames), dinámica que respeta restricciones del dominio, y evaluación en lazo cerrado (¿sirve para planear e intervenir?).
La simulación sintética, entonces, no es “inventar datos para rellenar un dataset” por sí sola. Es rodar futuros condicionados a acciones, con anclas físicas o de dominio, para aprender o evaluar políticas sin pagar el costo real de cada ensayo.
Antes (confusión común) Después (marco del paper) ─────────────────────── ───────────────────────── Generar video “realista” Simular evolución bajo acción Éxito = se ve bien Éxito = planificar / contrafactual Open-loop, un solo camino Lazo cerrado, muchas intervenciones Sin restricciones explícitas Constraints del dominio
En producto y en agentes, “simular” se usa para tres cosas distintas. Conviene no mezclarlas:
El paper usa la medicina como prueba de fuego: no se puede trial-and-error en el paciente. Ahí se ve que el valor del simulador no es el realismo de la imagen, sino si permite contrafactuales, plan de intervención y horizonte largo sin romperse.
estado t + acción a
│
v
simulador (world model)
│
v
estado t+1 (sintético)
│
├── ¿respeta constraints?
├── ¿sirve para planear?
└── ¿se parece solo “en la foto”?
│
v
usar / descartar el rollout
En lugar de catalogar arquitecturas, el survey agrupa el progreso en desafíos recurrentes (lectura de equipo, no de paper review):
Para Remora: cuando digamos “simulamos escenarios”, la barra no es el render. Es si el escenario condiciona acciones, respeta reglas del dominio y aguanta el horizonte de la decisión.
Simulación sintética “cuenta” si: 1. toma acción como input (no solo un prompt estético) 2. el resultado se puede usar para elegir entre opciones 3. se puede decir qué constraint falló cuando miente 4. se evalúa en lazo (plan → simular → decidir → medir)
Simulación sintética ≠ video sintético bonito. Es un simulador de “qué pasa si…”, con suficiente estructura como para decidir — y con la humildad de medir cuándo el simulador alucina dinámica.