¿'Entienden' física los modelos de vídeo? El benchmark WROP
TL;DR
- Verificado contra el paper: WROP (“Training Object Permanence in World Models”) es un benchmark + corpus de entrenamiento con 150 tareas diseñadas a mano en Blender, repartidas en seis familias de cognición básica (3 de permanencia de objetos, 3 de solidez), con 10.000 muestras por generador (1,5M en total) y un examen fijo de 300 preguntas. Todo liberado: corpus, examen, respuestas, puntuaciones, pesos y generadores.
- Verificado (según los autores): en el examen, los dos primeros puestos son comerciales reference-to-video — Wan 3.0 Prime y MiniMax H3, ambos a Elo 1723,6, empate declarado. Tercero: PWM-WROP, un modelo de 16B fine-tuned desde Cosmos3-Nano de NVIDIA con el corpus WROP, y primero entre los modelos que realmente continúan el vídeo.
- El matiz: el podio es más blando de lo que parece. Los intervalos de confianza solapan y los propios autores hablan de empate estadístico. Son 361 juicios humanos pareados, 50-52 por modelo.
- Lo que me parece la señal real: la interfaz del modelo explica el leaderboard mejor que su tamaño, y la física básica se puede entrenar — una época de fine-tuning basta para sacar +224 Elo al siguiente modelo de continuación.
Qué he verificado yo y qué no
He contrastado las cifras de esta pieza contra el HTML v1 del paper en arXiv (2609.28654, publicado el 23-sep-2026): taxonomía de tareas, composición del corpus, protocolo del examen, tabla del leaderboard, probabilidades top-1, ranking por familias y detalles del entrenamiento. Las estrellas de GitHub del repositorio las consulté vía API el 2026-09-27 (180 estrellas, 6 forks; la cifra se mueve rápido, no la tomes como referencia fija).
No he ejecutado el modelo ni el examen. Todo lo relativo al ranking son resultados del propio estudio, y así hay que leerlo: “según los autores”. Con benchmarks nuevos y sin réplica independiente, la posición por defecto de este sitio es la de siempre: dato bonito, verificación pendiente.
La prueba que un bebé aprueba a los 3,5 meses
Los bebés humanos representan objetos que no ven a partir de los 3,5 meses (los experimentos de Baillargeon) y detectan violaciones de solidez antes de los seis. Es lo que la psicología del desarrollo llama core knowledge: el andamiaje mínimo sobre el que se monta toda la física intuitiva.
Los modelos de vídeo — a los que el sector ya llama world models con naturalidad sospechosa — siguen fallando exactamente ahí. Los objetos desaparecen tras un oclusor y reaparecen donde no les toca, cambian de color o de número al cubrirse, o atraviesan barreras sólidas como si no existieran. No son errores cosméticos: un modelo que permite interpenetrar objetos no puede producir colisiones ni caídas coherentes, y todo lo que construya encima hereda el fallo.
WROP (World Reasoning with Object Permanence) convierte ese diagnóstico en dos cosas: un examen y un corpus de entrenamiento. La pregunta del paper es doble — ¿falla la física básica de los modelos de vídeo? — y, sobre todo, ¿se puede arreglar entrenando?
Cómo funciona el examen de 300 preguntas
La maquinaria, según el paper:
- 150 generadores de tareas en Blender, organizados en seis familias. Permanencia de objetos (OP): oclusión dinámica estilo Baillargeon (OP-1), oclusión estática de escenas (OP-2) y permanencia en contenedores (OP-3). Solidez (OS): obstrucción por tamaño de hueco (OS-1), caída al retirar el soporte (OS-2) y colisiones (OS-3). Son 90 generadores OP y 60 OS.
- 10.000 muestras por generador → corpus de entrenamiento de 1,5M de muestras. El examen fijo toma 2 muestras por generador → 300 preguntas.
- Cada muestra es un clip de 120 frames a 1280×720 y 24 fps, cortado en el evento clave: 60 frames de entrada y 60 de objetivo. El modelo recibe la primera mitad y tiene que generar lo que pasa después — la reaparición tras la oclusión, la caída, la colisión.
- Anti-memorización: cada generador randomiza los parámetros superficiales (colores, materiales, iluminación, cámara) y varía de forma controlada los estructurales (número de objetos, trayectorias, momentos de contacto), preservando la estructura cognitiva de la tarea. No te libras aprendiendo la escena de carreras; tienes que entender el problema.
Dos detalles que cambian cómo hay que leer los resultados:
El ground truth no sale de un motor de física. Es animación keyframe escrita a mano en Blender, “físicamente consistente” por diseño del animador. El paper lo dice sin rodeos: no se usa ningún solver de cuerpos rígidos; la plausibilidad física es responsabilidad del autor de la escena. Consistente, sí — pero es autoría humana, no simulación.
Los jueces no son VLM. Los autores citan los déficits de core knowledge de los modelos visión-lenguaje para descartarlos como jueces, y usan 20 evaluadores humanos a ciegas: 476 juicios pareados de los que 361 comparan modelos distintos (50-52 por modelo), agregados con un modelo Bradley–Terry en escala Elo. Suena poco, y lo es; vuelve sobre esto en dos secciones.
El podio, con las trampas incluidas
Leaderboard completo del examen (20 jueces, 361 juicios; empates cuentan 0,5; Elo con media 1500; IC 95% por bootstrap sobre jueces). Cifras de la Tabla 2 del paper:
| # | Modelo | Interfaz | Elo | IC 95% | Win rate |
|---|---|---|---|---|---|
| 1 | Wan 3.0 Prime | reference-to-video | 1723,6 | 1629,2–1864,9 | 77,9% |
| 2 | MiniMax H3 | reference-to-video | 1723,6 | 1644,5–1837,6 | 77,9% |
| 3 | PWM-WROP (16B, abierto) | continuación | 1679,5 | 1603,5–1781,5 | 73,1% |
| 4 | Seedance 2.5 | reference-to-video | 1649,6 | 1554,2–1751,5 | 69,6% |
| 5 | Runway Aleph 2 | edit | 1518,3 | 1425,1–1621,6 | 52,9% |
| 6 | Wan-VACE 14B | edit | 1506,7 | 1429,9–1590,8 | 51,0% |
| 7 | Gemini Omni Flash 1.1 | edit | 1492,5 | 1404,1–1572,9 | 49,0% |
| 8 | Kling O3 Pro | edit | 1471,3 | 1404,0–1534,0 | 46,2% |
| 9 | Grok Imagine (video extend) | continuación | 1457,0 | 1362,7–1555,1 | 44,2% |
| 10 | LTX-2.3 Extend | continuación | 1453,4 | 1363,6–1545,8 | 43,1% |
| 11 | Cosmos3 Super | edit | 1409,2 | 1318,2–1488,7 | 37,3% |
| 12 | LTX-2.3 Dev | edit | 1398,9 | 1297,7–1482,3 | 36,5% |
| 13 | HY-OmniWeaving | edit | 1268,5 | 1159,4–1344,2 | 21,0% |
| 14 | MAGI-1 24B | continuación | 1248,0 | 1137,2–1315,6 | 19,2% |
Wan 3.0 Prime y MiniMax H3 comparten registro idéntico y los autores los declaran empatados en el primer puesto. Sobre el siguiente modelo de continuación (Grok Imagine video-extend), PWM-WROP saca +224 Elo. En métricas automáticas contra el vídeo objetivo, a resolución igualada, PWM-WROP es el mejor en LPIPS (0,081), MS-SSIM (0,921) y error píxel — según los autores, y con la advertencia de ellos mismos de que esas métricas miden parecido con el objetivo, no razonamiento físico.
Ser tercero con intervalos solapados no es ser tercero
Mira los IC de la tabla. PWM-WROP: [1603,5, 1781,5]. Wan: [1629,2, 1864,9]. MiniMax: [1644,5, 1837,6]. Se solapan los tres. Los autores lo dicen explícitamente: intervalos que se solapan no deben leerse como diferencias de rango significativas, y al primer y segundo puesto los llaman statistical tie. Lo mismo aplica al tercero.
Las probabilidades top-1 por bootstrap lo dejan claro: Wan 46,8%, MiniMax 36,4%, PWM-WROP 12,3%, Seedance 4,5%, y cero para los otros diez. Eso es “PWM-WROP gana a los líderes en el 12% de los mundos que exploró el bootstrap”, no “tercer mejor modelo de vídeo del mundo”.
Con 361 juicios repartidos entre catorce modelos, cada estimación se sostiene en 50-52 comparaciones. Es suficiente para separar la cabeza de la cola (el último, MAGI-1, está a más de 475 puntos y ahí no hay duda), pero insuficiente para ordenar los cinco primeros. Si necesitas un recordatorio de cómo leer esto — y de qué benchmarks ignorar — ya lo tratamos en Leaderboards explicados: qué benchmark mirar y cuál ignorar.
Mi lectura: este estudio demuestra que PWM-WROP es competitivo con los líderes comerciales en este examen y con estos jueces. Eso ya es noticia. El podio en sí es titular cómodo y estadística tosca.
La interfaz explica el ranking mejor que el tamaño
Los catorce modelos se reparten en tres clases que juegan exámenes distintos:
- Reference-to-video (3): Wan 3.0 Prime, MiniMax H3 y Seedance 2.5 toman el clip de entrada como referencia visual y regeneran todo el evento en su propia línea temporal. No continúan el vídeo: lo re-interpretan. Esa libertad les permite producir escenas coherentes — y les pasa factura cuando hay que preservar lo mostrado.
- Edición/transferencia (7): repintan el intervalo de entrada frame a frame. Por construcción no pueden mostrar nada que ocurra después de la oclusión — exactamente lo que el examen pregunta. Del quinto al duodécimo puesto hay seis edit/transferencia y solo dos de continuación (Grok Imagine y LTX-2.3 Extend): el medio de la tabla es suyo por diseño.
- Continuación real (4): PWM-WROP, MAGI-1 24B, LTX-2.3 Extend y Grok Imagine video-extend tratan la entrada como prefijo y sintetizan lo que sigue. Es el único grupo que juega el mismo juego que el benchmark.
Los cuatro primeros puestos son tres reference-to-video más el fine-tune de 16B. Los autores lo resumen sin piedad: la clase de interfaz explica el leaderboard mejor que la escala del modelo. PWM-WROP compite a 320×192 nativos contra sistemas que sacan 720p y 1080p — menos del 7% de los píxeles de un 720p, un 3% de un 1080p — y aun así queda a 44,1 puntos de Elo del empate cabeza.
Qué entrenaron exactamente (y con qué hardware)
- Base: Cosmos3-Nano de NVIDIA, 16B. Solo cambia la señal de entrenamiento; arquitectura y tokenizer quedan intactos.
- Datos: una época sobre las 1,5M de muestras del corpus. Sin etiquetas de tarea ni supervisión extra: el clip y su prompt en lenguaje natural, nada más. El único modelo del estudio entrenado con datos WROP.
- Geometría: clip empaquetado de 117 frames a 320×192 (57 de condición + 60 predichos), que es la misma geometría de evaluación.
- Hardware: un solo nodo AWS trn2.48xlarge con Trainium2 (16 chips, 64 NeuronCores lógicos), paralelismo tensor 4 × FSDP2 16, batch 16. El stack — PWM, PyTorch nativo sin trazado XLA — está liberado, y el apéndice B del paper documenta cómo bajaron el paso de 15,1 s a 5,7 s con tres optimizaciones verificadas. En inferencia el modelo pesa 29 GB en bf16 y cabe en un trn2.3xlarge de 4 cores.
Que un modelo abierto de 16B se fine-tunea con un corpus público y un nodo de hardware es el patrón que esta casa lleva tiempo siguiendo en texto: el post-training sobre pesos abiertos es donde se está moviendo el valor (caso reciente: Nex-N2.5 y el mayor post-training trillion-scale en pesos abiertos).
Por familias, el perfil del fine-tune es revelador: PWM-WROP es primero en OP-2 (oclusión estática), tercero en OP-1 y OP-3, segundo en OS-2 (caída), pero quinto en OS-1 y octavo en OS-3 (colisiones). Entrenar permanencia por oclusión funciona; la dinámica de contacto resiste mucho más. Los autores lo admiten: el régimen actual de fine-tuning es más efectivo para rastrear oclusiones que para contactos.
Dos formas de fallar, con nombre propio
El análisis cualitativo del paper es lo más útil que tiene, porque pone nombre a los dos modos de fallo que verás en producción:
Representation dropout — el modelo pierde la cuenta de lo que hay. El caso G43: tres bolas entran en túneles paralelos y tienen que salir en el mismo orden, color y número. Gemini Omni Flash saca una cuarta bola y descoloca las calles. En G19, Seedance 2.5 mueve una pantalla que no cubre a los objetos (que siguen asomando al lado) y luego los hace reaparecer de la nada, sin continuidad con sus posiciones previas.
Causal decoupling — los eventos individualmente son razonables, pero no hay física que los conecte. El caso G27: se retira el soporte y la bola de Seedance se queda flotando varios frames antes de caer, tarde y sin gracia. En G137 (rotura de billar), Gemini Omni Flash inventa bolas antes del golpe (de 7 a 12 o más) y la bola morada — la primera que recibe el impacto — desaparece al ser golpeada.
Y el fallo más común de todos, según los autores, lo cometen también los líderes: la bola atraviesa sin inmutarse el agujero más pequeño que ella (tarea G10). Lo hacen Seedance, MiniMax H3 y Wan 3.0 Prime. La solidez, de momento, se la salta todo el mundo.
Cómo usarlo tú
Todo el kit está liberado:
- Corpus (1,5M muestras): huggingface.co/datasets/Hokin/object-permanence
- Examen (300 preguntas): huggingface.co/datasets/Hokin/object-permanence-benchmark
- Pesos del modelo: huggingface.co/Hokin/PWM-WROP
- Generadores + stack PWM: github.com/hokindeng/object-permanence (180 estrellas y 6 forks a 27-sep-2026)
- Web y leaderboard: object-permanence.world
Qué haría yo con esto:
- Si generas vídeo con continuación (V2V): el examen es pequeño y ejecutable; medir tus modelos antes de prometer “coherencia física” en cualquier deck.
- Si entrenas world models: el corpus es la joya. Separar parámetros estructurales de superficiales en 150 generadores es una rareza en datos sintéticos, y el apéndice de Trainium2 te ahorra meses de ingeniería si tu backend es ese.
- Si solo consumes vídeo generado: ya tienes detector de fallos gratis. Haz que algo se oculte y cuenta los objetos cuando reaparezca. El número de veces que el modelo se equivoca te dirá más que cualquier demo.
Veredicto escéptico
Con matices, como todo lo que merece la pena:
- El “tercer puesto” es una estimación puntual. Con esos IC, lo defendible es “estadísticamente indistinguible de los dos primeros en este examen”. Ni más ni menos.
- El leaderboard mezcla clases de interfaz en una sola tabla. El reference-to-video tiene ventaja estructural en este formato (regenera en vez de continuar) y los autores lo reconocen. Cómodo para el titular, tosco para decidir.
- El ground truth es keyframe manual, no simulación. Consistente por diseño, pero si el animador se equivoca, el examen premia el error. Los autores auditan interpenetraciones; sigue siendo autoría humana.
- Aun así, el resultado central me parece real: una época de fine-tuning con datos cognitivos bien diseñados deja a un 16B abierto a 44,1 puntos de Elo de sistemas comerciales que generan a 720p y 1080p. La brecha entre pesos abiertos y comerciales lleva tiempo cerrándose en texto — DeepSeek V4 fue el caso canónico — y esto sugiere que la física básica de los vídeos no va a ser la excepción.
- Lo que haría falta para creérmelo del todo: réplica independiente del leaderboard (los números son de los autores y de nadie más, por ahora), más jueces (361 juicios es poquito para catorce modelos), y ver si la dinámica de colisiones mejora lo mismo que la oclusión en una segunda iteración.
Si solo te llevas una idea, que sea esta: los fallos de física de los modelos de vídeo ya tienen nombre — representation dropout y causal decoupling — y hay evidencia de que se pueden entrenar. Eso convierte la “permanencia de objetos” de curiosidad cognitiva en línea de trabajo concreta. Y los datos para intentarlo están en Hugging Face, gratis.
Fuentes: Paper en arXiv (2609.28654) · HTML v1 completo · object-permanence.world · leaderboard · repositorio GitHub · corpus en Hugging Face · examen en Hugging Face · modelo en Hugging Face