El Seoul World Model de Naver genera vídeo de calles reales sin alucinarse la ciudad
Investigadores de NAVER AI Lab y KAIST publicaron el Seoul World Model, el primer sistema de generación de vídeo con IA basado en geometría urbana real, entrenado con 1,2 millones de imágenes de street view de Seúl y que supera a seis modelos de mundo existentes en precisión espacial.
Investigadores de NAVER AI Lab, KAIST y la Universidad Nacional de Seúl publicaron esta semana el Seoul World Model (SWM), el primer sistema de generación de vídeo con IA explícitamente anclado en una ciudad real en lugar de en un entorno sintéticamente imaginado. La diferencia importa más de lo que parece.
Los modelos de mundo de vídeo existentes generan entornos visualmente plausibles inventando el contenido desde cero. Parecen realistas. No corresponden a ningún lugar concreto. SWM, en cambio, recupera imágenes reales de street view de Seúl como señales de condicionamiento durante la generación, anclando cada salida a la geometría real de una ubicación específica. El resultado es un sistema capaz de generar trayectorias de vídeo de varios kilómetros por las calles reales de Seúl —y que generaliza a otras ciudades con las que nunca fue entrenado.
Los datos de entrenamiento son específicos: 1,2 millones de imágenes panorámicas reales de street view capturadas en toda Seúl, más 10.000 vídeos sintéticos del simulador urbano CARLA, que cubren 431.500 metros cuadrados de superficie urbana. Los datos sintéticos resolvieron una limitación estructural: las cámaras montadas en vehículos capturan vistas frontales a intervalos dispersos, dejando huecos en la cobertura. El simulador rellenó esos huecos con trayectorias de cámara diversas que la captura real de street view no puede proporcionar.
El mecanismo técnico central es la generación aumentada por recuperación aplicada al vídeo. Dados unos coordenados GPS, instrucciones de movimiento de cámara y prompts de texto opcionales, SWM recupera imágenes de street view cercanas y condiciona el modelo de vídeo autorregresivo sobre la geometría y la apariencia de esas referencias. Esto ancla cada segmento generado a lo que esa ubicación realmente parece, evitando la deriva espacial que lastra la generación de vídeo a largo horizonte.
El artículo introduce lo que los autores denominan Virtual Lookahead Sink: durante la generación, el sistema recupera continuamente una imagen de street view desde un punto futuro de la trayectoria planificada y la usa como ancla para estabilizar el segmento actual. A lo largo de cientos de metros de trayectoria generada, esto evita que el error acumulado haga que el resultado derive hacia la incoherencia.
En benchmarks sobre Seúl, Busan y Ann Arbor —esta última, una ciudad que el modelo nunca había visto durante el entrenamiento— SWM superó a seis modelos de mundo de vídeo existentes en calidad visual y consistencia temporal. El resultado de generalización es notable: un modelo entrenado con datos de street view coreanos funcionó bien en una ciudad de Michigan sin ningún fine-tuning adicional.
La capacidad de prompting textual añade una dimensión práctica. Los usuarios pueden describir escenarios —olas inundando la calle, Godzilla entre rascacielos, cambios meteorológicos— y SWM integra esas alteraciones manteniendo la fidelidad espacial de la ubicación base. Esta combinación de anclaje en el mundo real y superposición fantástica es precisamente lo que la mayoría de los modelos de mundo sintéticos no tienen.
Las aplicaciones más evidentes son la simulación de planificación urbana, la evaluación de conducción autónoma en entornos urbanos realistas y la generación de datos de entrenamiento para robótica. En una perspectiva más especulativa, esto es la base para mapas que no son imágenes estáticas sino simulaciones dinámicas y navegables de lugares reales. Google y Apple tienen programas de street view por razones similares. SWM demuestra que los datos subyacentes pueden sostener ahora la generación de vídeo interactivo, no solo la captura fotográfica.
El código y los pesos del modelo están previstos para su publicación. El artículo en arXiv es el 2603.15583.
Lecturas relacionadas
- Modelos de IA OpenAI cierra Sora: 15 millones de dólares al día en costes y un acuerdo Disney que nunca fue
- Herramientas de IA OpenAI Cerró Sora. Quemaba un Millón de Dólares al Día y Disney se Enteró una Hora Antes que el Público.
- Modelos de IA OpenAI pausa el desarrollo de Astra al rozar por primera vez el nivel de riesgo cibernético 'Crítico'