Harnesses / SEÑAL VERIFICADA

Tencent presenta WorldClaw, un framework agéntico que genera mundos 3D abiertos a escala

Tencent Hunyuan3D presentó WorldClaw, un framework agéntico que convierte un prompt abierto en un mundo 3D a gran escala, coherente y editable objeto por objeto: agentes de planificación mantienen la organización global del terreno mientras generan detalle local solo donde el terreno lo soporta.

Ilustración digital de ciencia ficción: un robot gigante de cuatro patas con garras y un anillo de luz cian, con el nombre WorldClaw en el torso, flota sobre un valle con ciudad futurista, estructuras holográficas azules, montañas nevadas y un anillo circular brillante; el logo de Tencent aparece en la esquina superior derecha, con drones y robots menores en primer plano, paleta sepia y grises con acentos cian
SIG/TENVERIFICADO · 2026-08-11

Harnessesalta

#agentes#modelos#fundamentos

Tencent Hunyuan3D acaba de presentar WorldClaw, un framework totalmente agéntico que convierte un prompt abierto en un mundo 3D a gran escala, coherente y editable objeto por objeto. La propuesta resuelve un problema real: generar mundos explorables desde texto obliga a mantener a la vez coherencia espacial global, contenido local rico y activos explícitos que se puedan reusar y editar.

El sistema funciona de grueso a fino y de lo global a lo regional. Agentes especializados ejecutan tres etapas y se comunican por representaciones intermedias estructuradas compartidas, para que la generación y el refinamiento local respeten la organización global de la escena.

  • Análisis de intención y planificación: un agente extrae y normaliza solo las restricciones que el prompt dice explícitamente, sin inventar contenido, y un agente de planificación resuelve ambigüedades siguiendo un esquema de especificación predefinido (regiones, restricciones de terreno, restricciones de objetos).
  • Generación global de terreno: un mapa semántico de layout, prototipos 3D reutilizables y materiales generativos o procedurales se combinan en un campo de altura consciente de regiones, con un bucle de render y corrección que ajusta transiciones, escalas y dispersión.
  • Generación y colocación de objetos por región: un agente de planificación regional elige solo las zonas cuyo terreno soporta las funciones pedidas, las reconstruye como mallas texturizadas editables y un agente de refinamiento corrige pose, calidad de malla, escala y contacto con el terreno.

El resultado son escenas grandes con organización espacial coherente, contenido local convincente y activos editables a nivel de instancia, conservando una estructura de terreno global consistente. El paper muestra once mundos distintos, desde una aldea medieval multibioma hasta un caldero de lava o un puesto avanzado ártico, cada uno entregado como layout isométrico, órbita aérea y recorrido a nivel de suelo, renderizado también en canales de apariencia, máscaras de instancia, normales y profundidad.

La conclusión del equipo es clara: separar la organización global del mundo del contenido local por instancia es lo que permite que una escena generada siga coherente mientras crece. Como trabajo futuro, apuntan a modelado 3D nativo en código (ya generan materiales de terreno como grafos de nodos ejecutables de Blender y shaders) y a integrarse con motores de producción para generación procedural en tiempo de ejecución, navegación, física e interacción.

Para más detalles: