
Si has pasado algún tiempo jugando con generadores 3D impulsados por IA durante el último año, ya conoces el procedimiento. Alimentas un prompt o una foto, esperas dos minutos y recibes una masa de geometría texturizada impía e imposible de animar. Claro, los 'Gaussian splats' se ven elegantes en una demo de navegador, pero intenta soltar uno en un motor de juego real o en una cadena de producción y observa cómo tu artista técnico rompe a llorar.
Por eso, LEGO-Anything, un nuevo framework que convierte fotos 2D individuales en código procedural de Blender, captó inmediatamente mi atención. En lugar de generar una nube de puntos desordenada o una malla congelada, obliga a los agentes de visión-lenguaje a generar scripts Python de Blender editables y modulares. Obtienes objetos, transformaciones y primitivas reales que puedes ajustar directamente en la ventana gráfica. Sobre el papel, así es exactamente como debería funcionar el modelado 3D asistido por IA.
Luego llegaron los resultados de los benchmarks, y la realidad rápidamente arruinó la fiesta. Incluso los modelos multimodales líderes alcanzaron un máximo de alrededor del 53 por ciento de precisión de reconstrucción. Pero el verdadero chiste no es la mediocre tasa de finalización; es el bucle de autocrítica. Cuando los investigadores probaron si estos agentes podían evaluar su propia precisión geométrica a partir de vistas renderizadas, los modelos no se desempeñaron mejor que un lanzamiento de moneda al azar.
Esto es un cuello de botella masivo para cualquiera que construya herramientas de diseño agénticas. Toda la promesa del desarrollo de software autónomo depende del bucle de retroalimentación: el agente escribe código, inspecciona la salida del compilador o el render, detecta sus errores e itera. Si un agente no puede saber si la pata de una silla está flotando tres pulgadas sobre el suelo o atravesando la pared de yeso, no puede corregirse a sí mismo. Presentará felizmente una credenza del revés y te dirá con absoluta confianza que el trabajo está hecho.
Como prueba de concepto, avanzar hacia grafos de escena editables y scripts procedurales es una mejora masiva sobre las 'sopas de polígonos' de caja negra. Pero hasta que los modelos de visión desarrollen una intuición espacial real y una comprensión estereoscópica, herramientas como LEGO-Anything siguen siendo generadores glorificados de borradores. Obtienes una ventaja en tu diseño, pero sigues atascado pasando la tarde limpiando scripts Python a medio hacer en Blender a mano.
Foto: Bernd 📷 Dittrich / Unsplash (https://unsplash.com/@hdbernd)
Black Forest Labs' new Flux 3 Image promises multi-step editing that preserves image integrity, plus precise scene composition using bounding boxes and multiple reference images. It aims to deliver surgical precision for AI-generated visuals.

OpenAI successfully blocked a massive campaign to scrape its models' hidden reasoning tokens, but the exploit kept working on Microsoft Azure for weeks.

Zhipu's open-weight GLM-5.3 model can generate cyber exploits almost as effectively as top closed models, with its Flash variant creating a reliable Chrome attack for a mere $20.40, raising serious alarms about AI safety and misuse.

Manus 2.0 shifts from a browser tool to an ambitious agent platform running from your phone, but its flashy new features raise questions about actual utility.

Comentarios (1)
I'm curious, have you explored if LEGO-Anything's output can be fine-tuned with additional inputs or guidance to improve the reconstruction accuracy beyond 53 percent?
I gave it a shot – feeding it rough sketches or a second angle nudges the fidelity a bit, but the model still stalls around the low‑50s unless you start tweaking the prompt engineering yourself. In short, you can coax a modest improvement, but you won’t magically get production‑grade builds without a lot of manual cleanup.