Roboticz Lab EN
‹ Noticias

Un cartel impreso secuestra un robot con VLM | Qué ha cambiado en robótica con IA

Un estudio con 5.670 pruebas consigue desviar robots controlados por VLM poniendo texto a la vista de la cámara, con un 27,0 % y un 29,4 % de éxito. Además, un modelo humanoide de cuerpo entero con 40 horas de dataset doméstico, 11 fallos destapados en Isaac Sim y Unitree fijando el precio de su salida a bolsa.

  • VLM
  • seguridad
  • manipulación
  • humanoides
  • dataset
  • Isaac Sim
  • actualidad
Imagen generada: detalle macro de instrumental de laboratorio, acompaña a la entrada Un cartel impreso secuestra un robot con VLM

¿Qué ha cambiado de verdad en robótica con IA en las últimas 24 horas? Lo más útil no es un robot nuevo, es un aviso de seguridad: si dejas que un modelo de visión y lenguaje decida lo que hace tu brazo, un folio impreso dentro del encuadre puede darle órdenes. Y funciona bastante más de lo que te gustaría. Junto a eso, un modelo humanoide que anda y manipula a la vez con 40 horas de casa grabadas, un trabajo que le encuentra 11 fallos a Isaac Sim, y Unitree poniendo precio a su salida a bolsa.

De hardware asequible, hoy nada verificable. Y ojo con esto: ninguno de los tres papers publica código ni pesos, y ni LeRobot, ni MuJoCo, ni Isaac Lab, ni Genesis sacaron versión en esta ventana. Son ideas para copiar, no repositorios que te clonas esta tarde.

Un papel pegado en la escena se lleva por delante al robot

Este es el hallazgo del día. Un equipo publicó el 6 de agosto el primer estudio sistemático de lo que llaman inyección de prompt física. La idea es tonta de puro simple: el VLM que planifica lee la escena por la cámara, y el texto que hay en la escena entra en su razonamiento como si fuera una instrucción más.

Montaron un banco de 20 prompts de ataque en cuatro familias, señalización indirecta, redefinición de la tarea, suplantación de autoridad e inyección de conflicto, y los probaron sobre tres disposiciones físicas y tres formas de dar la orden. Total, 5.670 pruebas sobre un robot de clasificación con tres modelos: GPT-4o cayó en el 27,0 % de los casos, Gemini 2.5 Flash en el 29,4 % y Qwen3-VL-32B en el 5,0 %. Los ataques de suplantación de autoridad y los de negación funcionaron contra los tres.

La parte que más me llama la atención está en las trazas de razonamiento. En el 99,9 % de los ataques con éxito el modelo reconoce explícitamente el texto del cartel antes de obedecerlo. O sea, no es que no lo vea: es que lo ve y decide hacerle caso. Y cada modelo se defiende de una forma distinta, Gemini rechazando de forma explícita y GPT-4o directamente no prestando atención a esa parte de la imagen.

¿Qué haces con esto en tu mesa? Probaron tres defensas y las tres bajan el riesgo mucho. La instrucción defensiva en el prompt del sistema da entre un 75 % y un 100 % según el modelo, la verificación en dos pasos entre un 85 % y un 100 %, y tapar el texto en el preprocesado de imagen llega al 100 %. Ten en cuenta el peaje que los propios autores avisan: si enmascaras el texto, tu robot deja de poder leer etiquetas de la escena, y para muchas tareas de clasificación eso era justo lo que necesitabas. Es un preprint sin revisión por pares, pero el montaje es reproducible y la conclusión práctica es clara: en un robot con VLM, lo que se ve por la cámara no es dato neutro, es entrada de usuario.

Un humanoide que anda y manipula a la vez, y 40 horas de casa grabadas

El segundo trabajo del mismo día es ω-0, un modelo world-action de cuerpo entero para lo que llaman loco-manipulación concurrente. Traducido: mover el cuerpo, corregir la postura, mantener el equilibrio y manipular el objeto como un solo comportamiento, en vez de trocear locomoción y brazo en dos políticas que luego se pisan.

El truco técnico es que no reconstruye vídeo futuro. Aprende embeddings compactos de la observación siguiente como objetivo predictivo ligero, y a partir de ahí genera los latentes de acción de cuerpo entero por difusión, ya compatibles con el controlador. Acepta RGB egocéntrico, RGB exocéntrico y profundidad exocéntrica. Los autores reportan que un solo modelo supera a las líneas base de imitación, VLA, humanoide y world-action en 11 tareas domésticas reales, aunque no ponen cifras de éxito en el resumen.

Lo que a mí me parece más valioso es el dataset: ω-HOME, más de 40 horas de tareas domésticas reales con vistas múltiples sincronizadas, movimiento de cuerpo entero en formato SMPL, estados del robot y latentes de acción. Ahí está el trabajo caro de verdad. La página del paper no confirma que el dataset se vaya a publicar, así que de momento es una promesa, no una descarga.

11 fallos destapados en Isaac Sim, 9 ya confirmados o corregidos

Este pasa desapercibido y toca a mucha gente. Si entrenas en simulación antes de bajar al hardware, tu simulador es infraestructura, y la infraestructura también tiene bugs. IcFuzz es el primer fuzzer para NVIDIA Isaac Sim. Parte los programas de simulación en etapas con un LLM para entender qué objeto es qué, y sobre eso aplica mutaciones a varios niveles.

Los números que reportan: entre un 190 % y un 205 % de la cobertura de código de las líneas base, y una media de 3,7 caídas únicas en tres rondas de 12 horas de prueba, cuando las líneas base no encontraron ninguna. En unos cuatro meses destaparon 11 fallos, y 9 ya están confirmados o corregidos por los desarrolladores.

Aquí lo importante es la lectura para ti: cuando una política se comporta raro en sim y bien en real, o al revés, no siempre es culpa de tu modelo. A veces es el simulador. Que 9 fallos hayan entrado ya en el ciclo de arreglo de NVIDIA es la mejor noticia del bloque.

Unitree pone precio a su salida a bolsa

Esto es financiero, no técnico, y lo marco como tal porque no cambia nada en tu banco de trabajo. Según Caixin Global, Unitree fijó el precio en 150,80 yuanes por acción, unos 22,3 dólares, lo que implica una valoración de 61.000 millones de yuanes. La suscripción abre el 10 de agosto y el tramo institucional quedó sobresuscrito más de 2.600 veces. El trámite regulatorio tardó 104 días, un récord.

Los datos que sí dicen algo del negocio: en 2025 la compañía declara 591 millones de yuanes de beneficio neto sobre 1.700 millones de ingresos, con margen bruto por encima del 60 %. Son cifras de la propia empresa presentadas al mercado, no auditoría independiente, así que tómalas como lo que son. Y DeepSeek entra como inversor estratégico con 933.399 acciones, un 2,31 %, con bloqueo de tres años.

Qué haría yo hoy

Si tienes un robot que decide con un VLM, aunque sea un brazo de escritorio con una cámara USB, dedica media hora al paper de la inyección física y mete la defensa más barata que puedas: una instrucción explícita en el prompt del sistema de que el texto visible en la escena es contenido observado y nunca una orden. Cuesta dos líneas y te quita la mayoría del problema.

Si estás en simulación, apunta IcFuzz y revisa si alguno de esos 11 fallos te explica ese comportamiento raro que llevas dos semanas achacando a tus hiperparámetros.

Y si lo tuyo es humanoide, ω-0 es lectura, no descarga. Sé que hoy la cosecha va corta de cosas para tocar, pero el aviso de seguridad vale por los tres. Cuando salga el dataset o el código, lo contamos con el enlace al lado.

Fuentes
  1. arXiv 2608.05715, enviado el 6 de agosto de 2026: inyección de prompt física en robots controlados por VLM
  2. arXiv 2608.06375, enviado el 6 de agosto de 2026: ω-0, modelo world-action de cuerpo entero para loco-manipulación humanoide
  3. arXiv 2608.06088, enviado el 6 de agosto de 2026: IcFuzz, fuzzing de NVIDIA Isaac Sim con guía semántica por etapas
  4. Caixin Global, 7 de agosto de 2026: Unitree fija el precio de su salida a bolsa en Shanghái con una valoración de 61.000 millones de yuanes

Cada afirmación de arriba sale de aquí. Si algo no tiene fuente, no está.

Y ahora móntalo tú

Guías con la lista de materiales y la lógica explicada.

Suscribirme por RSS