Roboticz Lab EN
‹ Noticias

Tres preprints intentan enseñar más con menos datos | Robótica con IA

Qué ha cambiado de verdad en las últimas 24 horas: tres preprints prueban locomoción y manipulación con datos sintéticos, una sola demostración o una demostración estructurada. Son resultados de investigación, no productos listos para montar.

  • aprendizaje robótico
  • VLA
  • manipulación
  • humanoides
  • cuadrúpedos
  • actualidad
Imagen generada: detalle macro de instrumental de laboratorio, acompaña a la entrada Tres preprints intentan enseñar más con menos datos

¿Qué ha cambiado de verdad en las últimas 24 horas? No ha salido una placa nueva ni un humanoide a la venta. Han aparecido tres preprints que atacan el cuello de botella más caro de la robótica con IA: conseguir datos útiles para que un robot aprenda. Uno usa un experto en simulación y llega a un Spot y a un G1 reales. Otro intenta juntar razonamiento y acción en un único modelo. El tercero usa una demostración estructurada para adaptarse a escenas nuevas.

Los tres trabajos son preprints. Eso significa que sus cifras son las de sus autores y todavía no equivalen a una validación independiente. Aun así, hay material técnico suficiente para prestar atención.

SMPC más aprendizaje, menos recompensa escrita a mano

El primer trabajo, Learning Loco-Manipulation From SMPC Demonstrations, usa un controlador predictivo basado en muestras como experto dentro de la simulación. Ese experto genera muchos datos y después una política de aprendizaje por refuerzo aprende con recompensas escasas, sin que alguien tenga que diseñar una recompensa detallada para cada movimiento.

Los autores dicen que transfirieron habilidades de locomoción y manipulación a un cuadrúpedo Spot con brazo y a un humanoide G1. La idea útil no es que la simulación sea perfecta. Es que puede producir demostraciones de forma automática y dejar al aprendizaje la parte de descubrir cómo repetirlas.

Para un proyecto casero, esto todavía no es un repositorio que clonas y conectas a un servo. Sí es un patrón que puedes copiar a pequeña escala: primero construyes un experto simple en simulación, después usas sus trayectorias para entrenar una política y solo al final pruebas con el robot real.

G0.5 mezcla la explicación y el movimiento

En G0.5, los autores proponen un modelo visión-lenguaje-acción autoregresivo. En lugar de usar un modelo de visión y lenguaje como contexto y otro componente separado para producir acciones, un único decodificador genera tokens de razonamiento y de acción.

El paper reporta un 76,7 % en el ajuste con robots R1lite y R1pro, frente al 53,3 % de pi0.5 y el 24,4 % de GR00T-N1.7 en ese régimen. También reporta un 31,4 % en 50 tareas largas de manipulación móvil del benchmark BEHAVIOR 2025. Son comparaciones internas del preprint, no una garantía de que el modelo funcione igual en cualquier brazo.

Lo que cambia aquí es la arquitectura. Si el mismo modelo decide qué hacer y cómo expresarlo en acciones, hay menos piezas que coordinar. El coste es que entrenar y depurar un sistema así puede ser más difícil. Para un maker, la lección es sencilla: el modelo no sustituye la cámara, la calibración ni el controlador de seguridad.

StellaVLA usa una demostración para adaptarse a una escena nueva

El tercer trabajo, StellaVLA, intenta que una política no copie píxeles sin entender la tarea. Un proceso automático convierte una trayectoria en una demostración estructurada con plan, subobjetivos y movimiento tridimensional descrito. En la prueba se recupera una demostración y se usa como contexto para actuar en una situación distinta.

El paper coloca a StellaVLA en primer lugar en una tabla de VLA-Arena con una puntuación de 0,63, frente a 0,44 para pi0.5 y 0,22 para LingBot-VLA. También reporta un 98,8 % de éxito medio en LIBERO y un 85,1 % en LIBERO-Plus. De nuevo, son cifras del trabajo y conviene leer la configuración antes de compararlas como si fueran una liga universal.

La parte que sí puedes trasladar a tu banco es el formato de la demostración. En vez de guardar solo vídeo y posiciones, guarda qué tarea se intentaba, qué subobjetivo tocaba y qué movimiento era importante. Ese contexto puede ayudar a reutilizar datos cuando cambias el objeto, la cámara o el robot.

Qué no ha salido hoy

No he encontrado una placa, sensor o actuador nuevo con documentación suficiente para recomendarlo. Tampoco una actualización de LeRobot, ROS 2 o un despliegue industrial verificable en esta ventana. Las tres señales de hoy son investigación. Léelas como métodos para probar, no como productos que ya puedas comprar.

Si estás empezando, no te compliques con un VLA de millones de parámetros. Monta primero una tarea pequeña, registra bien una demostración y mide qué falla. Cuando tengas ese bucle, estos trabajos te dan tres caminos para necesitar menos datos y aprovechar mejor los que ya tienes.

Fuentes
  1. Learning Loco-Manipulation From SMPC Demonstrations With Sparse Offline-to-Online RL, arXiv, 12 de agosto de 2026
  2. G0.5: One Autoregressive Stream for Robot Reasoning and Action, arXiv, 12 de agosto de 2026
  3. StellaVLA: In-Context Structured Demonstration for Generalizable Vision-Language-Action Models, arXiv, 12 de agosto de 2026

Cada afirmación de arriba sale de aquí. Si algo no tiene fuente, no está.

Y ahora móntalo tú

Guías con la lista de materiales y la lógica explicada.

Suscribirme por RSS