Stanford presenta HomeBody: un G1 guiado por GPT Astra ordena una cocina nueva
TML de Stanford y Caltech muestran un Unitree G1 orquestado por GPT Astra en una cocina desconocida, con memoria espacial y skills componibles, sin dataset del piso ni un VLA extra. Es una demo de laboratorio, no un mayordomo comercial.

El laboratorio TML de Stanford, con Caltech, publicó HomeBody: un sistema para que un modelo de visión y lenguaje de frontera —en las demos, GPT Astra— orqueste un humanoide Unitree G1 en una cocina que el robot no ha visto antes. No hay dataset de esa cocina. No hay un VLA extra entrenado para la casa. Hay memoria espacial persistente y una librería de habilidades que se pueden componer.
El vídeo que Gio Huh hizo circular el 26 de septiembre lo cuenta mejor que el abstract. El G1 recoge bolsas de café, tira envases caducados y, más tarde, recupera un medicamento que le pediste de forma vaga porque recuerda dónde lo vio. La escena es doméstica a propósito. El argumento no es acrobacia. Es que el modelo general puede hacer de jefe de obra si le das mapa y gestos reutilizables.
-IA Crew dice: Enseñar a un robot a tirar la leche caducada parece poco hasta que recuerdas que la mayoría de humanoides todavía tropiezan con la categoría objeto que no debería estar ahí.-
La pregunta que hace HomeBody
La arquitectura habitual de un humanoide autónomo se cuenta en tres capas. Un VLM (Sistema 2) mira e interpreta. Un VLA aprendido (Sistema 1) convierte eso en acciones. Un controlador de cuerpo completo (Sistema 0) mantiene el equilibrio. HomeBody pregunta algo incómodo: si Astra ya planea con bastante tino, ¿hace falta ese VLA intermedio para tareas largas de casa?
La respuesta del paper no es que el control sobra. Es más estrecha. En tareas semánticas de horizonte largo —ordenar, buscar lo que no está a la vista, encadenar destrezas de las dos manos— el modelo de frontera puede llamar a skills ya fiables sin reentrenar una política para cada piso. El control de bajo nivel sigue ahí. Lo que se adelgaza es la capa que memorizaba esta cocina, estos cajones, este fregadero.
El despliegue que describen tiene dos tiempos. Primero el robot explora: vídeo de iPhone a media resolución, cámara D435i, LiDAR con SLAM, poses articulares y puntos de vista que elige Astra. Después, el propio Astra hace de agente Real2Sim y arma un gemelo en Isaac Sim con lo que acaba de recoger. Esa memoria, no un fine-tune de la vivienda, es lo que permite volver a un objeto que ya no está delante.
Qué demuestra, y qué no
Demuestra que un G1 de laboratorio puede completar una limpieza cruzando la estancia y una búsqueda con instrucción ambigua sin datos específicos del entorno. Demuestra que la memoria espacial no tiene que ser un mapa bonito para humanos: puede ser un almacén de observaciones que el VLM consulta. Demuestra, sobre todo, una tesis de diseño: las skills componibles y un modelo general ganan terreno al entrena una política por casa.
No demuestra un mayordomo comercial. El G1 sigue siendo una plataforma de investigación, con batería corta y manos que no perdonan un vaso mojado. HomeBody no elimina la latencia ni inventa un controlador mágico. Tampoco prueba que el VLA haya muerto: para deportes de contacto con la física —empujar una silla atascada, recuperar el equilibrio con un objeto en la mano— las políticas entrenadas siguen siendo el sitio razonable para invertir.
El matiz importa porque el clip se presta al entusiasmo fácil. Un humanoide que entiende tira lo caducado es noticia. Un humanoide que lo hace todos los días, en pisos distintos, sin un técnico detrás, es otra industria. Stanford y Caltech están en el primer párrafo, no en el segundo.
-IA Crew dice: El gemelo digital de tu cocina es un avance científico. También es una forma muy cara de recordar dónde dejaste el paracetamol.-
Por qué encaja en la semana de los agentes
Mientras OpenAI cuenta agentes de software que se cuelan en webs ajenas, HomeBody enseña el otro vector: el agente con cuerpo. Misma idea de fondo —un modelo general que no se queda en el chat— y un riesgo distinto. En un navegador, el fallo es una foto publicada o una clave reutilizada. En una cocina, el fallo es un cajón, un cuchillo o una botella.
La lección útil para quien no tiene un G1 en el salón es de arquitectura. Separar entender qué hay que hacer de cómo mueve el cuerpo permite cambiar el cerebro sin reentrenar el equilibrio. Es el mismo patrón que se ve en agentes de software cuando el sistema coordina herramientas y el modelo solo decide. HomeBody aplica ese patrón al piso de verdad.
Todavía falta lo aburrido: manos mejores, menos espera entre la orden y el gesto, y una memoria que no exija reconstruir Isaac Sim cada vez que te mudas. Hasta entonces, el vídeo de la leche caducada funciona como prueba de existencia. Un modelo de frontera ya puede capataz de una casa desconocida, si le dejas skills y un mapa. El resto, como siempre, es ingeniería y paciencia.
-IA Crew dice: El día que el robot recuerde el medicamento y se olvide de publicarlo en un hosting, habremos avanzado en las dos direcciones a la vez.-
Diccionario de la Crew
VLM — Modelo de visión y lenguaje: un sistema que interpreta imagen y texto juntos y, en este caso, planifica la tarea del robot.
VLA — En este contexto, política visión-lenguaje-acción entrenada para convertir una instrucción visual en movimiento. HomeBody explora prescindir de una capa extra de este tipo para tareas domésticas largas.


