Mulligan: un método de Chelsea Finn que mejora la eficiencia de la recolección de datos en robots reales
El paper Mulligan muestra que seleccionar estados iniciales de fallo y no probados mejora el aprendizaje en robot real. Evaluado en 2.550 episodios ciegos, eleva el éxito entre 10 y 34 puntos porcentuales frente al muestreo uniforme.

Un equipo de Stanford liderado por Chelsea Finn ha publicado Mulligan, un método que cambia cómo se recogen datos para entrenar políticas de manipulación en robots reales. En lugar de muestrear estados iniciales de forma uniforme, el sistema prioriza los fallos observados y los estados aún no explorados.
El paper (arXiv 2610.05882) evalúa el enfoque en 2.550 episodios reales ciegos distribuidos en tres tareas de manipulación de alta precisión. Cuando se combina con selección de acciones basada en valor (HiL-IDQL), el método mejora la tasa de éxito final entre 10 y 34 puntos porcentuales respecto al muestreo uniforme a igual presupuesto de datos. Con intervenciones del operador, el equipo humano-robot completa el 98 % de los episodios de recolección.
-RobotCrew dice: Resulta que el robot aprende más rápido cuando le dejas fallar en los sitios donde ya falla, en lugar de repetir lo que ya sabe hacer.-
Los autores observan que los fallos de las políticas se concentran en un subconjunto pequeño de estados iniciales. Muestrear de forma uniforme desperdicia tiempo en estados ya dominados. Mulligan selecciona de forma adaptativa y entrena una función de valor con todos los datos, incluidos los fallos. El trabajo incluye dos tareas simuladas además de las tres reales, y el código y los datos se han liberado en la página del proyecto.
Qué cambia en la práctica del aprendizaje on-robot
Para los equipos que entrenan políticas de manipulación, el cuello de botella suele ser el tiempo de recolección en hardware real. Mulligan reduce la cantidad de demostraciones necesarias para alcanzar un nivel de rendimiento dado. La evidencia es de laboratorio: tres tareas concretas con rangos amplios de colocación de objetos, no un benchmark general de cualquier objeto o entorno.
El paper distingue entre la recolección guiada por rendimiento y el muestreo uniforme clásico. No afirma que el método elimine la necesidad de intervención humana; de hecho, documenta que con intervenciones se mantiene alta la productividad del operador. Tampoco se ha revisado por pares todavía; se trata de un preprint enviado el 5 de octubre.
-RobotCrew dice: El paper demuestra que se puede ser más eficiente fallando a propósito. Lo que aún no dice es cuánto cuesta convencer al operador de que deje que el robot falle más.-
Límites y recursos disponibles
El trabajo se centra en tareas de alta precisión donde la distribución de estados iniciales importa. No aborda navegación, locomoción o escenarios multi-robot. Los autores publican vídeos, código y datos, lo que permite a otros equipos reproducir o adaptar el método. La mejora se mide en episodios ciegos de evaluación, no en un despliegue comercial continuo.
Para la comunidad de investigación en aprendizaje robótico, Mulligan ofrece una alternativa práctica al muestreo uniforme cuando el hardware es limitado. La página del proyecto (mulligan.page) concentra los recursos. El paper no incluye una comparación exhaustiva con todos los métodos de active learning existentes, pero sí con el baseline de muestreo uniforme a presupuesto igualado.
-RobotCrew dice: 2.550 episodios reales son muchos para un paper. Son pocos para un almacén que tiene que procesar pedidos todo el día.-
Diccionario de la Crew
Imitación — Aprendizaje de una política a partir de demostraciones, normalmente de un operador humano.
Función de valor — Estimación de qué tan bueno es un estado o una acción para alcanzar el objetivo de la tarea.
Fuentes:
arXiv | https://arxiv.org/abs/2610.05882
mulligan.page | https://mulligan.page/

