
Fuente: Laboratorio de Ciencias de la Computación e Inteligencia Artificial del MIT
Su nuevo robot doméstico se entrega en su casa y le pide que le prepare una taza de café. Aunque conoce las habilidades básicas de la práctica anterior en cocinas simuladas, hay demasiadas cosas que puede hacer: abrir el grifo, descargar el inodoro, vaciar el contenedor de harina, etc. Sin embargo, hay un pequeño número de acciones que pueden ser útiles. ¿Cómo se supone que el robot averiguará qué pasos son razonables en la nueva situación?
Podría ser útil PIGNet, un nuevo sistema que tiene como objetivo mejorar de manera efectiva las capacidades de resolución de problemas de los robots domésticos. Los investigadores del Laboratorio de Ciencias de la Computación e Inteligencia Artificial (CSAIL) del MIT están utilizando el aprendizaje automático para reducir el típico proceso iterativo de programación de tareas que considera todas las acciones posibles. PIGINet elimina los planes de tareas que no cumplen con los requisitos sin colisiones y reduce el tiempo de planificación en un 50-80 % cuando se entrena en solo 300-500 problemas.
Por lo general, los robots prueban diferentes planes de tareas y refinan iterativamente sus movimientos hasta que encuentran una solución viable que puede ser ineficiente y consumir mucho tiempo, especialmente cuando hay obstáculos móviles y articulados. Tal vez, por ejemplo, después de cocinar quieras poner todas las salsas en la alacena. Este problema puede llevar de dos a ocho pasos, dependiendo de cómo se vea el mundo en este momento. ¿El robot necesita abrir varias puertas del gabinete o hay obstáculos dentro del gabinete que deben moverse para hacer espacio? No querrás que tu robot sea irritantemente lento, y será aún peor si se duerme durante el almuerzo mientras piensa.
Por lo general, se considera que los robots domésticos realizan tareas específicas de acuerdo con reglas predeterminadas, lo que no siempre es apropiado para entornos diversos o cambiantes. Entonces, ¿cómo evita PIGINet estas reglas predefinidas? PIGINet es una red neuronal que recopila “planes, imágenes, objetivos y hechos iniciales” y luego predice la probabilidad de que el plan de tareas se pueda refinar para encontrar planes de movimiento viables.
En pocas palabras, utiliza un codificador de transformador, un modelo versátil y de última generación diseñado para operar en secuencias de datos. La secuencia de entrada en este caso es información sobre la tarea planificada, imágenes del entorno y codificación simbólica del estado inicial y el objetivo deseado. El codificador combina planes de trabajo, imágenes y texto para generar una predicción de viabilidad para el plan de trabajo seleccionado.
Manteniendo las cosas en la cocina, el equipo creó cientos de entornos simulados, cada uno con un diseño diferente y tareas específicas que requieren que reorganices los elementos entre encimeras, refrigeradores, armarios, fregaderos y ollas. Al medir el tiempo que llevó resolver los problemas, compararon PIGINet con enfoques anteriores. Un programa de tareas correcto podría incluir abrir la puerta izquierda del refrigerador, quitar la tapa de la olla, mover el repollo de la olla al refrigerador, mover la papa al refrigerador, sacar la botella del fregadero, poner la botella en el fregadero, sacar la tomate, o colocando el tomate. PIGINet ha reducido significativamente el tiempo de planificación en un 80 % en escenarios más simples y entre un 20 % y un 50 % en escenarios más complejos que tienen secuencias de planificación más largas y menos datos de entrenamiento.
“Sistemas como PIGINet, que utilizan el poder de los métodos basados en datos para tratar casos conocidos de manera efectiva, pero aún pueden confiar en métodos de planificación de ‘principios básicos’ para validar sugerencias basadas en el aprendizaje y resolver nuevos problemas, ofrecen lo mejor de ambos mundos. .” , proporcionando soluciones confiables y eficientes de uso general para una amplia gama de problemas”, dice la profesora del MIT e investigadora principal de CSAIL, Leslie Pack Kaelbling.
El uso de PIGINet de incrustaciones multimodales en la secuencia de entrada permitió una mejor representación y comprensión de relaciones geométricas complejas. El uso de datos de imágenes ayudó al modelo a capturar los diseños espaciales y las configuraciones de los objetos sin conocer las mallas 3D del objeto para una verificación precisa de los conflictos, lo que permitió una toma de decisiones rápida en una variedad de entornos.
Uno de los principales desafíos que enfrentó el desarrollo de PIGINet fue la escasez de buenos datos de capacitación, ya que todos los planes factibles e inviables deben ser generados por planificadores tradicionales, lo cual es lento en primer lugar. Sin embargo, mediante el uso de modelos de lenguaje visual previamente entrenados y trucos de aumento de datos, el equipo pudo superar este desafío, demostrando reducciones impresionantes en el tiempo de planificación no solo para problemas con objetos vistos, sino también para la generalización del tiro nulo a objetos nunca antes vistos. .
“Dado que cada hogar es diferente, los robots deben resolver problemas de manera flexible, no solo seguir las regulaciones. Nuestra idea clave es habilitar la programación universal de tareas para generar posibles planes de tareas y utilizar un modelo de aprendizaje profundo para seleccionar las más prometedoras. El resultado es un robot doméstico más potente, flexible y práctico que puede navegar ágilmente incluso en entornos complejos y dinámicos. Además, las aplicaciones prácticas de PIGINet no se limitan a los hogares”, dice Zhutian Yang, estudiante de doctorado de MIT CSAIL y autor principal del artículo.
“Nuestro objetivo futuro es perfeccionar aún más PIGINet para sugerir planes de tareas alternativos cuando se identifiquen acciones inviables, acelerando aún más la generación de planes de tareas viables sin la necesidad de grandes conjuntos de datos para capacitar al planificador general desde cero. Creemos que esto podría revolucionar la forma en que se entrena a los robots durante el desarrollo y luego se implementan en los hogares de todos”.
“Este artículo aborda el desafío central de implementar un robot de propósito general: cómo aprender de la experiencia pasada para acelerar la toma de decisiones en entornos no estructurados llenos de una gran cantidad de obstáculos articulados y móviles”, dice el Dr. Beomjoon Kim. ’20, profesor asistente en la Escuela de Graduados de IA en el Instituto de Ciencia y Tecnología Avanzada de Corea (KAIST).
“El principal cuello de botella en tales problemas es cómo especificar un plan de tareas de alto nivel para que haya un plan de movimiento de bajo nivel que ejecute el plan de alto nivel. Por lo general, debe oscilar entre la programación de movimientos y la programación de trabajos, lo que genera importantes ineficiencias computacionales. El trabajo de Zhutian aborda este problema utilizando el aprendizaje para eliminar los planes de tareas inviables y es un paso en una dirección prometedora”.
Su investigación fue presentada en la conferencia Robótica: ciencia y sistemascelebrada del 10 al 14 de julio en Corea.
Proporcionado por el Laboratorio de Ciencias de la Computación e Inteligencia Artificial del MIT