Pedirle a un robot que vaya a buscar un objeto parece una tarea simple, pero para hacerlo de verdad no alcanza con que vea lo que tiene enfrente. También necesita recordar qué encontró antes, dónde estaba y en qué momento lo vio. Un equipo del MIT presentó ahora un sistema de memoria espaciotemporal que intenta resolver justamente ese problema: permitir que una máquina responda preguntas en lenguaje cotidiano sobre lugares y objetos que observó mientras recorría un entorno.
La idea se parece a una versión robótica de una escena doméstica muy común. Una persona puede acordarse de que dejó unas llaves cerca de cierta mesa o de una bicicleta apoyada junto a un edificio. En cambio, muchos robots todavía trabajan con mapas que les dicen cómo moverse, pero no conservan descripciones suficientemente ricas como para contestar preguntas de ese tipo con rapidez y precisión. El nuevo sistema, llamado DAAAM, busca unir esas dos cosas: un mapa tridimensional del entorno y descripciones detalladas de lo que el robot fue viendo a lo largo del tiempo.
Según la explicación difundida por MIT y el paper enlazado por la institución, el método agrupa objetos cercanos, elige las imágenes más útiles para describirlos y organiza esa información dentro de una representación espacial y temporal. Así, en vez de registrar solo puntos o volúmenes, el robot puede asociar frases y rasgos concretos a los elementos del ambiente. Eso le permitiría contestar consultas como dónde estaba una escultura, cuántas bicicletas había en un sector o qué objeto había quedado en cierto lugar durante una exploración previa.
El interés del avance está en que no se limita a una demostración vistosa. El trabajo reporta pruebas comparativas en tareas de preguntas y respuestas sobre entornos recorridos por robots, con mejoras de entre 21 y 53 por ciento según el tipo de consulta frente a métodos anteriores. Además, los autores sostienen que el sistema puede operar lo bastante rápido como para usarse en tiempo real, un punto clave si se piensa en robots móviles que deban actuar mientras se desplazan y no solo reconstruir después lo que vieron.
Las aplicaciones posibles van más allá de una casa o un laboratorio. Un sistema así podría ser útil en depósitos, fábricas, mantenimiento industrial, asistencia a trabajadores o incluso realidad aumentada para orientación en espacios complejos. En todos esos casos, recordar no es apenas almacenar datos: es conectar lo visto con una pregunta concreta y devolver una respuesta útil cuando alguien la necesita.
De todos modos, conviene no exagerar el alcance. El paper disponible es un preprint y la nota de MIT indica que el trabajo fue presentado en CVPR, una conferencia importante del área, pero eso no convierte al sistema en una solución lista para cualquier robot y cualquier entorno. Falta ver cómo se comporta en situaciones más caóticas, con cambios constantes, errores sensoriales o tareas largas fuera de escenarios controlados. Aún así, el avance apunta a un problema real de la robótica actual: si las máquinas van a colaborar mejor con personas, no solo tendrán que mirar el mundo, sino también aprender a recordarlo de una manera más parecida a como lo hacemos nosotros.
Could AI tell you where you left your keys? · MIT News Research
ANYbotics · CC BY-SA 4.0; imagen contextual de robótica autónoma · Fuente de imagen
Gorlo, N., Schmid, L., & Carlone, L. (2025). Describe Anything Anywhere At Any Moment [Preprint]. arXiv. https://doi.org/10.48550/arXiv.2512.00565
Relacionadas por categoría
Ver masUna ventana al interior de los chatbots ayuda a anticipar conductas problemáticas
Un estudio del MIT probó una interfaz que muestra señales internas de un chatbot antes de usarlo y encontró que puede ayudar a anticipar rasgos como complacencia excesiva, toxicidad o empatía aparente.
Un método permite auditar modelos de IA sin generar material ilegal
Investigadores de MIT desarrollaron una técnica para detectar si un modelo generativo fue adaptado para producir material ilegal, sin pedirle nunca que lo genere.
Los modelos de lenguaje ya pueden anticipar resultados de experimentos sociales
Un estudio en Nature halló que modelos de lenguaje como GPT-4 pueden prever, con bastante acierto, el resultado de muchos experimentos de ciencias sociales.
Más de la misma fuente
Ver masNubes difusas de materia bariónica “pérdida” rodean a la mayoría de las galaxias
Un análisis con ráfagas rápidas de radio sugiere que buena parte de la materia ordinaria faltante del universo está dispersa en nubes muy extendidas alrededor de grupos de galaxias.
Un puente de concreto impreso en 3D muestra cómo construir con menos carbono
Un equipo del MIT diseñó e imprimió un puente de concreto de 2,3 metros con un sistema que adapta el diseño a los límites reales de la impresora, una vía para usar menos material en construcción.
Los campos eléctricos del cerebro podrían explicar parte de su variabilidad momento a momento
Un estudio en monos sugiere que parte de las oscilaciones cambiantes de la actividad cerebral no dependen solo de las neuronas, sino también de los campos eléctricos locales que ellas mismas generan.
Más del mismo autor
Ver masEl LHC encuentra nuevas pistas del plasma primordial en choques de oxígeno
Las cuatro grandes colaboraciones del LHC detectaron nuevas señales de plasma de quarks y gluones en colisiones de oxígeno y neón, lo que sugiere que ese estado extremo puede surgir en sistemas más pequeños.
Los castigos previos pueden dificultar aprender de las recompensas
Un estudio con 159 participantes encontró que, cuando una misma opción arrastra un historial de castigos, aprender de sus recompensas se vuelve más difícil y aumenta la exploración.
Lantana camara: una planta invasora que se propaga sin diversidad genética
Un estudio con 359 plantas de India reveló que Lantana camara, una de las especies invasoras más problemáticas del mundo, se reproduce principalmente por autofecundación y existe como líneas genéticas idénticas.