miércoles, 23 de septiembre de 2026

VLASH le da a los robots la capacidad de pensar mientras trabajan

VLASH es un desarrollo que permite a los robots preparar su siguiente movimiento mientras realizan el anterior, reduciendo las pausas que todavía los hacen lentos al trabajar.

Los robots actuales pueden hacer cosas sorprendentes: doblar ropa, clasificar objetos, preparar alimentos o entender instrucciones como “toma la taza que está junto al plato y guárdala en el gabinete”. Sin embargo, basta observarlos durante unos minutos para descubrir una limitación evidente: muchas veces necesitan demasiado tiempo para decidir qué hacer a continuación. Pueden tomar un objeto con enorme precisión y después hacer una pequeña pausa para calcular el siguiente movimiento.

En una demostración de laboratorio puede parecer simplemente torpeza. En una fábrica, un hospital o una casa, donde las personas y los objetos no esperan a que una máquina piense, esos segundos empiezan a importar. Investigadores de MIT, Nvidia, UC Berkeley, UC San Diego, Caltech y la Universidad de Tsinghua creen haber encontrado una manera de reducir esas pausas mediante una técnica llamada VLASH. Su propuesta consiste en conseguir que el robot prepare lo que hará después antes de terminar la tarea actual.

Para entender por qué esto supone un cambio hay que conocer brevemente los modelos VLA, siglas en inglés de visión, lenguaje y acción. Son sistemas que permiten a un robot combinar lo que observa a través de sus cámaras con una instrucción expresada en lenguaje cotidiano y convertir ambas cosas en movimientos. Si colocamos varias prendas sobre una mesa y pedimos “guarda las playeras en el cajón”, el robot necesita reconocer cuáles objetos son playeras, localizar el cajón, interpretar nuestra petición y calcular cómo mover sus brazos para completar la tarea.

El problema es que ese proceso requiere tiempo. Muchos sistemas funcionan mediante una secuencia que podría resumirse como pensar, actuar, volver a pensar y volver a actuar. Entre cada una de esas etapas aparecen pequeñas pausas que hacen que la máquina sea mucho menos fluida que una persona.

Pensar antes de terminar

Los humanos hacemos algo diferente. Cuando caminamos hacia una puerta no esperamos a detenernos completamente frente a ella para decidir cómo abrirla. Durante los últimos pasos ya preparamos el movimiento del brazo y acomodamos la mano para alcanzar la manija. Nuestro cuerpo encadena acciones porque prepara lo siguiente antes de terminar lo anterior.

[pms-restrict subscription_plans="431, 2200"]

VLASH intenta trasladar esa idea a los robots. Durante la ejecución de un movimiento, el sistema calcula aproximadamente en qué posición estará la máquina cuando termine y utiliza esa estimación para preparar la siguiente acción. Así reduce el tiempo en el que el robot permanece inmóvil a la espera de una nueva decisión.

Los investigadores probaron el sistema en simulaciones y con robots reales en tareas como recoger, apilar y clasificar objetos. En uno de los experimentos, un robot consiguió clasificar cubos por colores y colocarlos en una caja aproximadamente dos veces más rápido, con una precisión de 90%, similar a la del mejor método utilizado como comparación. También probaron actividades como ping-pong y Whac-a-Mole, donde no basta con elegir el movimiento correcto: hay que ejecutarlo antes de que la oportunidad desaparezca.

La mejora no significa que los robots hayan adquirido reflejos humanos. VLASH modifica el momento en que comienzan a calcular la siguiente acción, pero ese cambio tiene consecuencias importantes porque elimina parte del tiempo muerto entre una decisión y otra.

El reto de intentar adivinar el futuro

Hay una dificultad. Cuando el robot prepara su siguiente movimiento, la información que recibió de sus cámaras ya pertenece al pasado. Si extiende el brazo para recoger una taza, cuando termine la acción su cuerpo estará en una posición distinta de la que tenía cuando comenzó el cálculo.

VLASH intenta solucionar esa diferencia con la anticipación de algo que la máquina conoce bien: sus propios movimientos. Si sabe qué acción ejecuta, puede estimar dónde estará cuando termine y calcular desde esa posición futura qué debería hacer después. El desafío aparece cuando también cambia el mundo que la rodea. Una persona puede cruzarse, una caja puede caer o alguien puede mover la taza que pretendía recoger.

Predecir todo eso resulta mucho más complicado que calcular dónde terminará un brazo mecánico. Por eso una de las posibilidades futuras consiste en combinar técnicas como VLASH con los llamados modelos del mundo, sistemas de IA que intentan anticipar cómo puede cambiar un entorno después de determinada acción. Un robot podría pasar de calcular “mi brazo estará aquí dentro de un segundo” a intentar comprender “mi brazo estará aquí, pero esta persona se acerca y probablemente tendré que cambiar de movimiento”. Los propios investigadores señalan la incorporación de modelos capaces de anticipar cambios en el entorno como una posible dirección futura.

Todavía estamos lejos de conseguir esa capacidad de manera completamente fiable en ambientes cotidianos. Una casa, un hospital o una fábrica son lugares considerablemente más impredecibles que un laboratorio. Sin embargo, reducir el tiempo entre pensamiento y acción es una pieza necesaria para llevar las máquinas a esos espacios.

Durante los últimos años buena parte de la carrera de la robótica se ha concentrado en enseñar a las máquinas a comprender mejor lo que ven y lo que les pedimos. Los modelos VLA intentan conectar esas capacidades con el movimiento para que no sea necesario programar manualmente cada acción.

VLASH apunta hacia la siguiente dificultad. Entender qué debe hacerse no basta cuando una máquina tiene que convivir y trabajar con personas. También necesita reaccionar con suficiente rapidez para seguir el ritmo de un mundo que no se detiene mientras ella piensa.

Enseñar a un robot qué hacer es sólo una parte del problema. También tiene que decidirlo a tiempo.

[/pms-restrict]

Contenido restringido para usuarios premium

Comienza con 30 días de acceso incluido. Después, continúa por $169 MXN al mes.

Una forma simple de estar al día

Una selección clara sobre IA, tecnología y los cambios que vale la pena seguir, directo en tu correo.