miércoles, 23 de septiembre de 2026

AEROBAT: La inteligencia artificial que busca entender cómo toman decisiones los demás modelos de IA

AEROBAT es un modelo académico de IA que puede estudiar el comportamiento de otras inteligencias artificiales para ayudarnos a entender cómo toman decisiones y cómo funcionan sus procesos de análisis internos mientras responden peticiones.

Supongamos que un agente de inteligencia artificial comienza a comportarse de manera inesperada. Queremos saber por qué, así que un investigador observa lo ocurrido, propone posibles explicaciones, diseña experimentos para comprobarlas, repite las pruebas suficientes veces para descartar una casualidad y analiza los resultados. Ahora imaginemos que buena parte de ese proceso queda en manos de otra inteligencia artificial.

Esa es la propuesta de AEROBAT, un sistema presentado el 10 de agosto de 2026 que busca automatizar parte de la investigación científica sobre el comportamiento de agentes de IA.

Durante años hemos evaluado los modelos con preguntas, problemas matemáticos, código o imágenes. Si queremos saber qué tan bueno es un sistema, le damos una tarea y medimos el resultado. Los agentes autónomos complican esa lógica porque no necesariamente se limitan a producir una respuesta: pueden recibir un objetivo, decidir qué pasos seguir, utilizar herramientas, interactuar con otros sistemas y cambiar de estrategia de acuerdo con lo que encuentren.

Entonces deja de ser suficiente preguntar si llegaron a la respuesta correcta. También queremos saber por qué tomaron determinadas decisiones, qué circunstancias podrían hacerlos cambiar de comportamiento y si volverían a actuar de la misma manera en otra situación. El diseño manual de todas las pruebas necesarias para responder esas preguntas puede convertirse rápidamente en un trabajo enorme.

[pms-restrict subscription_plans="2200, 431"]

Una IA con bata de laboratorio

AEROBAT intenta automatizar parte de ese proceso. Un investigador indica qué comportamiento quiere estudiar y el sistema genera posibles explicaciones, diseña experimentos controlados para ponerlas a prueba, ejecuta simulaciones, analiza estadísticamente los resultados y produce un informe. En términos cotidianos, hace algo parecido a una versión acelerada del método experimental: pregunta qué ocurre, propone por qué podría ocurrir y busca una manera de comprobarlo.

La escala hace interesante el experimento. Para probar el sistema, los investigadores seleccionaron 12 comportamientos de agentes de IA. AEROBAT generó 79 hipótesis, diseñó 1,240 experimentos controlados y realizó 23,512 rondas de simulación. Los autores encontraron evidencia estadística moderada o fuerte para 26 de esas hipótesis y señalan que algunas eran novedosas.

Conviene no convertir eso en algo que el estudio no demuestra. Una hipótesis nueva generada por una IA no equivale automáticamente a un descubrimiento científico, y el trabajo es un preprint que otros investigadores deberán examinar y reproducir. Lo importante es otra cosa: un científico humano puede estudiar cuidadosamente un conjunto limitado de explicaciones; un sistema automatizado puede explorar muchas más posibilidades y repetir las pruebas miles de veces. No necesariamente investiga mejor, pero puede investigar mucho más.

Esta capacidad puede adquirir importancia conforme aumente el número de agentes autónomos. Pensemos en uno encargado de organizar un viaje: puede buscar vuelos, comparar hoteles, hacer reservaciones y modificar su estrategia si algo sale mal. Saber que finalmente consiguió llevarnos a París no explica todas las decisiones que tomó durante el proceso. Ahora multipliquemos ese problema por miles de agentes, distintas herramientas y situaciones que sus desarrolladores nunca anticiparon.

AEROBAT propone utilizar precisamente una de las fortalezas de la inteligencia artificial —su capacidad para trabajar a gran escala— como herramienta para investigar la complejidad creada por otras inteligencias artificiales.

¿Quién revisa al investigador?

La idea también tiene una limitación evidente. Que una IA proponga una hipótesis no significa que sea correcta; que diseñe un experimento tampoco garantiza que esté bien planteado, y encontrar una relación estadística entre dos comportamientos no demuestra necesariamente que uno sea la causa del otro. Si el mismo sistema ayuda a formular la explicación, diseña las pruebas, analiza los resultados y redacta las conclusiones, la supervisión humana continúa como una pieza indispensable.

Los propios investigadores presentan AEROBAT en esos términos: no como un sustituto del científico, sino como una herramienta que podría complementar y ampliar la investigación manual. El investigador conserva la responsabilidad de decidir qué merece atención, revisar los experimentos y determinar si las conclusiones realmente tienen sentido.

AEROBAT puede desaparecer, cambiar de nombre o nunca convertirse en una herramienta de uso generalizado. Lo interesante es la señal que deja detrás. Construimos cada vez más agentes y les permitimos tomar suficientes decisiones como para comenzar a necesitar sistemas especializados en estudiar su comportamiento.

Durante siglos hemos creado instrumentos para observar aquello que nuestros sentidos no podían comprender por sí solos: telescopios para objetos demasiado lejanos, microscopios para aquello que es demasiado pequeño y simuladores para fenómenos difíciles de reproducir. Si los sistemas de inteligencia artificial aumentan en número, autonomía y complejidad, quizá terminemos por necesitar una nueva clase de instrumento para entenderlos.

Y ese instrumento podría ser otra inteligencia artificial.

[/pms-restrict]

Contenido restringido para usuarios premium

Comienza con 30 días de acceso incluido. Después, continúa por $169 MXN al mes.

Una forma simple de estar al día

Una selección clara sobre IA, tecnología y los cambios que vale la pena seguir, directo en tu correo.