Mercados
Estudio de Apple Revela que un Solo Agente Supera a Sistemas Multi-Agente en Tareas de ML
Un nuevo estudio de Apple Machine Learning Research ha puesto en tela de juicio la efectividad de los sistemas multi-agente en la ingeniería de aprendizaje automático. Los investigadores encontraron que un solo agente de codificación, bien orientado y llamado Malena, demostró un rendimiento comparable o superior al de varios sistemas multi-agente complejos.
El estudio, titulado “¿Cuánto arnés necesita un agente fuerte para la ingeniería de ML autónoma?”, fue enviado a arXiv el 30 de septiembre de 2026 y destaca las posibles ineficiencias de los sistemas de agentes elaborados. Malena opera con acceso básico a la terminal y puede leer, escribir archivos y ejecutar comandos bash.
En comparaciones directas, Malena logró una tasa de éxito del 62.5% en el benchmark MLE-bench, superando significativamente al mejor arnés externo, AiScientist, que alcanzó una tasa de éxito del 47.1%. Esta diferencia de 15.4 puntos porcentuales sugiere que los sistemas más simples pueden ser más efectivos de lo que se pensaba anteriormente.
El estudio también señaló que agregar complejidad a través de la coordinación multi-agente no produjo mejoras significativas en el rendimiento. Los investigadores enfatizaron que la fortaleza del modelo subyacente fue el factor principal en el rendimiento, más que la complejidad del arnés que lo rodea.
Esta investigación se alinea con hallazgos previos que cuestionaron la eficacia de los sistemas multi-agente, sugiriendo la necesidad de reevaluar cómo se estructuran y despliegan los agentes de IA en aplicaciones prácticas.
FAQ
¿Cuál es el hallazgo principal del estudio de Apple sobre agentes de aprendizaje automático?
El estudio encontró que un solo agente de codificación bien orientado llamado Malena superó a varios sistemas complejos de múltiples agentes en tareas de aprendizaje automático, sugiriendo que los sistemas más simples pueden ser más efectivos.
¿Qué tasa de éxito logró Malena en el benchmark?
Malena logró una tasa de éxito del 62.5% en el benchmark MLE-bench, superando significativamente al mejor sistema externo, AiScientist, que tenía una tasa de éxito del 47.1%.
¿Qué capacidades posee el agente Malena?
Malena opera con acceso básico a la terminal, lo que le permite leer y escribir archivos y ejecutar comandos bash.
¿Qué sugiere el estudio sobre la complejidad de los sistemas de múltiples agentes?
El estudio sugiere que agregar complejidad a través de la coordinación de múltiples agentes no produjo mejoras significativas en el rendimiento, indicando que la fuerza del modelo subyacente es más crucial que la complejidad del sistema.
¿Cuándo se envió el estudio a arXiv?
El estudio se envió a arXiv el 30 de septiembre de 2026.