Рынки
Исследование Apple показывает, что один агент превосходит многопользовательские системы в задачах машинного обучения
Новое исследование от Apple Machine Learning Research поставило под сомнение эффективность многопользовательских систем в области машинного обучения. Исследователи обнаружили, что один хорошо настроенный кодирующий агент по имени Малена демонстрирует производительность на уровне или выше, чем у нескольких сложных многопользовательских систем.
Исследование под названием «Насколько сильному агенту нужно управление для автономной инженерии машинного обучения?» было представлено на arXiv 30 сентября 2026 года и подчеркивает потенциальные неэффективности сложных систем агентов. Малена работает с базовым доступом к оболочке и может читать, записывать файлы и выполнять команды bash.
В прямых сравнениях Малена достигла 62,5% уровня успеха на бенчмарке MLE-bench, значительно превзойдя лучший внешний инструмент, AiScientist, который показал уровень успеха 47,1%. Этот разрыв в 15,4 процентных пункта предполагает, что более простые системы могут быть более эффективными, чем считалось ранее.
Исследование также отметило, что добавление сложности через координацию многопользовательских систем не привело к значительным улучшениям в производительности. Исследователи подчеркнули, что сила базовой модели была основным фактором производительности, а не сложность окружающего её инструмента.
Это исследование соответствует предыдущим выводам, которые ставили под сомнение эффективность многопользовательских систем, что указывает на необходимость переоценки структуры и развертывания AI-агентов в практических приложениях.
FAQ
Каковы основные выводы исследования Apple о агентах машинного обучения?
Исследование показало, что один хорошо настроенный кодирующий агент по имени Малена превзошел несколько сложных многопользовательских систем в задачах машинного обучения, что предполагает, что более простые системы могут быть более эффективными.
Какой уровень успеха достигла Малена на бенчмарке?
Малена достигла уровня успеха 62,5% на бенчмарке MLE-bench, значительно превзойдя лучший внешний инструмент, AiScientist, который имел уровень успеха 47,1%.
Какие возможности имеет агент Малена?
Малена работает с базовым доступом к оболочке, что позволяет ей читать и записывать файлы и выполнять команды bash.
Что исследование предполагает о сложности многопользовательских систем?
Исследование предполагает, что добавление сложности через координацию многопользовательских систем не дало значительных улучшений в производительности, что указывает на то, что сила базовой модели важнее, чем сложность системы.
Когда исследование было отправлено в arXiv?
Исследование было отправлено в arXiv 30 сентября 2026 года.