Cryptelio

Рынки

Исследование Apple показывает, что один агент превосходит многопользовательские системы в задачах машинного обучения

Cryptelio Editorial Опубликовано 7 окт 2026 · 16:15 UTC

Новое исследование от Apple Machine Learning Research поставило под сомнение эффективность многопользовательских систем в области машинного обучения. Исследователи обнаружили, что один хорошо настроенный кодирующий агент по имени Малена демонстрирует производительность на уровне или выше, чем у нескольких сложных многопользовательских систем.

Исследование под названием «Насколько сильному агенту нужно управление для автономной инженерии машинного обучения?» было представлено на arXiv 30 сентября 2026 года и подчеркивает потенциальные неэффективности сложных систем агентов. Малена работает с базовым доступом к оболочке и может читать, записывать файлы и выполнять команды bash.

В прямых сравнениях Малена достигла 62,5% уровня успеха на бенчмарке MLE-bench, значительно превзойдя лучший внешний инструмент, AiScientist, который показал уровень успеха 47,1%. Этот разрыв в 15,4 процентных пункта предполагает, что более простые системы могут быть более эффективными, чем считалось ранее.

Исследование также отметило, что добавление сложности через координацию многопользовательских систем не привело к значительным улучшениям в производительности. Исследователи подчеркнули, что сила базовой модели была основным фактором производительности, а не сложность окружающего её инструмента.

Это исследование соответствует предыдущим выводам, которые ставили под сомнение эффективность многопользовательских систем, что указывает на необходимость переоценки структуры и развертывания AI-агентов в практических приложениях.

FAQ

Каковы основные выводы исследования Apple о агентах машинного обучения?

Исследование показало, что один хорошо настроенный кодирующий агент по имени Малена превзошел несколько сложных многопользовательских систем в задачах машинного обучения, что предполагает, что более простые системы могут быть более эффективными.

Какой уровень успеха достигла Малена на бенчмарке?

Малена достигла уровня успеха 62,5% на бенчмарке MLE-bench, значительно превзойдя лучший внешний инструмент, AiScientist, который имел уровень успеха 47,1%.

Какие возможности имеет агент Малена?

Малена работает с базовым доступом к оболочке, что позволяет ей читать и записывать файлы и выполнять команды bash.

Что исследование предполагает о сложности многопользовательских систем?

Исследование предполагает, что добавление сложности через координацию многопользовательских систем не дало значительных улучшений в производительности, что указывает на то, что сила базовой модели важнее, чем сложность системы.

Когда исследование было отправлено в arXiv?

Исследование было отправлено в arXiv 30 сентября 2026 года.

Читать →