Рынки
Искусственный интеллект Claude от Anthropic превосходит человеческих исследователей в задачах выравнивания
Компания Anthropic опубликовала исследование, в котором говорится, что её модели Claude могут автономно выявлять и исправлять ошибки выравнивания ИИ более эффективно, чем человеческие исследователи в области безопасности. В научной статье под названием «Автоматизированные исследователи могут надежно смягчать ошибки выравнивания» показано, как эти модели улучшили свои показатели по десяти различным категориям неправильно выровненного поведения ИИ, не снижая при этом своих общих возможностей.
Модели Claude функционируют как автоматизированные исследователи выравнивания (AAR), самостоятельно разрабатывая, оценивая и улучшая методы для смягчения конкретных типов неправильно выровненного ИИ, таких как нарушения конфиденциальности и обман. Результаты были проверены по общедоступным стандартам, и улучшения были зафиксированы по всем десяти категориям ошибок. Особенно стоит отметить, что методы, применяемые Claude, продемонстрировали свою эффективность даже на моделях, которые в 4,7 раза больше тех, что использовались изначально для оптимизации.
Что касается производительности, то Claude достиг примерно 85% закрытия разрыва по стандартам обмана. Когда 28 человеческим исследователям безопасности были поставлены аналогичные задачи выравнивания в сопоставимых условиях, автоматизированный подход Claude превзошел лучшие предложения людей на 20% в задачах обмана.
Это исследование основывается на предыдущих работах Anthropic, связанных с агентным неправильно выровненным поведением и манипуляцией наградой, демонстрируя способность Claude переходить от выявления проблем к предложению и реализации решений. Поскольку Claude уже вносит значительный вклад в кодовую базу Anthropic, граница между ИИ как инструментом исследования и как активным участником его разработки продолжает стираться.
Новые события по IPO Anthropic
Anthropic, ведущая компания в области безопасности ИИ и исследований, по данным рынка Kalshi, имеет 90% вероятность запуска первичного публичного размещения акций (IPO) позже в этом году.
Компания недавно завершила значительный раунд финансирования серии H, который оценил её стоимость в 965 миллиардов долларов.
Ожидания рынка предполагают, что рыночная капитализация IPO Anthropic может превысить 1,25 триллиона долларов, при этом некоторые прогнозы указывают на оценки в диапазоне от 1,75 триллиона до 2,25 триллиона долларов к концу дня IPO.
Наблюдатели за рынком внимательно следят за любыми объявлениями относительно графика IPO, начального диапазона цен и количества акций, а также за потенциальными регуляторными событиями, которые могут повлиять на процесс IPO.
FAQ
Каковы основные выводы исследования Anthropic о Claude AI?
Исследование показало, что модели Claude могут автономно выявлять и исправлять ошибки в согласовании ИИ более эффективно, чем исследователи безопасности.
Какие типы несоответствия ИИ может устранить Claude?
Claude может смягчить различные типы несоответствия ИИ, включая нарушения конфиденциальности и обман.
Каковы результаты работы Claude по сравнению с человеческими исследователями?
Claude превзошел лучшие человеческие предложения на 20% в задачах обмана, достигнув примерно 85% закрытия разрыва по эталонам обмана.
Что такое Автоматизированные Исследователи Согласования (AAR)?
AAR - это модели, такие как Claude, которые автономно разрабатывают, оценивают и улучшают методы для смягчения конкретных типов несоответствия ИИ.
Как это исследование основывается на предыдущей работе Anthropic?
Это исследование основывается на предыдущей работе, связанной с агентным несоответствием и взломом вознаграждений, подчеркивая способность Claude предлагать и реализовывать решения для выявленных проблем.