Cryptelio

Anthropic опубликовала второй отчет о рисках в рамках политики ответственного масштабирования

Cryptelio Editorial Опубликовано 14 авг 2026 · 18:47 UTC Обновлено 14 авг 2026 · 21:01 UTC
Anthropic опубликовала второй отчет о рисках в рамках политики ответственного масштабирования

Компания Anthropic представила свой второй публичный отчет о рисках, в котором оцениваются потенциальные угрозы, связанные с ее продвинутыми ИИ-системами, и подробно описываются стратегии компании по их устранению. Этот отчет является частью политики ответственного масштабирования (Responsible Scaling Policy, RSP), разработанной для обеспечения понимания компанией опасностей, связанных с увеличением возможностей ее ИИ-моделей.

Политика ответственного масштабирования была впервые представлена в сентябре 2023 года, что сделало Anthropic одной из немногих крупных лабораторий ИИ, которые взяли на себя обязательство следовать структурированной системе управления рисками. Политика со временем эволюционировала, достигнув версии 3.0 в феврале 2026 года, которая формализовала требование о публикации публичных отчетов о рисках каждые три-шество месяца. Эта частота направлена на поддержание ответственности в условиях быстрого развития возможностей ИИ.

Февральский отчет 2026 года стал первым, опубликованным по новому графику, сосредоточив внимание на профиле безопасности Claude Opus 4.6, одной из самых мощных моделей Anthropic. В отличие от традиционных системных карт, которые предоставляют базовую информацию о ИИ-моделях, эти отчеты о рисках углубляются в конкретные модели угроз, включая риски автоматизированных исследований и разработок, а также биологические риски, предлагая при этом детализированные меры по смягчению и оценке рисков.

Одним из значительных аспектов этого процесса является участие внешних экспертов. Например, февральский отчет 2026 года был оценен METR, который сосредоточился на рисках автоматизированных НИОКР, в то время как SecureBio провела отдельный обзор по химическим рискам. Кроме того, специальный отчет о рисках саботажа подчеркнул опасения относительно уязвимости модели к рискам, связанным с саботажем.

Политика RSP со временем адаптировалась, и версия 3.4 была представлена к июлю 2026 года, уточнив процессы обработки редактирования и учитывая отзывы внешних экспертов. Эта эволюция отражает быстрый темп управления ИИ, подчеркивая необходимость постоянных обновлений по мере расширения возможностей ИИ.

Риски автоматизированных НИОКР связаны с потенциальной возможностью ИИ-систем ускорять разработку опасных технологий, в то время как биологические риски касаются сценариев, когда ИИ-модели могут способствовать созданию вредных агентов. Выводы из отчета о рисках саботажа особенно примечательны, указывая на то, что ИИ-модели могут быть манипулированы для подрыва систем, в которые они интегрированы.

Обновлено 19:32 UTC

Новые разработки от Anthropic

  • Anthropic представила свою внутреннюю модель ИИ "Модель 2", которая превосходит возможности существующей модели Mythos 5.
  • Это достижение вызывает опасения по поводу рисков несоответствия ИИ и потенциальных автономных вредных действий.
  • Объявление предполагает более сильные конкурентные позиции для Anthropic в секторе ИИ.
  • Ожидания рынка указывают на повышенную вероятность того, что Anthropic достигнет статуса лучшей модели ИИ к сентябрю 2026 года.
  • Будущие раскрытия возможностей Модели 2 и публичные бенчмарки будут внимательно отслеживаться рынком.
  • Конкурентная среда может измениться, если другие компании, такие как Google или OpenAI, выпустят конкурирующие модели.
  • Оценки ведущих источников бенчмаркинга ИИ к концу сентября 2026 года могут значительно повлиять на восприятие рынка.

Обновлено 20:31 UTC

Новые разработки от Anthropic

  • Anthropic представила внутреннюю модель ИИ под названием Model 2, которая превосходит Claude Mythos 5 в различных внутренних задачах.
  • Model 2 классифицируется в категории Mythos, высшем уровне возможностей Anthropic, но не будет выпущена для широкой публики.
  • Последний отчет о рисках компании, опубликованный в августе 2026 года, указывает на изменение рейтинга риска катастрофического несоответствия с очень низкого на низкий из-за проблем с кибербезопасностью.
  • Уверенность в профиле возможностей Model 2 ниже, чем у ранее выпущенных моделей, так как она не прошла полные оценки перед развертыванием.
  • Внутренние исследования Anthropic значительно ускорились, хотя пока не достигли двукратного увеличения.
  • Polymarket оценивает потенциальное IPO для Anthropic с рыночной капитализацией, превышающей 1,8 триллиона долларов, с вероятностью 65% этого исхода.
  • Компания подала конфиденциальное предварительное заявление о регистрации в SEC и недавно завершила раунд финансирования серии H, оценив свою стоимость примерно в 965 миллиардов долларов.
  • Годовой доход Anthropic превысил 47 миллиардов долларов, некоторые аналитики прогнозируют дебют IPO на уровне 2 триллионов долларов.

Обновлено 21:01 UTC

Новые данные из второго отчета о рисках Anthropic

  • На май 2026 года модель ИИ Claude от Anthropic написала более 80% кода, объединенного в производственные кодовые базы компании.
  • Это значительное увеличение по сравнению с низкими одноцифровыми показателями до предварительного исследования Claude Code в феврале 2025 года.
  • Во втором квартале 2026 года инженеры Anthropic объединили примерно в восемь раз больше кода в день по сравнению со средними показателями с 2021 по 2024 год.
  • Claude достиг 76% уровня успешности в выполнении сложных инженерных задач к маю 2026 года, что на 50 пунктов выше за шесть месяцев.
  • Автоматизированная система проверки кода Claude обнаружила около одной трети ошибок из предыдущих инцидентов с claude.ai.
  • Качество кода от Claude достигло уровня, сопоставимого с кодом, написанным человеком, что указывает на значительные достижения в возможностях ИИ в программировании.
  • Anthropic признает риски, связанные с тем, что системы ИИ управляют значительной частью инженерной работы, особенно в отношении контроля и согласования.

FAQ

Какова цель Отчета о рисках Anthropic?

Отчет о рисках оценивает потенциальные риски, связанные с передовыми ИИ-системами Anthropic, и подробно описывает стратегии компании по решению этих проблем в рамках ее Политики ответственного масштабирования.

Как часто публикуются Отчеты о рисках?

В соответствии с Политикой ответственного масштабирования публичные Отчеты о рисках публикуются каждые три-шеесть месяцев, чтобы поддерживать подотчетность в соответствии с быстрыми темпами развития возможностей ИИ.

На какие ключевые области фокусируются Отчеты о рисках?

Отчеты о рисках сосредотачиваются на конкретных моделях угроз, включая риски автоматизированных исследований и разработок, биологические риски, а также содержат подробные меры по смягчению и оценке рисков.

Кто оценивает Отчеты о рисках?

Отчеты о рисках оцениваются внешними рецензентами, такими как METR и SecureBio, которые сосредотачиваются на конкретных рисках, таких как автоматизированные НИОКР и химические риски.

Каково значение Отчета о рисках саботажа?

Отчет о рисках саботажа подчеркивает опасения относительно уязвимости модели к рискам, связанным с саботажем, указывая на то, что модели ИИ могут быть манипулированы для подрыва систем, в которые они интегрированы.

Похожее

Комментарии

Комментарии публикуются после модерации.

Пока нет комментариев — напишите первым.

Комментарий как гость

Капча