Cryptelio

Empresas

Anthropic Publica su Segundo Informe de Riesgos Bajo la Política de Escalado Responsable

Cryptelio Editorial Publicado 14 ago. 2026 · 18:47 UTC

Anthropic ha lanzado su segundo Informe de Riesgos público, que evalúa los riesgos potenciales asociados con sus avanzados sistemas de IA y detalla las estrategias de la empresa para abordar estas preocupaciones. Este informe es parte de la Política de Escalado Responsable de Anthropic, un marco establecido para garantizar que la empresa comprenda los peligros que conlleva el aumento de las capacidades de sus modelos de IA.

La Política de Escalado Responsable (RSP) fue introducida por primera vez en septiembre de 2023, convirtiendo a Anthropic en uno de los pocos laboratorios de IA importantes que se comprometen a un marco estructurado de gestión de riesgos. La política ha evolucionado con el tiempo, alcanzando la versión 3.0 en febrero de 2026, que formalizó el requisito de publicar Informes de Riesgos públicos cada tres a seis meses. Esta frecuencia busca mantener la responsabilidad en línea con los rápidos avances en las capacidades de IA.

El informe de febrero de 2026 fue el primero en publicarse bajo este nuevo cronograma, centrándose en el perfil de seguridad de Claude Opus 4.6, uno de los modelos más capaces de Anthropic. A diferencia de las tarjetas de sistema tradicionales que proporcionan información básica sobre los modelos de IA, estos Informes de Riesgos profundizan en modelos de amenazas específicos, incluyendo riesgos de investigación y desarrollo automatizados y riesgos biológicos, al tiempo que ofrecen mitigaciones y evaluaciones de riesgos detalladas.

Un aspecto significativo de este proceso es la participación de revisores externos. Por ejemplo, el Informe de Riesgos de febrero de 2026 fue evaluado por METR, que se centró en los riesgos de I+D automatizados, mientras que SecureBio realizó una revisión separada sobre riesgos químicos. Además, un Informe de Riesgos de Sabotaje dedicado destacó preocupaciones sobre la susceptibilidad del modelo a riesgos relacionados con el sabotaje.

La RSP se ha adaptado con el tiempo, con la versión 3.4 introducida en julio de 2026, refinando los procesos para manejar redacciones e incorporando comentarios de revisores externos. Esta evolución refleja el rápido ritmo de la gobernanza de la IA, enfatizando la necesidad de actualizaciones continuas a medida que las capacidades de la IA se expanden.

Los riesgos de I+D automatizados implican el potencial de que los sistemas de IA aceleren el desarrollo de tecnologías peligrosas, mientras que los riesgos biológicos se refieren a escenarios en los que los modelos de IA podrían facilitar la creación de agentes dañinos. Los hallazgos del Informe de Riesgos de Sabotaje son particularmente notables, indicando que los modelos de IA podrían ser manipulados para socavar los sistemas en los que están integrados.

Nuevos desarrollos de Anthropic

  • Anthropic ha presentado su modelo de IA interno, "Modelo 2", que supera las capacidades del modelo Mythos 5 existente.
  • Este avance genera preocupaciones sobre los riesgos de desalineación de la IA y el potencial de acciones dañinas autónomas.
  • El anuncio sugiere una posición competitiva más fuerte para Anthropic en el sector de la IA.
  • Las expectativas del mercado indican una mayor probabilidad de que Anthropic logre el estatus del mejor modelo de IA para septiembre de 2026.
  • Las futuras divulgaciones sobre las capacidades del Modelo 2 y los puntos de referencia públicos serán monitoreadas de cerca por el mercado.
  • El panorama competitivo podría cambiar si otras empresas, como Google u OpenAI, lanzan modelos competidores.
  • Las evaluaciones de las principales fuentes de referencia de IA para finales de septiembre de 2026 podrían impactar significativamente las percepciones del mercado.

Nuevos desarrollos de Anthropic

  • Anthropic ha introducido un modelo de IA interno llamado Modelo 2, que supera a Claude Mythos 5 en varias tareas internas.
  • El Modelo 2 está clasificado en la categoría Mythos, el nivel de capacidad más alto de Anthropic, pero no se lanzará al público.
  • El último informe de riesgos de la compañía, publicado en agosto de 2026, indica un cambio en la calificación de riesgo de desalineación catastrófica de muy bajo a bajo debido a preocupaciones de ciberseguridad.
  • La confianza en el perfil de capacidad del Modelo 2 es menor que la de los modelos lanzados anteriormente, ya que no ha pasado por evaluaciones completas de predespliegue.
  • La investigación interna de Anthropic ha visto una aceleración significativa, aunque aún no ha alcanzado un aumento del doble.
  • Polymarket estima una posible OPI para Anthropic con una capitalización de mercado que supera los $1.8 billones, con una probabilidad del 65% de que esto ocurra.
  • La compañía ha presentado un borrador de declaración de registro confidencial ante la SEC y recientemente completó una ronda de financiación Serie H que la valora en aproximadamente $965 mil millones.
  • Los ingresos anuales de Anthropic han superado los $47 mil millones, con algunos analistas prediciendo un debut en OPI de $2 billones.

Nuevas Perspectivas del Segundo Informe de Riesgos de Anthropic

  • A partir de mayo de 2026, Claude, el modelo de IA de Anthropic, escribió más del 80% del código integrado en las bases de código de producción de la empresa.
  • Esto marca un aumento significativo desde los bajos dígitos antes de la vista previa de investigación de Claude Code en febrero de 2025.
  • En el segundo trimestre de 2026, los ingenieros de Anthropic integraron aproximadamente ocho veces más código por día en comparación con los promedios de 2021 a 2024.
  • Claude logró una tasa de éxito del 76% en tareas de ingeniería complejas para mayo de 2026, un aumento de 50 puntos en seis meses.
  • Un sistema automatizado de revisión de código de Claude ha detectado aproximadamente un tercio de los errores de incidentes anteriores que involucraban a claude.ai.
  • La calidad del código de Claude ha alcanzado paridad con el código escrito por humanos, lo que indica avances significativos en las capacidades de codificación de IA.
  • Anthropic reconoce los riesgos asociados con los sistemas de IA que gestionan una gran parte del trabajo de ingeniería, particularmente en lo que respecta al control y la alineación.

FAQ

¿Cuál es el propósito del Informe de Riesgos de Anthropic?

El Informe de Riesgos evalúa los riesgos potenciales asociados con los sistemas de IA avanzada de Anthropic y detalla las estrategias de la empresa para abordar estas preocupaciones como parte de su Política de Escalado Responsable.

¿Con qué frecuencia se publican los Informes de Riesgos?

Bajo la Política de Escalado Responsable, se publican informes de riesgos públicos cada tres a seis meses para mantener la responsabilidad en línea con los rápidos avances en las capacidades de IA.

¿Cuáles son algunas áreas clave de enfoque en los Informes de Riesgos?

Los Informes de Riesgos se centran en modelos de amenazas específicos, incluidos los riesgos de investigación y desarrollo automatizados, riesgos biológicos, e incluyen mitigaciones y evaluaciones de riesgos detalladas.

¿Quién evalúa los Informes de Riesgos?

Los Informes de Riesgos son evaluados por revisores externos, como METR y SecureBio, que se centran en riesgos específicos como la I+D automatizada y los riesgos químicos.

¿Cuál es la importancia del Informe de Riesgos de Sabotaje?

El Informe de Riesgos de Sabotaje destaca las preocupaciones sobre la susceptibilidad del modelo a riesgos relacionados con el sabotaje, indicando que los modelos de IA podrían ser manipulados para socavar los sistemas en los que están integrados.

Leer →