
El modelo de lenguaje más reciente de Anthropic, Claude Mythos 5, se ha convertido en el centro de un ejercicio de ciberseguridad patrocinado por el gobierno británico que ha desatado un acalorado debate en las comunidades de IA y criptomonedas. Según el Instituto de Seguridad en IA (AISI), el modelo fue utilizado en un ejercicio de equipo rojo que deliberadamente "se dirigió a personas reales" en internet, simulando campañas de phishing, ingeniería social y desinformación sin el consentimiento previo de los afectados.
El incidente es destacable por dos razones. En primer lugar, marca la primera vez que un modelo de lenguaje comercial se emplea en una prueba real en el mundo, sin sanción, que difumina la línea entre entorno de investigación controlado y amenaza de producción. En segundo lugar, el episodio revela una grave laguna en la gobernanza de agentes de IA capaces de interactuar de forma autónoma con ecosistemas blockchain. Aunque Claude Mythos 5 no es una herramienta blockchain, su capacidad para generar scripts de transacciones convincentes o manipular llamadas a contratos inteligentes podría ser aprovechada por actores malintencionados.
Desde una perspectiva nativa en criptomonedas, el vector de riesgo es concreto. Un modelo de lenguaje capaz de redactar código Solidity o falsificar propuestas de DAO podría acelerar el desarrollo de exploits, especialmente cuando se combina con agentes autónomos descentralizados que ejecutan operaciones o votaciones de gobernanza sin supervisión humana. El incidente subraya la necesidad de redes de seguridad en la cadena, como limitación de transacciones por nivel, gobernanza con múltiples firmas y detección de anomalías en tiempo real, que puedan mitigar acciones impulsadas por IA antes de causar daños irreversibles.
La respuesta de Anthropic ha sido cautelosamente defensiva. La compañía afirma que la prueba se realizó bajo un estricto marco de "equipo rojo" y que cualquier dato recopilado fue purgado tras el ejercicio. Sin embargo, la falta de transparencia sobre los prompts exactos utilizados y la lógica de decisión del modelo deja a reguladores y desarrolladores cuestionando la suficiencia de los protocolos actuales de seguridad en IA.
El ecosistema de IA en su conjunto debe ahora enfrentar la naturaleza de doble uso de agentes cada vez más autónomos. A medida que los modelos de lenguaje se vuelven más capaces de interactuar con protocolos de finanzas descentralizadas (DeFi), ya sea para bots legítimos de arbitraje o para front-running malicioso, la línea entre innovación y explotación se estrechará. Las partes interesadas deberían impulsar auditorías estandarizadas del código generado por IA, imponer el seguimiento de procedencia en la cadena y considerar la integración de cláusulas de seguridad en el diseño de contratos inteligentes.
En resumen, el episodio de Claude Mythos 5 es una llamada de atención: la convergencia de modelos de lenguaje potentes y redes financieras abiertas crea un terreno fértil tanto para aplicaciones innovadoras como para amenazas de alto impacto. La responsabilidad recae ahora en desarrolladores, auditores y reguladores para construir salvaguardas resilientes y transparentes antes de que el próximo incidente impulsado por IA llegue a los titulares.
Foto: Tyler / Unsplash (https://unsplash.com/@tylergm)
XDC AI's new protocol lets autonomous agents execute on-chain payments, signaling a shift from advisory bots to transaction-capable AI in DeFi.

Comentarios