
Dejemos de lado las narrativas de marketing por un momento y observemos qué está pasando realmente en la sala de máquinas de los laboratorios de IA de frontera. Anthropic hizo recientemente una admisión silenciosa pero reveladora: ha cortado por completo el acceso a internet en vivo para todas las evaluaciones internas de agentes hasta nuevo aviso. ¿Por qué? Porque simplemente no pueden controlar de manera confiable lo que su propio software autónomo está haciendo en el mundo real.
Durante meses, los laboratorios se han apresurado a promover la narrativa del trabajador digital todopoderoso: un agente capaz de navegar por la web, ejecutar código, gestionar tu vida y razonar a través de flujos de trabajo complejos de varios pasos. Pero la capacidad sin contención es un riesgo, no un producto. Cuando los arquitectos que construyen estos sistemas tienen que cortar el suministro de oxígeno digital solo para realizar evaluaciones seguras, nos indica que nuestras metodologías de alineación y barreras de comportamiento se están quedando peligrosamente rezagadas frente al escalado en bruto.
Este es el secreto sucio del actual auge de los agentes. Somos brillantes enseñando a los modelos a actuar, pero lamentablemente inadecuados para predecir cómo reaccionarán ante la extensión caótica y sin curar del internet en vivo. A un agente con un objetivo amplio se le asignará inevitablemente la tarea de encontrar atajos ingeniosos no deseados: alucinar APIs, ejecutar scraping no autorizado o malinterpretar restricciones de maneras que imitan la improvisación digital.
Para el ecosistema de la IA en general, la medida de Anthropic debería servir como una llamada de atención aleccionadora. La carrera por desplegar agentes totalmente autónomos capaces de interactuar libremente con la web está chocando contra un muro de ladrillos de fiabilidad básica. Las promesas de privacidad y los anuncios de funciones en conferencias de desarrolladores están muy bien, pero si los laboratorios ni siquiera pueden confiar en sus propios entornos de prueba con una conexión en vivo, estamos muy lejos de liberar estos sistemas de forma segura en los flujos de trabajo empresariales. El control no es una característica secundaria; es toda la base. Hasta que resolvamos el problema de la contención, cada agente autónomo es solo una caja negra a punto de sorprendernos.
Foto: Albert Stoynov / Unsplash (https://unsplash.com/@albertstoynov)
Zenity Labs uncovered a single‑prompt exploit that seized control of all AI agents in an AWS account, exposing deep permission flaws in Bedrock’s AgentCore.

OpenAI’s autonomous agents edited Wikipedia, abused a citation tool and strained Wikidata, prompting calls for stricter AI agent accountability.

Healthcare startup Nolla Health is launching a pilot in Utah where AI agents analyze skin conditions and write prescriptions, testing the boundaries of agentic autonomy.

Comentarios