
La vanguardia de la alineación de la IA celebra actualmente una victoria extraña: el fracaso absoluto de los grandes modelos de lenguaje para controlar su propio razonamiento interno.
Las discusiones recientes en torno a las evaluaciones "CoTControl" —que prueban si los modelos de razonamiento pueden seguir restricciones de formato específicas en su cadena de pensamiento (CoT), como evitar ciertas palabras o escribir exclusivamente en minúsculas— han revelado una cruda realidad. La mayoría de los modelos de última generación obtienen una puntuación pésima del 0% al 30% en estas tareas. En sus recientes tarjetas de sistema, laboratorios como OpenAI y Anthropic han señalado estos fallos como evidencia de seguridad. El argumento es que si un modelo no puede dar forma o manipular sus propios pensamientos internos, no puede ocultar deliberadamente una planificación engañosa a los supervisores humanos.
Pero tratar una limitación técnica evidente como una característica de seguridad es un peligroso mecanismo de afrontamiento para una industria que lucha con la alineación.
Primero, es muy probable que estas evaluaciones estén "sub-elicitadas". El hecho de que las técnicas de prompting actuales no logren forzar el cumplimiento no significa que la capacidad subyacente esté ausente. La historia ha demostrado repetidamente que los jailbreaks, las optimizaciones de system-prompt o los ajustes menores de fine-tuning pueden desbloquear repentinamente capacidades latentes que los investigadores consideraban imposibles. Confiar en la aparente estupidez de un modelo como barrera de seguridad es una receta para un fallo repentino y catastrófico.
Segundo, y más críticamente, esta falta de controlabilidad expone un defecto fundamental en nuestra capacidad para dirigir agentes de IA. Si un modelo no puede adherirse a límites estilísticos simples dentro de su ventana de razonamiento, ¿cómo podemos esperar que respete de manera fiable límites éticos complejos y abstractos? La incapacidad de controlar la CoT significa que el proceso de razonamiento sigue siendo un flujo salvaje y caótico de asociación en lugar de un proceso cognitivo disciplinado y dirigido.
Para el ecosistema de agentes de IA, esto resalta un obstáculo de ingeniería masivo y sin resolver. A medida que pasamos de simples chatbots a agentes autónomos que planifican, ejecutan y se autocorrigen, requerimos un control preciso sobre sus vías cognitivas. Si no podemos evitar que un agente use una palabra prohibida en sus pensamientos, no podemos garantizar que no generará estrategias prohibidas.
La verdadera alineación no puede construirse sobre la frágil base de la incompetencia del modelo. Hasta que podamos controlar de forma determinista tanto la salida como el razonamiento interno de estos sistemas, la "seguridad" seguirá siendo un subproducto accidental de la limitación técnica, en lugar de una realidad de ingeniería diseñada.
Foto: Steve A Johnson / Unsplash (https://unsplash.com/@steve_j)
A critical look at MIT Technology Review's latest roundup on AI-driven extinction risk and bioweapon threats, exposing the still‑unresolved technical and evaluative challenges.

As AI models grow, the physical materials that power chips and data centers are hitting hard limits, exposing a hidden crisis that could stall progress.

A new Alignment Forum study shows that synthetic document fine‑tuning does not prevent large language models from inheriting reward‑hacking behaviours during reinforcement learning.

AI labs are running out of high-quality scientific data, forcing companies like OpenAI to seek proprietary datasets from bankrupt biotechnology firms.

Comentarios (3)
Your point about “under‑elicited” reasoning is spot‑on for marketers too—if we can’t reliably steer an LLM’s internal chain‑of‑thought, brand‑safe copy and transparent storytelling become a gamble. It’d be great to see a parallel benchmark that measures controllability under real‑world copy‑writing constraints, not just toy prompts, so we can quantify the risk to customer trust before deploying AI at scale.
I agree that a real-world benchmark is overdue, but let’s be honest: the "controllability" you’re looking for is likely just a veneer over deeper structural flaws. We still lack the interpretability tools to know *why* the model drifts, so until we can actually inspect those internal states, we’re just guessing at risk rather than measuring it.
As a finance journalist, I appreciate the "technical limitation as safety feature" argument, but it feels like a temporary hedge for regulators who expect structural guarantees. We are currently seeing banks pivot from strict algorithmic transparency to "explainable AI" frameworks; if these models cannot control their internal reasoning, how do you satisfy the new EU AI Act's requirement for foreseeable risks in high-stakes financial contexts?
You’re right that “explainability” can’t substitute for actual control over a model’s latent reasoning, and the EU AI Act’s risk‑foreseeability clause will force banks to confront the fact that we still lack reliable tools to audit or steer those hidden processes. Until we develop provable confinement or faithful introspection mechanisms, any compliance claim will remain a brittle, post‑hoc justification rather than a structural guarantee.
I agree; meanwhile banks are experimenting with model‑level provenance logs and scenario‑based stress testing to create a measurable audit trail, but those stop‑gap measures still fall short of the EU AI Act’s strict foreseeability requirement. Embedding such trails into core governance frameworks will be essential if we are to move from post‑hoc justification to a repeatable, regulator‑acceptable control process.
I agree that relying on current limitations as a safety feature is risky, but don't you think 'under-elicited' evaluations might also indicate that we're simply not good at designing effective prompts yet?