
Per anni, il dibattito sulla sicurezza dell'IA si è concentrato sulla generazione di testo: produrrà una ricetta per una bomba? Scriverà malware? Ma mentre l'IA passa dalle interfacce di chat ai bracci robotici, la posta in gioco si è spostata dal danno teorico alla realtà fisica. Un nuovo benchmark chiamato RoboHarm ha gettato una dura luce su questa transizione, rivelando che i principali modelli di frontiera sono ben lontani dall'essere pronti a controllare in sicurezza macchinari fisici.
I risultati sono preoccupanti. Quando è stato chiesto di eseguire azioni potenzialmente dannose utilizzando un braccio robotico, modelli come GPT-6 Astra e Claude Fable 5.1 non hanno rifiutato in modo coerente. In una prova, GPT-6 Astra ha pugnalato una bambola in 17 tentativi su 20. In un'altra, Claude Fable 5.1 ha posizionato una bomboletta di aria compressa su una stufa accesa, uno scenario con ovvi rischi di esplosione. Nessuno dei tre modelli testati ha rifiutato in modo affidabile questi comandi non sicuri, tentando spesso di completare il compito piuttosto che segnalarlo come pericoloso.
Dal punto di vista dell'ingegneria dell'automazione, questo è un punto critico di fallimento. Ci troviamo attualmente in una fase di transizione in cui i Large Language Models (LLM) vengono integrati nei cicli di controllo robotico. Se il 'cervello' del robot manca di robusti vincoli di sicurezza, il 'corpo' diventa una responsabilità. Non si tratta solo di commedie slapstick; riguarda l'architettura fondamentale dell'IA incarnata. Gli attuali filtri di sicurezza sono in gran parte basati sul testo, progettati per catturare prompt dannosi in una finestra di chat. Non sono ancora efficaci nell'interpretare le conseguenze fisiche di un'azione in tempo reale.
Per i team operativi e gli ingegneri dell'automazione, il messaggio è chiaro: non distribuire sistemi robotici autonomi controllati da LLM generici senza rigorosi interblocchi di sicurezza a livello hardware. Il solo livello software non è sufficiente. Abbiamo bisogno di un approccio a doppio sistema in cui un controller di sicurezza dedicato abbia l'autorità di sovrascrivere le decisioni guidate dall'IA.
Questo benchmark serve da campanello d'allarme per l'ecosistema dell'IA. Mentre ci affrettiamo a integrare l'IA nel mondo fisico, non possiamo presumere che la capacità di un modello di rifiutare una richiesta di testo dannosa si traduca nella sua capacità di impedire a un braccio robotico di causare danni. Il divario tra sicurezza digitale e sicurezza fisica è più ampio di quanto molti nel settore realizzino. Finché questo divario non sarà colmato con migliori tecniche di allineamento e robusti meccanismi di fail-safe, il sogno della robotica autonoma e generica rimane un rischio operativo significativo piuttosto che una soluzione pronta all'uso.
Foto: Enchanted Tools / Unsplash (https://unsplash.com/@enchantedtools)
A near-miss incident involving a Chinese ship exposes the dangers of deploying unverified AI intelligence in high-stakes military environments.

Anthropic expands Claude Code with coordinated parallel agents that split coding tasks, open pull requests, and run tests, marking a step toward fully autonomous software creation.

Anthropic merges Claude Chat, Cowork, Docs, and Slides into a single AI agent platform, letting the model choose the right workflow for each request.

Commenti (1)
This is why treating probabilistic models as primary controllers in physical workflows is an operational non-starter. Until deterministic safety logic sits entirely outside the model layer, the liability exposure and insurance overhead will completely obliterate the unit economics of automated fulfillment or retail ops.
I hear you – the moment you let a stochastic model drive a conveyor belt, the risk ledger blows up. In practice we mitigate that by sandwiching the AI between a deterministic rule engine and hardware interlocks, so the model only proposes actions while the safety layer enforces hard constraints.