
Abbiamo visto tutti i vistosi repository di GitHub e i pitch deck dei VC che promettono un futuro in cui uno "sciame" di agenti IA costruisce magicamente la tua prossima startup mentre sorseggi un margarita. Sulla carta sembra fantastico. Hai un agente manager, un agente sviluppatore, un agente QA e magari un agente designer, tutti a chattare in una stanza Slack digitale. Ma se hai provato davvero a eseguire queste configurazioni, probabilmente avrai notato due cose: richiedono un'eternità e la tua bolletta delle API sembra un numero di telefono.
Ora, lo sviluppatore di OpenAI Codex Eric Provencher ha fornito dati concreti su ciò che molti di noi sospettavano. Avverte che far funzionare più di due sotto-agenti in parallelo significa essenzialmente bruciare denaro senza alcun guadagno in termini di qualità. Provencher fa riferimento a un progetto sbalorditivo in cui uno sciame di 1.393 agenti ha speso la bellezza di 20.000 dollari in token per fare il refactoring di un singolo codebase Python: un compito che un singolo modello di ragionamento avanzato come GPT-6 Astra avrebbe probabilmente potuto gestire per pochi centesimi.
Provencher chiama questo fenomeno "tassa di coordinamento". In breve, gli agenti non si fidano l'uno dell'altro. Quando si inserisce un gruppo di LLM in un loop, passano la maggior parte del tempo a ricontrollare, correggere e discutere sul lavoro reciproco. È l'equivalente digitale di una riunione di un comitato aziendale pletorico in cui non si conclude nulla, ma tutti vengono pagati a ore.
Come persona che testa questi strumenti quotidianamente, ho provato questo dolore in prima persona. L'UX dei framework di sciami è indubbiamente affascinante: guardare le finestre del terminale scorrere con la scritta "L'agente A sta pensando..." fa sentire come nel futuro. Ma l'utilità non c'è ancora. La maggior parte dei framework multi-agente è gonfia, non ottimizzata e, francamente, frutto di una progettazione pigra. Gli sviluppatori stanno lanciando più agenti contro un problema invece di progettare prompt migliori, costruire solide barriere deterministiche o utilizzare loop di ragionamento a singolo agente.
Per l'ecosistema dell'IA, questo è un bagno di realtà quanto mai necessario. L'era del "gonfiore agentico" si sta scontrando con il muro della realtà economica. Se oggi stai creando flussi di lavoro di IA, evita lo sciame da 10 agenti. Affidati a un unico modello di ragionamento di alta qualità, forniscigli un prompt di sistema solido e magari, solo magari, affiancalo a un singolo agente critico per rivedere l'output. Il tuo portafoglio ti ringrazierà.
Foto: Tyler / Unsplash (https://unsplash.com/@tylergm)
Spotify is finally letting parents exclude kids' music from their Wrapped and personalized recommendations, fixing a long-standing algorithmic UX nightmare.

Apple has finally rolled out its long-awaited Siri upgrade built on Google's Gemini models, bringing screen context and multi-step tasks, alongside some classic AI hiccups.

OpenAI, Anthropic, and Google are reportedly discussing self-regulation to pace AI development. Here is why 'safety' theater is ruining the user experience.

Commenti