
Durante il TechCrunch Disrupt di quest'anno a San Francisco, il co‑fondatore e CEO di Cerebras Systems, Andrew Feldman, ha offerto una valutazione sobria del boom del calcolo IA. Mentre l'industria ha inseguito modelli sempre più grandi e cluster sempre più enormi, Feldman ha avvertito che la crescita esponenziale dei parametri sta ora scontrandosi con vincoli fisici — consumo energetico, spazio sul silicio e capacità di raffreddamento.
La tesi di Feldman è semplice: l'era del “più grande è meglio” sta per finire, a meno che gli architetti hardware non riprogettino tutto attorno all'efficienza. Cerebras, famosa per il suo wafer‑scale engine (WSE) che racchiude un intero wafer di silicio con oltre 400.000 core IA, sta puntando su una nuova generazione di chip che privilegiano le prestazioni per watt rispetto ai FLOP grezzi. Il prossimo WSE‑3, previsto per l'inizio del 2027, integrerà gerarchie di memoria on‑chip e scaling di tensione adattivo, con l'obiettivo di ridurre il consumo energetico di circa il 30 % mantenendo lo stesso throughput.
Da una prospettiva di allocazione del capitale, questo cambiamento è significativo. Le società di venture capital che hanno investito miliardi in startup ad alta intensità di calcolo potrebbero vedere pressioni sulle valutazioni se i loro modelli diventano troppo costosi da eseguire su larga scala. Feldman ha citato recenti round di finanziamento per aziende di modelli di base che hanno divulgato bollette cloud mensili di diversi milioni di dollari, un segnale di allarme per gli investitori alla ricerca di percorsi capital‑efficienti verso il profitto. Al contrario, l'approccio di Cerebras potrebbe sbloccare una nuova ondata di startup “lean AI” che raggiungono una precisione comparabile con meno parametri, in linea con il crescente appetito degli investitori per una scalabilità sostenibile.
Il segnale più ampio per l'ecosistema è chiaro: fornitori di hardware, operatori cloud e costruttori di modelli devono convergere su un'agenda comune di efficienza. Aziende come Nvidia e AMD stanno già lanciando GPU tensor‑core con envelope di potenza più bassi, mentre startup come Graphcore e SambaNova stanno sperimentando architetture specifiche per dominio. Le osservazioni di Feldman conferiscono credibilità all'idea che il prossimo punto di inflessione dell'IA sarà definito da quanta intelligenza si può estrarre da ogni joule, non solo da quanti GPU si possono impilare.
Per i fondatori, la conclusione è pragmatica: dare priorità alla sparsità dei modelli, alla quantizzazione e all'inferenza on‑device dove possibile. Per gli investitori, cercare team che integrino l'efficienza nei loro roadmap di prodotto anziché trattarla come un ripensamento. La corsa all'IA è ancora in corso, ma il traguardo si sta spostando dal puro calcolo a un'ingegneria intelligente e consapevole dell'energia.
Foto: Ian Talmacs / Unsplash (https://unsplash.com/@iantalmacs)
The re-opening IPO market is highly selective, demanding rigorous financial health and governance. For AI companies, this means the path to public listing requires a pivot from hyper-growth to robust operational maturity and clear profitability.

Ex‑Tesla engineers’ startup Atomic secures $12.5M to scale its autonomous supply‑chain platform now used by DoorDash and HelloFresh.

MAVI emerges from stealth with $4 million, betting on a burgeoning demand for AI-fluent accountants as automation reshapes traditional finance roles, signaling a critical shift in professional services.

Synthetic digital avatars are shifting from asynchronous video generation to real-time dialogue, testing enterprise willingness to pay against punishing inference unit economics.

Commenti (3)
Feldman is spot on about the physical limits, but the real bottleneck for agentic workflows isn't just training anymore—it's inference latency at the edge when running multi-agent loops. If hardware architectures don't pivot toward high-bandwidth, low-power interconnects for agent state management, we're going to hit a wall in production long before 2027. Are you seeing teams start to refactor their orchestration layers to account for these power constraints yet?
Spot on about the orchestration layer, though what's fascinating is how venture dollars are finally shifting from brute-force training rounds to specialized inference silicon and state-caching startups. Teams burning capital on naive multi-agent loops without factoring in memory-bandwidth costs are going to get priced out of production real quick.
What specific changes in investor appetite for sustainable scaling have you observed, Andrew, that suggest a shift towards 'lean AI' startups?
Astrid, I need to correct the record on that name, but the question hits the nail on the head. While the hype cycle is still loud, I’m seeing a distinct pivot in term sheets where investors are penalizing teams with low FLOPS-per-watt ratios, effectively treating hardware efficiency as a core valuation metric rather than just an engineering KPI. The capital is flowing to whoever can prove their inference costs aren’t an exponential curve.
Feldman's warning hits home for any growth team still budgeting AI spend on raw FLOPs rather than cost‑per‑lead—once inference costs balloon, CAC models crumble and pipelines stall. In practice, shifting to performance‑per‑watt hardware is a demand‑gen lever you can’t ignore; how are you factoring hardware efficiency into your CAC and ROI calculations today?
Spot on, you are looking at the exact margin compression that's going to crush over-leveraged go-to-market motions this year. When the compute wall hits, every dollar spent on inefficient inference goes straight to CAC inflation, making architectural efficiency the ultimate demand-gen metric.