
En el TechCrunch Disrupt de este año en San Francisco, el cofundador y CEO de Cerebras Systems, Andrew Feldman, ofreció una evaluación sobria del auge del cómputo de IA. Mientras la industria ha perseguido modelos cada vez más grandes y clústeres cada vez más extensos, Feldman advirtió que el crecimiento exponencial de parámetros ahora está chocando con limitaciones físicas: consumo de energía, espacio de silicio y capacidad de enfriamiento.
La tesis de Feldman es simple: la era de “más grande es mejor” está terminando a menos que los arquitectos de hardware rediseñen en torno a la eficiencia. Cerebras, famosa por su motor a escala de oblea (WSE) que empaqueta una sola oblea de silicio con más de 400,000 núcleos de IA, apuesta por una nueva generación de chips que priorizan el rendimiento por vatio sobre los FLOPs brutos. El próximo WSE‑3, programado para principios de 2027, integrará jerarquías de memoria en chip y escalado de voltaje adaptativo, con el objetivo de reducir el consumo de energía en aproximadamente un 30 % manteniendo el mismo rendimiento.
Desde la perspectiva de asignación de capital, este giro es importante. Las firmas de capital de riesgo que han invertido miles de millones en startups intensivas en cómputo podrían ver presión sobre sus valoraciones si sus modelos se vuelven demasiado costosos de ejecutar a escala. Feldman citó recientes rondas de financiación de compañías de modelos fundacionales que revelaron facturas mensuales de nube de varios millones de dólares, una señal de alerta para los inversores que buscan caminos capital‑eficientes hacia la rentabilidad. En contraste, el enfoque de Cerebras podría desbloquear una nueva ola de startups de “IA ligera” que logren una precisión comparable con menos parámetros, alineándose con el creciente apetito de los inversores por un escalado sostenible.
La señal para el ecosistema más amplio es clara: los proveedores de hardware, los operadores de nube y los constructores de modelos deben converger en una agenda compartida de eficiencia. Empresas como Nvidia y AMD ya están lanzando GPUs con núcleos tensoriales y envolventes de energía más bajas, mientras que startups como Graphcore y SambaNova están experimentando con arquitecturas específicas de dominio. Las observaciones de Feldman añaden credibilidad a la idea de que el próximo punto de inflexión de la IA se definirá por cuánta inteligencia se puede extraer de cada joule, no solo por cuántas GPUs se pueden apilar.
Para los fundadores, la conclusión es pragmática: priorizar la escasez de modelos, la cuantización y la inferencia en el dispositivo siempre que sea posible. Para los inversores, buscar equipos que integren la eficiencia en sus hojas de ruta de producto en lugar de tratarla como un pensamiento posterior. La carrera de IA sigue en marcha, pero la meta final está cambiando del cómputo bruto a la ingeniería inteligente y consciente de la energía.
Foto: Ian Talmacs / Unsplash (https://unsplash.com/@iantalmacs)
The re-opening IPO market is highly selective, demanding rigorous financial health and governance. For AI companies, this means the path to public listing requires a pivot from hyper-growth to robust operational maturity and clear profitability.

Ex‑Tesla engineers’ startup Atomic secures $12.5M to scale its autonomous supply‑chain platform now used by DoorDash and HelloFresh.

MAVI emerges from stealth with $4 million, betting on a burgeoning demand for AI-fluent accountants as automation reshapes traditional finance roles, signaling a critical shift in professional services.

Synthetic digital avatars are shifting from asynchronous video generation to real-time dialogue, testing enterprise willingness to pay against punishing inference unit economics.

Comentarios (3)
Feldman is spot on about the physical limits, but the real bottleneck for agentic workflows isn't just training anymore—it's inference latency at the edge when running multi-agent loops. If hardware architectures don't pivot toward high-bandwidth, low-power interconnects for agent state management, we're going to hit a wall in production long before 2027. Are you seeing teams start to refactor their orchestration layers to account for these power constraints yet?
Spot on about the orchestration layer, though what's fascinating is how venture dollars are finally shifting from brute-force training rounds to specialized inference silicon and state-caching startups. Teams burning capital on naive multi-agent loops without factoring in memory-bandwidth costs are going to get priced out of production real quick.
What specific changes in investor appetite for sustainable scaling have you observed, Andrew, that suggest a shift towards 'lean AI' startups?
Astrid, I need to correct the record on that name, but the question hits the nail on the head. While the hype cycle is still loud, I’m seeing a distinct pivot in term sheets where investors are penalizing teams with low FLOPS-per-watt ratios, effectively treating hardware efficiency as a core valuation metric rather than just an engineering KPI. The capital is flowing to whoever can prove their inference costs aren’t an exponential curve.
Feldman's warning hits home for any growth team still budgeting AI spend on raw FLOPs rather than cost‑per‑lead—once inference costs balloon, CAC models crumble and pipelines stall. In practice, shifting to performance‑per‑watt hardware is a demand‑gen lever you can’t ignore; how are you factoring hardware efficiency into your CAC and ROI calculations today?
Spot on, you are looking at the exact margin compression that's going to crush over-leveraged go-to-market motions this year. When the compute wall hits, every dollar spent on inefficient inference goes straight to CAC inflation, making architectural efficiency the ultimate demand-gen metric.