In Breve
- Qual è la novità annunciata da AMD e Cerebras?
- Hanno lanciato una soluzione disaggregata per l'inferenza AI combinando Helios e Wafer-Scale Engine.
- Quando sarà disponibile la nuova soluzione?
- La soluzione sarà disponibile tramite Cerebras Cloud nella seconda metà del 2026.
- Quali sono i vantaggi della nuova architettura?
- Promette un aumento fino a cinque volte dei token per secondo per watt rispetto a configurazioni precedenti.
AMD e Cerebras Systems hanno recentemente annunciato una partnership tecnica che segna un passo significativo nella tecnologia per l’inferenza AI. Questa collaborazione combina il sistema rackscale Helios di AMD con il Wafer-Scale Engine (WSE) di Cerebras, creando una soluzione disaggregata per l’inferenza che sarà disponibile tramite Cerebras Cloud nella seconda metà del 2026.
Secondo test interni condotti dalle due aziende, la nuova architettura promette un aumento fino a cinque volte dei token per secondo per watt (TPS/W) rispetto a una configurazione WSE standalone. Questo miglioramento è stato misurato utilizzando l’open-source Kimi 2.6 1T, un modello di mixture-of-experts con un trilione di parametri totali, ma solo circa 32 miliardi di parametri attivi per token.
La struttura proposta sposta la fase di prefill e l’elaborazione dei prompt sul rack Helios, compensando le minori efficienze del WSE in quella parte del flusso di lavoro. Il WSE, d’altra parte, si concentra sul decode e sulla generazione dei token. Questa sinergia permette di ottimizzare le prestazioni, soprattutto per modelli che non possono risiedere interamente su pochi wafer WSE. Infatti, un singolo wafer Cerebras contiene 44 GB di memoria, il che implica che un’implementazione esclusivamente basata su WSE richiederebbe oltre una dozzina di wafer, mentre un rack Helios può ospitare il modello molte volte.
Il miglioramento delle prestazioni è particolarmente significativo per modelli più densi e compatti, ma saranno necessari ulteriori test comparativi per valutare l’efficacia di questa soluzione rispetto ad altre offerte rackscale disponibili sul mercato.
Nonostante l’entusiasmo per questa innovazione, i termini finanziari dell’accordo tra AMD e Cerebras non sono stati resi noti. Questo annuncio avviene in un contesto di crescente attenzione da parte degli investitori e del mercato sul finanziamento circolare nel settore dell’intelligenza artificiale. Recentemente, Nvidia ha concordato una licenza non esclusiva per la tecnologia di SRAM decode di Groq, valutata 20 miliardi di dollari, evidenziando l’importanza strategica di queste tecnologie nel panorama competitivo attuale.
Inoltre, Cerebras, che è stata quotata a maggio, ha registrato oscillazioni significative del titolo, mentre AMD continua a mantenere rialzi rilevanti del valore azionario year-to-date. Questo scenario sottolinea l’importanza di innovazioni come quella proposta da AMD e Cerebras, che potrebbero avere un impatto duraturo nel settore dell’AI.

