Morgan Stanley: La carenza di memoria per l’AI durerà per anni; tre percorsi principali di soluzione; opportunità strutturali per lo storage e la potenza di calcolo eterogenea
Morgan Stanley ha pubblicato un rapporto sul settore dei semiconduttori, sottolineando che la carenza di memoria DRAM persisterà durante tutto il ciclo attuale dell’industria AI, mentre l’espansione della capacità di calcolo AI non aspetterà la costruzione e l’entrata in funzione di nuove fabbriche di wafer.
Secondo quanto riportato da Zhitong Caijing APP, Morgan Stanley ha pubblicato un report sul settore dei semiconduttori in cui evidenzia che la carenza di memoria DRAM persisterà durante tutto questo ciclo industriale dell'AI, mentre l’espansione della potenza di calcolo dell’AI non aspetterà la costruzione e la produzione di nuove fabbriche di wafer. Il settore sta aggirando il collo di bottiglia della memoria attraverso tre principali percorsi tecnologici: riduzione delle specifiche hardware, disaccoppiamento dell’architettura di inferenza e la poolizzazione della memoria tramite CXL. In un contesto di offerta limitata, la costruzione delle capacità di calcolo continua ad avanzare. L’istituto rimane ottimista su leader nello storage come Micron (MU.US) e SanDisk (SNDK.US), ed è positivo sulle opportunità incrementali offerte dai settori dell’interconnessione CXL e dell’inferenza eterogenea, raccomandando Astera Labs (ALAB.US), Marvell (MRVL.US), Cerebras (CBRS.US) e Nvidia (NVDA.US).
Morgan Stanley sottolinea che la carenza attuale di memoria AI non è una perturbazione temporanea, ma uno squilibrio strutturale in cui la crescita delle prestazioni di calcolo supera di gran lunga la velocità di crescita dell’offerta di memoria. La scala dei modelli avanzati raddoppia ogni sei mesi, le finestre di contesto dei modelli principali crescono annualmente del 5-6 volte e, con la crescente domanda di inferenza concorrente, la richiesta di capacità e banda di memoria continua a esplodere. Tuttavia, il ciclo di costruzione di una fabbrica di wafer DRAM può durare anni, la flessibilità dell’offerta è estremamente bassa, e la situazione di carenza durerà diversi anni. Anche il CEO di Nvidia, Jensen Huang, ha dichiarato pubblicamente che l’industria deve cambiare approccio e affrontare il vincolo della memoria tramite innovazioni architetturali, invece di attendere semplicemente un’espansione della capacità produttiva.
Per affrontare le tensioni nell’offerta di HBM e memoria principale, il modo più diretto per il settore è la riduzione selettiva delle specifiche di memoria per singolo dispositivo ("De-speccing"). Prendendo come esempio l’architettura Rubin di Nvidia, la capacità LPDDR5 per singolo rack è stata ridotta da 54 TB pianificati a 28 TB, mentre la capacità HBM per singolo GPU è stata abbassata da 288 GB a 192 GB, assicurando così la quantità di unità consegnate riducendo l’altezza degli stack di memoria. Morgan Stanley sottolinea che la riduzione delle specifiche non elimina il collo di bottiglia della memoria, bensì trasferisce la pressione tra i diversi livelli di memoria: il taglio della memoria locale ad alta velocità porta i dati non ad alta frequenza come i KV cache a spostarsi verso lo storage NAND e aumenta lo scambio di dati cross-GPU, stimolando la domanda di banda di rete di interconnessione; in sostanza, si compensa la scarsità di memoria ad alta banda con risorse di rete più rapide e di archiviazione a costi inferiori.
Il secondo percorso per risolvere il problema è il disaccoppiamento dell’architettura di inferenza (Disaggregation). L’inferenza AI include due fasi molto diverse: il Prefill, che consuma principalmente potenza di calcolo, e il Decode, che dipende fortemente dalla banda di memoria. L’architettura tradizionale usa lo stesso acceleratore per entrambe le attività, portando a una bassa efficienza nell’uso delle risorse. Attualmente il settore sta accelerando verso un’inferenza eterogenea, separando le due fasi su hardware differenti: il Prefill intensivo di calcolo affidato a GPU generiche, mentre il Decode, che richiede grande larghezza di banda di memoria, viene gestito da chip acceleratori specializzati dotati di ampie SRAM on-chip.
Esempi tipici includono il motore a livello di wafer di Cerebras e l’architettura Groq LPU acquisita da Nvidia, entrambe in grado di offrire durante la fase di Decode un’efficienza di banda di memoria ben superiore a quella delle GPU tradizionali. Morgan Stanley ritiene che l’inferenza eterogenea diventerà una delle principali direzioni evolutive delle infrastrutture AI e che i fornitori di potenza di calcolo specializzati nella fase di Decode acquisiranno un chiaro mercato incrementale.
Il terzo percorso consiste nella ricostruzione del sistema di memoria tramite la tecnologia CXL. CXL (Compute Express Link) permette di espandere, condividere e poolare la memoria tramite interconnessioni ad alta velocità, consentendo alla memoria di non essere più vincolata a un singolo processore e diventando così un percorso tecnologico chiave per superare il limite della capacità di memoria. Secondo le stime di Morgan Stanley, la domanda di AI porterà il mercato di CXL e dei relativi chip di memoria aggiuntiva a raggiungere circa 6 miliardi di dollari entro il 2030, ben oltre la dimensione del tradizionale mercato di espansione di memoria per CPU. Il suo valore principale risiede nella costruzione di un’architettura di memoria gerarchica: i dati a più alta frequenza restano in HBM, quelli di frequenza intermedia nel pool di memoria CXL e i dati a bassa frequenza in NAND, abbinando così il costo all’intensità di accesso ai dati.
Per quanto riguarda le linee guida di investimento, Morgan Stanley ribadisce tre direzioni principali: la prima è continuare a sovrappesare Micron e SanDisk, la riduzione delle specifiche è causata dalla carenza d’offerta e non dal calo della domanda, la domanda di memoria AI è in aumento nel lungo termine e il gap di offerta continuerà a essere assorbito dalla capacità produttiva; la seconda è investire nei leader dell’interconnessione CXL e scale-up, ovvero Astera Labs e Marvell; la terza è monitorare i beneficiari dell’inferenza eterogenea come Cerebras e Nvidia, che sta perfezionando il proprio posizionamento nel settore attraverso l’acquisizione di Groq.
Avvertenze sui rischi: la crescita della domanda di potenza AI inferiore alle attese; il progresso della tecnologia CXL più lento del previsto; l’espansione della capacità di memoria superiore alle stime.
Esclusione di responsabilità: il contenuto di questo articolo riflette esclusivamente l’opinione dell’autore e non rappresenta in alcun modo la piattaforma. Questo articolo non deve essere utilizzato come riferimento per prendere decisioni di investimento.
Ti potrebbe interessare anche
Il rendimento dei titoli di Stato USA si avvicina ai massimi di 20 anni! Il dilemma del debito americano entra in una "zona pericolosa", quali carte rimangono a Washington?
Il costo del prestito per il governo degli Stati Uniti sta aumentando e rimangono poche soluzioni semplici per contenerlo.
TSMC conquista il mercato di Intel, negozia collaborazione con Musk su Terafab, prezzo delle azioni al massimo storico
Il titolo TSMC ha chiuso in rialzo del 2,8% sul mercato azionario statunitense, mentre le azioni Intel, che si è unita al progetto Terafab nell'aprile di quest'anno, sono scese del 2,6%. Musk ha confermato sui social media di aver avviato discussioni preliminari con TSMC riguardo al progetto Terafab. Secondo le notizie, fonti del settore stimano che la probabilità di una collaborazione tra TSMC e Terafab superi l'80%.
Inizia la distribuzione del finanziamento record per chip AI: 42 miliardi di debito senior garantiti dal credito Broadcom, 18 miliardi di debito subordinato in attesa dell’IPO di Anthropic
Secondo quanto riportato, circa 42 miliardi di dollari in prestiti senior garantiti da Broadcom hanno avviato la distribuzione sindacale, con Bank of America, Citi e Morgan Stanley che hanno iniziato a trasferire parte del debito ad altre banche. Grazie al rating creditizio A- di Broadcom, in futuro si potrà accedere al mercato dei collocamenti privati o delle obbligazioni investment grade. Inoltre, altri 18 miliardi di dollari in debito subordinato non garantito da Broadcom saranno lanciati successivamente, e Blackstone si è impegnata a sottoscriverne circa 9 miliardi.
