Semiconduttori di nuova generazione: come l'intelligenza artificiale e il supercalcolo si stanno spingendo oltre i transistor più piccoli

In breve: i progressi dell'IA ora derivano dall'intero sistema dei semiconduttori.

La prossima generazione di hardware per l'intelligenza artificiale e il supercalcolo non si basa su una singola innovazione rivoluzionaria. Si sta costruendo a partire da diverse tecnologie che devono lavorare in sinergia: transistor gate-all-around, alimentazione dal lato posteriore, architetture a chiplet, packaging avanzato, memorie ad alta larghezza di banda, collegamenti die-to-die più veloci e reti ottiche in continua espansione. Il risultato pratico è una maggiore potenza di calcolo, una maggiore larghezza di banda della memoria e una migliore scalabilità, senza dover ricorrere esclusivamente a dimensioni dei transistor più piccole.

Questo è importante perché i moderni acceleratori di intelligenza artificiale e i supercomputer scientifici spesso raggiungono i limiti di trasferimento dati e di potenza prima ancora di esaurire la loro capacità di calcolo. Un motore di matrici più veloce è utile solo se i pesi del modello, le attivazioni e i risultati intermedi possono raggiungerlo abbastanza rapidamente. Allo stesso modo, aggiungere altri acceleratori è utile solo se il pacchetto, la rete rack, il sistema di memoria, il sistema di raffreddamento e lo stack software sono in grado di mantenerli occupati.

Primo piano di un modulo acceleratore multi-chip con pacchetti di memoria impilati davanti a rack di server raffreddati a liquido.
Un modulo acceleratore multi-chip con diversi pacchetti di memoria sovrapposti illustra la direzione intrapresa dall'hardware moderno per l'intelligenza artificiale: elaborazione, memoria, packaging, alimentazione e raffreddamento sono sempre più progettati come un unico sistema.

1. Le nuove strutture dei transistor migliorano l'efficienza, ma sono solo il punto di partenza.

La logica di ultima generazione si sta allontanando dalla struttura FinFET che ha dominato i chip avanzati per anni. I progetti gate-all-around, o GAA, avvolgono il gate attorno a un nanosheet o a una struttura di canale simile, offrendo ai progettisti di chip un controllo elettrostatico più preciso man mano che le dimensioni dei componenti si riducono. Ciò può migliorare le prestazioni, ridurre le correnti di dispersione o fornire un migliore equilibrio tra le due.

TSMC afferma che il suo processo N2 a 2 nanometri è entrato in produzione di massa nel quarto trimestre del 2025, mentre la sua tecnologia A16 combina transistor a nanosheet con una linea di alimentazione posteriore pensata in particolare per prodotti di calcolo ad alte prestazioni con elevate esigenze di alimentazione. TSMC ha dichiarato che la produzione di massa di A16 è prevista per la seconda metà del 2026. Consultare la pagina della fonderia dedicata alla tecnologia A16 e la relazione annuale del 2025 .

Intel sta seguendo una direzione simile con Intel 18A. Il suo processo combina transistor RibbonFET GAA con l'alimentazione PowerVia sul lato posteriore. Intel afferma che la produzione di 18A è iniziata nel 2025, mentre la versione migliorata 18A-P è entrata in produzione di prova nel giugno 2026. Intel pubblica anche dati comparativi su prestazioni, consumo energetico e densità per questo nodo; tali cifre sono fornite dal produttore e dovrebbero essere validate rispetto a un progetto specifico piuttosto che essere considerate come miglioramenti universali a livello di chip. I dettagli aggiornati sono disponibili sulla pagina del processo Intel 18A .

L'alimentazione sul lato posteriore è importante perché i chip avanzati devono instradare sia i segnali che l'alimentazione attraverso un cablaggio estremamente denso. Spostare parte della rete di alimentazione sul lato posteriore può liberare risorse di instradamento sul lato dei segnali e migliorare l'erogazione di tensione. Per gli acceleratori di intelligenza artificiale, dove grandi array di unità di calcolo commutano ad alta velocità, questo può essere importante quanto la densità dei transistor.

2. I chiplet e il packaging avanzato stanno trasformando un pacco in un piccolo sistema informatico.

I chip monolitici diventano sempre più difficili e costosi da scalare man mano che crescono. I chiplet offrono un'alternativa: le singole funzioni possono essere prodotte con tecnologie di processo più adatte e poi collegate all'interno di un unico package. Un chip di calcolo potrebbe richiedere il processo logico più avanzato, mentre I/O, cache, circuiti analogici o altre funzioni potrebbero non averne bisogno.

È il packaging a rendere tutto ciò pratico. La piattaforma di packaging avanzato CoWoS di TSMC , ad esempio, è progettata per integrare più dispositivi logici e stack di memoria ad alta larghezza di banda in un package 2.5D. TSMC posiziona CoWoS specificamente per i prodotti di intelligenza artificiale e calcolo ad alte prestazioni (HPC), dove le connessioni brevi e ampie tra il calcolo e la memoria ad alta larghezza di banda sono fondamentali.

Stanno inoltre emergendo standard per rendere i chiplet meno proprietari. La specifica UCIe 3.0 , rilasciata nell'agosto 2025, supporta velocità di trasmissione dati di 48 GT/s e 64 GT/s e aggiunge funzionalità per l'efficienza energetica, la gestibilità e sistemi multi-chip più flessibili. UCIe non rende i chiplet intercambiabili dall'oggi al domani, ma fornisce al settore un framework elettrico e di protocollo comune per i collegamenti on-package.

Questo approccio è particolarmente interessante quando un'azienda desidera realizzare diverse varianti di acceleratori utilizzando componenti riutilizzabili. È meno attraente quando il costo del package, la densità termica o la complessità del design superano i vantaggi della modularità. Un prodotto più piccolo con esigenze di memoria e I/O modeste potrebbe comunque essere gestito meglio da un dispositivo monolitico più semplice.

3. La memoria ad alta larghezza di banda sta diventando strategica quanto l'acceleratore stesso.

I carichi di lavoro dell'IA trasferiscono ripetutamente tensori di grandi dimensioni tra la memoria e le unità di calcolo. Ciò rende la larghezza di banda della memoria un vincolo di progettazione di primaria importanza. La memoria ad alta larghezza di banda, o HBM, risolve il problema impilando i chip DRAM e posizionandoli fisicamente vicino all'acceleratore tramite un'interfaccia molto ampia.

La tecnologia HBM4 sta passando dalla fase di roadmap alla sua commercializzazione. Samsung ha annunciato le prime spedizioni commerciali di HBM4 nel febbraio 2026, affermando che il prodotto è entrato in produzione di massa con una velocità di trasferimento sostenuta di 11,7 Gb/s, con una capacità fino a 13 Gb/s. Nel maggio 2026, Samsung ha anche annunciato la spedizione di campioni di HBM4E. Ulteriori dettagli sono disponibili nell'annuncio di Samsung relativo alla produzione di HBM4 .

SK hynix ha dichiarato nei risultati del secondo trimestre 2026 di aver avviato le spedizioni di massa di HBM4 durante il trimestre e di prevedere un aumento della produzione nella seconda metà dell'anno. L'azienda ha inoltre spedito campioni di HBM4E a 12 strati. Per lo stato attuale, si vedano i risultati del secondo trimestre 2026 di SK hynix .

Perché è importante nella pratica? Le attuali specifiche di NVIDIA per Vera Rubin indicano 288 GB di HBM4 su una GPU Rubin e una larghezza di banda della memoria GPU di 19,2 TB/s. Per confronto, gli acceleratori della serie MI350 di AMD utilizzano HBM3E; AMD indica fino a 288 GB e 8 TB/s per il MI355X. Si tratta di architetture diverse e non dovrebbero essere confrontate basandosi solo su un dato di larghezza di banda, ma entrambe illustrano come la capacità di memoria e la larghezza di banda siano ormai specifiche fondamentali per gli acceleratori, piuttosto che dettagli secondari. Consultare le specifiche ufficiali di NVIDIA Vera Rubin NVL72 e la pagina della serie AMD Instinct MI350 .

4. Le interconnessioni di scalabilità verticale e orizzontale determinano se molti acceleratori si comportano come uno

Modelli complessi e simulazioni scientifiche raramente si adattano perfettamente a un singolo dispositivo. Il sistema deve suddividere il lavoro tra più acceleratori e scambiare frequentemente risultati parziali. Se la comunicazione è lenta, le costose unità di calcolo rimangono inattive.

Ecco perché le tecnologie proprietarie di scalabilità si stanno evolvendo di pari passo con le GPU stesse. La piattaforma Rubin di NVIDIA utilizza NVLink di sesta generazione; NVIDIA dichiara una larghezza di banda NVLink di 3 TB/s per GPU Rubin e di 216 TB/s su un sistema NVL72. AMD utilizza Infinity Fabric su tutte le sue piattaforme di accelerazione. Per gli acquirenti, la questione importante non è solo la larghezza di banda di collegamento di picco, ma anche come si comporta la tecnologia in base alle precise operazioni collettive, ai modelli paralleli e alla topologia utilizzati dall'applicazione.

Anche a livello di memoria di sistema, Compute Express Link si sta evolvendo. Il consorzio CXL afferma che CXL 4.0 raddoppia la velocità di segnalazione da 64 GT/s a 128 GT/s, aggiunge porte raggruppate ed espande le funzionalità di affidabilità della memoria. CXL è rilevante quando gli architetti desiderano un'espansione, un pooling o una disaggregazione coerente della memoria senza trattare ogni livello di memoria come un dispositivo di archiviazione remoto.

5. La fotonica al silicio si sta avvicinando alla commutazione del silicio

Il rame rimane un'ottima soluzione per connessioni elettriche brevi e dense, ma i collegamenti ottici diventano sempre più interessanti con l'aumentare della distanza e della larghezza di banda complessiva. Un importante passo successivo è rappresentato dall'ottica integrata, in cui i componenti ottici vengono avvicinati al circuito integrato di rete (ASIC) anziché risiedere interamente in ricetrasmettitori plug-in ai margini di uno switch.

NVIDIA afferma che la sua piattaforma Spectrum-X Ethernet Photonics utilizza componenti ottici integrati e offre un'efficienza energetica di rete fino a 5 volte superiore rispetto ai tradizionali design con ricetrasmettitori plug-in. Si tratta di un confronto tra fornitori, non di una garanzia per ogni topologia di data center, ma evidenzia la direzione intrapresa: il consumo energetico di rete sta diventando un fattore così rilevante che l'integrazione ottica è ormai parte integrante della progettazione dei sistemi a semiconduttore. Per maggiori informazioni, consultare la panoramica sulla fotonica al silicio di NVIDIA .

Cosa significa questo per l'intelligenza artificiale reale e i carichi di lavoro di supercalcolo

Carico di lavoroCaratteristiche dei semiconduttori da privilegiarePerché sono importanti
Pre-addestramento di modelli di grandi dimensioniCapacità e larghezza di banda HBM, collegamenti di scalabilità rapida, confezionamento denso, raffreddamento potenteL'addestramento si concentra in gran parte sul movimento dei tensori e sulla comunicazione sincronizzata tra numerosi acceleratori.
Inferenza a lungo termine e agentivaGrandi pool HBM, calcolo efficiente a bassa precisione, elevata larghezza di banda di interconnessione, tiering della memoriaLa cache KV e le fasi di ragionamento ripetute possono rendere la capacità di memoria e il trasferimento dei dati più limitanti rispetto al picco di FLOPS.
HPC chirurgicoCapacità FP64, larghezza di banda della memoria, interconnessioni affidabili, librerie numeriche matureI codici di simulazione spesso dipendono dalla doppia precisione e da una larghezza di banda sostenuta, piuttosto che dalla sola velocità di elaborazione dei tensori a bassa precisione.
Deduzione aziendalePrestazioni per watt, compatibilità software, memoria di dimensioni adeguate, opzioni di implementazione PCIeIl sistema migliore potrebbe essere quello che si adatta ai server e ai consumi energetici esistenti, piuttosto che quello che punta alla massima densità di rack.
Acceleratori personalizzatiStrategia per i chiplet, ecosistema di packaging, supporto UCIe, maturità del processoLa modularità può accorciare i cicli di riutilizzo, ma la complessità dell'imballaggio e la qualificazione della catena di fornitura possono vanificare questo vantaggio.

Un esempio concreto: perché una GPU più veloce non è sufficiente

Consideriamo un team che gestisce un modello linguistico di grandi dimensioni con finestre di contesto lunghe. Supponiamo che la profilazione mostri che le GPU sono spesso in attesa di trasferimenti di memoria e comunicazioni tra GPU. Il passaggio a un acceleratore più recente potrebbe essere d'aiuto, ma solo se il nuovo sistema offre anche una capacità HBM sufficiente, una larghezza di banda di memoria più elevata e una topologia che riduce i blocchi di comunicazione. Acquistare un dispositivo con prestazioni tensoriali teoriche superiori, mantenendo gli stessi colli di bottiglia di memoria e di rete, potrebbe portare a miglioramenti molto inferiori a quanto suggerito dalle specifiche principali.

Lo stesso principio si ritrova nel supercalcolo tradizionale. Il sistema Frontier dell'Oak Ridge National Laboratory combina acceleratori AMD MI250X con memoria HBM e un'interconnessione di sistema ad alta velocità. La guida utente di Frontier documenta il funzionamento congiunto di calcolo, memoria HBM, collegamenti CPU-GPU e rete Slingshot. L'hardware è di generazione precedente rispetto alle più recenti piattaforme di intelligenza artificiale del 2026, ma la lezione architetturale rimane valida: le prestazioni costanti di un'applicazione dipendono dal percorso tra calcolo, memoria e altri nodi.

Quando conviene passare all'hardware a semiconduttori di nuova generazione?

Un aggiornamento è più giustificabile quando risolve un collo di bottiglia misurabile, piuttosto che limitarsi a sostituire un componente obsoleto. Prima di optare per una nuova generazione di acceleratori, verificare quanto segue:

  • Pressione sulla memoria: il modello o la simulazione intasano la memoria host, richiedono checkpoint frequenti o impongono un livello di partizionamento del modello eccessivamente oneroso?
  • Pressione sulla larghezza di banda: i kernel sono limitati dalla memoria durante la profilazione, oppure gli acceleratori impiegano un tempo significativo in attesa di tutte le operazioni di riduzione e altre operazioni collettive?
  • Alimentazione e raffreddamento: il rack, la struttura e il circuito di raffreddamento sono in grado di supportare la nuova densità di potenza? Prestazioni superiori potrebbero comunque non essere adatte se gli aggiornamenti infrastrutturali rappresentano la parte preponderante dei costi.
  • Prontezza del software: il compilatore, le librerie, i kernel, lo stack di orchestrazione e gli strumenti di monitoraggio sono maturi per la nuova architettura?
  • Requisiti di precisione: il carico di lavoro può utilizzare in sicurezza formati a precisione inferiore, oppure richiede FP64 o un altro percorso a precisione superiore?
  • Utilizzo: Il carico di lavoro manterrà il nuovo hardware sufficientemente occupato da giustificarne il costo? La capacità inutilizzata non diventa economicamente vantaggiosa solo perché il chip è più recente.

I compromessi stanno diventando più concreti

I progressi nel campo dei semiconduttori stanno producendo capacità impressionanti, ma i fattori limitanti sono sempre più tangibili. I package avanzati sono più grandi e più difficili da produrre. Gli stack HBM concentrano il calore in prossimità della logica ad alta potenza. I sistemi su scala rack possono richiedere raffreddamento a liquido, una distribuzione di potenza densa e reti specializzate. L'ottica co-confezionata può ridurre il consumo energetico della rete, ma introduce nuove considerazioni in termini di produzione e manutenzione. I chiplet possono migliorare la modularità, ma aggiungono lavoro di validazione, confezionamento e gestione della resa.

Esiste anche un compromesso a livello software. L'aritmetica a bassa precisione, come FP8, FP6 o FP4, può aumentare notevolmente la produttività dell'IA, ma il software deve preservare la qualità del modello. I codici scientifici potrebbero non essere in grado di utilizzare le stesse scorciatoie. Una caratteristica di un semiconduttore è utile solo quando lo stack applicativo può sfruttarla senza violare i requisiti di accuratezza o affidabilità.

Cosa guardare dopo

Per il resto del 2026 e per tutto il 2027, i segnali più utili non si limiteranno ai nuovi nomi dei nodi. Bisognerà osservare se i processi A16 di TSMC e della famiglia 18A di Intel si diffonderanno ampiamente nei prodotti destinati ai clienti; con quale rapidità HBM4 e HBM4E diventeranno disponibili su larga scala; se UCIe 3.0 creerà una significativa interoperabilità tra chiplet di diversi fornitori; dove farà la sua comparsa CXL 4.0 nei sistemi di produzione; e se le ottiche co-confezionate si dimostreranno economiche e gestibili su larga scala.

Questi traguardi dimostreranno se l'industria dei semiconduttori sarà in grado di continuare a scalare l'intelligenza artificiale e il supercalcolo senza che lo spostamento della memoria, l'alimentazione, la rete e il raffreddamento annullino i vantaggi ottenuti grazie alla maggiore densità logica.

In conclusione

Il futuro dell'IA e del supercalcolo non è più alimentato da un singolo "nodo di nuova generazione", ma da un'ingegneria dei semiconduttori coordinata. I transistor GAA e l'alimentazione posteriore migliorano le fondamenta logiche. I chiplet e il packaging avanzato consentono ai progettisti di assemblare sistemi più grandi di quanto un singolo die possa comodamente fornire. La memoria HBM4 alimenta gli acceleratori con una larghezza di banda estrema. UCIe, CXL, NVLink, Infinity Fabric e le reti ottiche trasferiscono dati su domini progressivamente più ampi.

Se stai scegliendo l'hardware, parti dal vero collo di bottiglia del tuo carico di lavoro. Per l'IA limitata dalla memoria, dai priorità alla capacità HBM e alla larghezza di banda. Per l'addestramento distribuito, dai priorità all'infrastruttura di scalabilità verticale e orizzontale. Per il calcolo scientifico, verifica le prestazioni FP64 e delle librerie. Per l'implementazione aziendale, includi nella decisione alimentazione, raffreddamento, supporto software e impegno di integrazione. Il semiconduttore più veloce sulla carta non è automaticamente il sistema più veloce o più economico per il tuo carico di lavoro.

Riferimenti primari

Lascia un commento

Tech-Enabled Senior Care in 2026: What AI and Smart Homes Can—and Can’t—Do for Aging in Place

Tech-Enabled Senior Care in 2026: What AI and Smart Homes Can—and Can’t—Do for Aging in Place

A practical 2026 guide to AI, smart-home sensors, remote monitoring, fall safety, privacy, and how technology can support aging in place without replacing care.

Pianificazione urbana basata sui dati: costruire città intelligenti, sostenibili e a misura di pedone

Pianificazione urbana basata sui dati: costruire città intelligenti, sostenibili e a misura di pedone

Scopri come le città possono trasformare i dati relativi a mobilità, uso del suolo, clima e comunità in quartieri più sicuri, più verdi e più vivibili, senza anteporre la tecnologia alle persone.

Dove studiare ingegneria dei droni nel 2026: i migliori programmi aerospaziali in base all'obiettivo di carriera

Dove studiare ingegneria dei droni nel 2026: i migliori programmi aerospaziali in base all'obiettivo di carriera

Confronta i principali programmi di ingegneria aerospaziale e UAV per droni, autonomia, sistemi di controllo, operazioni UAS e ricerca di dottorato, con aggiornamenti verificati fino al 2026.

Robotica chirurgica basata sull'intelligenza artificiale: una guida pratica alla precisione, all'autonomia e a ciò che accade realmente in sala operatoria.

Robotica chirurgica basata sull'intelligenza artificiale: una guida pratica alla precisione, all'autonomia e a ciò che accade realmente in sala operatoria.

Una guida pratica alla robotica chirurgica basata sull'intelligenza artificiale: capacità attuali, livelli di autonomia, vantaggi in termini di precisione, limiti, regolamentazione e criteri di valutazione.

Ampliamento dell'implementazione della cattura e utilizzo del carbonio (CCUS): la cattura del carbonio può davvero invertire le emissioni globali?

Ampliamento dell'implementazione della cattura e utilizzo del carbonio (CCUS): la cattura del carbonio può davvero invertire le emissioni globali?

Gli investimenti nella cattura e utilizzo del carbonio (CCUS) sono in aumento, ma la cattura del carbonio può davvero invertire le emissioni globali? Scopri dove funziona, quali sono i limiti di scala e quali sono le evidenze scientifiche rilevanti.

Where to Study Cross-Border Digital Supply Chain Management: 7 Programs to Compare

Where to Study Cross-Border Digital Supply Chain Management: 7 Programs to Compare

Compare seven global programs for digital supply chains, logistics, analytics, global trade, and operations, with practical guidance on choosing the right fit.

Dalla fantascienza alla realtà: come la tecnologia BCI sta restituendo mobilità e parola.

Dalla fantascienza alla realtà: come la tecnologia BCI sta restituendo mobilità e parola.

Scopri come le interfacce cervello-computer decodificano i segnali neurali per ripristinare la comunicazione e il movimento, quali risultati hanno ottenuto gli studi più recenti e cosa limita ancora l'utilizzo delle BCI.

Anatomia dei droni commerciali: innovazioni hardware e volo autonomo

Anatomia dei droni commerciali: innovazioni hardware e volo autonomo

Scopri come i droni commerciali combinano sensori, intelligenza artificiale edge, batterie, sistemi di comunicazione e software di controllo del volo, e in che modo l'autonomia dipende ancora dalla missione e dalle normative.

Where Should You Study Energy Storage Engineering? 7 Battery Tech Programs Compared

Where Should You Study Energy Storage Engineering? 7 Battery Tech Programs Compared

Compare seven strong battery and energy storage master's options by materials, systems, research, industry exposure, flexibility, language, and cost trade-offs.

Progettare il cielo: come i droni industriali possono superare i limiti di batteria e carico utile

Progettare il cielo: come i droni industriali possono superare i limiti di batteria e carico utile

Scopri come la massa del carico utile, i limiti della batteria, le condizioni meteorologiche, l'efficienza della propulsione e l'architettura del velivolo influenzano l'autonomia dei droni industriali e come migliorarla.