MIAR / Architetture per l’AI
Ricerca in corso
Ricerca su processori AI con memoria NAND persistente e calcolo locale
Il progetto studia architetture nelle quali i pesi di un modello AI sono conservati in memoria NAND non volatile e utilizzati da circuiti di calcolo locali. La prospettiva di ricerca comprende un’architettura chiplet NAND–CMOS e l’integrazione con memoria 3D NAND.
Obiettivo della ricerca
Esplorare un sistema autonomo capace di eseguire modelli AI da circa 7 miliardi di parametri, con una velocità obiettivo di 20 token al secondo e una potenza obiettivo di 30 watt. La ricerca deve verificare la possibilità di raggiungere questi traguardi e le condizioni necessarie per farlo.
I pesi sono i valori numerici che descrivono il comportamento appreso dal modello. Un token è un’unità di testo elaborata o generata: il numero di token al secondo indica la velocità di generazione.
Approccio
Il percorso studiato collega la conservazione persistente dei pesi al loro trasferimento e utilizzo nel calcolo. Il doppio buffer dispone due aree temporanee di memoria per organizzare l’alternanza dei dati; una unità MAC controllata esegue operazioni di moltiplicazione e accumulo.
Percorso dei dati
- NANDPesi persistenti · INT4
- Doppio bufferTrasferimento e alternanza dei dati
- MACMoltiplicazione e accumulo · attivazioni INT8
- RisultatiValori di uscita · INT32
Nel dimostratore il calcolo avviene nella FPGA. L’architettura chiplet NAND–CMOS e l’integrazione con 3D NAND sono prospettive di ricerca distinte da questo risultato.
Risultati preliminari
Risultati ottenuti in simulazione
Il dimostratore è stato verificato in simulazione su quattro matrici 16×256, con pesi INT4, attivazioni INT8 e risultati INT32. Queste sigle indicano rappresentazioni numeriche intere, rispettivamente a 4, 8 e 32 bit.
- Prove della catena
- 150
- Completate positivamente in simulazione.
- Prove con matrici non uniformi
- 16
- Completate positivamente in simulazione.
- Condizioni del modello CMOS del MAC
- 27
- Verificate positivamente nel modello simulato.
Le verifiche riguardano il dimostratore e il modello CMOS del MAC. Non dimostrano ancora l’esecuzione del modello da circa 7 miliardi di parametri, né i traguardi di 20 token/s e 30 W del processore completo.
Stato della ricerca
Simulazione, sintesi della logica FPGA e validazione sperimentale sono livelli di verifica distinti. I risultati dell’uno non sostituiscono le evidenze richieste dagli altri.
Verifiche completate
Simulazioni
Sono disponibili i risultati preliminari del dimostratore sulle quattro matrici e delle condizioni del modello CMOS del MAC descritte in questa pagina.
Esiti da documentare
Sintesi della logica FPGA
La sintesi traduce la descrizione logica in una realizzazione destinata alla FPGA. Risorse, vincoli e report di temporizzazione vanno documentati separatamente: non costituiscono misure sperimentali sul prototipo.
Ancora da svolgere
Validazione sperimentale
La realizzazione del prototipo e le misure su hardware sono le prossime verifiche necessarie. Gli obiettivi del processore completo non sono ancora dimostrati.
Prossime attività
Il passaggio dalla simulazione al prototipo servirà a verificare il funzionamento nelle condizioni effettive e a raccogliere misure confrontabili con gli obiettivi della ricerca.
Realizzazione del prototipo
Realizzare il dimostratore hardware e preparare le prove sperimentali della catena NAND, doppio buffer, MAC e risultati.
Tempi e correttezza
Verificare i tempi di trasferimento e di calcolo e misurare la correttezza dei risultati sul prototipo.
Banda, corrente ed energia
Misurare banda dei dati, corrente assorbita ed energia, mantenendo separati i risultati sperimentali dalle stime di progetto.
Interfaccia e fattibilità industriale
Studiare l’interfaccia interna NAND–CMOS e valutare la fattibilità industriale dell’architettura chiplet e dell’integrazione con 3D NAND.
Documentazione
Questa sezione è lo spazio dedicato alla documentazione della ricerca. Dossier tecnico, schemi e metodologia saranno collegati qui quando disponibili per la consultazione. Al momento non sono pubblicati file scaricabili.
Dossier tecnico
Descrizione del dimostratore, risultati preliminari, ipotesi architetturali e limiti delle verifiche.
Schemi
Percorso dei dati, organizzazione del doppio buffer e relazione fra memoria e unità di calcolo.
Metodologia
Configurazione delle matrici, formati numerici, prove della catena e condizioni del modello CMOS del MAC.
Fonti e riferimenti della ricerca
Kioxia, imec ed Europractice sono citati come riferimenti della ricerca. La citazione non attribuisce collaborazioni, affiliazioni o finanziamenti al progetto.
Confronto scientifico e tecnologico
Per richieste sulla ricerca, sulla documentazione e su possibili collaborazioni, contatta MIAR.