Wireva

Strata porta un LLM da 125 miliardi di parametri su PC da gaming

Un nuovo progetto open source consente di eseguire modelli linguistici di grandi dimensioni su hardware consumer, usando VRAM come cache e la RAM di sistema per gli esperti non attivi. Bastano 32 GB di RAM, 12 GB di VRAM e circa 80 GB di storage.

Un progetto open source chiamato Strata promette di eseguire un modello linguistico da 125 miliardi di parametri su un normale PC da gaming, senza ricorrere a costose farm di GPU o a servizi cloud. L'obiettivo è rendere accessibile la sperimentazione con i modelli di intelligenza artificiale generativa a chi possiede hardware di fascia consumer, pur con alcuni requisiti minimi che restano significativi.

Strata, sviluppato da un autore noto come Niko1221, supporta diverse varianti del modello Qwen3.8, incluse versioni con quantizzazioni differenti e specializzazioni per il coding. Il modello Qwen3.8-Flash-Next adotta un'architettura mixture-of-experts con 24.576 esperti di piccole dimensioni, dei quali solo dieci vengono attivati per ogni token generato. Questa caratteristica riduce il carico computazionale rispetto a un modello denso di pari dimensioni.

Il cuore dell'innovazione sta nella gestione della memoria. Strata tratta la VRAM della scheda video come una cache per il modello completo, che risiede nella RAM di sistema. Gli esperti usati più di frequente restano sulla GPU, mentre l'intera collezione rimane in memoria centrale. Inoltre, una tabella di ricerca da circa 29 GB viene mantenuta sull'SSD e consultata quando necessario. Il software sfrutta anche il meccanismo di predizione multi-token del modello per il decoding speculativo, verificando più token candidati in un solo passaggio.

Secondo il progetto, una RTX 5070 con 12 GB di VRAM può generare da 50 a 90 token al secondo, a seconda della quantizzazione. Considerando che i token non corrispondono sempre a parole intere, si tratta di una velocità rispettabile per un modello di queste dimensioni eseguito localmente. I requisiti minimi indicati sono almeno 32 GB di RAM di sistema, 12 GB di VRAM e circa 80 GB di spazio di archiviazione, quindi «modesto» è un termine relativo.

L'installazione non è priva di ostacoli. Il file setup.sh pone alcune domande al primo avvio e poi gestisce le opzioni di avvio selezionate, con tempi di caricamento che possono richiedere alcuni minuti. Sono state segnalate incompatibilità con il compilatore NVIDIA, la versione di gcc e alcune intestazioni, ma si tratta di problemi che possono variare da sistema a sistema. Una volta avviato, Strata permette di interagire tramite browser web e mette a disposizione API compatibili con OpenAI e Anthropic su localhost, così che front-end di chat, assistenti di coding e altri strumenti possano usare il modello locale senza adattamenti particolari.

Le prestazioni non sono paragonabili a quelle dei grandi modelli cloud per ogni tipo di compito. In una prova, interrogato su Hackaday, il modello ha fornito diverse informazioni corrette ma ha confuso il fondatore del sito e alcuni autori. Aumentare il «livello di pensiero» e ridurre la temperatura non ha migliorato sensibilmente la precisione, spostando piuttosto l'incertezza su altri fatti. Il modello ha invece dato risultati migliori quando gli è stato chiesto di identificare codice problematico o di delineare come portare un compilatore C su una nuova piattaforma.

Nonostante i limiti, Strata dimostra come l'architettura mixture-of-experts e una gestione intelligente della memoria possano spingere l'hardware di un normale PC da gaming ben oltre le aspettative. Modelli linguistici di questo tipo, economici e locali, possono funzionare anche su macchine più vecchie, seppure con velocità inferiori. Per chi vuole sperimentare con l'IA generativa senza dipendere da servizi esterni, il progetto offre una strada concreta, a patto di accettare qualche compromesso in termini di configurazione e precisione delle risposte.

Same event, other desks

Story file →