Mappe MoE
La tecnologia da cui prende il nome l'app: far girare modelli Mixture-of-Experts più grandi della memoria del tuo computer, tenendo pronti gli «esperti» che usi davvero.
L'app usa le mappe, ha una pagina tutta loro (v. La pagina Mappe MoE) e, con la Modalità esperti, le crea sui tuoi testi (v. Creare una mappa). In arrivo: il portale per condividerle.
L'idea
Un modello Mixture-of-Experts ha decine o centinaia di esperti per ogni strato, ma per ogni parola ne usa pochi. E non li usa tutti allo stesso modo: su un certo tipo di testo, un gruppo ristretto di esperti lavora quasi sempre, gli altri di rado.
- Profilare. L'app fa leggere al modello testi come quelli su cui lo userai (i tuoi documenti, il tuo codice) e annota quali esperti si attivano.
- Mappare. Ne esce una mappa: quali esperti tenere sempre in memoria e quali lasciare sul disco.
- Caricare con intelligenza. Gli esperti «caldi» restano in memoria; gli altri si leggono dal disco solo quando servono. Così un modello più grande della memoria del PC diventa utilizzabile.
Usare una mappa
Una mappa è un file .moeplan fatto per un file di modello preciso. Mettilo nella cartella plans dentro
la cartella dati dell'app, oppure accanto al modello. Quando carichi il modello l'app trova la mappa da sola; con Usa la
mappa degli expert attivo (di default, nelle Impostazioni):
- blocca in RAM gli expert caldi: lo stato mostra Blocco degli expert in RAM…. Si leggono dal disco decine di GB: da qualche secondo a un paio di minuti;
- carica il modello, che trova quegli expert già in memoria. Quando è pronto lo stato mostra Pronto · mappa attiva.
Una mappa vale solo per il file esatto per cui è stata fatta (stesso nome, stessa dimensione): un'altra quantizzazione dello stesso modello ha bisogno della sua mappa. L'app non blocca mai più della RAM totale meno la RAM da lasciare libera scelta nelle Impostazioni (12 GB di default, da 512 MB in su). Se ci sono più mappe sceglie la più grande che entra: tenere mappe di taglie diverse le permette di scendere di taglia quando chiedi più RAM libera. Se il blocco non riesce, il modello parte lo stesso senza mappa, solo più lento, e le Impostazioni ti dicono perché.
Fedeltà selettiva
Per ogni parola il modello sceglie pochi expert; a volte uno di questi è fuori mappa ma conta poco nella risposta. La fedeltà selettiva usa al suo posto il miglior expert in mappa, così il disco si legge meno spesso.
| Impostazione | Cosa fa |
|---|---|
| Spenta | Il modello usa sempre gli expert che sceglie. La più lenta. |
| Bilanciata (default) | Sostituisce un expert fuori mappa solo quando è al margine della scelta del modello e in mappa ce n'è uno quasi altrettanto buono. Più del doppio della velocità sui testi simili a quelli della mappa; qualità quasi invariata. |
| Veloce | Gli expert in mappa contano quattro volte tanto nella scelta del modello. Fino a circa 2,6 volte più veloce sui testi simili a quelli della mappa, ma su testi diversi la qualità cala in modo visibile. Da usare con una mappa fatta sui tuoi contenuti. |
Nelle nostre prove con Qwen3-235B su un PC con 64 GB di RAM e una mappa da 40 GB, su testi simili a quelli della mappa, la generazione è passata da circa 1,4 parole al secondo con la sola mappa a 3,1 con Bilanciata e 3,6 con Veloce. Su testi diversi entrambe arrivano a circa 2.
La pagina Mappe MoE
Nella barra a sinistra, Mappe MoE mostra ogni modello installato con le sue mappe: quanta RAM bloccano, quanto coprono e lo stato (In uso adesso, Si userà al prossimo caricamento, Pronta, oppure Non entra in memoria con la RAM libera scelta).
- Mappa da usare: con più mappe per lo stesso modello scegli quale usare; Automatica (il default) prende la più grande che entra in memoria. Una scelta che non entra non viene mai forzata. Se il modello è già caricato, la nuova mappa vale dal prossimo caricamento: la pagina lo segnala, con Ricarica ora.
- Importa una mappa… controlla che il file sia una mappa valida e lo copia nella cartella
plans; Apri la cartella delle mappe la apre in Esplora file. Le mappe di quella cartella si possono anche eliminare, con una conferma. - Le mappe della cartella fatte per modelli che non hai installato compaiono a parte, in Altre mappe nella cartella.
Selezionando una mappa, a destra vedi:
- Prevista e reale: la copertura prevista dalla mappa accanto a quella reale, cioè quanti expert il modello trova davvero in memoria mentre lavori. Si aggiorna dal vivo quando il modello gira con quella mappa. Se la reale resta sotto la prevista, stai usando expert diversi da quelli della mappa: una mappa fatta sui tuoi testi andrebbe meglio.
- Copertura per memoria: quanta parte del lavoro coprono gli expert più usati in base alla memoria che gli dai, con il punto della mappa. Aiuta a scegliere la taglia: oltre un certo punto, altra RAM aggiunge poco.
- Calore degli expert: una riga per layer. In ogni riga, prima gli expert tenuti in memoria, dal più usato (viola) al meno usato (ciano), poi quelli lasciati sul disco, scuri: la parte colorata è lunga quanti expert di quel layer sono in mappa, e si vede subito dove la mappa si concentra.
La velocità con e senza mappa, giorno per giorno, è nelle Statistiche.
Creare una mappa
Con la Modalità esperti attiva (Impostazioni), nella pagina Mappe MoE compare Crea una mappa…. Una procedura in quattro passi:
- Modello. Compaiono solo i modelli Mixture-of-Experts installati: ai modelli densi una mappa non serve.
- Testi. Aggiungi cartelle o file simili a quelli su cui userai il modello: documenti PDF e Word, testi, codice. L'app ne prende circa 80 KB, campionati su tutto, e lascia fuori file generati, dipendenze, binari e file troppo grandi. Chiavi, token e password trovati nei testi vengono sostituiti prima della profilazione: l'app ti dice in quali file erano, senza mostrarne il valore.
- Profilazione. Il modello legge il testo e l'app annota quali expert sceglie a ogni parola. Una barra mostra i token letti e il tempo che resta; Interrompi ferma tutto e il profilo parziale si può già usare, con meno testo.
- Mappa. Scegli con un cursore quanta RAM darle, guardando la curva copertura/memoria e la copertura prevista. Il valore proposto è il massimo che entra lasciando libera la RAM scelta nelle Impostazioni. Dai un nome e premi Crea la mappa: finisce nella cartella delle mappe e, se lo lasci scelto, il modello la usa dal prossimo caricamento.
Su un modello più grande della RAM la profilazione dura da qualche minuto a mezz'ora (sul nostro PC, circa 2,5 minuti per 2.000 token con Qwen3-235B). La CPU lavora al massimo, il disco legge l'intero modello, la RAM libera si riempie con la cache del modello e una parte della VRAM ospita l'attenzione. Il modello caricato viene scaricato prima di iniziare e la chat non si può usare finché non finisce.
Il testo raccolto resta sul PC e si cancella a fine profilazione, comunque vada. Accanto alla mappa resta il profilo .moep con lo stesso nome: serve a rifare la mappa di un'altra taglia senza riprofilare, e non contiene i testi. Una mappa in uso tiene bloccata la sua RAM per tutto il tempo in cui il modello è caricato.
I file delle mappe
| File | Cos'è |
|---|---|
.moeplan | La mappa: quali expert tenere in memoria, in che ordine e dove stanno nel file del modello. È un file di testo fatto per un file di modello preciso (stesso nome, stessa dimensione), ed è l'unico che serve all'app. |
.moep | Il profilo: quali expert ha scelto il modello mentre leggeva i testi di esempio. Serve solo per generare le mappe e si riusa per farne di taglie diverse. |
Sono formati di HotMoE. Nessuno dei due contiene i testi usati per crearli, solo statistiche sugli expert: condividere una mappa non rivela i tuoi documenti.
In arrivo
Condividere e scaricare mappe da un portale della comunità, solo se lo vuoi.
HotMoE è un progetto di Virsion. Questa guida descrive l'app com'è oggi: quello che è ancora in arrivo è segnato come tale.