Usare l'app

Modelli

Il modello è il «cervello» che risponde. HotMoE lo esegue sul tuo computer: scegli quello adatto alla tua memoria e a quello che devi fare.

SchedeCatalogoConsigliatiScaricareI tuoi fileQuale scegliereMixture-of-Experts

La pagina Modelli.
La pagina Modelli.

Le due schede

In alto, sotto il titolo, ci sono due schede:

  • I miei modelli: la cartella dei modelli, con Apri cartella, e i modelli già sul tuo computer. Il numero tra parentesi dice quanti sono. Se non ne hai, Sfoglia il catalogo ti porta all'altra scheda.
  • Catalogo: Consigliati per il tuo PC, poi ricerca, filtri e l'elenco dei modelli da scaricare.

La pagina si apre su I miei modelli se hai dei modelli, altrimenti su Catalogo. Apri un file GGUF… sta in alto, fuori dalle schede.

Catalogo

La pagina Modelli legge il catalogo in diretta da Hugging Face, il sito dove sono pubblicati i modelli. Elenca i modelli GGUF ripubblicati da unsloth, ggml-org e lmstudio-community: editori che ripropongono i modelli ufficiali. Mostra i più scaricati del mese; la casella di ricerca cerca su Hugging Face.

Filtri

Un clic su un filtro lo accende o lo spegne: Gira bene su questo PC, Adatto agli agenti, Vede le immagini, Ragionamento, Programmazione, Contesto lungo, Mixture-of-Experts.

Le capacità si leggono dai dati del modello stesso:

  • Adatto agli agenti: il modello supporta gli strumenti e ha almeno 7 miliardi di parametri circa.
  • Vede le immagini: il repository ha un proiettore di immagini (un file mmproj), la parte che permette al modello di vedere le immagini.
  • Mixture-of-Experts: confermato dall'intestazione del file del modello.

Cosa mostra ogni scheda

  • Le etichette delle capacità, la licenza e l'editore.
  • Parametri (per un Mixture-of-Experts anche quelli attivi), lunghezza del contesto, download del mese e dimensione.
  • Come gira su questo PC: Scorrevole, Usabile, Lento, Solo con la mappa degli expert: lento o Troppo grande per questo PC. La fascia con la mappa riguarda i modelli MoE grandi fino a circa il doppio della memoria di RAM e scheda video insieme: girano con una mappa degli expert, che tiene in memoria quelli più usati (Qwen3-235B su una RTX 5080 con 64 GB: da 4 a 6 token/s). La stima nasce da memoria e velocità di RAM e scheda video: è un'indicazione, non una misura. Per le schede NVIDIA più diffuse l'app conosce la vera velocità della memoria dal nome della scheda (più bassa sui portatili); per le altre usa un valore prudente.
  • Versione sceglie la quantizzazione, cioè quanto è compresso il modello: una versione più piccola chiede meno memoria, con una qualità di poco inferiore. Ogni scheda seleziona già la versione migliore per questo PC: la più grande che gira in modo scorrevole, ma non sotto circa 3,5 bit per peso; altrimenti la più grande usabile da Q4 in su. Mai oltre Q6, per lasciare un po' di memoria libera. Se una versione del modello è già sul disco, viene selezionata quella.
  • Un link apre la pagina del modello su Hugging Face.

I modelli che richiedono un account Hugging Face non sono elencati. L'ultimo catalogo è salvato sul computer: la pagina lo mostra subito e funziona anche senza connessione, con un avviso quando Hugging Face non risponde.

In cima alla scheda Catalogo, fino a cinque proposte tra i modelli più scaricati:

  • il più capace che gira in modo usabile sul tuo computer;
  • il più capace che è già scorrevole in qualità Q4: veloce senza abbassare la qualità;
  • il migliore per gli agenti;
  • il migliore per le immagini;
  • il miglior MoE: il Mixture-of-Experts più grande che gira bene.

Uno stesso modello può essere proposto per più motivi. Al primo avvio la pagina Benvenuto propone il primo modello consigliato.

Scaricare e avviare

  • Scarica e avvia: download con avanzamento e tempo che manca; Metti in pausa e riprendi quando vuoi, da dove eri rimasto.
  • A fine download l'app verifica dimensione e impronta SHA-256 del file, quella pubblicata da Hugging Face: un file corrotto viene scartato.
  • I file vanno nella cartella dei modelli, in editore/repository. Per un modello che vede le immagini, il proiettore viene scaricato accanto al modello.
  • Avvia carica un modello già scaricato. Uno solo alla volta: avviarne un altro sostituisce quello in uso.

I tuoi file GGUF

Puoi usare qualunque modello in formato GGUF, il formato dei modelli per llama.cpp.

  • Apri un file GGUF… carica un modello da qualunque cartella.
  • Se nella cartella del GGUF che apri c'è anche un file mmproj*.gguf, l'app carica anche quello e il modello può vedere le immagini.
  • I miei modelli elenca i modelli nella cartella dei modelli; i modelli divisi in più file compaiono come uno solo, con il numero di parti. Apri cartella la mostra in Esplora file.
  • Le impostazioni di generazione arrivano dal file stesso, se le contiene, oppure da quelle consigliate per la famiglia del modello (Qwen, Gemma, gpt-oss, DeepSeek); altrimenti si usano quelle del motore. Non devi regolare niente a mano.

Quale scegliere

  • Per cominciare: i modelli in Consigliati per il tuo PC.
  • File, posta e agenti: un modello segnato Adatto agli agenti.
  • Screenshot, foto e pagine scansionate: un modello segnato Vede le immagini.
  • Lento o troppo grande: scegli una Versione più piccola, o un modello più piccolo.
  • Per velocizzare: il motore CUDA su schede NVIDIA, un contesto più corto o il ragionamento spento per le domande semplici.

Mixture-of-Experts

Un modello Mixture-of-Experts (MoE) è fatto di tanti «esperti», e per ogni parola ne usa solo pochi. Per questo un MoE da 35 miliardi di parametri, che ne attiva circa 3 alla volta, risponde con la qualità di un modello grande e la velocità di uno piccolo. È su questi modelli che lavora la tecnologia delle Mappe MoE, in arrivo.

HotMoE è un progetto di Virsion. Questa guida descrive l'app com'è oggi: quello che è ancora in arrivo è segnato come tale.