Usare l'app

Impostazioni

Poche scelte, pensate per valere con qualunque modello.

GeneraleRagionamentoModelloMappa degli expertAccelerazione GPUMemoriaPercorsi

Le impostazioni: lingua, ragionamento, contesto, modalità esperti e accelerazione GPU.
Le impostazioni: lingua, ragionamento, contesto, modalità esperti e accelerazione GPU.
Quando valgono

Le impostazioni del ragionamento e del contesto valgono dopo aver ricaricato il modello: quando le cambi compare l'avviso con il pulsante Ricarica il modello (pochi secondi per i modelli piccoli). La lingua invece cambia subito.

Generale

Lingua dell'interfaccia: italiano, inglese, francese, tedesco o spagnolo, oppure Automatica, che segue la lingua del sistema. Il cambio è immediato, senza riavviare; numeri, date e unità seguono la lingua scelta. I modelli rispondono comunque nella lingua in cui scrivi.

Copia il testo selezionato: il testo che selezioni nelle risposte va subito negli appunti, con un breve avviso. Spento, si copia solo con Ctrl+C o col tasto destro. Vale subito.

Ragionamento

  • Ragiona prima di rispondere: acceso dà risposte più accurate su problemi, calcoli e codice; spento dà risposte immediate, ideale per domande semplici.
  • Durata massima del ragionamento: superato il tetto, il modello smette di ragionare e risponde. Più basso è più rapido, più alto è più accurato sui problemi difficili.
DurataToken di ragionamento
Breve1.024
—2.048 · 4.096
Standard (predefinita)8.192
—16.384 · 32.768
Lungo65.536
Senza limiteIl ragionamento può durare finché riempie il contesto: con i modelli piccoli anche molti minuti. L'app te lo segnala.

Oltre al ragionamento, ogni risposta ha fino a 16.384 token di testo.

Modello

  • Lunghezza del contesto: quanto testo il modello tiene a mente, ragionamento compreso. Automatico (il default) sceglie il contesto più lungo che lascia tutto il modello nella scheda video, ma almeno 16K (di più se lo chiede il tetto al ragionamento); in alternativa da 4.096 a 262.144 token. Più contesto usa più memoria: un contesto fisso troppo lungo sposta parti del modello sulla CPU e lo rallenta molto (Qwen3.8-27B su una RTX 5080: 17 token/s con 16K, 10 con 64K). Mentre il modello gira, il pulsante del contesto nella chat mostra la lunghezza scelta. Con una mappa degli expert, la priorità del contesto automatico decide come dividere la memoria della scheda video: Velocità (default) la dà quasi tutta agli expert più usati; Equilibrio si ferma quando altri expert accelerano poco e dà il resto al contesto (sulle schede grandi il contesto cresce molto); Contesto lungo tiene almeno 32K. Con più contesto, inoltre, le conversazioni lunghe vengono compattate meno spesso.
  • Se il contesto è più piccolo del tetto al ragionamento, l'app ti avvisa: il modello lo esaurirebbe prima di rispondere.
  • Modalità esperti: mostra gli strumenti per creare le mappe degli expert dei modelli MoE sui tuoi testi (v. Creare una mappa).

Mappa degli expert

  • Usa la mappa degli expert (attivo di default): quando il modello ha una mappa, gli expert più usati restano in RAM. V. Usare una mappa.
  • RAM da lasciare libera: l'app non blocca mai più della RAM totale meno questa quantità (da 512 MB a 32 GB, 12 GB di default). Conta solo la parte bloccata: il resto del modello è cache che Windows restituisce agli altri programmi. Sotto i 4 GB l'app avvisa che il PC può diventare lento.
  • Fedeltà selettiva: Spenta, Bilanciata (consigliata) o Veloce. Dettagli in Fedeltà selettiva.
  • VRAM per gli expert (visibile in modalità esperti): tiene sulla scheda video gli expert più usati della mappa, che la GPU calcola al posto della CPU. Automatica (default) usa la VRAM che resta dopo il contesto scelto; puoi anche fissarla da 2 a 12 GB o spegnerla. Più VRAM agli expert vuol dire risposte più veloci ma meno contesto: sul Qwen3-235B con una RTX 5080 la scrittura passa da 4,1 a 5,5 token/s con 6 GB e a 6,1 con 8 GB. Un valore fisso che non entra col contesto scelto viene ridotto. Serve una mappa con la classifica degli expert (rigenerata con build_plan.py dal 29/09/2026).
  • Sotto, l'app ti dice se c'è una mappa per il modello attuale, quanta RAM blocca, se è in uso oppure perché no (troppo grande per la tua RAM, blocco non riuscito).

Come il contesto, queste impostazioni valgono dopo aver ricaricato il modello. Contesto e fedeltà si cambiano anche dalla chat, con il pulsante accanto ad Accessi (vedi Chat).

Accelerazione GPU

Con una scheda NVIDIA, qui puoi scaricare il motore CUDA se non l'hai fatto al primo avvio. Dettagli nei primi passi.

Memoria

Ricorda tra le conversazioni è spento di default. Quando lo accendi, la chat può:

  • salvare brevi ricordi su di te (preferenze, persone, fatti ricorrenti) quando dici qualcosa da tenere o le chiedi di ricordarlo: «ricorda che il mio commercialista è Paolo Verdi». Ogni ricordo salvato compare nella conversazione come passo Ricorda;
  • cercare nelle conversazioni passate quando parli di qualcosa di cui avete già parlato («quanto costava il preventivo della cucina?»).

I ricordi salvati entrano in ogni nuova conversazione. In questa sezione li vedi tutti con la data, ne aggiungi uno a mano, ne dimentichi uno (Dimentica) o tutti (Dimentica tutto). Se spegni la memoria la chat non li usa più, ma restano qui finché non li cancelli. In alto nella chat, · memoria attiva ti ricorda che è accesa.

La chat salva solo quello che le dici di te, mai il contenuto di mail o file. Tutto resta su questo computer.

Percorsi

  • Dati dell'app: impostazioni, cronologia, agenti e tutto il resto. Apri la cartella dei dati la mostra in Esplora file. Cosa contiene è spiegato in Privacy e sicurezza.
  • Modelli: dove si trovano i modelli scaricati.
  • Motore: il motore in uso, con il tipo (Vulkan o CUDA) e la versione.

HotMoE è un progetto di Virsion. Questa guida descrive l'app com'è oggi: quello che è ancora in arrivo è segnato come tale.