Modèles
Le modèle est le « cerveau » qui répond. HotMoE le fait tourner sur votre ordinateur : choisissez celui qui convient à votre mémoire et à ce que vous avez à faire.
OngletsCatalogueRecommandésTéléchargementVos fichiersLequel choisirMixture-of-Experts

Les deux onglets
En haut, sous le titre, il y a deux onglets :
- Mes modèles : le dossier des modèles, avec Ouvrir le dossier, et les modèles déjà sur votre ordinateur. Le nombre entre parenthèses indique combien il y en a. Si vous n'en avez aucun, Parcourir le catalogue vous mène à l'autre onglet.
- Catalogue : Recommandés pour votre PC, puis la recherche, les filtres et la liste des modèles à télécharger.
La page s'ouvre sur Mes modèles si vous avez des modèles, sinon sur Catalogue. Ouvrir un fichier GGUF… reste en haut, hors des onglets.
Catalogue
La page Modèles lit le catalogue en direct sur Hugging Face, le site où les modèles sont publiés. Elle liste les modèles GGUF republiés par unsloth, ggml-org et lmstudio-community : des éditeurs qui reconditionnent les modèles officiels. Elle affiche les plus téléchargés du mois ; le champ de recherche cherche sur Hugging Face.
Filtres
Un clic sur un filtre l'active ou le désactive : Tourne bien sur ce PC, Adapté aux agents, Voit les images, Raisonnement, Programmation, Contexte long, Mixture-of-Experts.
Les capacités sont lues dans les données du modèle lui-même :
- Adapté aux agents : le modèle prend en charge les outils et a au moins 7 milliards de paramètres environ.
- Voit les images : le dépôt contient un projecteur d'images (un fichier
mmproj), la partie qui permet au modèle de voir les images. - Mixture-of-Experts : confirmé par l'en-tête du fichier du modèle.
Ce que montre chaque fiche
- Les étiquettes de capacités, la licence et l'éditeur.
- Les paramètres (pour un Mixture-of-Experts, aussi les paramètres actifs), la longueur du contexte, les téléchargements du mois et la taille.
- Comment il tourne sur ce PC : Fluide, Utilisable, Lent, Seulement avec une carte des experts : lent ou Trop grand pour ce PC. La catégorie avec carte concerne les modèles MoE jusqu'à environ deux fois la mémoire de la RAM et de la carte graphique réunies : ils tournent avec une carte des experts, qui garde en mémoire les plus utilisés (Qwen3-235B sur une RTX 5080 avec 64 Go : de 4 à 6 tokens/s). L'estimation vient de la mémoire et de la vitesse de la RAM et de la carte graphique : c'est une indication, pas une mesure. Pour les cartes NVIDIA courantes, l'app connaît la vitesse réelle de la mémoire d'après le nom de la carte (plus basse sur les portables) ; pour les autres, elle utilise une valeur prudente.
- Version choisit la quantification, c'est-à-dire à quel point le modèle est compressé : une version plus petite demande moins de mémoire, avec une qualité un peu inférieure. Chaque fiche sélectionne déjà la meilleure version pour ce PC : la plus grande qui tourne de façon fluide, mais pas en dessous d'environ 3,5 bits par poids ; sinon, la plus grande utilisable à partir de Q4. Jamais au-delà de Q6, pour laisser un peu de mémoire libre. Si une version du modèle est déjà sur le disque, c'est celle-ci qui est sélectionnée.
- Un lien ouvre la page du modèle sur Hugging Face.
Les modèles qui demandent un compte Hugging Face ne sont pas listés. Le dernier catalogue est enregistré sur votre ordinateur : la page l'affiche tout de suite et fonctionne aussi hors ligne, avec un avis quand Hugging Face ne répond pas.
Recommandés pour votre PC
En haut de l'onglet Catalogue, jusqu'à cinq propositions parmi les modèles les plus téléchargés :
- le plus performant qui tourne de façon utilisable sur votre ordinateur ;
- le plus performant qui est déjà fluide en qualité Q4 : rapide sans baisser la qualité ;
- le meilleur pour les agents ;
- le meilleur pour les images ;
- le meilleur MoE : le plus grand Mixture-of-Experts qui tourne bien.
Un même modèle peut être proposé pour plusieurs raisons. Au premier démarrage, la page Bienvenue propose le premier modèle recommandé.
Télécharger et démarrer
- Télécharger et démarrer : un téléchargement avec progression et temps restant ; Mettre en pause et reprenez quand vous voulez, là où vous vous êtes arrêté.
- À la fin du téléchargement, l'app contrôle la taille du fichier et son empreinte SHA-256, celle publiée par Hugging Face : un fichier corrompu est supprimé.
- Les fichiers vont dans le dossier des modèles, sous éditeur/dépôt. Pour un modèle qui voit les images, le projecteur est téléchargé à côté du modèle.
- Démarrer charge un modèle déjà téléchargé. Un seul à la fois : en démarrer un autre remplace celui en cours d'utilisation.
Vos fichiers GGUF
Vous pouvez utiliser n'importe quel modèle au format GGUF, le format de modèle de llama.cpp.
- Ouvrir un fichier GGUF… charge un modèle depuis n'importe quel dossier.
- Si le dossier du GGUF que vous ouvrez contient aussi un fichier
mmproj*.gguf, l'app le charge aussi et le modèle peut voir les images. - Mes modèles liste les modèles du dossier des modèles ; les modèles découpés en plusieurs fichiers apparaissent comme un seul, avec le nombre de parties. Ouvrir le dossier l'affiche dans l'Explorateur de fichiers.
- Les paramètres de génération viennent du fichier lui-même, s'il les contient, ou de ceux recommandés pour la famille du modèle (Qwen, Gemma, gpt-oss, DeepSeek) ; sinon, ceux du moteur sont utilisés. Rien à régler à la main.
Lequel choisir
- Pour commencer : les modèles de Recommandés pour votre PC.
- Fichiers, e-mail et agents : un modèle marqué Adapté aux agents.
- Captures d'écran, photos et pages numérisées : un modèle marqué Voit les images.
- Lent ou trop grand : choisissez une Version plus petite, ou un modèle plus petit.
- Pour aller plus vite : le moteur CUDA sur les cartes NVIDIA, un contexte plus court ou le raisonnement désactivé pour les questions simples.
Mixture-of-Experts
Un modèle Mixture-of-Experts (MoE) est composé de nombreux « experts », et pour chaque mot il n'en utilise que quelques-uns. C'est pourquoi un MoE de 35 milliards de paramètres qui en active environ 3 milliards à la fois répond avec la qualité d'un grand modèle et la vitesse d'un petit. Ce sont les modèles sur lesquels travaille la technologie des Cartes MoE, bientôt disponible.
HotMoE est un projet Virsion. Ce guide décrit l'app telle qu'elle est aujourd'hui : ce qui est encore à venir est indiqué comme tel.