Utiliser l'app

Cartes MoE

La technologie qui donne son nom à l'app : faire tourner des modèles Mixture-of-Experts plus grands que la mémoire de votre ordinateur, en gardant prêts les « experts » que vous utilisez vraiment.

Ce qui est disponible

L'app utilise les cartes, leur consacre une page (voir La page Cartes MoE) et, avec le Mode expert, les crée sur vos propres textes (voir Créer une carte). Bientôt : le portail pour les partager.

L'idée

Un modèle Mixture-of-Experts compte des dizaines ou des centaines d'experts dans chaque couche, mais pour chaque mot il n'en utilise que quelques-uns. Et il ne les utilise pas tous de la même façon : sur un certain type de texte, un petit groupe d'experts travaille presque tout le temps, les autres rarement.

  1. Profiler. L'app fait lire au modèle des textes semblables à ceux sur lesquels vous l'utiliserez (vos documents, votre code) et note quels experts s'activent.
  2. Cartographier. Le résultat est une carte : quels experts garder toujours en mémoire et lesquels laisser sur le disque.
  3. Charger intelligemment. Les experts « chauds » restent en mémoire ; les autres ne sont lus depuis le disque qu'en cas de besoin. Ainsi, un modèle plus grand que la mémoire du PC devient utilisable.

Utiliser une carte

Une carte est un fichier .moeplan fait pour un fichier de modèle précis. Placez-le dans le dossier plans du dossier de données de l'app, ou à côté du modèle. Quand vous chargez le modèle, l'app trouve la carte toute seule ; avec Utiliser la carte des experts activé (par défaut, dans les Paramètres), elle :

  1. verrouille les experts chauds en RAM : l'état affiche Verrouillage des experts en RAM…. Des dizaines de Go sont lus sur le disque : de quelques secondes à deux minutes environ ;
  2. charge le modèle, qui trouve ces experts déjà en mémoire. Quand il est prêt, l'état affiche Prêt · carte active.

Une carte ne vaut que pour le fichier exact pour lequel elle a été faite (même nom, même taille) : une autre quantification du même modèle a besoin de sa propre carte. L'app ne verrouille jamais plus que votre RAM totale moins la RAM à laisser libre choisie dans les Paramètres (12 Go par défaut, à partir de 512 Mo). S'il y a plusieurs cartes, elle choisit la plus grande qui tient : garder des cartes de tailles différentes lui permet de descendre d'une taille quand vous demandez plus de RAM libre. Si le verrouillage échoue, le modèle démarre quand même sans carte, seulement plus lentement, et les Paramètres vous disent pourquoi.

Fidélité sélective

Pour chaque mot, le modèle choisit quelques experts ; parfois l'un d'eux est hors carte mais compte peu dans la réponse. La fidélité sélective utilise à sa place le meilleur expert de la carte : le disque est lu moins souvent.

RéglageCe qu'il fait
DésactivéeLe modèle utilise toujours les experts qu'il choisit. La plus lente.
Équilibrée (par défaut)Ne remplace un expert hors carte que lorsqu'il est à la limite du choix du modèle et qu'un expert de la carte est presque aussi bon. Plus de deux fois plus rapide sur des textes proches de ceux de la carte ; qualité presque inchangée.
RapideLes experts de la carte comptent quatre fois plus dans le choix du modèle. Jusqu'à environ 2,6 fois plus rapide sur des textes proches de ceux de la carte, mais sur des textes différents la qualité baisse nettement. À utiliser avec une carte faite sur vos contenus.

Dans nos essais avec Qwen3-235B sur un PC avec 64 Go de RAM et une carte de 40 Go, sur des textes proches de ceux de la carte, la génération est passée d'environ 1,4 mot par seconde avec la carte seule à 3,1 avec Équilibrée et 3,6 avec Rapide. Sur des textes différents, les deux atteignent environ 2.

La page Cartes MoE

Dans la barre de gauche, Cartes MoE affiche chaque modèle installé avec ses cartes : la RAM qu'elles verrouillent, leur couverture et leur état (Utilisée en ce moment, Utilisée au prochain chargement, Prête, ou Ne tient pas en mémoire avec la RAM libre choisie).

  • Carte à utiliser : avec plusieurs cartes pour le même modèle, choisissez laquelle utiliser ; Automatique (par défaut) prend la plus grande qui tient en mémoire. Un choix qui ne tient pas n'est jamais forcé. Si le modèle est déjà chargé, la nouvelle carte vaut à partir du prochain chargement : la page le signale, avec Recharger maintenant.
  • Importer une carte… vérifie que le fichier est une carte valide et le copie dans le dossier plans ; Ouvrir le dossier des cartes l'ouvre dans l'Explorateur de fichiers. Les cartes de ce dossier peuvent aussi être supprimées, après confirmation.
  • Les cartes du dossier faites pour des modèles que vous n'avez pas installés apparaissent à part, dans Autres cartes dans le dossier.

En sélectionnant une carte, vous voyez à droite :

  • Prévue et réelle : la couverture prévue par la carte à côté de la couverture réelle, c'est-à-dire combien d'experts le modèle trouve vraiment en mémoire pendant que vous travaillez. Elle se met à jour en direct quand le modèle tourne avec cette carte. Si la réelle reste sous la prévue, vous utilisez d'autres experts que ceux de la carte : une carte faite sur vos textes serait meilleure.
  • Couverture selon la mémoire : la part du travail couverte par les experts les plus utilisés selon la mémoire que vous leur donnez, avec le point de la carte. Elle aide à choisir la taille : au-delà d'un certain point, plus de RAM apporte peu.
  • Chaleur des experts : une ligne par couche. Dans chaque ligne, d'abord les experts gardés en mémoire, du plus utilisé (violet) au moins utilisé (cyan), puis ceux laissés sur le disque, sombres : la partie colorée est aussi longue que le nombre d'experts de cette couche dans la carte, et on voit tout de suite où la carte se concentre.

La vitesse avec et sans carte, jour par jour, se trouve dans les Statistiques.

Créer une carte

Avec le Mode expert activé (Paramètres), la page Cartes MoE affiche Créer une carte…. Une procédure en quatre étapes :

  1. Modèle. Seuls les modèles Mixture-of-Experts installés apparaissent : les modèles denses n'ont pas besoin de carte.
  2. Textes. Ajoutez des dossiers ou des fichiers semblables à ceux sur lesquels vous utiliserez le modèle : documents PDF et Word, textes, code. L'app en prend environ 80 Ko, échantillonnés sur l'ensemble, et laisse de côté les fichiers générés, les dépendances, les binaires et les fichiers trop gros. Les clés, jetons et mots de passe trouvés dans les textes sont remplacés avant le profilage : l'app vous dit dans quels fichiers ils étaient, sans en montrer la valeur.
  3. Profilage. Le modèle lit le texte et l'app note quels experts il choisit pour chaque mot. Une barre montre les tokens lus et le temps restant ; Interrompre arrête tout, et le profil partiel est déjà utilisable, avec moins de texte.
  4. Carte. Choisissez avec un curseur combien de RAM lui donner, en regardant la courbe couverture/mémoire et la couverture prévue. La valeur proposée est la plus grande qui tient en laissant libre la RAM choisie dans les Paramètres. Donnez-lui un nom et appuyez sur Créer la carte : elle va dans le dossier des cartes et, si vous la laissez choisie, le modèle l'utilise dès le prochain chargement.
Pendant le profilage, le PC est occupé

Sur un modèle plus grand que la RAM, le profilage dure de quelques minutes à une demi-heure (sur notre PC, environ 2,5 minutes pour 2 000 tokens avec Qwen3-235B). Le processeur tourne à plein, le disque lit tout le modèle, la RAM libre se remplit du cache du modèle et une partie de la VRAM accueille l'attention. Le modèle chargé est déchargé avant de commencer et le chat est inutilisable jusqu'à la fin.

Le texte collecté reste sur le PC et est effacé à la fin du profilage, quoi qu'il arrive. Le profil .moep reste à côté de la carte, avec le même nom : il permet de refaire la carte dans une autre taille sans reprofiler, et il ne contient pas les textes. Une carte en usage garde sa RAM verrouillée tant que le modèle est chargé.

Les fichiers des cartes

FichierCe que c'est
.moeplanLa carte : quels experts garder en mémoire, dans quel ordre et où ils se trouvent dans le fichier du modèle. C'est un fichier texte fait pour un fichier de modèle précis (même nom, même taille), et le seul dont l'app a besoin.
.moepLe profil : quels experts le modèle a choisis en lisant les textes d'exemple. Il sert uniquement à générer les cartes et se réutilise pour en faire de différentes tailles.

Ce sont des formats de HotMoE. Aucun des deux ne contient les textes utilisés pour les créer, seulement des statistiques sur les experts : partager une carte ne révèle pas vos documents.

Bientôt

Partager et télécharger des cartes depuis un portail communautaire, seulement si vous le souhaitez.

HotMoE est un projet Virsion. Ce guide décrit l'app telle qu'elle est aujourd'hui : ce qui est encore à venir est indiqué comme tel.