MoE-Karten
Die Technik, nach der die App benannt ist: Mixture-of-Experts-Modelle ausführen, die größer sind als der Speicher deines Computers, indem die „Experten“ bereitgehalten werden, die du wirklich nutzt.
Die App verwendet Karten, hat eine eigene Seite dafür (siehe Die Seite MoE-Karten) und erstellt sie im Expertenmodus aus deinen eigenen Texten (siehe Eine Karte erstellen). Kommt noch: das Portal zum Teilen.
Die Idee
Ein Mixture-of-Experts-Modell hat in jeder Schicht Dutzende oder Hunderte von Experten, nutzt aber für jedes Wort nur wenige. Und es nutzt sie nicht alle gleich oft: Bei einer bestimmten Art von Text arbeitet eine kleine Gruppe von Experten fast ständig, die anderen selten.
- Profilieren. Die App lässt das Modell Texte lesen, wie du sie damit bearbeiten wirst (deine Dokumente, deinen Code), und notiert, welche Experten aktiv werden.
- Karte. Das Ergebnis ist eine Karte: welche Experten immer im Speicher bleiben und welche auf der Festplatte bleiben können.
- Klug laden. Die „heißen“ Experten bleiben im Speicher; die anderen werden nur bei Bedarf von der Festplatte gelesen. So wird ein Modell nutzbar, das größer ist als der Speicher des PCs.
Eine Karte verwenden
Eine Karte ist eine .moeplan-Datei, die für genau eine Modelldatei erstellt wurde. Lege sie in den Ordner
plans im Datenordner der App oder neben das Modell. Beim Laden des Modells findet die App die Karte selbst; ist
Expertenkarte verwenden eingeschaltet (Standard, in den Einstellungen), dann:
- sperrt sie die heißen Experten im RAM: Der Status zeigt Experten werden im RAM gesperrt…. Dabei werden Dutzende GB von der Festplatte gelesen: einige Sekunden bis etwa zwei Minuten;
- lädt sie das Modell, das diese Experten schon im Speicher vorfindet. Ist es bereit, zeigt der Status Bereit · Karte aktiv.
Eine Karte gilt nur für genau die Datei, für die sie erstellt wurde (gleicher Name, gleiche Größe): Eine andere Quantisierung desselben Modells braucht ihre eigene Karte. Die App sperrt nie mehr als deinen gesamten RAM minus den frei zu lassenden RAM aus den Einstellungen (standardmäßig 12 GB, ab 512 MB). Gibt es mehrere Karten, nimmt sie die größte, die passt: Mit Karten verschiedener Größe kann sie eine Stufe kleiner wählen, wenn du mehr freien RAM verlangst. Schlägt das Sperren fehl, startet das Modell trotzdem ohne Karte, nur langsamer, und die Einstellungen sagen dir, warum.
Selektive Treue
Für jedes Wort wählt das Modell einige Experten; manchmal liegt einer davon außerhalb der Karte, zählt aber wenig für die Antwort. Die selektive Treue nimmt stattdessen den besten Experten aus der Karte, sodass seltener von der Festplatte gelesen wird.
| Einstellung | Was sie tut |
|---|---|
| Aus | Das Modell verwendet immer die Experten, die es wählt. Am langsamsten. |
| Ausgewogen (Standard) | Ersetzt einen Experten außerhalb der Karte nur, wenn er am Rand der Auswahl des Modells liegt und einer aus der Karte fast genauso gut ist. Mehr als doppelt so schnell bei Texten, die denen der Karte ähneln; Qualität nahezu unverändert. |
| Schnell | Experten aus der Karte zählen bei der Auswahl des Modells viermal so viel. Bis etwa 2,6-mal so schnell bei Texten, die denen der Karte ähneln, bei anderen Texten sinkt die Qualität aber spürbar. Am besten mit einer Karte aus deinen eigenen Inhalten. |
In unseren Tests mit Qwen3-235B auf einem PC mit 64 GB RAM und einer 40-GB-Karte stieg die Generierung bei Texten, die denen der Karte ähneln, von etwa 1,4 Wörtern pro Sekunde mit der Karte allein auf 3,1 mit Ausgewogen und 3,6 mit Schnell. Bei anderen Texten erreichen beide etwa 2.
Die Seite MoE-Karten
In der linken Leiste zeigt MoE-Karten jedes installierte Modell mit seinen Karten: wie viel RAM sie sperren, wie viel sie abdecken und ihren Zustand (Gerade in Gebrauch, Wird beim nächsten Laden verwendet, Bereit oder Passt nicht in den Speicher mit dem gewählten freien RAM).
- Zu verwendende Karte: Gibt es mehrere Karten für dasselbe Modell, wählst du, welche verwendet wird; Automatisch (Standard) nimmt die größte, die in den Speicher passt. Eine Wahl, die nicht passt, wird nie erzwungen. Ist das Modell schon geladen, gilt die neue Karte ab dem nächsten Laden: Die Seite weist darauf hin, mit Jetzt neu laden.
- Karte importieren… prüft, ob die Datei eine gültige Karte ist, und kopiert sie in den Ordner
plans; Kartenordner öffnen öffnet ihn im Datei-Explorer. Karten in diesem Ordner lassen sich nach einer Bestätigung auch löschen. - Karten im Ordner für Modelle, die du nicht installiert hast, erscheinen separat unter Weitere Karten im Ordner.
Wählst du eine Karte aus, siehst du rechts:
- Erwartet und tatsächlich: die von der Karte erwartete Abdeckung neben der tatsächlichen, also wie viele Experten das Modell beim Arbeiten wirklich im Speicher findet. Sie aktualisiert sich live, wenn das Modell mit dieser Karte läuft. Bleibt der tatsächliche Wert unter dem erwarteten, nutzt du andere Experten als die der Karte: Eine Karte aus deinen Texten wäre besser.
- Abdeckung nach Speicher: wie viel der Arbeit die meistgenutzten Experten abdecken, je nach Speicher, den du ihnen gibst, mit dem Punkt der Karte. Das hilft bei der Wahl der Größe: Ab einem gewissen Punkt bringt mehr RAM wenig.
- Wärme der Experten: eine Zeile pro Schicht. In jeder Zeile zuerst die Experten im Speicher, vom meistgenutzten (Violett) zum am wenigsten genutzten (Cyan), dann die auf der Festplatte, dunkel: Der farbige Teil ist so lang, wie Experten dieser Schicht in der Karte sind, und man sieht sofort, worauf sich die Karte konzentriert.
Die Geschwindigkeit mit und ohne Karte, Tag für Tag, findest du in den Statistiken.
Eine Karte erstellen
Mit eingeschaltetem Expertenmodus (Einstellungen) zeigt die Seite MoE-Karten Karte erstellen…. Ein Ablauf in vier Schritten:
- Modell. Es erscheinen nur installierte Mixture-of-Experts-Modelle: Dichte Modelle brauchen keine Karte.
- Texte. Füge Ordner oder Dateien hinzu, die dem ähneln, wofür du das Modell nutzt: PDF- und Word-Dokumente, Texte, Code. Die App nimmt etwa 80 KB, verteilt über alles, und lässt erzeugte Dateien, Abhängigkeiten, Binärdateien und zu große Dateien weg. In den Texten gefundene Schlüssel, Tokens und Passwörter werden vor dem Profiling ersetzt: Die App sagt dir, in welchen Dateien sie waren, ohne ihren Wert zu zeigen.
- Profiling. Das Modell liest den Text, und die App notiert, welche Experten es für jedes Wort wählt. Ein Balken zeigt die gelesenen Token und die verbleibende Zeit; Abbrechen stoppt alles, und das Teilprofil ist schon verwendbar, mit weniger Text.
- Karte. Wähle mit einem Schieberegler, wie viel RAM sie bekommt, anhand der Kurve Abdeckung/Speicher und der erwarteten Abdeckung. Vorgeschlagen wird der größte Wert, der passt, wenn der in den Einstellungen gewählte RAM frei bleibt. Gib ihr einen Namen und drücke Karte erstellen: Sie landet im Kartenordner, und wenn du sie ausgewählt lässt, verwendet das Modell sie ab dem nächsten Laden.
Bei einem Modell, das größer als der RAM ist, dauert das Profiling ein paar Minuten bis eine halbe Stunde (auf unserem PC etwa 2,5 Minuten für 2.000 Token mit Qwen3-235B). Die CPU läuft am Anschlag, die Festplatte liest das ganze Modell, der freie RAM füllt sich mit dem Cache des Modells und ein Teil des VRAM nimmt die Attention auf. Das geladene Modell wird vorher entladen, und der Chat lässt sich bis zum Ende nicht nutzen.
Der gesammelte Text bleibt auf dem PC und wird nach dem Profiling gelöscht, was auch passiert. Das Profil .moep bleibt mit gleichem Namen neben der Karte: Damit lässt sich die Karte in einer anderen Größe ohne neues Profiling erstellen, und es enthält die Texte nicht. Eine Karte in Gebrauch hält ihren RAM gesperrt, solange das Modell geladen ist.
Die Kartendateien
| Datei | Was sie ist |
|---|---|
.moeplan | Die Karte: welche Experten im Speicher bleiben, in welcher Reihenfolge und wo sie in der Modelldatei liegen. Eine Textdatei für eine bestimmte Modelldatei (gleicher Name, gleiche Größe) und die einzige, die die App braucht. |
.moep | Das Profil: welche Experten das Modell beim Lesen der Beispieltexte gewählt hat. Es dient nur zum Erzeugen von Karten und lässt sich für Karten verschiedener Größe wiederverwenden. |
Beides sind HotMoE-Formate. Keines enthält die Texte, mit denen es erstellt wurde, nur Statistiken über die Experten: Eine Karte zu teilen verrät nichts über deine Dokumente.
Demnächst
Karten über ein Community-Portal teilen und herunterladen, nur wenn du willst.
HotMoE ist ein Projekt von Virsion. Dieses Handbuch beschreibt die App so, wie sie heute ist: Was noch kommt, ist als solches gekennzeichnet.