Die App nutzen

Modelle

Das Modell ist das „Gehirn“, das antwortet. HotMoE führt es auf deinem Computer aus: Wähl das, das zu deinem Speicher und zu deinen Aufgaben passt.

TabsKatalogEmpfohlenHerunterladenDeine DateienWelches wählenMixture-of-Experts

Die Seite Modelle.
Die Seite Modelle.

Die zwei Tabs

Oben, unter dem Titel, gibt es zwei Tabs:

  • Meine Modelle: der Modellordner mit Ordner öffnen und die Modelle, die schon auf deinem Computer liegen. Die Zahl in Klammern zeigt, wie viele es sind. Hast du keine, führt dich Katalog durchsuchen zum anderen Tab.
  • Katalog: Empfohlen für deinen PC, dann Suche, Filter und die Liste der Modelle zum Herunterladen.

Die Seite öffnet sich auf Meine Modelle, wenn du Modelle hast, sonst auf Katalog. GGUF-Datei öffnen… steht oben, außerhalb der Tabs.

Katalog

Die Seite Modelle liest den Katalog live von Hugging Face, der Website, auf der die Modelle veröffentlicht werden. Sie listet GGUF-Modelle, die unsloth, ggml-org und lmstudio-community neu veröffentlichen: Anbieter, die die offiziellen Modelle neu verpacken. Angezeigt werden die meistgeladenen des Monats; das Suchfeld durchsucht Hugging Face.

Filter

Ein Klick schaltet einen Filter ein oder aus: Läuft gut auf diesem PC, Für Agenten geeignet, Sieht Bilder, Denkmodus, Programmierung, Langer Kontext, Mixture-of-Experts.

Die Fähigkeiten stammen aus den Daten des Modells selbst:

  • Für Agenten geeignet: Das Modell unterstützt Werkzeuge und hat mindestens etwa 7 Milliarden Parameter.
  • Sieht Bilder: Das Repository enthält einen Bildprojektor (eine mmproj-Datei), den Teil, mit dem das Modell Bilder sehen kann.
  • Mixture-of-Experts: bestätigt durch den Header der Modelldatei.

Was jede Karte zeigt

  • Die Fähigkeits-Tags, die Lizenz und den Anbieter.
  • Parameter (bei einem Mixture-of-Experts auch die aktiven), Kontextlänge, Downloads im Monat und Größe.
  • Wie es auf diesem PC läuft: Flüssig, Brauchbar, Langsam, Nur mit Expert-Karte: langsam oder Zu groß für diesen PC. Die Stufe mit Karte gilt für MoE-Modelle bis etwa zum Doppelten des Speichers von RAM und Grafikkarte zusammen: Sie laufen mit einer Expert-Karte, die die meistgenutzten im Speicher hält (Qwen3-235B auf einer RTX 5080 mit 64 GB: 4 bis 6 Token/s). Die Schätzung beruht auf Speicher und Geschwindigkeit von RAM und Grafikkarte: Sie ist ein Anhaltspunkt, keine Messung. Bei verbreiteten NVIDIA-Karten kennt die App die echte Speichergeschwindigkeit anhand des Kartennamens (bei Laptops niedriger); bei anderen Karten nimmt sie einen vorsichtigen Wert.
  • Version wählt die Quantisierung, also wie stark das Modell komprimiert ist: Eine kleinere Version braucht weniger Speicher, bei etwas geringerer Qualität. Jede Karte wählt schon die beste Version für diesen PC: die größte, die flüssig läuft, aber nicht unter etwa 3,5 Bit pro Gewicht; sonst die größte brauchbare ab Q4. Nie über Q6, damit etwas Speicher frei bleibt. Liegt schon eine Version des Modells auf der Festplatte, wird diese gewählt.
  • Ein Link öffnet die Seite des Modells auf Hugging Face.

Modelle, für die man ein Hugging-Face-Konto braucht, werden nicht aufgeführt. Der letzte Katalog wird auf deinem Computer gespeichert: Die Seite zeigt ihn sofort und funktioniert auch offline, mit einem Hinweis, wenn Hugging Face nicht antwortet.

Oben im Tab Katalog stehen bis zu fünf Vorschläge aus den meistgeladenen Modellen:

  • das leistungsfähigste, das auf deinem Computer brauchbar läuft;
  • das leistungsfähigste, das schon in Q4-Qualität flüssig läuft: schnell, ohne die Qualität zu senken;
  • das beste für Agenten;
  • das beste für Bilder;
  • das beste MoE: das größte Mixture-of-Experts, das gut läuft.

Dasselbe Modell kann aus mehreren Gründen vorgeschlagen werden. Beim ersten Start bietet die Seite Willkommen das erste empfohlene Modell an.

Herunterladen und starten

  • Herunterladen und starten: ein Download mit Fortschritt und Restzeit; Pausieren und fortsetzen, wann du willst, ab der Stelle, an der du aufgehört hast.
  • Am Ende des Downloads prüft die App Größe und SHA-256-Fingerabdruck der Datei, den Hugging Face veröffentlicht: Eine beschädigte Datei wird verworfen.
  • Die Dateien landen im Modellordner unter Anbieter/Repository. Bei einem Modell, das Bilder sieht, wird der Projektor neben das Modell heruntergeladen.
  • Starten lädt ein bereits heruntergeladenes Modell. Immer nur eines: Startest du ein anderes, ersetzt es das aktuelle.

Deine GGUF-Dateien

Du kannst jedes Modell im Format GGUF nutzen, dem Modellformat von llama.cpp.

  • GGUF-Datei öffnen… lädt ein Modell aus einem beliebigen Ordner.
  • Liegt im Ordner der GGUF-Datei, die du öffnest, auch eine Datei mmproj*.gguf, lädt die App sie mit, und das Modell kann Bilder sehen.
  • Meine Modelle listet die Modelle im Modellordner auf; Modelle, die in mehrere Dateien aufgeteilt sind, erscheinen als eines, mit der Anzahl der Teile. Ordner öffnen zeigt ihn im Datei-Explorer.
  • Die Einstellungen für die Textgenerierung kommen aus der Datei selbst, wenn sie welche enthält, oder aus den Empfehlungen für die Modellfamilie (Qwen, Gemma, gpt-oss, DeepSeek); sonst gelten die der Engine. Du musst nichts von Hand einstellen.

Welches du wählen solltest

  • Für den Anfang: die Modelle unter Empfohlen für deinen PC.
  • Dateien, E-Mail und Agenten: ein Modell mit der Markierung Für Agenten geeignet.
  • Screenshots, Fotos und gescannte Seiten: ein Modell mit der Markierung Sieht Bilder.
  • Langsam oder zu groß: Wähl eine kleinere Version oder ein kleineres Modell.
  • Für mehr Tempo: die CUDA-Engine bei NVIDIA-Karten, ein kürzerer Kontext oder ausgeschaltete Überlegungen bei einfachen Fragen.

Mixture-of-Experts

Ein Mixture-of-Experts-Modell (MoE) besteht aus vielen „Experten“ und nutzt für jedes Wort nur wenige davon. Deshalb antwortet ein MoE mit 35 Milliarden Parametern, das jeweils etwa 3 Milliarden aktiviert, mit der Qualität eines großen Modells und der Geschwindigkeit eines kleinen. Mit genau diesen Modellen arbeitet die Technik der MoE-Karten, die bald kommt.

HotMoE ist ein Projekt von Virsion. Dieses Handbuch beschreibt die App so, wie sie heute ist: Was noch kommt, ist als solches gekennzeichnet.