Usar la app

Mapas MoE

La tecnología que da nombre a la app: ejecutar modelos Mixture-of-Experts más grandes que la memoria de tu ordenador, manteniendo listos los «expertos» que realmente usas.

Qué hay

La app usa los mapas, tiene una página propia para ellos (ver La página Mapas MoE) y, con el Modo experto, los crea con tus propios textos (ver Crear un mapa). Próximamente: el portal para compartirlos.

La idea

Un modelo Mixture-of-Experts tiene decenas o cientos de expertos en cada capa, pero para cada palabra usa solo unos pocos. Y no los usa todos por igual: con un tipo de texto concreto, un pequeño grupo de expertos trabaja casi todo el tiempo y los demás, rara vez.

  1. Perfilar. La app hace que el modelo lea textos como los que vas a usar con él (tus documentos, tu código) y anota qué expertos se activan.
  2. Mapear. El resultado es un mapa: qué expertos mantener siempre en memoria y cuáles dejar en el disco.
  3. Cargar con inteligencia. Los expertos «calientes» se quedan en memoria; los demás se leen del disco solo cuando hacen falta. Así, un modelo más grande que la memoria del PC se vuelve utilizable.

Usar un mapa

Un mapa es un archivo .moeplan hecho para un archivo de modelo concreto. Ponlo en la carpeta plans dentro de la carpeta de datos de la app, o junto al modelo. Al cargar el modelo, la app encuentra el mapa sola; con Usar el mapa de expertos activado (por defecto, en Ajustes):

  1. bloquea en la RAM los expertos calientes: el estado muestra Bloqueando expertos en la RAM…. Se leen del disco decenas de GB: de unos segundos a un par de minutos;
  2. carga el modelo, que encuentra esos expertos ya en memoria. Cuando está listo, el estado muestra Listo · mapa activo.

Un mapa solo vale para el archivo exacto para el que se hizo (mismo nombre, mismo tamaño): otra cuantización del mismo modelo necesita su propio mapa. La app nunca bloquea más que tu RAM total menos la RAM que dejar libre elegida en Ajustes (12 GB por defecto, desde 512 MB). Si hay varios mapas elige el más grande que cabe: tener mapas de tamaños distintos le permite bajar de tamaño cuando pides más RAM libre. Si el bloqueo falla, el modelo arranca igualmente sin mapa, solo más lento, y Ajustes te dice por qué.

Fidelidad selectiva

Para cada palabra el modelo elige unos pocos expertos; a veces uno de ellos está fuera del mapa pero cuenta poco en la respuesta. La fidelidad selectiva usa en su lugar el mejor experto del mapa, así el disco se lee menos.

AjusteQué hace
DesactivadaEl modelo usa siempre los expertos que elige. La más lenta.
Equilibrada (por defecto)Sustituye un experto fuera del mapa solo cuando está al límite de la elección del modelo y en el mapa hay uno casi igual de bueno. Más del doble de rápido con textos parecidos a los del mapa; calidad casi igual.
RápidaLos expertos del mapa cuentan cuatro veces más en la elección del modelo. Hasta unas 2,6 veces más rápido con textos parecidos a los del mapa, pero con textos distintos la calidad baja de forma visible. Mejor con un mapa hecho con tus contenidos.

En nuestras pruebas con Qwen3-235B en un PC con 64 GB de RAM y un mapa de 40 GB, con textos parecidos a los del mapa, la generación pasó de unas 1,4 palabras por segundo con solo el mapa a 3,1 con Equilibrada y 3,6 con Rápida. Con textos distintos ambas llegan a unas 2.

La página Mapas MoE

En la barra de la izquierda, Mapas MoE muestra cada modelo instalado con sus mapas: cuánta RAM bloquean, cuánto cubren y su estado (En uso ahora, Se usará en la próxima carga, Listo, o No cabe en memoria con la RAM libre elegida).

  • Mapa que usar: con varios mapas para el mismo modelo eliges cuál usar; Automático (por defecto) toma el más grande que cabe en memoria. Una elección que no cabe nunca se fuerza. Si el modelo ya está cargado, el nuevo mapa vale desde la próxima carga: la página lo indica, con Recargar ahora.
  • Importar un mapa… comprueba que el archivo sea un mapa válido y lo copia a la carpeta plans; Abrir la carpeta de los mapas la abre en el Explorador de archivos. Los mapas de esa carpeta también se pueden eliminar, tras una confirmación.
  • Los mapas de la carpeta hechos para modelos que no tienes instalados aparecen aparte, en Otros mapas en la carpeta.

Al seleccionar un mapa, a la derecha ves:

  • Prevista y real: la cobertura prevista por el mapa junto a la real, es decir, cuántos expertos encuentra de verdad el modelo en memoria mientras trabajas. Se actualiza en directo cuando el modelo funciona con ese mapa. Si la real se queda por debajo de la prevista, estás usando expertos distintos de los del mapa: un mapa hecho con tus textos iría mejor.
  • Cobertura según la memoria: qué parte del trabajo cubren los expertos más usados según la memoria que les das, con el punto del mapa. Ayuda a elegir el tamaño: a partir de cierto punto, más RAM aporta poco.
  • Calor de los expertos: una fila por capa. En cada fila, primero los expertos en memoria, del más usado (violeta) al menos usado (cian), y luego los que quedan en el disco, oscuros: la parte coloreada es tan larga como expertos de esa capa hay en el mapa, y se ve enseguida dónde se concentra el mapa.

La velocidad con y sin mapa, día a día, está en Estadísticas.

Crear un mapa

Con el Modo experto activado (Ajustes), la página Mapas MoE muestra Crear un mapa…. Un procedimiento en cuatro pasos:

  1. Modelo. Solo aparecen los modelos Mixture-of-Experts instalados: los modelos densos no necesitan mapa.
  2. Textos. Añade carpetas o archivos parecidos a aquellos con los que usarás el modelo: documentos PDF y Word, textos, código. La app toma unos 80 KB, muestreados de todo, y deja fuera archivos generados, dependencias, binarios y archivos demasiado grandes. Las claves, tokens y contraseñas encontrados en los textos se sustituyen antes del perfilado: la app te dice en qué archivos estaban, sin mostrar su valor.
  3. Perfilado. El modelo lee el texto y la app anota qué expertos elige para cada palabra. Una barra muestra los tokens leídos y el tiempo que queda; Detener lo para todo, y el perfil parcial ya se puede usar, con menos texto.
  4. Mapa. Elige con un control deslizante cuánta RAM darle, mirando la curva cobertura/memoria y la cobertura prevista. El valor propuesto es el máximo que cabe dejando libre la RAM elegida en Ajustes. Ponle un nombre y pulsa Crear el mapa: va a la carpeta de los mapas y, si lo dejas elegido, el modelo lo usa desde la próxima carga.
Mientras perfila, el PC está ocupado

En un modelo más grande que la RAM, el perfilado dura desde unos minutos hasta media hora (en nuestro PC, unos 2,5 minutos para 2.000 tokens con Qwen3-235B). La CPU trabaja al máximo, el disco lee el modelo entero, la RAM libre se llena con la caché del modelo y una parte de la VRAM aloja la atención. El modelo cargado se descarga antes de empezar y el chat no se puede usar hasta que termine.

El texto recogido se queda en el PC y se borra al terminar el perfilado, pase lo que pase. El perfil .moep queda junto al mapa con el mismo nombre: sirve para rehacer el mapa en otro tamaño sin volver a perfilar, y no contiene los textos. Un mapa en uso mantiene bloqueada su RAM mientras el modelo esté cargado.

Los archivos de los mapas

ArchivoQué es
.moeplanEl mapa: qué expertos mantener en memoria, en qué orden y dónde están en el archivo del modelo. Es un archivo de texto hecho para un archivo de modelo concreto (mismo nombre, mismo tamaño), y el único que necesita la app.
.moepEl perfil: qué expertos eligió el modelo mientras leía los textos de ejemplo. Solo sirve para generar mapas y se reutiliza para hacerlos de distintos tamaños.

Son formatos de HotMoE. Ninguno de los dos contiene los textos usados para crearlos, solo estadísticas sobre los expertos: compartir un mapa no revela tus documentos.

Próximamente

Compartir y descargar mapas desde un portal de la comunidad, solo si quieres.

HotMoE es un proyecto de Virsion. Esta guía describe la app tal como es hoy: lo que aún está por llegar se indica como tal.