Ajustes
Pocas opciones, pensadas para funcionar con cualquier modelo.
GeneralRazonamientoModeloMapa de expertosAceleración por GPUMemoriaRutas

Los ajustes de razonamiento y de contexto se aplican después de volver a cargar el modelo: cuando los cambias, aparece un aviso con el botón Volver a cargar el modelo (unos segundos en los modelos pequeños). El idioma cambia al momento.
General
Idioma de la interfaz: inglés, italiano, francés, alemán o español, o Automático, que sigue el idioma del sistema. El cambio es inmediato, sin reiniciar; los números, las fechas y las unidades siguen el idioma elegido. Los modelos siguen respondiendo en el idioma en que escribes.
Copiar el texto seleccionado: el texto que seleccionas en las respuestas pasa directamente al portapapeles, con un breve aviso. Desactivado, se copia solo con Ctrl+C o con el botón derecho. Se aplica al momento.
Razonamiento
- Razonar antes de responder: activado da respuestas más precisas en problemas, cálculos y código; desactivado da respuestas inmediatas, ideal para preguntas sencillas.
- Duración máxima del razonamiento: superado este límite, el modelo deja de razonar y responde. Más bajo es más rápido; más alto, más preciso en problemas difíciles.
| Duración | Tokens de razonamiento |
|---|---|
| Corto | 1024 |
| — | 2048 · 4096 |
| Estándar (predeterminado) | 8192 |
| — | 16.384 · 32.768 |
| Largo | 65.536 |
| Sin límite | El razonamiento puede durar hasta llenar el contexto: con modelos pequeños, incluso muchos minutos. La app te avisa. |
Además del razonamiento, cada respuesta tiene hasta 16.384 tokens de texto.
Modelo
- Longitud del contexto: cuánto texto recuerda el modelo, razonamiento incluido. Automático (el predeterminado) elige el contexto más largo que mantiene todo el modelo en la tarjeta gráfica, pero al menos 16K (más si lo pide el límite de razonamiento); si no, de 4096 a 262.144 tokens. Más contexto usa más memoria: un contexto fijo demasiado largo pasa partes del modelo a la CPU y lo ralentiza mucho (Qwen3.8-27B en una RTX 5080: 17 tokens/s con 16K, 10 con 64K). Mientras el modelo funciona, el botón del contexto en el chat muestra la longitud elegida. Con un mapa de expertos, la prioridad del contexto automático decide cómo repartir la memoria de la tarjeta gráfica: Velocidad (predeterminada) la da casi toda a los expertos más usados; Equilibrio se detiene cuando más expertos apenas aceleran y da el resto al contexto (en tarjetas grandes el contexto crece mucho); Contexto largo mantiene al menos 32K. Con más contexto, además, las conversaciones largas se compactan con menos frecuencia.
- Si el contexto es menor que el límite de razonamiento, la app te avisa: el modelo lo agotaría antes de responder.
- Modo experto: muestra las herramientas para crear los mapas de expertos de los modelos MoE con tus propios textos (ver Crear un mapa).
Mapa de expertos
- Usar el mapa de expertos (activado por defecto): cuando el modelo tiene un mapa, sus expertos más usados se quedan en la RAM. Ver Usar un mapa.
- RAM que dejar libre: la app nunca bloquea más que tu RAM total menos esta cantidad (de 512 MB a 32 GB, 12 GB por defecto). Solo cuenta la parte bloqueada: el resto del modelo es caché que Windows devuelve a los demás programas. Por debajo de 4 GB la app avisa de que el PC puede volverse lento.
- Fidelidad selectiva: Desactivada, Equilibrada (recomendada) o Rápida. Detalles en Fidelidad selectiva.
- VRAM para los expertos (visible en modo experto): mantiene en la tarjeta gráfica los expertos más usados del mapa, que la GPU calcula en lugar de la CPU. Automática (por defecto) usa la VRAM que queda tras el contexto elegido; también puedes fijarla de 2 a 12 GB o desactivarla. Más VRAM para los expertos significa respuestas más rápidas pero menos contexto: en Qwen3-235B con una RTX 5080 la escritura pasa de 4,1 a 5,5 tokens/s con 6 GB y a 6,1 con 8 GB. Un valor fijo que no cabe con el contexto elegido se reduce. Hace falta un mapa con la clasificación de expertos (regenerado con
build_plan.pydesde el 29/09/2026). - Debajo, la app te dice si hay un mapa para el modelo actual, cuánta RAM bloquea, si está en uso o por qué no (demasiado grande para tu RAM, bloqueo fallido).
Como el contexto, estos ajustes se aplican después de recargar el modelo. El contexto y la fidelidad también se cambian desde el chat, con el botón junto a Accesos (ver Chat).
Aceleración por GPU
Con una tarjeta NVIDIA, aquí puedes descargar el motor CUDA si no lo hiciste en el primer inicio. Más detalles en Primeros pasos.
Memoria
Recordar entre conversaciones está desactivado por defecto. Cuando lo activas, el chat puede:
- guardar notas breves sobre ti (preferencias, personas, datos recurrentes) cuando dices algo que merece la pena guardar o le pides que lo recuerde: «recuerda que mi gestor se llama Paolo Verdi». Cada nota guardada aparece en la conversación como paso Recuerda;
- buscar en tus conversaciones pasadas cuando mencionas algo de lo que ya hablasteis («¿cuánto costaba el presupuesto de la cocina?»).
Las notas guardadas entran en cada nueva conversación. En esta sección las ves todas con su fecha, añades una a mano, olvidas una (Olvidar) o todas (Olvidarlo todo). Si desactivas la memoria, el chat deja de usarlas, pero se quedan aquí hasta que las borres. Arriba en el chat, · memoria activada te recuerda que está activa.
El chat solo guarda lo que le cuentas de ti, nunca contenido de correos o archivos. Todo se queda en este ordenador.
Rutas
- Datos de la aplicación: ajustes, historial, agentes y todo lo demás. Abrir la carpeta de datos la muestra en el Explorador de archivos. Lo que contiene se explica en Privacidad y seguridad.
- Modelos: dónde están los modelos descargados.
- Motor: el motor en uso, con su tipo (Vulkan o CUDA) y su versión.
HotMoE es un proyecto de Virsion. Esta guía describe la app tal como es hoy: lo que aún está por llegar se indica como tal.