Cifras medidas y límites honestos

FAQ de memown

Lo que medimos, cuándo y en qué hardware, y lo que memown no hace. Cada cifra de esta página es una medición interna de ZMLabs en hardware real, y cada una está fechada.

Cifras medidas

¿Puede memown ejecutar un modelo más grande que la memoria de la tarjeta gráfica?

En una prueba interna en junio de 2026, con una versión de memown anterior a la 1.0, sí. Un modelo de la clase 120B (gpt-oss-120B, unos 63 GB) arrancó y quedó servido en un portátil con una sola tarjeta gráfica de 8 GB (RTX 4070 Laptop) y 16 GB de RAM, con Windows 11 (4 arranques correctos), leyendo la mayor parte del modelo desde su SSD. En el mismo portátil, llama.cpp solo (el motor que usa memown) generó unos 1,5 tokens por segundo: funciona, despacio. La velocidad procede de una sola ejecución. No se ha vuelto a medir con la versión 1.0.

¿Qué velocidad da un modelo 30B en una tarjeta gráfica de portátil de 8 GB?

Un modelo 30B (Qwen3-30B-A3B, 4 bits) en una tarjeta gráfica RTX 4070 Laptop con 8 GB de memoria: unos 14 a 21 tokens por segundo con un ajuste de memoria prudente, 22 como máximo con un ajuste cercano al límite de memoria. Medido en junio de 2026, internamente, con llama.cpp, antes de la versión 1.0.

¿Cuánto antes empieza la respuesta cuando se reutiliza un contexto guardado?

Reutilizar un contexto guardado en lugar de volver a leerlo hizo que el primer token de la respuesta llegara 4,0 veces antes con un contexto de 179 tokens y 14,7 veces antes con un contexto de 2048 tokens (Qwen3-30B-A3B en una tarjeta gráfica de centro de datos alquilada, NVIDIA L40S 48 GB). Se probó el guardado y la restauración de llama.cpp, el mecanismo que usa memown, directamente con llama.cpp, con 50 ejecuciones por longitud. Medido el 3 de julio de 2026, internamente.

¿Qué hace la versión 1.0 tras un reinicio?

Tras reiniciar memown, un contexto guardado se reutiliza sin volver a leerse; solo se procesa la nueva pregunta. Medido el 23 de septiembre de 2026 en Windows 11 y Ubuntu 24.04: 214 tokens guardados restaurados, 29 tokens nuevos calculados.

¿La respuesta es la misma tras un reinicio?

En la misma máquina, sí: una respuesta calculada a partir de un contexto guardado tras un reinicio es idéntica, byte a byte, a la misma respuesta calculada desde cero (5 de 5 respuestas idénticas en Windows 11 y en Ubuntu 24.04; modelo pequeño de 398 MB, sin tarjeta gráfica). Medido el 23 de septiembre de 2026.

Límites honestos

¿memown hace rápido un ordenador pequeño?

No. Cuando un modelo es mucho más grande que la memoria de la tarjeta gráfica, las respuestas son lentas. Con llama.cpp solo (el motor que usa memown), el modelo 120B generó unos 1,5 tokens por segundo en el portátil con tarjeta gráfica de 8 GB y 16 GB de RAM, y 7,6 tokens por segundo en un servidor alquilado con 188 GB de RAM (NVIDIA L40S 48 GB). Medido en junio de 2026, internamente.

¿La respuesta es idéntica en Windows y en Linux?

No. La identidad byte a byte solo vale en la misma máquina: la misma pregunta dio respuestas distintas en Windows y en Linux (medido el 23 de septiembre de 2026). Con la versión 1.0 no se ha medido con modelos grandes ni en una tarjeta gráfica.

¿memown ahorra energía?

No afirmamos nada sobre energía ni medio ambiente: no lo hemos medido.

Usar memown 1.0

¿Sale algo de tu ordenador?

Tras la instalación, nada sale de tu máquina (por diseño). En el primer inicio, memown descarga su motor (llama.cpp, desde GitHub); el archivo de modelo (.gguf) lo aportas tú, por ejemplo descargado de Hugging Face. Después, todo funciona en tu ordenador.

¿En qué sistemas funciona memown 1.0?

Windows (x64): verificado el 23 de septiembre de 2026 en una máquina Windows 11 nueva, sin tarjeta gráfica; el programa no tiene firma digital. Linux (x64): Ubuntu 24.04 o más reciente (glibc ≥ 2.38), con libgomp1 instalada; verificado en Ubuntu 24.04 el 23 de septiembre de 2026; no arranca en Ubuntu 22.04. macOS (Apple Silicon e Intel): archivos de julio de 2026, firmados y notarizados, no reverificados desde entonces.

¿Cómo se conectan las aplicaciones a memown?

Mediante una API local: un endpoint de chat compatible con OpenAI en http://127.0.0.1:8095/v1, que solo escucha en tu propio ordenador (respondió el 23 de septiembre de 2026 en Windows 11 y Ubuntu 24.04). Se inicia con memown serve --model <archivo.gguf> (en Windows: .\memown.exe serve --model <archivo.gguf>).

¿Quién midió estas cifras?

ZMLabs, internamente, en hardware real; cada cifra está fechada. Los datos brutos de las mediciones no se publican.