Chiffres mesurés et limites honnêtes

FAQ memown

Ce que nous avons mesuré, quand, sur quel matériel, et ce que memown ne fait pas. Chaque chiffre de cette page est une mesure interne de ZMLabs sur du vrai matériel, et chacun est daté.

Chiffres mesurés

memown peut-il faire tourner un modèle plus gros que la mémoire de la carte graphique ?

Lors d'un test interne en juin 2026, avec une version de memown antérieure à la 1.0 : oui. Un modèle de la classe 120B (gpt-oss-120B, environ 63 Go) a démarré et a été servi sur un portable doté d'une seule carte graphique de 8 Go (RTX 4070 Laptop) et de 16 Go de RAM, sous Windows 11 (4 démarrages réussis), en lisant l'essentiel du modèle depuis son SSD. Sur le même portable, llama.cpp seul (le moteur qu'utilise memown) a généré environ 1,5 jeton (token) par seconde : ça tourne, lentement. La vitesse vient d'une seule exécution. Ce test n'a pas été refait avec la version 1.0.

Quelle vitesse pour un modèle 30B sur une carte graphique de portable de 8 Go ?

Un modèle 30B (Qwen3-30B-A3B, 4 bits) sur une carte graphique RTX 4070 Laptop de 8 Go de mémoire : environ 14 à 21 jetons par seconde avec un réglage de mémoire prudent, 22 au mieux avec un réglage proche de la limite de mémoire. Mesuré en juin 2026, en interne, avec llama.cpp, avant la version 1.0.

De combien la réponse commence-t-elle plus tôt quand un contexte sauvegardé est réutilisé ?

Réutiliser un contexte sauvegardé au lieu de le relire a fait arriver le premier jeton de la réponse 4,0 fois plus tôt pour un contexte de 179 jetons et 14,7 fois plus tôt pour un contexte de 2 048 jetons (Qwen3-30B-A3B sur une carte graphique de datacenter louée, NVIDIA L40S 48 Go). Le test portait sur la sauvegarde et la restauration de llama.cpp, le mécanisme qu'utilise memown, essayées directement avec llama.cpp, avec 50 exécutions par longueur. Mesuré le 3 juillet 2026, en interne.

Que fait la version 1.0 après un redémarrage ?

Après un redémarrage de memown, un contexte sauvegardé est réutilisé sans être relu ; seule la nouvelle question est traitée. Mesuré le 23 septembre 2026 sous Windows 11 et Ubuntu 24.04 : 214 jetons sauvegardés restaurés, 29 nouveaux jetons calculés.

La réponse est-elle la même après un redémarrage ?

Sur la même machine, oui : une réponse calculée à partir d'un contexte sauvegardé après un redémarrage est identique, octet pour octet, à la même réponse calculée de zéro (5 réponses identiques sur 5 sous Windows 11 et sous Ubuntu 24.04 ; petit modèle de 398 Mo, sans carte graphique). Mesuré le 23 septembre 2026.

Limites honnêtes

memown rend-il rapide un petit ordinateur ?

Non. Quand un modèle est beaucoup plus gros que la mémoire de la carte graphique, les réponses sont lentes. Avec llama.cpp seul (le moteur qu'utilise memown), le modèle 120B a généré environ 1,5 jeton par seconde sur le portable à carte graphique de 8 Go et 16 Go de RAM, et 7,6 jetons par seconde sur un serveur loué doté de 188 Go de RAM (NVIDIA L40S 48 Go). Mesuré en juin 2026, en interne.

La réponse est-elle identique sous Windows et sous Linux ?

Non. L'identité à l'octet ne vaut que sur la même machine : la même question a donné des réponses différentes sous Windows et sous Linux (mesuré le 23 septembre 2026). Avec la version 1.0, elle n'a pas été mesurée avec de gros modèles ni sur une carte graphique.

memown fait-il économiser de l'énergie ?

Nous n'affirmons rien sur l'énergie ni sur l'environnement : nous ne l'avons pas mesuré.

Utiliser memown 1.0

Quelque chose quitte-t-il l'ordinateur ?

Après l'installation, rien ne quitte la machine (par conception). Au premier lancement, memown télécharge son moteur (llama.cpp, depuis GitHub) ; le fichier de modèle (.gguf) est à fournir, par exemple téléchargé sur Hugging Face. Ensuite, tout tourne sur l'ordinateur.

Sur quels systèmes tourne memown 1.0 ?

Windows (x64) : vérifié le 23 septembre 2026 sur une machine Windows 11 neuve, sans carte graphique ; le programme n'est pas signé numériquement. Linux (x64) : Ubuntu 24.04 ou plus récent (glibc ≥ 2.38), avec libgomp1 installée ; vérifié sous Ubuntu 24.04 le 23 septembre 2026 ; ne démarre pas sous Ubuntu 22.04. macOS (Apple Silicon et Intel) : archives de juillet 2026, signées et notarisées, non revérifiées depuis.

Comment les applications parlent-elles à memown ?

Par une API locale : un point d'accès de chat compatible OpenAI sur http://127.0.0.1:8095/v1, qui n'écoute que sur l'ordinateur lui-même (il a répondu le 23 septembre 2026 sous Windows 11 et Ubuntu 24.04). Démarrage : memown serve --model <fichier.gguf> (sous Windows : .\memown.exe serve --model <fichier.gguf>).

Qui a mesuré ces chiffres ?

ZMLabs, en interne, sur du vrai matériel ; chaque chiffre est daté. Les fichiers bruts des mesures ne sont pas publiés.