Meta Muse Glimmer fonctionne hors ligne sur un seul GPU, mais nécessite 24 Go de mémoire vidéo (VRAM).

Meta a lancé Muse Glimmer le 10 août, un modèle linguistique comptant environ 30 milliards de paramètres. Ce qui retient l’attention, ce n’est pas tant le modèle lui-même que sa licence et la machine sur laquelle il est destiné à fonctionner. Les poids sont disponibles sur Hugging Face sous licence Apache 2.0 ; vous pouvez donc les télécharger, les modifier et les utiliser à des fins commerciales. Et ce modèle n’est pas conçu pour fonctionner dans un centre de données, mais sur une simple carte graphique installée sous votre bureau.
Ce modèle est issu du Meta Superintelligence Lab et est dérivé du modèle plus volumineux Muse Spark, ce qui signifie qu’un grand modèle a appris à un petit modèle comment répondre. Il accepte du texte et des images en entrée mais ne produit que du texte ; il prend en charge plus de 100 langues et fonctionne avec une fenêtre contextuelle de plus de 131 000 tokens. Ses connaissances s’arrêtent au 4 janvier 2026. Les dernières versions publiées par Meta sont l’agent Muse Code et le générateur d’images Muse Image.
24 Go de VRAM constituent le seuil d’accès
À pleine précision, le modèle aurait besoin de 64 Go de mémoire vidéo. Meta le compresse à environ 4 bits grâce à la quantification, une méthode de stockage des nombres moins précise qui occupe beaucoup moins d’espace. Cela réduit la partie linguistique à moins de 20 Go, ce qui laisse de la place pour l’encodeur visuel et le cache dédié à la conversation en cours.
Deux variantes prêtes à l’emploi sont fournies avec le modèle. K-Quant-Dynamic cible 32 Go et perd en moyenne 0,2 % de précision sur 15 benchmarks, tandis que K-Quant-17GB tient dans 24 Go et perd 1,0 %. Concrètement, cela signifie une GeForce RTX 5090, RTX 4090, RTX 3090 ou un Mac équipé d’un M4 Max. Une carte de milieu de gamme de 12 Go n’est pas compatible. Si vous disposez de moins de mémoire, notre guide présente des modèles plus légers adaptés à votre ordinateur portable, et même l’iPhone est désormais capable d’exécuter un modèle linguistique utilisable.
Un accélérateur le rend trois fois plus rapide
Pour éviter que le modèle local ne soit trop lent, Meta fournit un outil d’aide appelé DFlash. Celui-ci propose 16 tokens à la fois, et le grand modèle vérifie l’ensemble du bloc en un seul passage, ne corrigeant que ce qui est erroné. D’après les mesures de Meta, le débit sur une RTX 5090 passe de 74,9 à 233,4 tokens par seconde, soit un facteur de 3,1. Un MacBook équipé d’un M5 Max passe de 26,6 à 50,2 jetons, tandis que le M4 Max passe de 23,7 à 37,8.
AMD a publié ses propres chiffres le même jour. Un mini-PC équipé d’un Ryzen AI Max+ 395 atteint jusqu’à 24 jetons par seconde et une Radeon AI PRO R9700 jusqu’à 53, mesurés sous Windows avec llama.cpp. AMD précise que ces chiffres sont préliminaires.
Performant en planification, moins performant au niveau de l’interface
Meta compare Muse Glimmer à Gemma4-31B de Google et à Qwen3.6-27B d’Alibaba. Lorsque le modèle fait appel à des outils et élabore des plans en plusieurs étapes, il se démarque clairement. Il obtient un score de 75,5 sur MCP Atlas contre 54,2 et 62,5, et de 74,6 sur DeepSearch QA contre 61,7 et 71,1.
Qwen s'impose dans d'autres domaines. En matière de pilotage d’une véritable interface de bureau, le score est de 65,9 contre 75,6 ; dans le terminal, il est de 51,7 contre 60,7. Et lors du test de sécurité Siren AgentDojo, qui mesure la facilité avec laquelle un modèle peut être manipulé par des instructions dissimulées dans des documents externes, le taux de réussite des attaques de Muse Glimmer, à 28,4 %, devance celui de Qwen mais reste inférieur à celui de Gemma4, qui s’élève à 25,6 %. Il convient de garder cela à l’esprit avant d’utiliser le modèle sur vos propres fichiers et e-mails.
Comment se le procurer
Quatre paquets sont disponibles sur Hugging Face : le modèle de base avec les poids BF16 complets, les fichiers GGUF pour llama.cpp, les versions ExecuTorch pour les appareils Apple et l’outil d’aide DFlash. Le moyen le plus simple consiste à utiliser LM Studio, où le modèle apparaît dans les résultats de recherche. AMD recommande pour cela plus de 32 Go de mémoire vidéo ou une allocation équivalente de mémoire système. Si vous disposez d’une capacité inférieure, des fournisseurs tels qu’Unsloth proposent des quantifications plus légères, mais vous devrez alors décharger une partie du modèle dans la mémoire système standard, ce qui entraîne une perte de vitesse notable. La communauté a réagi rapidement. Moins d’une journée après sa sortie, on comptait déjà 57 quantifications supplémentaires et six réglages fins disponibles. Il n’est pas possible ici de le tester dans un navigateur, comme c’était le cas avec Kimi K3. Sans le matériel adéquat, Muse Glimmer reste inaccessible.
Source(s)
Top 10
» Le Top 10 des PC portables multimédia
» Le Top 10 des PC portables de jeu
» Le Top 10 des PC portables de jeu légers
» Le Top 10 des ordinateurs portables bureautiques
» Le Top 10 des PC portables bureautiques premium/professionnels
» Le Top 10 des Stations de travail mobiles
» Le Top 10 des Ultraportables
» Le Top 10 des Ultrabooks
» Le Top 10 des Convertibles
» Le Top 10 des Tablettes
» Le Top 10 des Tablettes Windows
» Le Top 10 des Smartphones
» Le Top 10 des PC Portables á moins de 300 euros
» Le Top 10 des PC Portables á moins de 500 euros
» Le Top 25 des meilleurs écrans d'ordinateurs






