Déployer un modèle localement avec Ollama ou LM Studio
Deux méthodes fiables pour télécharger et exécuter un modèle sur votre ordinateur, avec un parcours simple en GGUF et une procédure avancée de conversion si nécessaire.
Informations vérifiées le 23 juillet 2026.
Avant de commencer
- Privilégiez un GGUF déjà quantifié. Q4_K_M constitue souvent un bon point de départ, mais le meilleur choix dépend de la mémoire disponible et de la qualité souhaitée.
- Vérifiez la licence du modèle et, pour un dépôt gated, acceptez d’abord ses conditions sur Hugging Face.
- Prévoyez plus de mémoire que la seule taille du fichier : le contexte et le cache KV consomment aussi de la RAM ou de la VRAM.
- Un fichier .safetensors n’est pas automatiquement compatible : l’architecture doit être prise en charge par Ollama ou llama.cpp.
Méthode 1 : Ollama
Ollama convient au terminal, aux applications locales et à une API disponible par défaut sur http://localhost:11434.
1) Installer et vérifier Ollama
Sous Linux, utilisez le script officiel puis vérifiez l’installation :
curl -fsSL https://ollama.com/install.sh | sh
ollama -v
Sous macOS ou Windows, utilisez l’installateur officiel. L’application démarre normalement le service ; sinon, lancez ollama serve.
Ouvrir le guide officiel Ollama.
2) Choisir le chemin le plus simple
Si le modèle existe dans la bibliothèque Ollama, une seule commande suffit. Par exemple :
ollama run gemma3:4b
Pour un GGUF provenant de Hugging Face, continuez avec l’étape suivante.
3) Télécharger un seul GGUF depuis Hugging Face
Installez la CLI Hugging Face, puis remplacez le dépôt et le nom de fichier de l’exemple par ceux affichés dans l’onglet Files du modèle :
python3 -m pip install -U huggingface_hub
hf download publisher/model-GGUF model-Q4_K_M.gguf --local-dir ./models/mon-modele
Un dépôt public ne nécessite pas de token. Pour un dépôt privé ou gated, acceptez d’abord ses conditions puis exécutez hf auth login.
Ne placez jamais votre token directement dans un script ou une commande conservée dans l’historique.
4) Importer le GGUF avec un Modelfile
Dans le dossier courant, créez un fichier nommé Modelfile avec le chemin relatif ou absolu du GGUF :
FROM ./models/mon-modele/model-Q4_K_M.gguf
PARAMETER num_ctx 4096
Créez ensuite le modèle et lancez-le :
ollama create mon-modele -f Modelfile
ollama run mon-modele
Évitez d’ajouter un TEMPLATE générique : un mauvais template de conversation peut dégrader fortement les réponses. Utilisez uniquement celui recommandé par l’auteur du modèle.
5) Cas d’un modèle Safetensors
Ollama peut importer directement certains modèles Safetensors complets. Le Modelfile doit alors pointer vers le dossier contenant les poids, la configuration et le tokenizer :
FROM ./models/mon-modele-safetensors
Cette importation directe est limitée aux architectures annoncées comme compatibles par Ollama. Un adaptateur LoRA nécessite une instruction ADAPTER et exactement le même modèle de base que celui utilisé pendant l’entraînement.
Vérifier les architectures et procédures prises en charge par Ollama.
Procédure avancée : convertir et quantifier avec llama.cpp
N’utilisez cette procédure que si aucun GGUF approprié n’existe et si l’architecture est prise en charge par llama.cpp. Les commandes suivantes ciblent macOS et Linux :
git clone https://github.com/ggml-org/llama.cpp.git
cd llama.cpp
python3 -m pip install -r requirements.txt
python3 convert_hf_to_gguf.py /chemin/vers/modele-safetensors --outfile ./modele-bf16.gguf --outtype bf16
cmake -B build
cmake --build build --config Release
./build/bin/llama-quantize ./modele-bf16.gguf ./modele-Q4_K_M.gguf Q4_K_M
- La conversion et la quantification sont deux opérations distinctes.
- Ne requantifiez pas un modèle déjà quantifié : la qualité peut chuter fortement.
- Pour un modèle multimodal, un fichier de projection supplémentaire, souvent nommé mmproj, peut être requis.
Lire le guide officiel de conversion et quantification llama.cpp.
Méthode 2 : LM Studio
LM Studio propose une interface graphique, un catalogue Hugging Face intégré et une API locale.
1) Installer LM Studio et vérifier la compatibilité
Téléchargez la version correspondant à votre système. Vérifiez notamment la version de macOS, la prise en charge AVX2 sous Windows ou Linux x64, ainsi que la mémoire disponible.
2) Télécharger depuis l’onglet Discover — méthode recommandée
- Ouvrez Discover et recherchez le nom du modèle, son identifiant publisher/model ou son URL Hugging Face complète.
- Choisissez une quantification adaptée à votre mémoire ; une variante 4 bits ou supérieure est généralement un bon point de départ.
- Une fois le téléchargement terminé, ouvrez Chat, chargez le modèle puis démarrez une conversation.
3) Importer un GGUF déjà téléchargé
La CLI de LM Studio propose un import interactif, actuellement signalé comme expérimental dans sa documentation :
lms import /chemin/vers/modele-Q4_K_M.gguf
Si vous effectuez l’import manuellement, conservez l’arborescence publisher/model attendue :
~/.lmstudio/models/
└── publisher/
└── model/
├── model-Q4_K_M.gguf
└── model-Q5_K_M.gguf
Les différentes quantifications d’un même modèle peuvent rester dans ce même dossier. Rafraîchissez My Models si elles n’apparaissent pas immédiatement.
En cas de problème
- Erreur de mémoire : choisissez une quantification plus petite ou réduisez la taille du contexte.
- Modèle non reconnu : vérifiez son architecture, le fichier choisi et la version du moteur d’exécution.
- Réponses incohérentes : vérifiez le template de conversation recommandé par l’auteur du modèle.
- Exécution uniquement sur CPU : elle reste possible pour de nombreux modèles, mais elle sera généralement plus lente.