🏠 Accueil

Déployer un modèle localement avec Ollama ou LM Studio

Deux méthodes fiables pour télécharger et exécuter un modèle sur votre ordinateur, avec un parcours simple en GGUF et une procédure avancée de conversion si nécessaire.

Informations vérifiées le 23 juillet 2026.

Avant de commencer

Méthode 1 : Ollama

Ollama convient au terminal, aux applications locales et à une API disponible par défaut sur http://localhost:11434.

1) Installer et vérifier Ollama

Sous Linux, utilisez le script officiel puis vérifiez l’installation :

curl -fsSL https://ollama.com/install.sh | sh
ollama -v

Sous macOS ou Windows, utilisez l’installateur officiel. L’application démarre normalement le service ; sinon, lancez ollama serve. Ouvrir le guide officiel Ollama.

2) Choisir le chemin le plus simple

Si le modèle existe dans la bibliothèque Ollama, une seule commande suffit. Par exemple :

ollama run gemma3:4b

Pour un GGUF provenant de Hugging Face, continuez avec l’étape suivante.

3) Télécharger un seul GGUF depuis Hugging Face

Installez la CLI Hugging Face, puis remplacez le dépôt et le nom de fichier de l’exemple par ceux affichés dans l’onglet Files du modèle :

python3 -m pip install -U huggingface_hub
hf download publisher/model-GGUF model-Q4_K_M.gguf --local-dir ./models/mon-modele

Un dépôt public ne nécessite pas de token. Pour un dépôt privé ou gated, acceptez d’abord ses conditions puis exécutez hf auth login.

Ne placez jamais votre token directement dans un script ou une commande conservée dans l’historique.

Consulter la documentation officielle de hf download.

4) Importer le GGUF avec un Modelfile

Dans le dossier courant, créez un fichier nommé Modelfile avec le chemin relatif ou absolu du GGUF :

FROM ./models/mon-modele/model-Q4_K_M.gguf
PARAMETER num_ctx 4096

Créez ensuite le modèle et lancez-le :

ollama create mon-modele -f Modelfile
ollama run mon-modele

Évitez d’ajouter un TEMPLATE générique : un mauvais template de conversation peut dégrader fortement les réponses. Utilisez uniquement celui recommandé par l’auteur du modèle.

5) Cas d’un modèle Safetensors

Ollama peut importer directement certains modèles Safetensors complets. Le Modelfile doit alors pointer vers le dossier contenant les poids, la configuration et le tokenizer :

FROM ./models/mon-modele-safetensors

Cette importation directe est limitée aux architectures annoncées comme compatibles par Ollama. Un adaptateur LoRA nécessite une instruction ADAPTER et exactement le même modèle de base que celui utilisé pendant l’entraînement.

Vérifier les architectures et procédures prises en charge par Ollama.

Procédure avancée : convertir et quantifier avec llama.cpp

N’utilisez cette procédure que si aucun GGUF approprié n’existe et si l’architecture est prise en charge par llama.cpp. Les commandes suivantes ciblent macOS et Linux :

git clone https://github.com/ggml-org/llama.cpp.git
cd llama.cpp
python3 -m pip install -r requirements.txt
python3 convert_hf_to_gguf.py /chemin/vers/modele-safetensors --outfile ./modele-bf16.gguf --outtype bf16

cmake -B build
cmake --build build --config Release
./build/bin/llama-quantize ./modele-bf16.gguf ./modele-Q4_K_M.gguf Q4_K_M

Lire le guide officiel de conversion et quantification llama.cpp.

Méthode 2 : LM Studio

LM Studio propose une interface graphique, un catalogue Hugging Face intégré et une API locale.

1) Installer LM Studio et vérifier la compatibilité

Téléchargez la version correspondant à votre système. Vérifiez notamment la version de macOS, la prise en charge AVX2 sous Windows ou Linux x64, ainsi que la mémoire disponible.

Consulter la configuration requise pour LM Studio.

2) Télécharger depuis l’onglet Discover — méthode recommandée

  1. Ouvrez Discover et recherchez le nom du modèle, son identifiant publisher/model ou son URL Hugging Face complète.
  2. Choisissez une quantification adaptée à votre mémoire ; une variante 4 bits ou supérieure est généralement un bon point de départ.
  3. Une fois le téléchargement terminé, ouvrez Chat, chargez le modèle puis démarrez une conversation.

3) Importer un GGUF déjà téléchargé

La CLI de LM Studio propose un import interactif, actuellement signalé comme expérimental dans sa documentation :

lms import /chemin/vers/modele-Q4_K_M.gguf

Si vous effectuez l’import manuellement, conservez l’arborescence publisher/model attendue :

~/.lmstudio/models/
└── publisher/
    └── model/
        ├── model-Q4_K_M.gguf
        └── model-Q5_K_M.gguf

Les différentes quantifications d’un même modèle peuvent rester dans ce même dossier. Rafraîchissez My Models si elles n’apparaissent pas immédiatement.

Lire la procédure officielle d’import LM Studio.

En cas de problème