Quelle machine faut-il pour faire tourner une IA en local ?

Par Yamouni Noureddine · 8 juin 2026 · 0 min de lecture

La mémoire vidéo décide de presque tout. Voici comment dimensionner une machine pour exécuter un modèle de langage dans vos locaux, et comment vérifier vous-même avant d'acheter.

C'est la quantité de mémoire vidéo qui décide, bien avant la puissance du processeur. Un modèle doit tenir entièrement en mémoire pour répondre vite ; s'il déborde, la vitesse s'effondre. La règle utile : estimez la taille du modèle quantifié, ajoutez une marge pour le contexte, et vérifiez sur votre propre matériel avant d'acheter.

Pourquoi la mémoire vidéo compte plus que le reste ?

Un modèle de langage est un grand tableau de nombres qu'il faut parcourir entièrement à chaque mot produit. S'il tient dans la mémoire de la carte graphique, ce parcours est rapide. S'il déborde sur la mémoire système, chaque mot devient une attente.

C'est pourquoi une machine à processeur puissant mais à petite carte graphique répondra plus lentement qu'une machine modeste bien dimensionnée.

Comment estimer la taille d'un modèle ?

Un modèle est décrit par son nombre de paramètres — 7 milliards, 14 milliards, 70 milliards. En précision native, chaque paramètre occupe environ deux octets. La quantification réduit cette précision et fait tomber l'occupation autour d'un demi-octet par paramètre pour les formats les plus compacts.

Ajoutez ensuite de la place pour le contexte : plus vous envoyez de documents dans une question, plus il en faut. Comptez large, la marge coûte moins cher qu'un déploiement à refaire.

Quel dimensionnement pour quel usage ?

UsageTaille de modèleCe qui limite
Assistant de gestion, questions courtesPetit modèle quantifiéTient sur une carte grand public
Recherche documentaire sur un fonds interneModèle moyenLe contexte, plus que le modèle
Rédaction et analyse longuesGrand modèleLa mémoire vidéo
Plusieurs utilisateurs simultanésSelon l'usageLe nombre de requêtes en parallèle

Nous ne publions pas de tableau de références matérielles : il vieillirait en quelques mois et vous induirait en erreur. La méthode, elle, reste valable.

Comment vérifier avant d'acheter ?

Installez un moteur d'exécution local sur une machine dont vous disposez déjà, chargez un modèle quantifié, et posez-lui dix questions représentatives de votre usage réel — pas des questions de démonstration.

Mesurez deux choses : le temps avant le premier mot, et la vitesse de production ensuite. Si le premier dépasse quelques secondes sur une question simple, le modèle est trop grand pour la machine.

Cette mesure prend une après-midi et vaut tous les tableaux comparatifs.

Faut-il vraiment une carte graphique ?

Pour un petit modèle et quelques utilisateurs, un processeur récent avec beaucoup de mémoire vive suffit souvent — la réponse est plus lente mais utilisable. Dès que plusieurs personnes interrogent le système en même temps, la carte graphique devient nécessaire.

Nous évaluons la machine avant tout engagement, et il nous arrive de dire qu'un usage ne justifie pas l'investissement. Voir comment nous déployons une IA sur vos serveurs.

Mis à jour le 17 août 2026

Zone souveraine

Un projet à cadrer ?

Décrivez votre besoin en quelques lignes. Nous revenons vers vous sous 48 heures avec une proposition chiffrée.

Demander un devis Diagnostic gratuit — 30 min

Le diagnostic est un échange de trente minutes, sans engagement : nous regardons vos processus et nous vous disons franchement si un logiciel s'y justifie — y compris quand la réponse est non.

WhatsApp