Table of Contents

32 Go sur l’étiquette ne signifient pas 32 Go disponibles pour une charge Qwen 27B. Le système, le runtime, le KV cache, le format du modèle, les pilotes et la disposition des cartes changent tous le résultat. Une carte peu chère avec assez de capacité peut tout de même perdre sur le traitement du prompt ou le temps d’installation.

Pour octobre 2026, comparez la mémoire utilisable et le travail effectué par dollar, pas le nombre de Go de VRAM seul.

Ce guide présente les moyens pratiques d’exécuter un modèle Qwen 27B en qualité 6 bits avec une fenêtre de contexte importante. Il sépare les spécifications publiées des résultats de test rapportés. Le résultat en tokens par seconde d’une personne n’est pas une propriété universelle d’un GPU.

Pourquoi viser 32 Go

Le besoin mémoire commence avec les poids. Un modèle dense de 27B lit tout son jeu de paramètres pendant la génération. En quantification 6 bits, les poids occupent environ 20,5 Go avant les allocations du runtime et la mémoire de contexte.

Un contexte de 128K tokens ajoute une grande allocation. La taille exacte du KV cache varie selon l’architecture, la précision du cache, les réglages de batch et le backend. Une estimation pratique proche de 8 Go porte le total poids-cache à environ 28,5 Go, avant la part du système et du runtime d’inférence.

ConfigurationCe qu’elle prend en charge
GPU discret de 24 GoPoids 4 bits avec contexte réduit, ou offload partiel
GPU discret de 32 GoPoids 6 bits avec une cible utile de contexte 128K
Deux GPU de 16 GoModèle réparti avec moins de marge pour le runtime
64 Go de mémoire unifiéeContextes et modèles plus grands, selon la limite d’allocation GPU

La cible de 32 Go sert au dimensionnement, pas à une garantie. Le modèle peut se charger tout en laissant trop peu de place à un long prompt, un batch plus grand, des entrées multimodales ou un second processus.

La vidéo est une référence de terrain utile

La vidéo suivante compare les principales façons d’atteindre 32 Go pour l’IA locale. Elle sert de référence pour les prix rapportés, la difficulté d’installation et les résultats d’exécution. Cet article propose une comparaison distincte fondée sur les spécifications, le comportement mémoire du modèle, le support logiciel et le coût total de possession.

La mémoire utilisable compte plus que la mémoire annoncée

Mémoire unifiée Apple

Apple silicon partage un pool entre CPU et GPU. Apple propose des Mac mini avec 32 Go de mémoire unifiée, mais tout le pool n’est pas une allocation graphique dédiée. macOS, l’application et le runtime d’inférence ont aussi besoin d’espace.

Certaines sessions llama.cpp signalent environ 22 906 Mo disponibles sur un système de 32 Go. Cela représente environ 21,3 Gio, avec peu de place pour un modèle 27B 6 bits et un grand KV cache. Le plafond exact dépend du système, du runner, de la pression mémoire et des options de lancement.

Apple silicon reste intéressant pour un système silencieux. llama.cpp traite Metal comme un backend de premier ordre. Apple évite aussi les problèmes de pilotes et de consommation de nombreuses cartes de centre de données d’occasion. Le compromis est un débit inférieur à celui d’un GPU discret haut de gamme et une marge mémoire moins prévisible.

Deux cartes de 16 Go

Deux cartes de 16 Go fournissent 32 Go de VRAM physique, mais le runtime a encore besoin de tampons par appareil et d’espace de communication. Une carte peut signaler 13,4 Go utilisés et l’autre 14,4 Go. La capacité restante ne forme pas une réserve nette de 4 Go pour le contexte.

La méthode de répartition compte aussi. Le layer splitting assigne différentes couches à différentes cartes. Il augmente la capacité, mais les cartes traversent le modèle à tour de rôle. Le tensor splitting place le travail d’une même couche sur les deux cartes. La communication augmente, mais les deux appareils contribuent davantage.

Méthode de répartitionAvantage principalCoût principal
Layer splitExtension simple de la capacitéUne carte attend souvent pendant que l’autre travaille
Tensor splitCalcul parallèle supérieur dans certaines chargesPlus de réglages et de trafic interconnexion
Offload CPU plus GPUModèles supérieurs à la VRAM totaleForte pénalité quand le CPU traite des couches fréquentes

Un projet à deux cartes demande un backend testé avant l’achat. La génération PCIe, l’espacement des slots, l’alimentation, les pilotes et la quantification exacte influencent le résultat.

Options à carte unique

RTX 5090

NVIDIA indique 32 Go de GDDR7 et 1 792 Go/s de bande passante mémoire pour la RTX 5090. Elle offre un large support CUDA, des outils matures et de nombreux frontends testés. Le tableau CUDA actuel indique une capacité de calcul 12.0.

Le prix pose problème. Une 5090 neuve offre un chemin simple vers 32 Go, mais son coût rivalise avec plusieurs mois de location d’accélérateur. Elle consomme aussi jusqu’à 575 W de puissance graphique totale, donc le système exige une alimentation et un refroidissement sérieux.

Radeon AI PRO R9700

La R9700 est une option AMD de 32 Go avec une bande passante élevée et un prix d’entrée souvent inférieur à celui de la 5090. Sa valeur dépend fortement du runtime. La voie llama.cpp par défaut donne un résultat utilisable, tandis qu’un backend communautaire plus rapide donne un résultat bien supérieur sur la même carte dans certains tests rapportés.

C’est l’exemple le plus clair du besoin de deux colonnes de vitesse. La vitesse de décodage mesure les tokens générés. La vitesse de prefill mesure la lecture du prompt avant le premier token généré. Une base de code de 50 000 tokens révèle un prefill faible même si le décodage semble acceptable.

Intel Arc Pro B70

L’Arc Pro B70 vise les charges professionnelles avec 32 Go de mémoire. Elle est intéressante pour le rapport capacité-prix, mais sa voie logicielle demande plus d’examen que le matériel CUDA. Le support GGUF standard, les builds corrigés, les réglages de tokens spéculatifs et la maturité du backend influencent le résultat.

Un prix d’achat inférieur ne compense pas les heures passées à trouver un build fonctionnel. Pour un bricoleur, ce travail fait partie du projet. Pour une station utilisée chaque jour, le support des pilotes et des applications a une valeur réelle.

Cartes de centre de données d’occasion

Tesla V100

Les Tesla V100 d’occasion de 32 Go attirent l’attention car leur prix semble bas. Le système complet coûte davantage. Une carte passive exige un flux d’air, un châssis ou carénage adapté, des adaptateurs d’alimentation et un hôte avec assez de place PCIe.

L’âge du logiciel pose aussi problème. Le tableau CUDA actuel vise les architectures plus récentes et ne liste pas la V100 dans son tableau d’architectures actuel. Vérifiez la version CUDA, la branche de pilote, le backend et le fork communautaire avant l’achat.

Budgétez un système V100 fonctionnel, pas une carte seule. Une carte affichée près de 680 dollars peut devenir un projet d’environ 1 000 dollars après refroidissement, adaptateurs et plateforme hôte. Les prix d’occasion montent aussi quand une charge IA locale populaire attire les acheteurs vers le même accélérateur retiré.

AMD Instinct MI50

La MI50 offre un prix d’occasion intéressant par gigaoctet, mais son support logiciel actuel limite fortement son usage. Une carte qui exige une ancienne pile ROCm ou un fork communautaire n’équivaut pas à une carte grand public actuelle avec support applicatif courant.

L’écart de traitement du prompt compte plus que le prix affiché. Une comparaison a mesuré environ 128 tokens par seconde sur une MI50 contre environ 2 652 tokens par seconde sur une carte récente de 32 Go. Une base de code de 50 000 tokens prendrait des minutes sur la voie lente et des secondes sur la voie rapide avant le début de la génération.

La MI50 correspond à un cas d’usage étroit. Elle convient à un constructeur qui privilégie la capacité à la vitesse interactive et accepte la maintenance des pilotes. Elle convient mal à l’analyse rapide de code quand le prefill compte.

Le logiciel fait partie du GPU

llama.cpp prend en charge CUDA, HIP, Metal, Vulkan, SYCL et d’autres backends. Il prend aussi en charge l’inférence hybride CPU-GPU et le multi-GPU. Ces fonctions ne donnent pas les mêmes performances selon le fournisseur et le format du modèle.

Une même carte physique montre souvent de grands écarts entre :

  • Un build applicatif par défaut avec des réglages prudents.
  • Un build llama.cpp réglé avec des kernels propres au backend.
  • Un fork communautaire avec prédiction spéculative ou multi-token.
  • Un format de modèle corrigé conçu pour une voie d’accélérateur.

Les résultats rapportés dans la comparaison incluent environ 27 tokens par seconde pour une voie AMD 32 Go par défaut, environ 46 tokens par seconde avec prédiction multi-token et des résultats bien supérieurs sur un backend spécialisé. Le résultat montre une marge logicielle. Il ne promet pas le même résultat après une installation neuve.

Notez le backend, le commit, le fichier modèle, la quantification, la longueur de contexte, la longueur du prompt, la taille du batch et l’état de puissance pour chaque benchmark. Sans ces champs, les tokens par seconde forment un chiffre publicitaire.

Louer plutôt qu’acheter

Louer un GPU rapide change le calcul. Un prix rapporté proche de 0,69 dollar par heure pour une RTX 5090 fait correspondre un achat à 4 400 dollars à environ 6 377 heures de location, avant l’électricité, l’hôte, la maintenance et la valeur de revente.

Cela représente près de neuf mois de location continue, ou environ deux ans à huit heures par jour. Un achat de bureau à deux cartes proche de 1 560 dollars équivaut à environ 2 261 heures au même tarif. La 5090 louée évite aussi chaleur, bruit, installation des pilotes et panne locale.

Profil d’utilisationPremier test conseillé
Quelques heures par semaineModèle hébergé ou GPU loué
Projet courtLouer une carte de classe 5090 et mesurer la charge réelle
Usage interactif quotidienAcheter après test du backend et du contexte
Agents durant la nuitLe matériel possédé devient plus facile à justifier
Données privées avec charge stableMatériel possédé avec isolation réseau

Louez avant d’acheter quand le modèle, le backend ou la longueur de contexte restent incertains. Un week-end de mesures coûte moins cher qu’un mauvais achat de station.

Recommandations d’achat

Deux RTX 5060 Ti de 16 Go

Deux cartes de 16 Go fournissent une voie CUDA pratique pour les acheteurs qui ont besoin de 32 Go et veulent des tutoriels, pilotes et frontends courants. Utilisez le tensor splitting après vérification du format et du backend. Le layer splitting est plus simple, mais laisse souvent des performances inutilisées.

Cette voie demande aussi une carte mère avec deux slots utilisables, assez de puissance et un flux d’air entre les cartes. Une paire de cartes devient une vraie station une fois le coût de la plateforme inclus.

Une carte de 32 Go

Choisissez une carte unique de 32 Go quand fiabilité, garantie et déploiement simple comptent plus que le prix mémoire minimal. La R9700 et la RTX 5090 représentent deux versions de ce choix. AMD privilégie capacité et prix. NVIDIA privilégie l’étendue logicielle et le support CUDA mature.

Une V100 ou MI50 d’occasion

Choisissez du matériel de centre de données d’occasion seulement si le projet comprend les tests de pilotes, le refroidissement et la maintenance du backend. Le prix de la carte est la première ligne du budget, pas la dernière.

Apple silicon

Choisissez un système Apple silicon de 32 Go quand silence, faible consommation au repos et bureau compact comptent plus que le débit maximal. Vérifiez la mémoire attribuée par le runner exact avant de supposer que les 32 Go sont disponibles pour le modèle.

Location cloud

Choisissez la location si la charge est occasionnelle, si le modèle change souvent ou si la réponse rapide compte plus que la possession locale. Arrêtez l’instance après le test. Le temps d’inactivité supprime vite l’avantage de prix.

Une meilleure fiche de comparaison

Avant l’achat, notez ces valeurs pour chaque candidat :

  • Mémoire modèle utilisable après le surcoût du runtime.
  • Format des poids et taille attendue du modèle.
  • Taille du KV cache à la longueur de contexte cible.
  • Vitesse de prefill pour un prompt représentatif.
  • Vitesse de décodage une fois le contexte plein.
  • Version du backend et du pilote requise pour le résultat.
  • Consommation au repos et en charge au tarif électrique local.
  • Coût de l’hôte, refroidissement, adaptateurs, stockage et garantie.
  • Équivalent en location pour le nombre d’heures prévu.

Le test le plus utile utilise un prompt de votre charge réelle. Pour le code, utilisez une base représentative. Pour la recherche, utilisez un long document avec le workflow normal de recherche ou de collage. Mesurez le temps avant le premier token, le traitement du prompt, la génération, la mémoire, la qualité et la puissance.

Recommandation finale

Achetez deux RTX 5060 Ti de 16 Go pour la configuration CUDA 32 Go la plus simple. N’utilisez le tensor split qu’après un petit test confirmant le fonctionnement du backend.

Achetez une carte unique de 32 Go pour une station plus propre. Préférez la carte avec la meilleure voie logicielle pour votre runner, pas celle qui affiche le moins de dollars par gigaoctet.

Utilisez une V100 ou une MI50 seulement si vous acceptez le projet de maintenance. Un accélérateur bon marché avec un prefill faible n’est pas une bonne affaire pour de longs prompts de code.

Louez un GPU de classe 5090 si l’usage est irrégulier. Le test de location fournit des données réelles sur la mémoire, la vitesse et le contexte avant un achat important.

La question des 32 Go n’est donc pas « Quelle carte offre le gigaoctet le moins cher ? » Elle est « Quel système laisse assez de mémoire utilisable, lit ma charge rapidement, fonctionne avec mon logiciel et justifie son prix par un usage régulier ? »

Références

Prochaines étapes

Utilisez la fiche avec un prompt représentatif avant l’achat. Comparez le temps avant le premier token, le traitement du prompt, le décodage, la mémoire, la puissance et le coût total de la plateforme. Pour un projet court, louez d’abord et conservez le résultat mesuré avec la décision d’achat.