EPISODE · Aug 4, 2026
AirLLM : faire tourner 70B sur 4GB GPU
from IA7
AirLLM est un framework open-source qui compresse l'inférence des grands modèles (70B tokens) sur du matériel léger : une GPU 4GB suffit. La technique repose sur une pagination intelligente des poids entre la VRAM et la RAM système, avec ordonnancement des calculs pour minimiser les transferts. Selon les retours utilisateurs sur GitHub, la latence augmente (quelques secondes par token vs fractions de seconde sur GPU haute gamme), mais le coût matériel tombe de plusieurs milliers à quelques centaines d'euros. Le projet cible les cas d'usage en batch ou faible concurrence : développement local, prototypage, exécution sur machines d'occasion ou vieux laptops. Aucune quantification, aucune distillation : le modèle 70B complet s'exécute, pas une version allégée. Compatible Python, déploiement simple via pip. Limite opérationnelle : performance acceptable pour l'inférence, pas pour l'entraînement. Vitesse dépend fortement du débit RAM-GPU et du CPU. Sur SSD NVMe la pagination est plus rapide que sur disque tournant.
Embed this episode
NOW PLAYING
AirLLM : faire tourner 70B sur 4GB GPU
No transcript for this episode yet
Similar Episodes
No similar episodes found.
Similar Podcasts
No similar podcasts found.