À la une
Décodage spéculatif : quand un petit modèle accélère votre LLM
Votre modèle tient en mémoire, mais sa réponse arrive lentement. Un petit modèle peut préparer la suite du texte : voici quand cette aide fait gagner du temps.
À la une
Votre modèle tient en mémoire, mais sa réponse arrive lentement. Un petit modèle peut préparer la suite du texte : voici quand cette aide fait gagner du temps.
LeCompute décortique l'infrastructure de l'IA : GPU et silicium, mémoire HBM et interconnexions, runtimes d'inférence comme vLLM ou llama.cpp, quantification et edge AI. Des analyses techniques et des benchmarks reproductibles, du silicium au code, sans hype.
Read our articles in EnglishSilicon
Votre modèle dépasse la mémoire d’un GPU. AMD et NVIDIA proposent deux façons de lui faire de la place, mais leur capacité totale ne suffit pas à choisir.
Runtimes
Votre GPU travaille pendant qu’un autre ordinateur reste disponible. NVIDIA PAIR peut lui confier des demandes : voici quand cette répartition fait gagner du temps.
Silicon
Ryzen AI Halo et DGX Spark proposent 128 Go, mais leurs performances changent selon le modèle et le protocole. Mesures constructeur et essais indépendants audités.
Silicon
BlueField-4 et Pensando Salina ne calculent aucun token. Ils déplacent le réseau, le stockage, la sécurité et certains transferts du KV cache hors du CPU hôte. Voici le chemin de données qui peut libérer le GPU, ou seulement déplacer le goulot.
Coûts
MLPerf Endpoints mesure un service d'inférence derrière son API, sous plusieurs niveaux de charge. La version 0.7 trace enfin la courbe entre débit, TTFT, TPOT et qualité, mais ne normalise pas encore le coût.
Runtimes
MLPerf E2E-RAG chronomètre l'ingestion, la recherche, le reranking et quatre rôles LLM dans une boucle multi-hop. Son débit est comparable, mais son scénario offline et sa précision de référence à 35 % bornent le verdict.