Du calcul dense par pleines poignées
Le nerf de l'entraînement et du fine-tuning : la multiplication de matrices en BF16. Sur un seul GPU, tensor cores à plein régime.
Une image de rendu en quelques secondes
Cycles accéléré par OptiX. Une scène chargée — 25 modèles subdivisés, éclairage, 1080p — sort quasi instantanément une fois les kernels compilés.
Des LLM qui débitent
Servir un modèle de langage à plusieurs requêtes en parallèle, en local. Llama 3.1 8B sous vLLM, sur un seul GPU — sans jamais sortir de France.
Méthodologie
Matériel : un GPU NVIDIA RTX 5090 (32 Go GDDR7) du nœud de production, GPU au repos avant chaque mesure. Le tier Pro double ces capacités avec 2 GPU.
Calcul : torch.mm sur matrices 8192×8192, moyenne sur 50 itérations après chauffe, image session-ml (PyTorch 2.11+cu128).
Rendu : Blender / Cycles, périphérique OptiX, scène de 25 singes subdivisés (subsurf ×3) + sol + soleil, 1920×1080, 256 samples. Temps mesuré après compilation des kernels (image session-render).
LLM : Llama-3.1-8B-Instruct en BF16 sous vLLM 0.23, 256 tokens générés, débit agrégé sur 64 requêtes simultanées (image session-rag).
Mesures réalisées le 3 juillet 2026. Les chiffres exacts varient selon la charge, le modèle et la scène — l'ordre de grandeur, lui, est stable. Tu peux relancer ces tests toi-même dans une session.
Une station 2× RTX 5090 coûte 12 à 15 000 € à l'achat, plus l'électricité et la maintenance. Mais le matériel ne suffit pas : obtenir ces chiffres-là sur du Blackwell — architecture récente, mal documentée, pleine de pièges — est une compétence. C'est celle-là que je mets à votre service.