Pas une plaquette. Des choses qui fonctionnent, avec leurs chiffres.
Génération d'images pour créatifs
Environnements de génération dédiés (FLUX, ComfyUI) sur
RTX 5090 32 Go : visuels d'ambiance, photographie produit,
exploration de direction artistique. En prestation, ou en marque blanche
pour les agences qui gardent la relation client.
Vos briefs et vos rendus restent sur une infrastructure française dédiée —
pas dans les serveurs d'un outil grand public. Le portfolio ci-dessus
est notre démonstration permanente.
Déploiement LLM on-premise
vLLM en production sur GPU NVIDIA Blackwell (RTX 5090),
tensor-parallel sur deux cartes. Qwen3 27B quantifié FP8,
64 k de contexte, ~76 tokens/s.
Y compris les pièges non documentés du matériel récent : architecture sm_120,
crash DeepGEMM, gestion fine de la VRAM. Peu de gens ont eu ces cartes entre
les mains. Les performances mesurées, en détail →
Fine-tuning (LoRA · PEFT)
Spécialiser un modèle léger sur votre métier et votre vocabulaire, plutôt que
de louer un gros modèle généraliste.
Sur une tâche comptable française, un 8B fine-tuné a dépassé un 27B
trois fois plus lourd — donc moins de VRAM, moins de coût, plus de précision.
Mesuré sur un jeu de test interne synthétique : la performance sur données
réelles reste à établir, et on la mesure devant vous, sur les vôtres.
RAG documentaire
Qdrant + embeddings multilingues (e5-large), indexation incrémentale et
réindexation automatique. Vos documents deviennent interrogeables sans jamais
être envoyés à un tiers.
Agents autonomes
Agent en production : mémoire persistante, serveurs MCP, tâches planifiées,
garde-fous explicites. Un agent qui propose et qu'un humain valide — pas un
agent qui décide seul.