PC IA Persisto
PC IA Persisto
Infrastructure d'IA locale

Votre IA. Sur votre PC. Sous votre contrôle.

Un poste de calcul haute performance pour déployer des modèles d'IA, exploiter vos connaissances et connecter vos outils, tout en gardant vos données dans votre environnement.

ComposanteConfiguration
GPU (x2)2x GeForce RTX 5070 Ti 16GB GDDR6X
ProcesseurAMD Ryzen 9 9950X
Carte mèreASUS ProArt X870E-Creator WiFi
MémoireG.SKILL Flare X5 Series DDR5 RAM (AMD Expo) 64 Go (2 x 32 Go) 6000 MT/s
Stockage principalSamsung 990 Pro 2 To NVMe M.2
AlimentationCorsair HX1500i 1500W 80+ Platinum
RefroidissementARCTIC Liquid Freezer III 360 AIO
BoîtierFractal Design Torrent White

Une fondation prête pour l'IA d'entreprise

Le PC IA est conçu pour transformer vos documents et systèmes internes en un environnement d'assistance intelligent, sans dépendre exclusivement d'un service infonuagique.

PC IA Persisto

Données maîtrisées

Vos connaissances restent dans votre environnement, avec une base vectorielle et des contrôles adaptés à votre organisation.

Modèles locaux

Déployez des modèles ouverts performants pour les assistants, la recherche documentaire et l'automatisation.

Connecté à vos outils

Ajoutez des connecteurs RAG, l'authentification vocale et les intégrations nécessaires à vos processus.

Listes des modèles d'IA supportés par le PC IA Persisto.

1. Modèles exécutés à 100% sur la VRAM (Inférence ultra-rapide ⚡)

Ces modèles s'insèrent entièrement dans les 32 Go de VRAM de vos deux cartes graphiques. La vitesse de génération sera extrêmement élevée (généralement entre 40 et 80+ tokens/seconde selon la taille).

  • Modèles de taille intermédiaire non quantifiés (précision d'origine FP16/BF16) :
    • Llama 3.1 / 3.2 (8B), Mistral (7B), Phi-4 (14B), Qwen 2.5 (7B ou 14B).
    • Pourquoi c'est génial : Vous pouvez les charger en précision maximale sans aucune perte de qualité en répartissant le modèle sur vos deux GPU (environ 16-28 Go de VRAM requis).
  • Grands modèles quantifiés (quantification Q4, Q5 ou Q6, GGUF/EXL2)
    • DeepSeek-R1-Distill-Qwen-32B ou Qwen 2.5 (32B / Coder-32B) : En version quantifiée à 4 ou 5 bits (Q4_K_M ou Q5_K_M), ces modèles occupent environ 20 à 24 Go de VRAM. Ils tourneront à pleine vitesse avec assez de place pour un grand contexte de discussion (KV Cache).
    • Gemma 2 (27B) : Très performant, il tourne parfaitement en Q5 ou Q8 sur votre configuration.

Performance du système

Précision / Format d'IAUsage principal en IAPuissance totale de la machine (TOPS)
INT4 / FP4Modèles ultra-quantifiés, inférence rapide sur grand LLM~3850 à 4000+ TOPS
INT8 / FP8Inférence standard, RAG, vision, embeddings~1950 à 2000+ TOPS
FP16 / BF16Entraînement léger, Fine-tuning (LoRA), RAG complexe~950 à 1000 TFLOPS