Offre groupée KAI Inference Builder comprenant 10 agents et jusqu'à 1 000 requêtes par seconde

L'offre groupée KAI Inference Builder comprend 10 agents et jusqu'à 1 000 requêtes par seconde (abonnement d'un an, utilisation flottante dans le monde entier). Cette offre est conforme à la norme TAA.

image_produit
  • Form factor

    Software

  • License types

    Subscription

  • Performance Level

    1000 prompts per second, 10000 simulated users

Prêt pour un devis

Découvrez ce qui est inclus et explorez les options de mise à niveau disponibles auprès de Keysight.

Points forts

  • Simuler le comportement réaliste des clients IA à grande échelle afin de valider l'ensemble des infrastructures et des piles d'inférence IA.
  • Choisissez différentes instructions de personnalisation de l'IA qui ciblent les points critiques à différentes étapes du pipeline d'inférence de l'IA.
  • Validez les infrastructures d'inférence IA déployées dans le cloud public ou privé grâce à une émulation de client d'inférence entièrement virtuelle ou basée sur du matériel.
  • Évoluez jusqu'à des millions d'utilisateurs émulés tout en bénéficiant d'un contrôle précis sur le nombre de requêtes générées par seconde, pour des tests d'évolutivité de l'inférence IA sans précédent.
  • Obtenez des statistiques détaillées sur l'inférence afin d'identifier les goulots d'étranglement, les limites et les inefficacités potentiels au niveau des différents composants du pipeline d'inférence IA :
    • Calcul sur GPU
    • Systèmes de mémoire HBM / VRAM
    • Couche de cache KV et couches de stockage
    • Interconnexions PCIe et RDMA
    • Moteurs de modélisation et orchestrateurs
  • Mettre en corrélation les indicateurs côté client avec les données de télémétrie au niveau du moteur d'inférence (par exemple, les statistiques VLLM) et les données de télémétrie GPU au niveau du système (par exemple, les données DCGM) dans une vue unique synchronisée dans le temps :
    • Les invites, deuxième
    • Utilisateurs simultanés
    • Délai avant le premier jeton (TTFT) — Valeur maximale et percentiles (par exemple, P50, P90, P99)
    • Durée de vie du dernier jeton (TTLT) — Valeur maximale et percentiles (par exemple, P50, P90, P99)
    • Jetons par seconde (entrée / sortie)
    • Utilisation du cache
    • Temps de préremplissage et de décodage
    • Utilisation des Tensor Cores
    • État du planificateur
    • Consommation électrique du GPU