Capitalisation boursière: $2.5825T -3.89%
Volume(24h): $122.7307B -31.11%
  • Capitalisation boursière: $2.5825T -3.89%
  • Volume(24h): $122.7307B -31.11%
  • Indice de peur et de cupidité:
  • Capitalisation boursière: $2.5825T -3.89%
Cryptos
Les sujets
Cryptospedia
Nouvelles
Cryptosopique
Vidéos
Top nouvelles
Cryptos
Les sujets
Cryptospedia
Nouvelles
Cryptosopique
Vidéos
bitcoin
bitcoin

$76009.435780 USD

-1.53%

ethereum
ethereum

$2375.311573 USD

-2.24%

tether
tether

$0.999942 USD

0.01%

bnb
bnb

$682.047535 USD

-2.01%

xrp
xrp

$1.441787 USD

-5.55%

usd-coin
usd-coin

$1.000052 USD

0.00%

solana
solana

$92.061879 USD

-1.80%

tron
tron

$0.342038 USD

-0.93%

hyperliquid
hyperliquid

$77.587999 USD

-1.41%

dogecoin
dogecoin

$0.089327 USD

-2.08%

zcash
zcash

$782.134934 USD

-0.71%

unus-sed-leo
unus-sed-leo

$9.484522 USD

0.92%

chainlink
chainlink

$11.132242 USD

-5.45%

monero
monero

$431.110612 USD

0.39%

cardano
cardano

$0.214545 USD

-7.12%

Articles d’actualité sur les crypto-monnaies

NVIDIA GH200 NVL32 : révolutionner les performances du délai d'obtention du premier jeton pour les applications d'IA en temps réel

Sep 27, 2024 at 06:00 pm

Le dernier système GH200 NVL32 de NVIDIA démontre un bond remarquable en termes de performances de délai d'obtention du premier jeton (TTFT), répondant aux besoins croissants des grands modèles de langage (LLM) tels que Llama 3.1 et 3.2.

NVIDIA GH200 NVL32 : révolutionner les performances du délai d'obtention du premier jeton pour les applications d'IA en temps réel

NVIDIA's latest GH200 NVL32 system demonstrates a remarkable leap in time-to-first-token (TTFT) performance, addressing the growing needs of large language models (LLMs) such as Llama 3.1 and 3.2. According to the NVIDIA Technical Blog, this system is set to significantly impact real-time applications like interactive speech bots and coding assistants.

Le dernier système GH200 NVL32 de NVIDIA démontre un bond remarquable en termes de performances de délai d'obtention du premier jeton (TTFT), répondant aux besoins croissants des grands modèles de langage (LLM) tels que Llama 3.1 et 3.2. Selon le blog technique NVIDIA, ce système devrait avoir un impact significatif sur les applications en temps réel telles que les robots vocaux interactifs et les assistants de codage.

TTFT is the time it takes for an LLM to process a user prompt and begin generating a response. As LLMs grow in complexity, with models like Llama 3.1 now featuring hundreds of billions of parameters, the need for faster TTFT becomes critical. This is particularly true for applications requiring immediate responses, such as AI-driven customer support and digital assistants.

TTFT est le temps nécessaire à un LLM pour traiter une invite utilisateur et commencer à générer une réponse. À mesure que les LLM deviennent de plus en plus complexes, avec des modèles comme Llama 3.1 comportant désormais des centaines de milliards de paramètres, le besoin d'un TTFT plus rapide devient critique. Cela est particulièrement vrai pour les applications nécessitant des réponses immédiates, telles que le support client basé sur l'IA et les assistants numériques.

NVIDIA's GH200 NVL32 system, powered by 32 NVIDIA GH200 Grace Hopper Superchips and connected via the NVLink Switch system, is designed to meet these demands. The system leverages TensorRT-LLM improvements to deliver outstanding TTFT for long-context inference, making it ideal for the latest Llama 3.1 models.

Le système GH200 NVL32 de NVIDIA, alimenté par 32 superpuces NVIDIA GH200 Grace Hopper et connecté via le système NVLink Switch, est conçu pour répondre à ces demandes. Le système exploite les améliorations de TensorRT-LLM pour fournir un TTFT exceptionnel pour l'inférence à contexte long, ce qui le rend idéal pour les derniers modèles Llama 3.1.

Applications like AI speech bots and digital assistants require TTFT in the range of a few hundred milliseconds to simulate natural, human-like conversations. For instance, a TTFT of half a second is significantly more user-friendly than a TTFT of five seconds. Fast TTFT is particularly crucial for services that rely on up-to-date information, such as agentic workflows that use Retrieval-Augmented Generation (RAG) to enhance LLM prompts with relevant data.

Des applications telles que les robots vocaux IA et les assistants numériques nécessitent un TTFT de l'ordre de quelques centaines de millisecondes pour simuler des conversations naturelles et semblables à celles des humains. Par exemple, un TTFT d’une demi-seconde est nettement plus convivial qu’un TTFT de cinq secondes. Le TTFT rapide est particulièrement crucial pour les services qui s'appuient sur des informations à jour, tels que les flux de travail agents qui utilisent la génération de récupération augmentée (RAG) pour améliorer les invites LLM avec des données pertinentes.

The NVIDIA GH200 NVL32 system achieves the fastest published TTFT for Llama 3.1 models, even with extensive context lengths. This performance is essential for real-time applications that demand quick and accurate responses.

Le système NVIDIA GH200 NVL32 atteint le TTFT publié le plus rapide pour les modèles Llama 3.1, même avec des longueurs de contexte étendues. Ces performances sont essentielles pour les applications en temps réel qui exigent des réponses rapides et précises.

The GH200 NVL32 system connects 32 NVIDIA GH200 Grace Hopper Superchips, each combining an NVIDIA Grace CPU and an NVIDIA Hopper GPU via NVLink-C2C. This setup allows for high-bandwidth, low-latency communication, essential for minimizing synchronization time and maximizing compute performance. The system delivers up to 127 petaFLOPs of peak FP8 AI compute, significantly reducing TTFT for demanding models with long contexts.

Le système GH200 NVL32 connecte 32 superpuces NVIDIA GH200 Grace Hopper, chacune combinant un processeur NVIDIA Grace et un GPU NVIDIA Hopper via NVLink-C2C. Cette configuration permet une communication à large bande passante et à faible latence, essentielle pour minimiser le temps de synchronisation et maximiser les performances de calcul. Le système fournit jusqu'à 127 pétaFLOP de calcul IA FP8 de pointe, réduisant considérablement le TTFT pour les modèles exigeants avec des contextes longs.

For example, the system can achieve a TTFT of just 472 milliseconds for Llama 3.1 70B with an input sequence length of 32,768 tokens. Even for more complex models like Llama 3.1 405B, the system provides a TTFT of about 1.6 seconds using a 32,768-token input.

Par exemple, le système peut atteindre un TTFT de seulement 472 millisecondes pour Llama 3.1 70B avec une longueur de séquence d'entrée de 32 768 jetons. Même pour les modèles plus complexes comme le Llama 3.1 405B, le système fournit un TTFT d'environ 1,6 seconde en utilisant une entrée de 32 768 jetons.

Inference continues to be a hotbed of innovation, with advancements in serving techniques, runtime optimizations, and more. Techniques like in-flight batching, speculative decoding, and FlashAttention are enabling more efficient and cost-effective deployments of powerful AI models.

L'inférence continue d'être un foyer d'innovation, avec des progrès dans les techniques de service, les optimisations d'exécution, et bien plus encore. Des techniques telles que le traitement par lots en vol, le décodage spéculatif et FlashAttention permettent des déploiements plus efficaces et plus rentables de modèles d'IA puissants.

NVIDIA's accelerated computing platform, supported by a vast ecosystem of developers and a broad installed base of GPUs, is at the forefront of these innovations. The platform's compatibility with the CUDA programming model and deep engagement with the developer community ensure rapid advancements in AI capabilities.

La plateforme de calcul accéléré de NVIDIA, soutenue par un vaste écosystème de développeurs et une large base installée de GPU, est à l'avant-garde de ces innovations. La compatibilité de la plateforme avec le modèle de programmation CUDA et l'engagement profond avec la communauté des développeurs garantissent des progrès rapides dans les capacités de l'IA.

Looking ahead, the NVIDIA Blackwell GB200 NVL72 platform promises even greater advancements. With second-generation Transformer Engine and fifth-generation Tensor Cores, Blackwell delivers up to 20 petaFLOPs of FP4 AI compute, significantly enhancing performance. The platform's fifth-generation NVLink provides 1,800 GB/s of GPU-to-GPU bandwidth, expanding the NVLink domain to 72 GPUs.

Pour l’avenir, la plate-forme NVIDIA Blackwell GB200 NVL72 promet des avancées encore plus importantes. Avec Transformer Engine de deuxième génération et Tensor Cores de cinquième génération, Blackwell fournit jusqu'à 20 pétaFLOP de calcul FP4 AI, améliorant considérablement les performances. Le NVLink de cinquième génération de la plate-forme fournit 1 800 Go/s de bande passante GPU à GPU, étendant le domaine NVLink à 72 GPU.

As AI models continue to grow and agentic workflows become more prevalent, the need for high-performance, low-latency computing solutions like the GH200 NVL32 and Blackwell GB200 NVL72 will only increase. NVIDIA's ongoing innovations ensure that the company remains at the forefront of AI and accelerated computing.

À mesure que les modèles d'IA continuent de croître et que les flux de travail agents deviennent plus répandus, le besoin de solutions informatiques hautes performances et à faible latence comme le GH200 NVL32 et le Blackwell GB200 NVL72 ne fera qu'augmenter. Les innovations continues de NVIDIA garantissent que l'entreprise reste à la pointe de l'IA et du calcul accéléré.

Source primaire:blockchain

Clause de non-responsabilité:info@kdj.com

Les informations fournies ne constituent pas des conseils commerciaux. kdj.com n’assume aucune responsabilité pour les investissements effectués sur la base des informations fournies dans cet article. Les crypto-monnaies sont très volatiles et il est fortement recommandé d’investir avec prudence après une recherche approfondie!

Si vous pensez que le contenu utilisé sur ce site Web porte atteinte à vos droits d’auteur, veuillez nous contacter immédiatement (info@kdj.com) et nous le supprimerons dans les plus brefs délais.

Autres articles publiés sur Aug 24, 2026