Novus : NetApp apporte un stockage en 100 To/s aux clusters de GPU

Lors de sa conférence annuelle, NetApp a dévoilé ce qu’il appelle « la solution de stockage la plus rapide de la planète ». Elle repose sur le protocole pNFS, étonnamment racheté à l’entreprise Peak :AIO, et sur un partenariat matériel avec Supermicro.

Weka, Vast, Dell et les autres champions du stockage ultrarapide pour alimenter les fermes de GPU en données n’ont qu’à bien se tenir. NetApp lance une nouvelle infrastructure Novus qui bat tous les records de vitesse : 100 To/s de bande passante entre les données des entreprises et une ferme de 50 000 GPU qui les aspirent pour les faire analyser par des IA. L’enjeu est d’abolir les temps durant lesquels les GPU achetés hors de prix se tournent les pouces, faute d’être accompagnés de baies de stockage capables de fonctionner à leur vitesse.

Sur scène, le PDG du fournisseur George Kurian, euphorique lors de son discours d’ouverture de la conférence annuelle NetApp Insight 2026 qui se tient cette semaine à Las Vegas, parle d’une annonce historique, citant une étude selon laquelle les GPU ne travailleraient généralement qu’à 30% de leur capacité, voire à 7% dans certains cas.

« Il s'agit sans doute de l'annonce la plus importante : celle du système de fichiers le plus évolutif et le plus performant au monde. C'est le premier et le seul système de fichiers à 100 téraoctets par seconde capable de répondre aux exigences des plus grandes usines d'IA », lance-t-il à l’assemblée, en précisant que Novus est avant tout conçu pour les néoclouds. Ces hébergeurs de fermes de calcul n’exécutent que des services d’IA, en sous-traitance pour les éditeurs de modèles (OpenAI, Anthropic...) ou en renfort pour les hyperscalers lorsque leurs infrastructures ne sont plus suffisantes pour répondre à la demande.

Arindam Banerjee, le directeur technique de NetApp pour les sujets concernant l’IA (en photo en haut de cet article), donne la mesure du problème qu’il a fallu résoudre lors d’un entretien avec la presse :

« L'évolution des usages impose un changement d’architecture. Alors que les applications étaient auparavant limitées par le processeur, elles sont désormais pilotées par des GPU dont l'appétit pour les données est bien supérieur. Leur fonctionnement combine des milliards de lectures à la fois aléatoires et minuscules pour le chargement des données, avec des écritures de points de contrôle (les checkpoints) et tout cela se fait à l'échelle du téraoctet, simultanément, sur l'ensemble de l'infrastructure de stockage.

Changer d’échelle

Rappelons que, jusqu’ici, NetApp commercialisait plutôt, avec des partenaires comme Cisco, Intel et Bull, des configurations dites AI Pod pour exécuter des traitements d’IA en entreprise. Il s’agit dans ce cas de vendre ensemble des serveurs de calcul, du réseau et des baies de stockage qui ne sont taillés que pour l’inférence à l’échelle d’un seul client.

Dans ce domaine, NetApp avait aussi lancé l’année dernière une baie de stockage AFX intégrant un module avec des GPU d’appoint pour encoder ses contenus à la volée au format vectoriel nécessaire à des IA. Mais aucune de ces configurations n’était taillée pour les néoclouds.

« La clientèle de Novus doit gérer des quantités énormes d’utilisateurs et de données. Et c’est l’autre caractéristique phare de Novus : la configuration gère dans un même système de fichiers la capacité hallucinante de plusieurs dizaines d’exaoctets. C’est là aussi une première sur ce marché : nous allons des dizaines de fois plus loin que nos concurrents », se réjouit George Kurian.

« Pour atteindre cette échelle, vous devez désagréger les métadonnées des données, car elles évoluent selon des axes très différents. Vous ne pouvez pas les placer dans le même boîtier, leur faire partager le même support et le même réseau », ajoute Arindam Banerjee, en faisant référence au principe de fonctionnement de Novus : pNFS.

Une architecture désagrégée à base de pNFS

Dans pNFS, ce protocole standard depuis la version 4.1 du protocole de stockage en réseau NFS, le stockage est partagé en deux parties : les serveurs de calcul demandent à des serveurs d’index – les pNFS directors – d’accéder en lecture ou en écriture à certains fichiers, et les serveurs d’index leur répondent sur quels serveurs de données ils peuvent lire ou écrire eux-mêmes des bouts de ces fichiers.

Il en résulte un fonctionnement hautement parallèle, avec des liens dédiés entre chaque nœud de calcul et chaque nœud de stockage. En NFS traditionnel, le serveur d’index est aussi celui qui transfère les fichiers, ce qui aboutit à un engorgement de ses liens réseau et un ralentissement général.

Pour que cela fonctionne, les serveurs de calcul doivent disposer d’un pilote pNFS qui permet d’interroger différents serveurs de données. Ce pilote est livré en standard avec tous les Linux.

Les serveurs sur lesquels ils lisent ou écrivent des données ont juste besoin de partager leur contenu en NFS. C’est ce que font les baies AFF traditionnelles de NetApp. Le constructeur propose en l’occurrence ici un nouveau modèle haut de gamme, l’AFF 90N, dont il ne donne pas de détails, mais dont on se doute qu’il s’agit d’une version améliorée de l’AFF 90 avec des cartes réseau plus robustes. Certainement en 800 Gbit/s, d’après ce qu’a pu entendre LeMagIT dans les couloirs de la conférence.

Reste le système qui équipe les pNFS directors. À la surprise générale, NetApp, pourtant investi dans NFS et pNFS depuis des décennies, n’a pas choisi de le développer lui-même, mais plutôt de prendre un produit Open Source, Lattice, développé au sein du laboratoire de supercalcul américain Los Alamos National Laboratory et commercialisé par l’éditeur britannique Peak:AIO.

Accessoirement, NetApp a annoncé racheter Peak:AIO, le weekend qui a précédé sa conférence Insight 2026.

Par ailleurs, dans Novus, les machines qui exécuteront Lattice, renommé entretemps Novus Data Director, ne seront pas produites par NetApp, mais par le fabricant de serveurs en marque blanche Supermicro.

Une ouverture aux centres de supercalcul et au mode objet

Novus devrait être disponible dès novembre prochain. On ignore combien de machines seront nécessaires pour soutenir les communications de 50 000 GPU, mais NetApp promet que chaque GPU aura droit à une bande passante de 2 Go/s vers le stockage, ce qui correspond à au moins trois cartes réseau en 800 Gbit/s de part et d’autre.

Dans un second temps, NetApp envisage de remplacer les AFF 90N par d’autres serveurs Supermicro, manifestement pour soutenir une demande qui, paraît-il, serait si importante qu’elle dépasserait les capacités de production de matériels par NetApp. Ces serveurs Supermicro seraient des clones des AFF 90N et fonctionneraient sous le même système d’exploitation, soit OnTap.

Notons d’ailleurs que le partenariat avec Supermicro devrait d’ailleurs déboucher aussi sur de nouvelles configurations d’AI Pod pour les entreprises.

Lors d’un entretien avec la presse, Syam Nair, le patron des produits chez NetApp, donne quelques indices quant à l’évolution de Novus au fil des mois. Oui, NetApp entend bien vendre cette configuration aux centres de supercalcul et pas seulement aux néoclouds. Oui, Novus intégrera bien dans un second temps un accès en mode objet, via le même système de partage S3 que celui qui équipe ses baies StorageGrid. Oui, Lattice restera un produit Open source.

Il suggère par ailleurs que DataPelago, le logiciel de transformation de données que NetApp a récemment racheté, pourrait également à terme être livré préinstallé sur Novus, a priori sur les nœuds qui contiennent les données. Ce logiciel a pour intérêt principal de convertir et d’uniformiser les données à la source, sans qu’il soit besoin de déplacer les données dans un autre serveur. Mais encore faut-il que la source, ici une baie de stockage, ait suffisamment de puissance processeur restante pour exécuter le logiciel de DataPelago, distribué au format container.

Manifestement, ce serait le cas de l’AFF 90N ou du serveur Supermicro qui la remplacera. Pour autant, on ignore si NetApp entend à terme intégrer des GPU dans ces boîtiers pour convertir les données à la volée au format vectoriel, comme le fait la baie AFX. La baie AFX est également dotée de modules de stockage AFF 90, mais qui a besoin d’un module de calcul supplémentaire pour porter les GPU et le logiciel de conversion.

Quant à savoir pourquoi NetApp a décidé de racheter une technologie qu’il aurait pu développer lui-même, George Kurian répond lors d’un entretien avec la presse qu’il y avait urgence de fournir une solution fonctionnelle :

« Nous avons travaillé à développer cette couche. Nous avons regardé toutes les implémentations d’un pNFS director disponibles sur le marché. Mais, à la fin, force a été de constater que l’équipe de Peak:AIO possède une technologie vraiment spéciale. Et nous avons finalement décidé que la meilleure technologie était celle qu'ils possédaient. »

Pour approfondir sur SAN et NAS