NVIDIA build.nvidia.com : 100+ modèles IA en API gratuite (fini les modèles en local)
NVIDIA ouvre 100+ modèles d'IA via une API gratuite compatible OpenAI : une seule URL, une clé nvapi-, zéro GPU, zéro stockage. Guide complet avec du vrai code (Python, Node, cURL, Cursor, LangChain).
NVIDIA vient de faire sauter le plus gros frein de l'IA locale : le matériel. Avec build.nvidia.com, tu accèdes à 100+ modèles d'IA de pointe (Llama, Nemotron, DeepSeek, GLM-4, gpt-oss…) via une API gratuite, compatible OpenAI. Plus besoin de télécharger 200 Go de poids, plus besoin d'un GPU à 2 000 $, plus de « disque plein ». Tu changes deux lignes dans ton code et tu tournes sur les GPU de NVIDIA, dans le cloud. On déballe tout, avec du vrai code copiable.
- build.nvidia.com = catalogue d'inférence hébergée NVIDIA (marque NIM), endpoint compatible OpenAI.
- Base URL unique : https://integrate.api.nvidia.com/v1 + une clé nvapi-. Tu réutilises le SDK OpenAI tel quel.
- Gratuit : 1 000 crédits à l'inscription (jusqu'à 5 000 sur demande), 40 requêtes/min, sans carte bancaire, sans GPU.
- 100+ modèles + des Agentic Skills (capacités prêtes à l'emploi pour tes agents).
- Idéal pour prototyper : adieu les limites de stockage et de VRAM de ta machine.
flowchart LR
A["Ton code / IDE"] --> B["OpenAI SDK"]
B --> C["Endpoint NVIDIA
integrate.api.nvidia.com/v1"]
C --> D["NIM · GPU cloud"]
D --> E["100+ modeles
Llama · Nemotron · DeepSeek"]C'est quoi build.nvidia.com (NVIDIA NIM) ?
Depuis 2024, NVIDIA déploie NIM (NVIDIA Inference Microservices) : une couche qui sert des modèles d'IA optimisés pour ses GPU. Il y a deux moitiés : des conteneurs que tu peux héberger toi-même, et un catalogue d'inférence hébergée — c'est ce dernier qui fait du bruit aujourd'hui sur build.nvidia.com.
L'idée géniale : l'endpoint est compatible avec l'API OpenAI. Concrètement, n'importe quel outil, framework ou app qui sait pointer vers une « base URL » personnalisée peut viser NVIDIA sans aucune autre modification de code. Streaming, function calling, tool use : tout fonctionne comme avec OpenAI.
« Compatible OpenAI » veut dire que la forme des requêtes et réponses (Chat Completions) est identique. Tu gardes ton code, tu changes juste base_url et api_key.
Pourquoi c'est une bombe : fini les modèles en local
Faire tourner un gros modèle chez soi, c'est un parcours du combattant : télécharger des dizaines (voire centaines) de gigaoctets, avoir assez de VRAM, gérer les drivers CUDA, et accepter que ton laptop chauffe comme un radiateur. L'endpoint cloud règle tout ça d'un coup.
| Critère | Modèle en local | Endpoint NVIDIA |
|---|---|---|
| Stockage | 40 à 400+ Go par modèle | 0 Go (rien à télécharger) |
| Matériel | GPU avec beaucoup de VRAM | Aucun (GPU côté NVIDIA) |
| Mise en route | Heures (drivers, poids, quantization) | ~3 minutes (une clé) |
| Choix de modèles | Ce que ta machine encaisse | 100+ modèles, dont des 500B+ |
| Coût d'entrée | Élevé (carte graphique) | Gratuit (crédits offerts) |
| Confidentialité | Tout reste chez toi | Les données transitent par NVIDIA |
Démarrer en 3 minutes : ta clé nvapi-
Le seul prérequis est un compte gratuit du programme développeur NVIDIA. Pas de carte bancaire.
Les étapes : (1) va sur build.nvidia.com et connecte-toi, (2) ouvre n'importe quel modèle, (3) clique sur Get API Key, (4) copie la clé qui commence par nvapi- — elle n'est affichée qu'une fois. Ensuite, exporte-la et installe le SDK :
# 1. Stocke ta clé dans une variable d'environnement export NVIDIA_API_KEY="nvapi-xxxxxxxxxxxxxxxxxxxxxxxx" # 2. Installe le SDK OpenAI (oui, celui d'OpenAI) pip install openai
La clé nvapi- n'est montrée qu'une seule fois. Copie-la tout de suite et ne la commit jamais dans Git. Utilise une variable d'environnement (comme ci-dessus) ou un fichier .env ignoré.
Ton premier appel (Python)
Voici l'exemple le plus court qui marche. Remarque les deux seules choses spécifiques à NVIDIA : base_url et la clé.
from openai import OpenAI
client = OpenAI(
base_url="https://integrate.api.nvidia.com/v1",
api_key="nvapi-VOTRE_CLE", # ou os.environ["NVIDIA_API_KEY"]
)
resp = client.chat.completions.create(
model="deepseek-ai/deepseek-v4-pro",
messages=[{"role": "user", "content": "Explique le RAG en 3 phrases."}],
temperature=0.7,
max_tokens=1024,
)
print(resp.choices[0].message.content)Le RAG (Retrieval-Augmented Generation) combine une recherche documentaire avec un modèle de langage. On retrouve d'abord les passages pertinents dans une base de connaissances, puis on les injecte dans le prompt pour que le modèle réponde avec des faits à jour plutôt qu'avec sa seule mémoire.
Streaming, Node.js et cURL
Le streaming (afficher la réponse mot à mot) fonctionne comme avec OpenAI :
stream = client.chat.completions.create(
model="meta/llama-3.3-70b-instruct",
messages=[{"role": "user", "content": "Ecris un haiku sur le GPU."}],
stream=True,
)
for chunk in stream:
print(chunk.choices[0].delta.content or "", end="")En Node.js, c'est exactement le même SDK :
import OpenAI from "openai";
const client = new OpenAI({
baseURL: "https://integrate.api.nvidia.com/v1",
apiKey: process.env.NVIDIA_API_KEY,
});
const r = await client.chat.completions.create({
model: "openai/gpt-oss-120b",
messages: [{ role: "user", content: "Salut depuis Node !" }],
});
console.log(r.choices[0].message.content);Et en pur cURL, sans aucun SDK :
curl https://integrate.api.nvidia.com/v1/chat/completions \
-H "Authorization: Bearer $NVIDIA_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "nvidia/nemotron-3-ultra-550b-a55b",
"messages": [{"role": "user", "content": "Bonjour !"}]
}'Brancher Cursor, Claude Code et LangChain dessus
Comme l'endpoint est compatible OpenAI, tu peux le brancher partout où on accepte une base URL personnalisée. Pour Cursor : dans les réglages des modèles, renseigne la base URL https://integrate.api.nvidia.com/v1 et ta clé nvapi- — le chat, l'autocomplétion et l'agent basculent sur des modèles hébergés par NVIDIA. Même logique pour Claude Code, LangChain, CrewAI ou AutoGen : on change seulement la base URL et l'ID du modèle.
from langchain_openai import ChatOpenAI
llm = ChatOpenAI(
base_url="https://integrate.api.nvidia.com/v1",
api_key="nvapi-VOTRE_CLE",
model="meta/llama-3.3-70b-instruct",
)
print(llm.invoke("Donne-moi 3 idees de projets IA pour debuter.").content)Tu veux lister tous les modèles dispo en un coup d'œil ? Frappe l'endpoint /models — c'est aussi compatible OpenAI.
curl -s https://integrate.api.nvidia.com/v1/models \ -H "Authorization: Bearer $NVIDIA_API_KEY" | jq '.data[].id'
Les modèles dispo + les Agentic Skills
Le catalogue dépasse les 100 modèles : familles Llama et Nemotron (NVIDIA), DeepSeek, GLM-4 (Zhipu AI), gpt-oss (OpenAI en open weights), MiniMax, sans compter les modèles d'embeddings, de reconnaissance vocale et de simulation. Chaque fiche modèle affiche son tarif : certains sont totalement gratuits, d'autres consomment tes crédits.
NVIDIA pousse aussi les Agentic Skills : des capacités prêtes à l'emploi que ton agent peut appeler, rangées par domaine — AI & Machine Learning, Accelerated Computing, Physical AI, Developer Tools. De quoi assembler un agent qui agit, pas seulement qui discute.
La liste de modèles bouge souvent (NVIDIA en ajoute régulièrement). Filtre sur « Free Endpoint » dans le catalogue pour ne voir que les modèles gratuits.
Les limites du gratuit (à connaître)
Le palier gratuit est généreux pour prototyper, mais il a des bornes claires :
| Limite (2026) | Valeur |
|---|---|
| Crédits à l'inscription | 1 000 crédits d'inférence |
| Crédits max sur demande | Jusqu'à 5 000 |
| Débit (rate limit) | 40 requêtes / minute |
| Préfixe de clé | nvapi- |
| Carte bancaire | Non requise |
Si tu dépasses le débit, l'API renvoie une erreur 429 Too Many Requests. La parade classique : espacer les appels et réessayer avec un délai croissant (backoff).
import time
from openai import OpenAI
client = OpenAI(base_url="https://integrate.api.nvidia.com/v1", api_key="nvapi-VOTRE_CLE")
def chat_avec_retry(messages, model="meta/llama-3.3-70b-instruct", essais=5):
for i in range(essais):
try:
return client.chat.completions.create(model=model, messages=messages)
except Exception as e:
if "429" in str(e) and i < essais - 1:
time.sleep(2 ** i) # 1s, 2s, 4s, 8s...
continue
raiseConfidentialité. Sur l'essai gratuit, tes entrées et sorties peuvent être enregistrées par NVIDIA pour fournir et améliorer le service. N'envoie pas de données confidentielles ou personnelles sensibles via le palier gratuit.
Quand rester en local malgré tout
L'endpoint ne tue pas le local — il le complète. Tu restes en local quand : (1) tes données sont sensibles et ne doivent pas sortir, (2) tu travailles hors-ligne, (3) tu veux une latence ultra-stable, ou (4) tu es à grande échelle et l'auto-hébergement revient moins cher. Pour tout le reste — prototypage, démos, side-projects, apprentissage — l'endpoint gratuit est imbattable. Et le jour où tu veux passer en prod auto-hébergée, NVIDIA propose une licence R&D gratuite (jusqu'à 16 GPU) et un essai 90 jours d'AI Enterprise.
Tu sais maintenant brancher 100+ modèles en une URL. L'étape d'après : apprendre à piloter ces modèles comme un pro (prompts, agents, automatisation) avec nos cours pratiques — code réel, zéro blabla.
./cours-gratuit-claude-code voir tous les coursFAQ
build.nvidia.com est-il vraiment gratuit ?
Dois-je réécrire mon code OpenAI ?
base_url (https://integrate.api.nvidia.com/v1) et la clé (nvapi-). Streaming, function calling et tool use fonctionnent à l'identique.Mes données sont-elles privées ?
Quel modèle choisir pour commencer ?
📬 Tu veux recevoir ce type de guide chaque semaine ? Abonne-toi gratuitement — code réel, zéro blabla.