NVIDIA build.nvidia.com: +100 modelos de IA en API gratuita (se acabaron los modelos locales)
NVIDIA abre más de 100 modelos de IA mediante una API gratuita compatible con OpenAI: una única URL, una clave nvapi-, cero GPU, cero almacenamiento. Guía completa con código real (Python, Node, cURL, Cursor, LangChain).
NVIDIA acaba de eliminar el mayor obstáculo de la IA local: el hardware. Con build.nvidia.com, accedes a más de 100 modelos de IA de vanguardia (Llama, Nemotron, DeepSeek, GLM-4, gpt-oss…) a través de una API gratuita compatible con OpenAI. Ya no necesitas descargar 200 GB de pesos, ni un GPU de 2 000 $, ni «disco lleno». Cambias dos líneas en tu código y ejecutas en los GPU de NVIDIA, en la nube. Desglosamos todo, con código real copiable.
- build.nvidia.com = catálogo de inferencia alojada de NVIDIA (marca NIM), endpoint compatible con OpenAI.
- URL base única: https://integrate.api.nvidia.com/v1 + una clave nvapi-. Reutilizas el SDK de OpenAI tal cual.
- Gratis: 1 000 créditos al registrarte (hasta 5 000 bajo solicitud), 40 solicitudes/min, sin tarjeta de crédito, sin GPU.
- Más de 100 modelos + Agentic Skills (capacidades listas para usar en tus agentes).
- Ideal para prototipar: adiós a los límites de almacenamiento y VRAM de tu máquina.
flowchart LR
A["Tu código / IDE"] --> B["OpenAI SDK"]
B --> C["Endpoint NVIDIA
integrate.api.nvidia.com/v1"]
C --> D["NIM · GPU cloud"]
D --> E["100+ modelos
Llama · Nemotron · DeepSeek"]¿Qué es build.nvidia.com (NVIDIA NIM)?
Desde 2024, NVIDIA despliega NIM (NVIDIA Inference Microservices): una capa que sirve modelos de IA optimizados para sus GPU. Hay dos mitades: contenedores que puedes alojar tú mismo, y un catálogo de inferencia alojada —este último es el que está causando revuelo hoy en build.nvidia.com.
La idea genial: el endpoint es compatible con la API de OpenAI. En la práctica, cualquier herramienta, framework o app que sepa apuntar a una «base URL» personalizada puede dirigirse a NVIDIA sin ninguna otra modificación de código. Streaming, function calling, tool use: todo funciona igual que con OpenAI.
«Compatible con OpenAI» significa que la forma de las solicitudes y respuestas (Chat Completions) es idéntica. Mantienes tu código, solo cambias base_url y api_key.
Por qué es una bomba: se acabaron los modelos en local
Ejecutar un modelo grande en casa es un verdadero desafío: descargar decenas (o cientos) de gigabytes, tener suficiente VRAM, gestionar los drivers CUDA y aceptar que tu portátil se caliente como un radiador. El endpoint en la nube resuelve todo esto de golpe.
| Criterio | Modelo en local | Endpoint NVIDIA |
|---|---|---|
| Almacenamiento | 40 a 400+ GB por modelo | 0 GB (nada que descargar) |
| Hardware | GPU con mucha VRAM | Ninguno (GPU del lado de NVIDIA) |
| Puesta en marcha | Horas (drivers, pesos, cuantización) | ~3 minutos (una clave) |
| Selección de modelos | Lo que tu máquina soporte | Más de 100 modelos, incluidos algunos de 500B+ |
| Costo de entrada | Alto (tarjeta gráfica) | Gratis (créditos ofrecidos) |
| Privacidad | Todo queda en tu equipo | Los datos pasan por NVIDIA |
Comenzar en 3 minutos: tu clave nvapi-
El único requisito es una cuenta gratuita del programa para desarrolladores de NVIDIA. Sin tarjeta de crédito.
Los pasos: (1) entra en build.nvidia.com e inicia sesión, (2) abre cualquier modelo, (3) haz clic en Get API Key, (4) copia la clave que empieza por nvapi- —solo se muestra una vez. Luego, expórtala e instala el SDK:
# 1. Almacena tu clave en una variable de entorno export NVIDIA_API_KEY="nvapi-xxxxxxxxxxxxxxxxxxxxxxxx" # 2. Instala el SDK de OpenAI (sí, el de OpenAI) pip install openai
La clave nvapi- solo se muestra una vez. Cópiala inmediatamente y nunca la confirmes en Git. Usa una variable de entorno (como arriba) o un archivo .env ignorado.
Tu primera llamada (Python)
Aquí tienes el ejemplo más corto que funciona. Observa las dos únicas cosas específicas de NVIDIA: base_url y la clave.
from openai import OpenAI
client = OpenAI(
base_url="https://integrate.api.nvidia.com/v1",
api_key="nvapi-VOTRE_CLE", # ou os.environ["NVIDIA_API_KEY"]
)
resp = client.chat.completions.create(
model="deepseek-ai/deepseek-v4-pro",
messages=[{"role": "user", "content": "Explique le RAG en 3 phrases."}],
temperature=0.7,
max_tokens=1024,
)
print(resp.choices[0].message.content)El RAG (Retrieval-Augmented Generation) combina una búsqueda documental con un modelo de lenguaje. Primero recuperamos los pasajes relevantes en una base de conocimientos, luego los inyectamos en el prompt para que el modelo responda con hechos actualizados en lugar de solo con su memoria.
Streaming, Node.js y cURL
El streaming (mostrar la respuesta palabra por palabra) funciona igual que con OpenAI:
stream = client.chat.completions.create(
model="meta/llama-3.3-70b-instruct",
messages=[{"role": "user", "content": "Ecris un haiku sur le GPU."}],
stream=True,
)
for chunk in stream:
print(chunk.choices[0].delta.content or "", end="")En Node.js, es exactamente el mismo SDK:
import OpenAI from "openai";
const client = new OpenAI({
baseURL: "https://integrate.api.nvidia.com/v1",
apiKey: process.env.NVIDIA_API_KEY,
});
const r = await client.chat.completions.create({
model: "openai/gpt-oss-120b",
messages: [{ role: "user", content: "Salut depuis Node !" }],
});
console.log(r.choices[0].message.content);Y en puro cURL, sin ningún SDK:
curl https://integrate.api.nvidia.com/v1/chat/completions \
-H "Authorization: Bearer $NVIDIA_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "nvidia/nemotron-3-ultra-550b-a55b",
"messages": [{"role": "user", "content": "Bonjour !"}]
}'Conectar Cursor, Claude Code y LangChain
Como el endpoint es compatible con OpenAI, puedes conectarlo a cualquier lugar que acepte una base URL personalizada. Para Cursor: en la configuración de modelos, introduce la base URL https://integrate.api.nvidia.com/v1 y tu clave nvapi- —el chat, el autocompletado y el agente cambian a modelos alojados por NVIDIA. La misma lógica aplica para Claude Code, LangChain, CrewAI o AutoGen: solo cambias la base URL y el ID del modelo.
from langchain_openai import ChatOpenAI
llm = ChatOpenAI(
base_url="https://integrate.api.nvidia.com/v1",
api_key="nvapi-VOTRE_CLE",
model="meta/llama-3.3-70b-instruct",
)
print(llm.invoke("Donne-moi 3 idees de projets IA pour debuter.").content)¿Quieres listar todos los modelos disponibles de un vistazo? Llama al endpoint /models —también es compatible con OpenAI.
curl -s https://integrate.api.nvidia.com/v1/models \ -H "Authorization: Bearer $NVIDIA_API_KEY" | jq '.data[].id'
Los modelos disponibles + las Agentic Skills
El catálogo supera los 100 modelos: familias Llama y Nemotron (NVIDIA), DeepSeek, GLM-4 (Zhipu AI), gpt-oss (OpenAI en pesos abiertos), MiniMax, sin contar los modelos de embeddings, reconocimiento de voz y simulación. Cada ficha de modelo muestra su tarifa: algunos son totalmente gratuitos, otros consumen tus créditos.
NVIDIA también impulsa las Agentic Skills: capacidades listas para usar que tu agente puede invocar, organizadas por dominio —AI & Machine Learning, Accelerated Computing, Physical AI, Developer Tools. Con esto puedes armar un agente que actúe, no solo que converse.
La lista de modelos cambia con frecuencia (NVIDIA añade regularmente nuevos). Filtra por «Free Endpoint» en el catálogo para ver solo los modelos gratuitos.
Los límites del plan gratuito (para conocer)
El nivel gratuito es generoso para prototipar, pero tiene límites claros:
| Límite (2026) | Valor |
|---|---|
| Créditos al registrarte | 1 000 créditos de inferencia |
| Créditos máximos bajo solicitud | Hasta 5 000 |
| Tasa de solicitudes (rate limit) | 40 solicitudes / minuto |
| Prefijo de la clave | nvapi- |
| Tarjeta de crédito | No requerida |
Si superas el límite de tasa, la API devuelve un error 429 Too Many Requests. La solución clásica: espaciar las llamadas y reintentar con un retraso creciente (backoff).
import time
from openai import OpenAI
client = OpenAI(base_url="https://integrate.api.nvidia.com/v1", api_key="nvapi-VOTRE_CLE")
def chat_avec_retry(messages, model="meta/llama-3.3-70b-instruct", essais=5):
for i in range(essais):
try:
return client.chat.completions.create(model=model, messages=messages)
except Exception as e:
if "429" in str(e) and i < essais - 1:
time.sleep(2 ** i) # 1s, 2s, 4s, 8s...
continue
raisePrivacidad. En la prueba gratuita, tus entradas y salidas pueden ser registradas por NVIDIA para proporcionar y mejorar el servicio. No envíes datos confidenciales o personales sensibles a través del nivel gratuito.
Cuándo seguir en local a pesar de todo
El endpoint no elimina el uso local —lo complementa. Quédate en local cuando: (1) tus datos son sensibles y no deben salir, (2) trabajas sin conexión, (3) necesitas una latencia ultraestable, o (4) estás a gran escala y el autoalojamiento resulta más económico. Para todo lo demás —prototipado, demostraciones, proyectos personales, aprendizaje— el endpoint gratuito es imbatible. Y el día que quieras pasar a producción autoalojada, NVIDIA ofrece una licencia R&D gratuita (hasta 16 GPU) y una prueba de 90 días de AI Enterprise.
Ahora sabes conectar más de 100 modelos con una sola URL. El siguiente paso: aprender a controlar estos modelos como un profesional (prompts, agentes, automatización) con nuestros cursos prácticos —código real, cero relleno.
./cours-gratuit-claude-code ver todos los cursosFAQ
¿build.nvidia.com es realmente gratuito?
¿Tengo que reescribir mi código de OpenAI?
base_url (https://integrate.api.nvidia.com/v1) y la clave (nvapi-). Streaming, function calling y tool use funcionan de forma idéntica.¿Mis datos son privados?
¿Qué modelo elegir para empezar?
📬 ¿Quieres recibir este tipo de guía cada semana? Suscríbete gratis —código real, cero relleno.