NVIDIA build.nvidia.com: +100 modelos de IA en API gratuita (se acabaron los modelos locales)

NVIDIA abre más de 100 modelos de IA mediante una API gratuita compatible con OpenAI: una única URL, una clave nvapi-, cero GPU, cero almacenamiento. Guía completa con código real (Python, Node, cURL, Cursor, LangChain).

NVIDIA build.nvidia.com: +100 modelos de IA en API gratuita (se acabaron los modelos locales)

NVIDIA acaba de eliminar el mayor obstáculo de la IA local: el hardware. Con build.nvidia.com, accedes a más de 100 modelos de IA de vanguardia (Llama, Nemotron, DeepSeek, GLM-4, gpt-oss…) a través de una API gratuita compatible con OpenAI. Ya no necesitas descargar 200 GB de pesos, ni un GPU de 2 000 $, ni «disco lleno». Cambias dos líneas en tu código y ejecutas en los GPU de NVIDIA, en la nube. Desglosamos todo, con código real copiable.

tl;dr
  • build.nvidia.com = catálogo de inferencia alojada de NVIDIA (marca NIM), endpoint compatible con OpenAI.
  • URL base única: https://integrate.api.nvidia.com/v1 + una clave nvapi-. Reutilizas el SDK de OpenAI tal cual.
  • Gratis: 1 000 créditos al registrarte (hasta 5 000 bajo solicitud), 40 solicitudes/min, sin tarjeta de crédito, sin GPU.
  • Más de 100 modelos + Agentic Skills (capacidades listas para usar en tus agentes).
  • Ideal para prototipar: adiós a los límites de almacenamiento y VRAM de tu máquina.
flowchart LR
    A["Tu código / IDE"] --> B["OpenAI SDK"]
    B --> C["Endpoint NVIDIA
integrate.api.nvidia.com/v1"] C --> D["NIM · GPU cloud"] D --> E["100+ modelos
Llama · Nemotron · DeepSeek"]
./architecture — del SDK de OpenAI a los GPU de NVIDIA en una URL

¿Qué es build.nvidia.com (NVIDIA NIM)?

Desde 2024, NVIDIA despliega NIM (NVIDIA Inference Microservices): una capa que sirve modelos de IA optimizados para sus GPU. Hay dos mitades: contenedores que puedes alojar tú mismo, y un catálogo de inferencia alojada —este último es el que está causando revuelo hoy en build.nvidia.com.

La idea genial: el endpoint es compatible con la API de OpenAI. En la práctica, cualquier herramienta, framework o app que sepa apuntar a una «base URL» personalizada puede dirigirse a NVIDIA sin ninguna otra modificación de código. Streaming, function calling, tool use: todo funciona igual que con OpenAI.

NOTE

«Compatible con OpenAI» significa que la forma de las solicitudes y respuestas (Chat Completions) es idéntica. Mantienes tu código, solo cambias base_url y api_key.

Por qué es una bomba: se acabaron los modelos en local

Ejecutar un modelo grande en casa es un verdadero desafío: descargar decenas (o cientos) de gigabytes, tener suficiente VRAM, gestionar los drivers CUDA y aceptar que tu portátil se caliente como un radiador. El endpoint en la nube resuelve todo esto de golpe.

CriterioModelo en localEndpoint NVIDIA
Almacenamiento40 a 400+ GB por modelo0 GB (nada que descargar)
HardwareGPU con mucha VRAMNinguno (GPU del lado de NVIDIA)
Puesta en marchaHoras (drivers, pesos, cuantización)~3 minutos (una clave)
Selección de modelosLo que tu máquina soporteMás de 100 modelos, incluidos algunos de 500B+
Costo de entradaAlto (tarjeta gráfica)Gratis (créditos ofrecidos)
PrivacidadTodo queda en tu equipoLos datos pasan por NVIDIA

Comenzar en 3 minutos: tu clave nvapi-

El único requisito es una cuenta gratuita del programa para desarrolladores de NVIDIA. Sin tarjeta de crédito.

Los pasos: (1) entra en build.nvidia.com e inicia sesión, (2) abre cualquier modelo, (3) haz clic en Get API Key, (4) copia la clave que empieza por nvapi- —solo se muestra una vez. Luego, expórtala e instala el SDK:

bash
# 1. Almacena tu clave en una variable de entorno
export NVIDIA_API_KEY="nvapi-xxxxxxxxxxxxxxxxxxxxxxxx"

# 2. Instala el SDK de OpenAI (sí, el de OpenAI)
pip install openai
WARNING

La clave nvapi- solo se muestra una vez. Cópiala inmediatamente y nunca la confirmes en Git. Usa una variable de entorno (como arriba) o un archivo .env ignorado.

Tu primera llamada (Python)

Aquí tienes el ejemplo más corto que funciona. Observa las dos únicas cosas específicas de NVIDIA: base_url y la clave.

python
from openai import OpenAI

client = OpenAI(
    base_url="https://integrate.api.nvidia.com/v1",
    api_key="nvapi-VOTRE_CLE",   # ou os.environ["NVIDIA_API_KEY"]
)

resp = client.chat.completions.create(
    model="deepseek-ai/deepseek-v4-pro",
    messages=[{"role": "user", "content": "Explique le RAG en 3 phrases."}],
    temperature=0.7,
    max_tokens=1024,
)
print(resp.choices[0].message.content)
sortie
El RAG (Retrieval-Augmented Generation) combina una búsqueda documental
con un modelo de lenguaje. Primero recuperamos los pasajes relevantes en
una base de conocimientos, luego los inyectamos en el prompt para que el
modelo responda con hechos actualizados en lugar de solo con su memoria.

Streaming, Node.js y cURL

El streaming (mostrar la respuesta palabra por palabra) funciona igual que con OpenAI:

python
stream = client.chat.completions.create(
    model="meta/llama-3.3-70b-instruct",
    messages=[{"role": "user", "content": "Ecris un haiku sur le GPU."}],
    stream=True,
)
for chunk in stream:
    print(chunk.choices[0].delta.content or "", end="")

En Node.js, es exactamente el mismo SDK:

javascript
import OpenAI from "openai";

const client = new OpenAI({
  baseURL: "https://integrate.api.nvidia.com/v1",
  apiKey: process.env.NVIDIA_API_KEY,
});

const r = await client.chat.completions.create({
  model: "openai/gpt-oss-120b",
  messages: [{ role: "user", content: "Salut depuis Node !" }],
});
console.log(r.choices[0].message.content);

Y en puro cURL, sin ningún SDK:

bash
curl https://integrate.api.nvidia.com/v1/chat/completions \
  -H "Authorization: Bearer $NVIDIA_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "nvidia/nemotron-3-ultra-550b-a55b",
    "messages": [{"role": "user", "content": "Bonjour !"}]
  }'

Conectar Cursor, Claude Code y LangChain

Como el endpoint es compatible con OpenAI, puedes conectarlo a cualquier lugar que acepte una base URL personalizada. Para Cursor: en la configuración de modelos, introduce la base URL https://integrate.api.nvidia.com/v1 y tu clave nvapi- —el chat, el autocompletado y el agente cambian a modelos alojados por NVIDIA. La misma lógica aplica para Claude Code, LangChain, CrewAI o AutoGen: solo cambias la base URL y el ID del modelo.

python
from langchain_openai import ChatOpenAI

llm = ChatOpenAI(
    base_url="https://integrate.api.nvidia.com/v1",
    api_key="nvapi-VOTRE_CLE",
    model="meta/llama-3.3-70b-instruct",
)
print(llm.invoke("Donne-moi 3 idees de projets IA pour debuter.").content)
TIP

¿Quieres listar todos los modelos disponibles de un vistazo? Llama al endpoint /models —también es compatible con OpenAI.

bash
curl -s https://integrate.api.nvidia.com/v1/models \
  -H "Authorization: Bearer $NVIDIA_API_KEY" | jq '.data[].id'

Los modelos disponibles + las Agentic Skills

El catálogo supera los 100 modelos: familias Llama y Nemotron (NVIDIA), DeepSeek, GLM-4 (Zhipu AI), gpt-oss (OpenAI en pesos abiertos), MiniMax, sin contar los modelos de embeddings, reconocimiento de voz y simulación. Cada ficha de modelo muestra su tarifa: algunos son totalmente gratuitos, otros consumen tus créditos.

NVIDIA también impulsa las Agentic Skills: capacidades listas para usar que tu agente puede invocar, organizadas por dominio —AI & Machine Learning, Accelerated Computing, Physical AI, Developer Tools. Con esto puedes armar un agente que actúe, no solo que converse.

NOTE

La lista de modelos cambia con frecuencia (NVIDIA añade regularmente nuevos). Filtra por «Free Endpoint» en el catálogo para ver solo los modelos gratuitos.

Los límites del plan gratuito (para conocer)

El nivel gratuito es generoso para prototipar, pero tiene límites claros:

Límite (2026)Valor
Créditos al registrarte1 000 créditos de inferencia
Créditos máximos bajo solicitudHasta 5 000
Tasa de solicitudes (rate limit)40 solicitudes / minuto
Prefijo de la clavenvapi-
Tarjeta de créditoNo requerida

Si superas el límite de tasa, la API devuelve un error 429 Too Many Requests. La solución clásica: espaciar las llamadas y reintentar con un retraso creciente (backoff).

python
import time
from openai import OpenAI

client = OpenAI(base_url="https://integrate.api.nvidia.com/v1", api_key="nvapi-VOTRE_CLE")

def chat_avec_retry(messages, model="meta/llama-3.3-70b-instruct", essais=5):
    for i in range(essais):
        try:
            return client.chat.completions.create(model=model, messages=messages)
        except Exception as e:
            if "429" in str(e) and i < essais - 1:
                time.sleep(2 ** i)   # 1s, 2s, 4s, 8s...
                continue
            raise
WARNING

Privacidad. En la prueba gratuita, tus entradas y salidas pueden ser registradas por NVIDIA para proporcionar y mejorar el servicio. No envíes datos confidenciales o personales sensibles a través del nivel gratuito.

Cuándo seguir en local a pesar de todo

El endpoint no elimina el uso local —lo complementa. Quédate en local cuando: (1) tus datos son sensibles y no deben salir, (2) trabajas sin conexión, (3) necesitas una latencia ultraestable, o (4) estás a gran escala y el autoalojamiento resulta más económico. Para todo lo demás —prototipado, demostraciones, proyectos personales, aprendizaje— el endpoint gratuito es imbatible. Y el día que quieras pasar a producción autoalojada, NVIDIA ofrece una licencia R&D gratuita (hasta 16 GPU) y una prueba de 90 días de AI Enterprise.

passe-a-la-pratique

Ahora sabes conectar más de 100 modelos con una sola URL. El siguiente paso: aprender a controlar estos modelos como un profesional (prompts, agentes, automatización) con nuestros cursos prácticos —código real, cero relleno.

./cours-gratuit-claude-code ver todos los cursos

FAQ

¿build.nvidia.com es realmente gratuito?
Sí para empezar: 1 000 créditos de inferencia ofrecidos al registrarte (hasta 5 000 bajo solicitud), 40 solicitudes/minuto, sin tarjeta de crédito. Algunos modelos son 100 % gratuitos, otros consumen tus créditos —cada ficha de modelo lo indica.
¿Tengo que reescribir mi código de OpenAI?
No. El endpoint es compatible con OpenAI: solo cambias base_url (https://integrate.api.nvidia.com/v1) y la clave (nvapi-). Streaming, function calling y tool use funcionan de forma idéntica.
¿Mis datos son privados?
En el nivel gratuito, NVIDIA puede registrar tus entradas/salidas para mejorar el servicio. Para datos sensibles, quédate en local o pasa a una oferta autoalojada (licencia R&D gratuita, o AI Enterprise para producción).
¿Qué modelo elegir para empezar?
Para uso general, un Llama 3.x 70B o un Nemotron funcionan muy bien. Para razonamiento, prueba DeepSeek. Lista todo con el endpoint /models y filtra «Free Endpoint» en el catálogo.

📬 ¿Quieres recibir este tipo de guía cada semana? Suscríbete gratis —código real, cero relleno.