NVIDIA build.nvidia.com: 100+ modelos de IA em API gratuita (acabou os modelos locais)
NVIDIA abre 100+ modelos de IA via uma API gratuita compatível com OpenAI: uma única URL, uma chave nvapi-, zero GPU, zero armazenamento. Guia completo com código real (Python, Node, cURL, Cursor, LangChain).
A NVIDIA acabou de eliminar o maior obstáculo da IA local: o hardware. Com build.nvidia.com, você acessa mais de 100 modelos de IA de ponta (Llama, Nemotron, DeepSeek, GLM-4, gpt-oss…) por meio de uma API gratuita, compatível com OpenAI. Sem necessidade de baixar 200 GB de pesos, sem necessidade de uma GPU de 2.000 $, sem mais "disco cheio". Você altera duas linhas no seu código e executa nos GPUs da NVIDIA, na nuvem. Nós desvendamos tudo, com código real copiável.
- build.nvidia.com = catálogo de inferência hospedada da NVIDIA (marca NIM), endpoint compatível com OpenAI.
- URL base única: https://integrate.api.nvidia.com/v1 + uma chave nvapi-. Você reutiliza o SDK OpenAI exatamente como está.
- Grátis: 1 000 créditos no cadastro (até 5 000 mediante solicitação), 40 requisições/min, sem cartão de crédito, sem GPU.
- Mais de 100 modelos + Agentic Skills (capacidades prontas para uso em seus agentes).
- Ideal para prototipar: adeus aos limites de armazenamento e VRAM da sua máquina.
flowchart LR
A["Seu código / IDE"] --> B["OpenAI SDK"]
B --> C["Endpoint NVIDIA
integrate.api.nvidia.com/v1"]
C --> D["NIM · GPU na nuvem"]
D --> E["100+ modelos
Llama · Nemotron · DeepSeek"]O que é build.nvidia.com (NVIDIA NIM) ?
Desde 2024, a NVIDIA implanta NIM (NVIDIA Inference Microservices): uma camada que serve modelos de IA otimizados para seus GPUs. Existem duas metades: contêineres que você pode hospedar sozinho e um catálogo de inferência hospedada — este último que está fazendo barulho hoje em build.nvidia.com.
A ideia genial: o endpoint é compatível com a API OpenAI. Concretamente, qualquer ferramenta, framework ou app que saiba apontar para uma « base URL » personalizada pode mirar a NVIDIA sem nenhuma outra modificação de código. Streaming, function calling, tool use: tudo funciona como com a OpenAI.
« Compatível com OpenAI » significa que a forma das requisições e respostas (Chat Completions) é idêntica. Você mantém seu código, altera apenas base_url e api_key.
Por que é uma bomba: acabou os modelos locais
Executar um modelo grande em casa é um verdadeiro desafio: baixar dezenas (ou centenas) de gigabytes, ter VRAM suficiente, gerenciar drivers CUDA e aceitar que seu laptop esquente como um radiador. O endpoint na nuvem resolve tudo de uma vez.
| Critério | Modelo local | Endpoint NVIDIA |
|---|---|---|
| Armazenamento | 40 a 400+ GB por modelo | 0 GB (nada para baixar) |
| Hardware | GPU com muita VRAM | Nenhum (GPU no lado da NVIDIA) |
| Tempo para começar | Horas (drivers, pesos, quantização) | ~3 minutos (uma chave) |
| Escolha de modelos | O que sua máquina aguenta | Mais de 100 modelos, incluindo alguns de 500B+ |
| Custo de entrada | Alto (placa de vídeo) | Grátis (créditos oferecidos) |
| Privacidade | Tudo fica com você | Os dados transitam pela NVIDIA |
Comece em 3 minutos: sua chave nvapi-
O único pré-requisito é uma conta gratuita do programa de desenvolvedores da NVIDIA. Sem cartão de crédito.
Os passos: (1) acesse build.nvidia.com e faça login, (2) abra qualquer modelo, (3) clique em Get API Key, (4) copie a chave que começa com nvapi- — ela é exibida apenas uma vez. Depois, exporte-a e instale o SDK:
# 1. Armazene sua chave em uma variável de ambiente export NVIDIA_API_KEY="nvapi-xxxxxxxxxxxxxxxxxxxxxxxx" # 2. Instale o SDK OpenAI (sim, o da OpenAI) pip install openai
A chave nvapi- é mostrada apenas uma vez. Copie-a imediatamente e nunca a faça commit no Git. Use uma variável de ambiente (como acima) ou um arquivo .env ignorado.
Seu primeiro chamado (Python)
Aqui está o exemplo mais curto que funciona. Observe as duas únicas coisas específicas da NVIDIA: base_url e a chave.
from openai import OpenAI
client = OpenAI(
base_url="https://integrate.api.nvidia.com/v1",
api_key="nvapi-VOTRE_CLE", # ou os.environ["NVIDIA_API_KEY"]
)
resp = client.chat.completions.create(
model="deepseek-ai/deepseek-v4-pro",
messages=[{"role": "user", "content": "Explique le RAG en 3 phrases."}],
temperature=0.7,
max_tokens=1024,
)
print(resp.choices[0].message.content)Le RAG (Retrieval-Augmented Generation) combine une recherche documentaire avec un modèle de langage. On retrouve d'abord les passages pertinents dans une base de connaissances, puis on les injecte dans le prompt pour que le modèle réponde avec des faits à jour plutôt qu'avec sa seule mémoire.
Streaming, Node.js e cURL
O streaming (exibir a resposta palavra por palavra) funciona como com a OpenAI:
stream = client.chat.completions.create(
model="meta/llama-3.3-70b-instruct",
messages=[{"role": "user", "content": "Ecris un haiku sur le GPU."}],
stream=True,
)
for chunk in stream:
print(chunk.choices[0].delta.content or "", end="")Em Node.js, é exatamente o mesmo SDK:
import OpenAI from "openai";
const client = new OpenAI({
baseURL: "https://integrate.api.nvidia.com/v1",
apiKey: process.env.NVIDIA_API_KEY,
});
const r = await client.chat.completions.create({
model: "openai/gpt-oss-120b",
messages: [{ role: "user", content: "Salut depuis Node !" }],
});
console.log(r.choices[0].message.content);E em puro cURL, sem nenhum SDK:
curl https://integrate.api.nvidia.com/v1/chat/completions \
-H "Authorization: Bearer $NVIDIA_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "nvidia/nemotron-3-ultra-550b-a55b",
"messages": [{"role": "user", "content": "Bonjour !"}]
}'Conecte Cursor, Claude Code e LangChain
Como o endpoint é compatível com OpenAI, você pode conectá-lo em qualquer lugar que aceite uma base URL personalizada. Para Cursor: nas configurações de modelos, informe a base URL https://integrate.api.nvidia.com/v1 e sua chave nvapi- — o chat, o autocompletar e o agente passam a usar modelos hospedados pela NVIDIA. Mesma lógica para Claude Code, LangChain, CrewAI ou AutoGen: altere apenas a base URL e o ID do modelo.
from langchain_openai import ChatOpenAI
llm = ChatOpenAI(
base_url="https://integrate.api.nvidia.com/v1",
api_key="nvapi-VOTRE_CLE",
model="meta/llama-3.3-70b-instruct",
)
print(llm.invoke("Donne-moi 3 idees de projets IA pour debuter.").content)Quer listar todos os modelos disponíveis de uma vez? Chame o endpoint /models — também é compatível com OpenAI.
curl -s https://integrate.api.nvidia.com/v1/models \ -H "Authorization: Bearer $NVIDIA_API_KEY" | jq '.data[].id'
Os modelos disponíveis + as Agentic Skills
O catálogo ultrapassa 100 modelos: famílias Llama e Nemotron (NVIDIA), DeepSeek, GLM-4 (Zhipu AI), gpt-oss (OpenAI em open weights), MiniMax, sem contar os modelos de embeddings, reconhecimento de voz e simulação. Cada ficha de modelo exibe sua tarifa: alguns são totalmente gratuitos, outros consomem seus créditos.
A NVIDIA também promove as Agentic Skills: capacidades prontas para uso que seu agente pode chamar, organizadas por domínio — AI & Machine Learning, Accelerated Computing, Physical AI, Developer Tools. O suficiente para montar um agente que age, não apenas conversa.
A lista de modelos muda com frequência (a NVIDIA adiciona regularmente). Filtre por « Free Endpoint » no catálogo para ver apenas os modelos gratuitos.
Os limites do plano gratuito (para saber)
O nível gratuito é generoso para prototipar, mas tem limites claros:
| Limite (2026) | Valor |
|---|---|
| Créditos no cadastro | 1 000 créditos de inferência |
| Créditos máximos mediante solicitação | Até 5 000 |
| Taxa (rate limit) | 40 requisições / minuto |
| Prefixo da chave | nvapi- |
| Cartão de crédito | Não exigido |
Se você exceder a taxa, a API retorna um erro 429 Too Many Requests. A solução clássica: espaçar as chamadas e tentar novamente com um atraso crescente (backoff).
import time
from openai import OpenAI
client = OpenAI(base_url="https://integrate.api.nvidia.com/v1", api_key="nvapi-VOTRE_CLE")
def chat_avec_retry(messages, model="meta/llama-3.3-70b-instruct", essais=5):
for i in range(essais):
try:
return client.chat.completions.create(model=model, messages=messages)
except Exception as e:
if "429" in str(e) and i < essais - 1:
time.sleep(2 ** i) # 1s, 2s, 4s, 8s...
continue
raisePrivacidade. No teste gratuito, suas entradas e saídas podem ser registradas pela NVIDIA para fornecer e melhorar o serviço. Não envie dados confidenciais ou pessoais sensíveis pelo nível gratuito.
Quando permanecer local mesmo assim
O endpoint não mata o local — ele o complementa. Fique local quando: (1) seus dados são sensíveis e não devem sair, (2) você trabalha offline, (3) você quer uma latência ultrastável, ou (4) você está em grande escala e a auto-hospedagem sai mais barata. Para todo o resto — prototipagem, demos, side-projects, aprendizado — o endpoint gratuito é imbatível. E no dia em que quiser passar para produção auto-hospedada, a NVIDIA oferece uma licença R&D gratuita (até 16 GPUs) e um teste de 90 dias do AI Enterprise.
Você agora sabe conectar mais de 100 modelos em uma URL. O próximo passo: aprender a controlar esses modelos como um profissional (prompts, agentes, automação) com nossos cursos práticos — código real, zero enrolação.
./cours-gratuit-claude-code voir tous les coursFAQ
build.nvidia.com é realmente gratuito?
Preciso reescrever meu código OpenAI?
base_url (https://integrate.api.nvidia.com/v1) e a chave (nvapi-). Streaming, function calling e tool use funcionam de forma idêntica.Meus dados são privados?
Qual modelo escolher para começar?
📬 Quer receber este tipo de guia toda semana? Inscreva-se gratuitamente — código real, zero enrolação.