NVIDIA build.nvidia.com: 100+ modelos de IA em API gratuita (acabou os modelos locais)

NVIDIA abre 100+ modelos de IA via uma API gratuita compatível com OpenAI: uma única URL, uma chave nvapi-, zero GPU, zero armazenamento. Guia completo com código real (Python, Node, cURL, Cursor, LangChain).

NVIDIA build.nvidia.com: 100+ modelos de IA em API gratuita (acabou os modelos locais)

A NVIDIA acabou de eliminar o maior obstáculo da IA local: o hardware. Com build.nvidia.com, você acessa mais de 100 modelos de IA de ponta (Llama, Nemotron, DeepSeek, GLM-4, gpt-oss…) por meio de uma API gratuita, compatível com OpenAI. Sem necessidade de baixar 200 GB de pesos, sem necessidade de uma GPU de 2.000 $, sem mais "disco cheio". Você altera duas linhas no seu código e executa nos GPUs da NVIDIA, na nuvem. Nós desvendamos tudo, com código real copiável.

tl;dr
  • build.nvidia.com = catálogo de inferência hospedada da NVIDIA (marca NIM), endpoint compatível com OpenAI.
  • URL base única: https://integrate.api.nvidia.com/v1 + uma chave nvapi-. Você reutiliza o SDK OpenAI exatamente como está.
  • Grátis: 1 000 créditos no cadastro (até 5 000 mediante solicitação), 40 requisições/min, sem cartão de crédito, sem GPU.
  • Mais de 100 modelos + Agentic Skills (capacidades prontas para uso em seus agentes).
  • Ideal para prototipar: adeus aos limites de armazenamento e VRAM da sua máquina.
flowchart LR
    A["Seu código / IDE"] --> B["OpenAI SDK"]
    B --> C["Endpoint NVIDIA
integrate.api.nvidia.com/v1"] C --> D["NIM · GPU na nuvem"] D --> E["100+ modelos
Llama · Nemotron · DeepSeek"]
./architecture — do SDK OpenAI aos GPUs NVIDIA em uma URL

O que é build.nvidia.com (NVIDIA NIM) ?

Desde 2024, a NVIDIA implanta NIM (NVIDIA Inference Microservices): uma camada que serve modelos de IA otimizados para seus GPUs. Existem duas metades: contêineres que você pode hospedar sozinho e um catálogo de inferência hospedada — este último que está fazendo barulho hoje em build.nvidia.com.

A ideia genial: o endpoint é compatível com a API OpenAI. Concretamente, qualquer ferramenta, framework ou app que saiba apontar para uma « base URL » personalizada pode mirar a NVIDIA sem nenhuma outra modificação de código. Streaming, function calling, tool use: tudo funciona como com a OpenAI.

NOTE

« Compatível com OpenAI » significa que a forma das requisições e respostas (Chat Completions) é idêntica. Você mantém seu código, altera apenas base_url e api_key.

Por que é uma bomba: acabou os modelos locais

Executar um modelo grande em casa é um verdadeiro desafio: baixar dezenas (ou centenas) de gigabytes, ter VRAM suficiente, gerenciar drivers CUDA e aceitar que seu laptop esquente como um radiador. O endpoint na nuvem resolve tudo de uma vez.

CritérioModelo localEndpoint NVIDIA
Armazenamento40 a 400+ GB por modelo0 GB (nada para baixar)
HardwareGPU com muita VRAMNenhum (GPU no lado da NVIDIA)
Tempo para começarHoras (drivers, pesos, quantização)~3 minutos (uma chave)
Escolha de modelosO que sua máquina aguentaMais de 100 modelos, incluindo alguns de 500B+
Custo de entradaAlto (placa de vídeo)Grátis (créditos oferecidos)
PrivacidadeTudo fica com vocêOs dados transitam pela NVIDIA

Comece em 3 minutos: sua chave nvapi-

O único pré-requisito é uma conta gratuita do programa de desenvolvedores da NVIDIA. Sem cartão de crédito.

Os passos: (1) acesse build.nvidia.com e faça login, (2) abra qualquer modelo, (3) clique em Get API Key, (4) copie a chave que começa com nvapi- — ela é exibida apenas uma vez. Depois, exporte-a e instale o SDK:

bash
# 1. Armazene sua chave em uma variável de ambiente
export NVIDIA_API_KEY="nvapi-xxxxxxxxxxxxxxxxxxxxxxxx"

# 2. Instale o SDK OpenAI (sim, o da OpenAI)
pip install openai
WARNING

A chave nvapi- é mostrada apenas uma vez. Copie-a imediatamente e nunca a faça commit no Git. Use uma variável de ambiente (como acima) ou um arquivo .env ignorado.

Seu primeiro chamado (Python)

Aqui está o exemplo mais curto que funciona. Observe as duas únicas coisas específicas da NVIDIA: base_url e a chave.

python
from openai import OpenAI

client = OpenAI(
    base_url="https://integrate.api.nvidia.com/v1",
    api_key="nvapi-VOTRE_CLE",   # ou os.environ["NVIDIA_API_KEY"]
)

resp = client.chat.completions.create(
    model="deepseek-ai/deepseek-v4-pro",
    messages=[{"role": "user", "content": "Explique le RAG en 3 phrases."}],
    temperature=0.7,
    max_tokens=1024,
)
print(resp.choices[0].message.content)
sortie
Le RAG (Retrieval-Augmented Generation) combine une recherche documentaire
avec un modèle de langage. On retrouve d'abord les passages pertinents dans
une base de connaissances, puis on les injecte dans le prompt pour que le
modèle réponde avec des faits à jour plutôt qu'avec sa seule mémoire.

Streaming, Node.js e cURL

O streaming (exibir a resposta palavra por palavra) funciona como com a OpenAI:

python
stream = client.chat.completions.create(
    model="meta/llama-3.3-70b-instruct",
    messages=[{"role": "user", "content": "Ecris un haiku sur le GPU."}],
    stream=True,
)
for chunk in stream:
    print(chunk.choices[0].delta.content or "", end="")

Em Node.js, é exatamente o mesmo SDK:

javascript
import OpenAI from "openai";

const client = new OpenAI({
  baseURL: "https://integrate.api.nvidia.com/v1",
  apiKey: process.env.NVIDIA_API_KEY,
});

const r = await client.chat.completions.create({
  model: "openai/gpt-oss-120b",
  messages: [{ role: "user", content: "Salut depuis Node !" }],
});
console.log(r.choices[0].message.content);

E em puro cURL, sem nenhum SDK:

bash
curl https://integrate.api.nvidia.com/v1/chat/completions \
  -H "Authorization: Bearer $NVIDIA_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "nvidia/nemotron-3-ultra-550b-a55b",
    "messages": [{"role": "user", "content": "Bonjour !"}]
  }'

Conecte Cursor, Claude Code e LangChain

Como o endpoint é compatível com OpenAI, você pode conectá-lo em qualquer lugar que aceite uma base URL personalizada. Para Cursor: nas configurações de modelos, informe a base URL https://integrate.api.nvidia.com/v1 e sua chave nvapi- — o chat, o autocompletar e o agente passam a usar modelos hospedados pela NVIDIA. Mesma lógica para Claude Code, LangChain, CrewAI ou AutoGen: altere apenas a base URL e o ID do modelo.

python
from langchain_openai import ChatOpenAI

llm = ChatOpenAI(
    base_url="https://integrate.api.nvidia.com/v1",
    api_key="nvapi-VOTRE_CLE",
    model="meta/llama-3.3-70b-instruct",
)
print(llm.invoke("Donne-moi 3 idees de projets IA pour debuter.").content)
TIP

Quer listar todos os modelos disponíveis de uma vez? Chame o endpoint /models — também é compatível com OpenAI.

bash
curl -s https://integrate.api.nvidia.com/v1/models \
  -H "Authorization: Bearer $NVIDIA_API_KEY" | jq '.data[].id'

Os modelos disponíveis + as Agentic Skills

O catálogo ultrapassa 100 modelos: famílias Llama e Nemotron (NVIDIA), DeepSeek, GLM-4 (Zhipu AI), gpt-oss (OpenAI em open weights), MiniMax, sem contar os modelos de embeddings, reconhecimento de voz e simulação. Cada ficha de modelo exibe sua tarifa: alguns são totalmente gratuitos, outros consomem seus créditos.

A NVIDIA também promove as Agentic Skills: capacidades prontas para uso que seu agente pode chamar, organizadas por domínio — AI & Machine Learning, Accelerated Computing, Physical AI, Developer Tools. O suficiente para montar um agente que age, não apenas conversa.

NOTE

A lista de modelos muda com frequência (a NVIDIA adiciona regularmente). Filtre por « Free Endpoint » no catálogo para ver apenas os modelos gratuitos.

Os limites do plano gratuito (para saber)

O nível gratuito é generoso para prototipar, mas tem limites claros:

Limite (2026)Valor
Créditos no cadastro1 000 créditos de inferência
Créditos máximos mediante solicitaçãoAté 5 000
Taxa (rate limit)40 requisições / minuto
Prefixo da chavenvapi-
Cartão de créditoNão exigido

Se você exceder a taxa, a API retorna um erro 429 Too Many Requests. A solução clássica: espaçar as chamadas e tentar novamente com um atraso crescente (backoff).

python
import time
from openai import OpenAI

client = OpenAI(base_url="https://integrate.api.nvidia.com/v1", api_key="nvapi-VOTRE_CLE")

def chat_avec_retry(messages, model="meta/llama-3.3-70b-instruct", essais=5):
    for i in range(essais):
        try:
            return client.chat.completions.create(model=model, messages=messages)
        except Exception as e:
            if "429" in str(e) and i < essais - 1:
                time.sleep(2 ** i)   # 1s, 2s, 4s, 8s...
                continue
            raise
WARNING

Privacidade. No teste gratuito, suas entradas e saídas podem ser registradas pela NVIDIA para fornecer e melhorar o serviço. Não envie dados confidenciais ou pessoais sensíveis pelo nível gratuito.

Quando permanecer local mesmo assim

O endpoint não mata o local — ele o complementa. Fique local quando: (1) seus dados são sensíveis e não devem sair, (2) você trabalha offline, (3) você quer uma latência ultrastável, ou (4) você está em grande escala e a auto-hospedagem sai mais barata. Para todo o resto — prototipagem, demos, side-projects, aprendizado — o endpoint gratuito é imbatível. E no dia em que quiser passar para produção auto-hospedada, a NVIDIA oferece uma licença R&D gratuita (até 16 GPUs) e um teste de 90 dias do AI Enterprise.

passe-a-la-pratique

Você agora sabe conectar mais de 100 modelos em uma URL. O próximo passo: aprender a controlar esses modelos como um profissional (prompts, agentes, automação) com nossos cursos práticos — código real, zero enrolação.

./cours-gratuit-claude-code voir tous les cours

FAQ

build.nvidia.com é realmente gratuito?
Sim para começar: 1 000 créditos de inferência oferecidos no cadastro (até 5 000 mediante solicitação), 40 requisições/minuto, sem cartão de crédito. Alguns modelos são 100 % gratuitos, outros consomem seus créditos — cada ficha de modelo indica.
Preciso reescrever meu código OpenAI?
Não. O endpoint é compatível com OpenAI: você altera apenas base_url (https://integrate.api.nvidia.com/v1) e a chave (nvapi-). Streaming, function calling e tool use funcionam de forma idêntica.
Meus dados são privados?
No nível gratuito, a NVIDIA pode registrar suas entradas/saídas para melhorar o serviço. Para dados sensíveis, permaneça local ou migre para uma oferta auto-hospedada (licença R&D gratuita, ou AI Enterprise para produção).
Qual modelo escolher para começar?
Para uso geral, um Llama 3.x 70B ou um Nemotron cumprem muito bem a tarefa. Para raciocínio, teste DeepSeek. Liste tudo com o endpoint /models e filtre « Free Endpoint » no catálogo.

📬 Quer receber este tipo de guia toda semana? Inscreva-se gratuitamente — código real, zero enrolação.