
NVIDIA Nemotron 3 Ultra: Model Terbuka 550B untuk Agentic AI
NVIDIA Nemotron 3 Ultra: Model Terbuka 550B untuk Agentic AI
Pada 4 Jun 2026, NVIDIA mengumumkan Nemotron 3 Ultra — model terbesar dalam keluarga Nemotron 3. Jumlah parameternya ialah 550 bilion, tetapi hanya 55 bilion yang aktif pada satu-satu masa melalui seni bina Mixture-of-Experts (MoE).
Yang dikejar di sini bukan chat biasa.
Nemotron 3 Ultra direka untuk agentic workloads: sistem yang boleh berjalan berjam-jam, menggunakan tools, menulis kod, menjalankan research dan menyelaraskan beberapa agent untuk menyelesaikan tugasan yang lebih besar.
Cara NVIDIA membuka model ini pun menarik. Ia sepenuhnya open-source — weights, training recipe dan datasets semuanya tersedia. Ini bukan sekadar satu lagi model yang boleh kamu akses melalui hosted API. NVIDIA turut menyediakan infrastruktur di sebaliknya.
Spesifikasi Model
| Spesifikasi | Butiran |
|---|---|
| Architecture | Hybrid Mamba-Attention MoE dengan LatentMoE |
| Parameters | 550B keseluruhan / 55B aktif |
| Context Length | 1,048,576 token (1M) |
| Quantization | NVFP4 (pre-trained), BF16 tersedia |
| License | NVIDIA Nemotron Open Model License (enterprise-friendly, on-prem dibenarkan) |
| MTP Layers | 2 lapisan Multi-Token Prediction dengan shared-weight |
Mengapa Agentic AI Perlukan Ini
Sistem agentic ada keperluan yang berbeza daripada chatbot.
Sesi chat biasa hanya perlukan context yang cukup untuk menjawab perbualan semasa. Seorang agent pula boleh mengumpul tool results, fail, keputusan terdahulu, intermediate reasoning dan pelbagai state lain sepanjang ratusan atau ribuan langkah.
Keperluan yang terhasil jelas empat:
- Massive context — agent mengumpul history, tool outputs dan intermediate reasoning sepanjang ribuan langkah
- High throughput — inference cost berlipat ganda apabila agent berjalan berjam-jam
- Reliable tool calling — structured output, function calling, code execution
- Reasoning control — budget-aware inference untuk tradeoff cost/kualiti
Nemotron 3 Ultra dibina untuk memenuhi keperluan ini.
Context window 1M token model ini mengatasi open LLM terbaik lain pada RULER untuk panjang 1M token. Architecture hybrid Mamba-Attention dengan LatentMoE juga direka supaya inference kekal efisien. Pada tetapan 8k input / 64k output, NVIDIA melaporkan inference throughput 5.9x lebih tinggi berbanding GLM-5.1-754B-A40B dan 4.8x lebih tinggi berbanding Kimi-K2.6-1T-A32B.
Dua lapisan Multi-Token Prediction (MTP) turut berperanan penting. MTP membolehkan speculative decoding secara native, manakala reasoning budget controls memberi developer cara untuk membatasi compute yang boleh dibelanjakan model pada setiap langkah.
Bagi agent yang berjalan lama, kawalan sebegini penting. Sistem yang boleh reasoning tanpa had tidak semestinya berguna kalau setiap langkah menjadi terlalu mahal.
Akses API Percuma (OpenRouter)
Kalau mahu cuba Nemotron 3 Ultra tanpa setup data center dulu, OpenRouter ada route percuma:
Model ID: nvidia/nemotron-3-ultra-550b-a55b:free
Context: 1,000,000 token
Max Output: 65,536 token
Rate Limits (free tier): 20 RPM, 200 RPD
Contoh panggilan API:
from openai import OpenAI
client = OpenAI(
base_url="https://openrouter.ai/api/v1",
api_key="YOUR_OPENROUTER_KEY"
)
response = client.chat.completions.create(
model="nvidia/nemotron-3-ultra-550b-a55b:free",
messages=[{"role": "user", "content": "Design a multi-agent research system"}],
max_tokens=8192
)
Free tier dihadkan kepada 20 request seminit dan 200 request sehari. Kalau tak cukup, tambah $5–10 ke akaun untuk unlock "Paid tier" — had naik ke 1,000 request sehari. Had seminit kekal 20, manakala paid models tak tertakluk pada had free-tier OpenRouter.
Endpoint percuma ini berguna untuk testing dan prototyping, walaupun bukan itu cara kamu nak jalankan production agent system.
Deployment Self-Hosted (Tanpa Had)
Untuk production workloads, pilihan lain ialah jalankan model sendiri. Self-hosting hapuskan API limits dan bagi kamu kawalan penuh ke atas inference stack.
| Platform | Status |
|---|---|
| TensorRT-LLM | ✅ Optimized kernels untuk MoE + Mamba |
| vLLM / SGLang | ✅ |
| NIM Microservices | ✅ Diuruskan NVIDIA, production-grade |
| NeMo Framework | ✅ Training + inference |
NVIDIA turut sediakan beberapa checkpoint melalui Hugging Face:
nvidia/NVIDIA-Nemotron-3-Ultra-550B-A55B-NVFP4— quantized, post-trainednvidia/NVIDIA-Nemotron-3-Ultra-550B-A55B-BF16— post-trainednvidia/NVIDIA-Nemotron-3-Ultra-550B-A55B-Base-BF16— base modelnvidia/NVIDIA-Nemotron-3-Ultra-550B-A55B-GenRM— reward model untuk RLHF
Ada satu benda penting: 550 bilion parameter tetap banyak untuk dijalankan.
Ini wilayah multi-GPU — hardware kelas H100 atau A100 disyorkan. NVFP4 buat model lebih mudah diurus, tetapi ia tidak menjadikan model 550B sesuatu yang boleh berjalan santai pada desktop GPU.
Kalau kamu cuma ada satu GPU, model NVIDIA yang lebih kecil lebih praktikal. Nemotron 3 Super ialah 120B/12B, manakala Nemotron 3.5 Lightning ialah 30B/3B dengan MTP.
Training Pipeline (Fully Reproducible)
Salah satu perkara paling menarik dalam release ini — NVIDIA tidak berhenti setakat publish model weights. Training recipe yang lengkap tersedia dalam NVIDIA-NeMo/Nemotron.
Pipeline-nya:
Pretrain (20T token, NVFP4, 2-phase curriculum)
↓
SFT — multi-domain, 12+ data sources
↓
RLVR — 21 verifiable reward environments
↓
MOPD — Multi-teacher On-Policy Distillation
↓
MTP Boosting — Multi-Token Prediction heads
NVIDIA turut lepaskan beberapa dataset yang digunakan dalam proses ini:
- Nemotron-Pretraining-Code-v3 — 173B token kod GitHub segar (sehingga Sept 2025)
- Nemotron-Pretraining-Legal-v1 — legal reasoning sintetik
- Nemotron-Pretraining-Specialized-v1.2 — factual recall, senario moral, data MCQ/generative QA
- Nemotron-Posttraining-v3 — data SFT/RL untuk capability agentic, reasoning dan umum
Release ini jadi lebih berharga untuk pasukan research yang nak bereksperimen dengan pendekatan training itu sendiri, bukan sekadar download checkpoint dan jalankan inference.
Keluarga Nemotron 3 (Cari Saiz yang Sesuai)
Ultra ialah model flagship, tetapi bukan satu-satunya pilihan dalam keluarga ini.
| Tier | Params (Total/Active) | Use Case |
|---|---|---|
| Nano | 31.6B / 3.6B | Edge, PC, single GPU |
| Lightning | 30B / 3B + MTP | High-volume task execution, long-running agents |
| Super | 120.6B / 12.7B | Single GPU, frontier reasoning/coding |
| Ultra | 550B / 55B | Multi-GPU data center, agentic reasoning at scale |
| Nano Omni | 30B / 3B | Multimodal (teks, imej, video, audio) |
Julat saiz ini penting sebab tak semua agent perlukan model 550B.
Nano dan Lightning jauh lebih praktikal untuk edge atau high-volume workloads. Super pula di tengah-tengah — untuk pasukan yang nak reasoning dan coding yang lebih kuat tanpa perlu terus masuk ke deployment Ultra berskala data center.
Ultra memang untuk peringkat paling atas: sistem agent yang besar dan berjalan lama, di mana keupayaan tambahan dan context yang luas berbaloi dengan kos infrastruktur.
Apa yang Boleh Dibina
Dengan Nemotron 3 Ultra, beberapa workload jadi lebih menarik:
- Research agents yang menyerap korpus 1M token dan mensintesis dapatan
- Coding agents yang mengekalkan full repository context sepanjang ribuan edit
- Multi-agent orchestration dengan shared long-term memory
- Autonomous workflows yang berjalan berjam-jam dengan budget-controlled reasoning
Context 1M token amat berguna untuk aplikasi yang selalu terpaksa summarize atau trim context. Research agent, contohnya, boleh bekerja dengan bahan sumber yang jauh lebih besar tanpa perlu sentiasa buang maklumat lama.
Bagi coding agents, perkara yang sama terpakai untuk repositori besar dan tugasan yang berjalan lama. Daripada rebuild context berulang kali dalam window yang kecil, sistem boleh kekalkan lebih banyak state projek.
Training recipe yang turut dibuka juga sebahagian cerita pasal release ini. Pasukan boleh replikasi metodologi, adapt sebahagian daripadanya, atau guna data sendiri di mana lesen dan setup training membenarkannya.
NVIDIA Nemotron Open Model License turut benarkan penggunaan komersial dan deployment on-prem — model ini relevan untuk organisasi yang tidak mahu atau tidak boleh hantar workloads ke API luaran.
Kesimpulan
Nemotron 3 Ultra ialah open model flagship NVIDIA untuk agentic workloads: 550 bilion parameter keseluruhan, 55 bilion aktif, context window 1M token dan seni bina hybrid Mamba-Attention MoE.
Yang lebih penting, NVIDIA membuka weights bersama training recipe dan datasets. Ini menjadikannya open infrastructure, bukan sekadar satu lagi model yang ada pada API.
Untuk experiment, OpenRouter free tier mungkin tempat paling mudah untuk mula. Untuk production workloads, laluan yang lebih serius ialah self-hosting dengan TensorRT-LLM dan NVFP4 — asalkan ada kapasiti GPU untuk support model sebesar ini.
Dan kalau Ultra terlalu besar untuk hardware yang kamu ada, keluarga Nemotron 3 menyediakan pilihan yang lebih kecil.
Sistem agentic perlukan model yang boleh mengekalkan context, guna tools, reasoning melalui tugasan panjang dan berjalan tanpa inference costs melambung. Nemotron 3 Ultra ialah percubaan NVIDIA untuk satukan semua elemen ini dalam satu open model.
// penulis
Chief Operator
Gaara is the human operator behind hejes.my. He runs the briefing pipeline, curates the AI drafts, and presses the publish button.
sektor berkaitan //

llama.cpp Sertai Hugging Face: Local AI Ada Rumah Sendiri
Pasukan ggml.ai di sebalik llama.cpp kini menyertai Hugging Face. Runtime kekal 100% open source, dan jambatan transformers ke GGUF bakal jadi lebih pendek.

GLM-5.3-Flash vs Qwen3.8-Flash-Next: Dua Makmal, Satu Reka Bentuk
Z.ai dan Qwen lancar seni bina LLM hibrid yang hampir serupa dalam sehari: linear attention nisbah 3:1, bajet sparse 2048 token, empat cabang gated residual setiap satu.

Perplexity Portable Computer: Agent AI Tempatan di DGX Spark
Perplexity memperkenalkan Portable Computer — agent AI sepenuhnya tempatan berjalan di atas DGX Spark, tanpa kos per-token, sandbox ditadbir OS, dan eskalasi ke cloud atas kebenaran pengguna.
// sertai suapan
satu ilmu seminggu. tiada spam.