Skip to content
OpenAI Jalapeño: Keputusan Benchmark Pertama Sudah Keluar

OpenAI Jalapeño: Keputusan Benchmark Pertama Sudah Keluar

OpenAI Jalapeño: Keputusan Benchmark Pertama Sudah Keluar

Dalam Hot Chips 2026, OpenAI akhirnya buka kartu. Jalapeño — chip inference custom pertama mereka, dibangunkan bersama Broadcom — baru sahaja publish nombor benchmark pertama, dan angkanya serius. Merentasi tiga model open-weight, Jalapeño deliver 1.5 hingga 1.9 kali lebih banyak kerja AI per watt pada peak throughput, dan latency end-to-end 1.7 hingga 3.6 kali lebih rendah berbanding sistem perbandingan berasaskan Nvidia Blackwell.

Keputusan ini diuji melalui InferenceX benchmark dari SemiAnalysis, suite public yang mengukur keseluruhan lifecycle serving AI request — bukan sekadar FLOPS mentah, tapi seberapa cepat token sampai kepada pengguna di bawah beban yang realistik.

Apa Yang Diuji

Perbandingan dijalankan atas tiga model public: GPT-OSS 120B, DeepSeek R1 670B, dan Kimi K2.5 1T (model trillion-parameter dari Moonshot AI). Workload ujiannya ialah prompt 8k token dengan response 1k token — senario single-turn yang merangkumi high-throughput serving sehingga low-latency interactive use.

Sistem perbandingan ialah konfigurasi GB200/GB300 Blackwell dari Nvidia. Keputusan dinormalisasikan mengikut chip power rating yang diterbitkan oleh setiap accelerator.

Ini data utamanya:

MetrikJalapeño vs Blackwell
Kerja per watt (peak throughput)1.5–1.9x lebih tinggi
Latency end-to-end1.7–3.6x lebih rendah
Prestasi workload interaktif2.1–4.1x lebih tinggi
Throughput/kW pada TBT paling rendah8.6–104.3x lebih tinggi

Untuk DeepSeek R1 khususnya, SemiAnalysis mengukur lebih 700 tokens sesaat setiap pengguna pada concurrency level 1. Itu nombor sebenar, datang dari benchmark runs yang disahkan di makmal OpenAI.

Trik 700W

Jalapeño dinilai pada 700 watt, tapi kuasa sustained semasa ujian ini kekal pada atau di bawah 550 watt. Perbezaan tu penting. Chip ini guna power budget yang nampak kompetitif di atas kertas, tapi dalam praktik ia minum kurang daripada ratingnya sambil deliver nombor prestasi kat atas tu.

Ketua hardware OpenAI Richard Ho cakap terang: "Jalapeño boleh serve lebih banyak kerja AI per unit kuasa, sambil respons pun lebih cepat." Gabungan inilah yang jadi kunci — sistem sedia ada biasanya paksa anda pilih antara throughput dan latency. Jalapeño claim dia pecahkan tradeoff tu dalam satu seni bina.

Cara Ia Berfungsi

Jalapeño bukan GPU serba guna yang diadaptasi untuk inference. Ia direka dari zero untuk LLM serving, dibina sekitar tiga fasa proses inference:

Prefill — memproses prompt input, yang intensif compute. Decode — menjana token, yang bergantung pada memory bandwidth. Communication — memindahkan data antara chip, yang selalunya menambah latency.

Rekaannya secara eksplisit meminimumkan pergerakan data. Model state, termasuk KV cache yang digunakan semasa menjana respons, boleh diletakkan dan dikekalkan secara lokal. Sistem mengaktifkan gabungan compute, memory, dan networking yang tepat bagi setiap fasa, bukannya menangani mereka secara seragam.

Seni Bina Jalapeño (ringkas)
┌─────────────────────────────────────────┐
│  Model State / KV Cache — kekal lokal   │
├────────────────┬────────────────────────┤
│  Fasa Prefill  │  Laluan Compute-       │
│  (prompt masuk)│  optimized             │
├────────────────┼────────────────────────┤
│  Fasa Decode   │  Laluan Memory-        │
│  (penjanaan    │  bandwidth-optimized   │
│   token)       │                        │
├────────────────┴────────────────────────┤
│  Networking — silikon Tomahawk,         │
│  peletakan eksplisit                    │
└─────────────────────────────────────────┘

Implementasi Broadcom merangkumi silikon networking Tomahawk dan interconnect custom. Matlamatnya ialah utilisasi "jauh lebih hampir kepada theoretical peak performance" — satu dakwaan berani dalam ruang di mana kebanyakan accelerator buang sejumlah besar cycle pada pergerakan data.

Gelung Codex

Satu benda menarik: OpenAI guna AI mereka sendiri untuk bina stack software Jalapeño. Pasukan itu bawa tiga model open-weight kepada prestasi tinggi pada Jalapeño dalam dua bulan pakai Codex dengan GPT-Astra. Untuk blok attention dan mixture-of-experts yang dipilih, implementasi kernel yang dijana AI berjalan 1.5 hingga 1.8 kali lebih pantas berbanding kod yang ditulis oleh pakar manusia.

Itu bukan speedup untuk keseluruhan model — ia terpakai untuk blok yang dipilih — tapi ia tunjuk ke arah gelung maklum balas di mana model bantu bina hardware yang menjalankan mereka dengan lebih cepat.

# Contoh: stack serving Jalapeño memuatkan model dengan
# peletakan KV-cache eksplisit bagi setiap fasa inference
import jalapeno_serve as js

config = js.InferenceConfig(
    model="deepseek-r1-670b",
    kv_cache_placement="local",     # kekalkan cache pada chip
    prefill_policy="compute_opt",
    decode_policy="bandwidth_opt",
    max_concurrent_users=64,
)

server = js.InferenceServer(config)
server.start()  # serve dari state lokal, tiada pergerakan KV antara chip

Caveat Penting

Keputusannya nyata tapi terhad. SemiAnalysis mengesahkan larian tersebut, tapi ada beberapa sekatan:

  • Workload pendek sahaja. Ujian pakai senario single-turn 8k/1k. Workload multi-turn dengan context panjang — yang menekan routing dan cache management — tak diuji.
  • Bukan menentang Vera Rubin. Perbandingan adalah menentang Blackwell. Platform Nvidia Vera Rubin yang lebih baru, pakai HBM4 memory dan ships pada timeframe yang sama, bukan sebahagian daripada benchmark.
  • Engineering sample. Jalapeño masih di peringkat engineering sample. Kelayakan production sedang dijalankan.
  • Inference sahaja. Chip ini tak melatih model. Nvidia kekal tak dicabar untuk workload training.

Jadual Deployment

OpenAI merancang untuk deploy Jalapeño dalam infrastruktur komputer mereka menjelang akhir 2026, walaupun "dalam volum yang sangat kecil." CEO Broadcom Hock Tan beritahu CNBC bahawa skala bermakna tiba pada 2027, dengan production penuh pada separuh pertama 2028.

Mereka kata generasi 2 sedang dalam pembangunan yang mendalam dan generasi 3 sedang dibentuk. Setiap generasi akan push kecekapan lebih jauh.

Apa Ini Bermakna

Keputusan benchmark letak OpenAI sebagai pemain silikon yang kredibel, bukan sekadar syarikat perisian. Tapi impak segera adalah ekonomi, bukan seni bina. Jika kelebihan per-watt Jalapeño kekal dalam production, ia turunkan kos setiap token yang di-serve di ChatGPT, Codex, dan API.

Bagi industri lain, isyaratnya ialah integrasi vertical — mereka model, software serving, dan chip bersama — menghasilkan keuntungan yang boleh diukur. OpenAI akan terus deploy accelerator Nvidia bersama Jalapeño. Soalannya bukan sama ada custom silicon gantikan GPU, tapi berapa banyak inference work berpindah ke chip first-party dalam dua tahun akan datang. Jika anda berminat dengan ekosistem model terbuka NVIDIA, lihat liputan kami mengenai Nemotron 3 Ultra.

Ujian sebenar tiba pada 2027, bila Jalapeño berdepan dengan Vera Rubin pada workload production dengan trafik sebenar. Sehingga itu, nombor ini menjanjikan tapi terkawal.

// penulis

Gaara

Chief Operator

Gaara is the human operator behind hejes.my. He runs the briefing pipeline, curates the AI drafts, and presses the publish button.

GPT-5.6 Sol Ultrafast: 14x Lebih Cepat pada 750 Token Sesaat
GPT-5.6 Sol Ultrafast: 14x Lebih Cepat pada 750 Token Sesaat
>·6 baca lagi

GPT-5.6 Sol Ultrafast: 14x Lebih Cepat pada 750 Token Sesaat

Mod Ultrafast OpenAI menjalankan GPT-5.6 Sol pada 750 token sesaat atas cip Cerebras — 14x lebih cepat tanpa kehilangan kualiti.

openaicerebrasinference
>baca lagi_
llama.cpp Sertai Hugging Face: Local AI Ada Rumah Sendiri
llama.cpp Sertai Hugging Face: Local AI Ada Rumah Sendiri
>·5 baca lagi

llama.cpp Sertai Hugging Face: Local AI Ada Rumah Sendiri

Pasukan ggml.ai di sebalik llama.cpp kini menyertai Hugging Face. Runtime kekal 100% open source, dan jambatan transformers ke GGUF bakal jadi lebih pendek.

aiopen-sourcellm
>baca lagi_
GLM-5.3-Flash vs Qwen3.8-Flash-Next: Dua Makmal, Satu Reka Bentuk
GLM-5.3-Flash vs Qwen3.8-Flash-Next: Dua Makmal, Satu Reka Bentuk
>·7 baca lagi

GLM-5.3-Flash vs Qwen3.8-Flash-Next: Dua Makmal, Satu Reka Bentuk

Z.ai dan Qwen lancar seni bina LLM hibrid yang hampir serupa dalam sehari: linear attention nisbah 3:1, bajet sparse 2048 token, empat cabang gated residual setiap satu.

aillmopen-source
>baca lagi_

// sertai suapan

satu ilmu seminggu. tiada spam.