Skip to content
GLM-5.3-Flash vs Qwen3.8-Flash-Next: Dua Makmal, Satu Reka Bentuk

GLM-5.3-Flash vs Qwen3.8-Flash-Next: Dua Makmal, Satu Reka Bentuk

> · 7 min#ai#llm#open-source#inference#moe

GLM-5.3-Flash vs Qwen3.8-Flash-Next: Dua Makmal, Satu Reka Bentuk

Dua model frontier open-weight keluar dalam jarak hampir sehari minggu ini. Z.ai melancarkan GLM-5.3-Flash, model multimodal MoE bersaiz 320B dengan 18B parameter aktif. Pasukan Qwen dari Alibaba pula melancarkan Qwen3.8-Flash-Next, model 125B dengan 6B parameter aktif yang menjadi pratonton awal seni bina Qwen4.

Dua pasukan mereka bentuk sistem ini secara berasingan, tapi config mereka tetap kelihatan macam salinan yang hampir serupa. Kedua-dua guna hibrid 3:1 antara linear attention dan full attention. Kedua-dua memilih konteks dengan indexer mampat yang dihadkan kepada 2048 token. Kedua-dua melebarkan residual stream kepada empat cabang gated. Kedua-dua dilatih dengan optimizer Muon, membelah matriks fius sebelum orthogonalization. Evolusi konvergen memang lumrah dalam machine learning; yang menariknya, kali ini konvergensi berlaku pada corak yang sangat spesifik dan ketat.

Dua release secara ringkas

GLM-5.3-Flash ialah model multimodal native pertama dalam siri GLM-5, diterbitkan di bawah lesen MIT di Hugging Face. Sebelum ia didedahkan, Z.ai mengujinya tanpa nama di OpenRouter — model sulit itu jadi model paling popular minggu tersebut, dan komuniti, bukan lab, yang buka cerita ini. Model ini dilatih dengan korpus multimodal 30T token dan menyajikan context window 1M token. Z.ai kata ia menewaskan GLM-5.2 merentas benchmark pada harga satu per sepuluh, sambil menghampiri Claude Opus 4.8 untuk tugasan coding dan agentic. Harga senarai: $0.15/M token input, $0.50/M token output.

Qwen3.8-Flash-Next memainkan peranan yang sama seperti Qwen3-Next terhadap Qwen3.5: pratonton awal untuk keluarga seni bina baharu. Model card menyenaraikan model utama 125B ditambah jadual n-gram embedding 51B, dengan 6B parameter diaktifkan setiap token. Konteks native ialah 262,144 token, boleh dikembangkan ke 1M dengan YaRN. Katanya, latihan cuma mengambil kos compute sekitar 1/9 daripada Qwen3.7-Plus. Laporan teknikalnya bertajuk "On the Design of Qwen3.8-Next Architecture: Evaluation, Efficiency, and Training Stability." Anggap semua dakwaan prestasi dan harga di sini sebagai vendor-stated — benchmark bebas untuk Flash-Next hampir belum wujud, seperti yang dicatatkan penganalisis model gap.

Perkongsian rahsia 1: tiga daripada setiap empat lapisan attention ialah linear

Attention ialah bahagian transformer yang paling mahal, dan KV cache yang membesar mengikut konteks. Dua-dua makmal buang sebahagian besar daripadanya. GLM-5.3-Flash menyusun 45 lapisan — 34 lapisan linear-attention dan 11 lapisan full-attention, mengikut config yang sudah digabung dalam llama.cpp. Qwen3.8-Flash-Next menyusun 48 lapisan sebagai blok berulang 3 lapisan Gated DeltaNet plus 1 lapisan Qwen Sparse Attention, mengikut resipi vLLM. Nisbah 3:1 yang sama.

Lapisan linear dapat nama mereka daripada triknya: bukannya KV cache yang membesar ikut panjang input, semua sejarah dimampatkan ke dalam recurrent state bersaiz tetap, jadi compute setiap token kekal rata walau prompt terus bertambah panjang. GLM guna Kimi Delta Attention (KDA), reka bentuk yang diperkenalkan Moonshot AI dalam Kimi Linear, dengan decay gate halus per-channel. Qwen guna Gated DeltaNet (GDN) mereka sendiri yang menerapkan gate di peringkat per-head. Granulariti berbeza, keluarga delta-rule yang sama, kerja yang sama.

Baki suku lapisan mengendalikan retrieval jarak jauh yang tepat. GLM guna NoPE multi-head latent attention (MLA) gaya DeepSeek. Qwen guna grouped-query attention dalam QSA. Di sinilah KV cache sebenarnya duduk — dan di sinilah perkongsian rahsia kedua bermula.

Perkongsian rahsia 2: mampat 4x, kemudian simpan 2048 token

Kedua-dua model tidak membenarkan lapisan full-attention mereka menjangkau keseluruhan konteks. Kedua-duanya memasang indexer kecil yang dilatih untuk menilai cebisan sejarah dan menyimpan pemenang sahaja.

Lapisan sparse GLM guna lightning indexer 32-head dengan pemilihan top-2048, berasal daripada DSA DeepSeek. Untuk mengurangkan kos indexer pada konteks 1M token, Z.ai memperkenalkan IndexPool, yang memampatkan empat vektor kunci indexer menjadi satu melalui weighted pooling sebelum penilaian. QSA Qwen pula beroperasi pada granulariti micro-block: indexer ringan menilai blok 4 token dan menyimpan 512 blok teratas — iaitu tepat 2048 token. Dua implementasi, satu bajet. Qwen mengkreditkan QSA dengan pecutan prefill sehingga 7.6x dan decoding 4.9x berbanding full attention pada 1M token, menerusi rujukan NVIDIA di GB300 NVL72.

Bandingkan idea struktur kedua-dua model:

# Apa yang sebenarnya dihantar dalam weights
glm-5.3-flash:
  layers: 45
  linear: 34     # Kimi Delta Attention, per-channel decay gate
  full: 11       # NoPE MLA  (qk_rope_head_dim = 0)
  sparse_indexer: lightning 32-head, top-2048
  residual: mHC, 4 gated branches

qwen3.8-flash-next:
  layers: 48
  linear: 36     # Gated DeltaNet, per-head gate
  full: 12       # QSA, grouped-query
  sparse_indexer: micro-block 4-token, top-512 blocks (= 2048 tokens)
  residual: Gated Residual, 4 branches

Di pihak GLM, hasilnya besar. Berbanding GLM-5.3 penuh, Z.ai melaporkan seni bina Flash memotong compute attention lebih kurang 3x dan saiz KV cache 4.4x, sambil hampir separuh parameter aktif (18B vs 32B) dan lapisan (45 vs 92).

Perkongsian rahsia 3: empat residual stream menggantikan satu

Kedua-dua model meninggalkan residual stream tunggal yang menjadi definisi transformer sejak 2017, lalu melebarkannya kepada empat cabang selari, dengan gate mengawal apa yang dibaca dan ditulis oleh setiap blok.

GLM menggunakan Manifold-Constrained Hyper-Connections (mHC), reka bentuk berasal DeepSeek, ditala kepada 4 cabang dalam weights yang dihantar. Qwen menulis varian sendiri, Gated Residual, yang mengalirkan trafik menerusi 4 stream yang dilebarkan dengan read gate element-wise bergantung pada data dan write gate skalar setiap cabang. Qwen berhujah Gated Residual membuang langkah cabang-mixing tambahan yang diperlukan Hyper-Connections, mengurangkan overhead akses memori, serta gate itu menekan activation outliers cukup untuk menyokong penyimpanan residual FP8. Bahagian yang menarik: pasukan itu menjalankan ablasi untuk kedua-dua pendekatan dan mendapati ia hampir setara. Dua makmal, dua implementasi, satu kesimpulan — empat stream gated lebih baik daripada satu.

Perkongsian rahsia 4: Muon, dengan matriks fius dibelah dahulu

Kedua-dua model dilatih dengan optimizer Muon. Dan kedua-dua menerapkan penghalusan yang sama: matriks projeksi yang difius dibelah kembali kepada transformasi bebasnya sebelum Muon melakukan orthogonalization. Qwen mendokumenkan pembelahan projeksi QKV, SwiGLU, dan GDN yang difius — Muon untuk peta linear 2-D sebenar, AdamW untuk embeddings, router, dan parameter low-rank. Mereka juga menyesuaikan semula scaling law untuk seni bina baharu dan membuang batch-size warmup sepenuhnya selepas mengukur bahawa warmup itu memerlukan 18.8% lebih langkah optimizer tanpa menambah baik hasil. Bila dua makmal bebas membuang satu amalan latihan yang semua orang anggap standard, itu memang patut dicatat.

Di mana mereka berbeza: positional encoding

Pemisahan yang paling jelas ialah rotary position embeddings dalam lapisan full-attention. GLM-5.3-Flash membuangnya: config menetapkan qk_rope_head_dim = 0, jadi lapisan MLA sparse tersebut sepenuhnya NoPE. Maklumat posisi mengalir secara implisit melalui lapisan linear recurrent.

Qwen cuba perkara sama dan kekal dengan RoPE. Laporan teknikal mereka menjelaskan kenapa: NoPE tidak menunjukkan perbezaan terukur semasa pre-training, tapi selepas post-training, varian NoPE kerap gagal berhenti menjana. Ini hasil amaran yang berguna untuk industri. Lengkung loss pre-training boleh menyembunyikan kecacatan tingkah laku yang hanya muncul selepas penalaan peringkat RLHF.

MiniMax berkata tidak

Corak reka bentuk ini bukan milik dua makmal sahaja. DeepSeek mempelopori corak sparse-indexer-plus-2048-budget dengan DSA dalam DeepSeek-V3.2-Exp, dan mHC ialah reka bentuk DeepSeek yang kini dihantar dalam GLM. Kimi dari Moonshot membekalkan lapisan linear-attention yang tepat digunakan GLM. Model terbuka China jelas saling meminjam komponen seni bina dan mendarat pada corak yang serupa.

Pembangkang utama ialah MiniMax. Semasa pembangunan M2, pasukan menguji linear dan sliding-window attention pada skala besar dan mendapati defisit serius dalam multi-hop reasoning, terutamanya selepas 32K konteks selepas SFT — jadi M2 dihantar dengan full softmax attention dalam setiap lapisan. Untuk M3, mereka mengguna pakai MiniMax Sparse Attention, yang menjadikan softmax attention sparse melalui pemilihan blok, tanpa satu pun lapisan linear-attention. Jadi bidang ini belum benar-benar selesai: Z.ai, Qwen, DeepSeek, dan Kimi bertaruh hibrid linear 3:1 mengekalkan reasoning; ablasi MiniMax kata tidak, sekurang-kurangnya untuk stack mereka.

Apa yang perlu ditonton seterusnya

Bagi kebanyakan developer, mesej praktikalnya mudah: tier model terbuka yang murah serta pantas sedang jadi lebih murah secara struktur. Model dengan 6B aktif yang menjadi berita bajet sebegini ialah ceritanya sendiri — corak yang sama seperti yang kita bincangkan dengan tokenizer dan alatan GGUF kini berlaku pada lapisan seni bina model.

Dua perkara wajar diikuti. Pertama, apa yang akan dilakukan Qwen4 apabila ia mendarat di atas blueprint Flash-Next — pertaruhan Qwen3-Next terbukti berbaloi merentas tiga siri model penuh, jadi pratonton ini lebih daripada sekadar teaser. Kedua, sama ada resipi 3:1 bertahan di bawah penilaian bebas; buat masa ini GLM-5.3-Flash ada benchmark luar yang sebenar manakala Flash-Next masih self-reported. Kalau nisbah itu lulus pemeriksaan, kita akan nampak lebih banyak hibrid 3:1 pada 2027.

// penulis

Gaara

Chief Operator

Gaara is the human operator behind hejes.my. He runs the briefing pipeline, curates the AI drafts, and presses the publish button.

llama.cpp Sertai Hugging Face: Local AI Ada Rumah Sendiri
llama.cpp Sertai Hugging Face: Local AI Ada Rumah Sendiri
>·5 baca lagi

llama.cpp Sertai Hugging Face: Local AI Ada Rumah Sendiri

Pasukan ggml.ai di sebalik llama.cpp kini menyertai Hugging Face. Runtime kekal 100% open source, dan jambatan transformers ke GGUF bakal jadi lebih pendek.

aiopen-sourcellm
>baca lagi_
NVIDIA Nemotron 3 Ultra: Model Terbuka 550B untuk Agentic AI
NVIDIA Nemotron 3 Ultra: Model Terbuka 550B untuk Agentic AI
>·7 baca lagi

NVIDIA Nemotron 3 Ultra: Model Terbuka 550B untuk Agentic AI

NVIDIA memperkenalkan Nemotron 3 Ultra — model MoE 550B dengan context window sehingga 1 juta token, percuma di OpenRouter, direka untuk agentic AI.

ainvidianemotron
>baca lagi_
GPT-5.6 Sol Ultrafast: 14x Lebih Cepat pada 750 Token Sesaat
GPT-5.6 Sol Ultrafast: 14x Lebih Cepat pada 750 Token Sesaat
>·6 baca lagi

GPT-5.6 Sol Ultrafast: 14x Lebih Cepat pada 750 Token Sesaat

Mod Ultrafast OpenAI menjalankan GPT-5.6 Sol pada 750 token sesaat atas cip Cerebras — 14x lebih cepat tanpa kehilangan kualiti.

openaicerebrasinference
>baca lagi_

// sertai suapan

satu ilmu seminggu. tiada spam.