Skip to content
Needle 2: Model 14MB yang Panggil Tool pada Mana-mana Peranti

Needle 2: Model 14MB yang Panggil Tool pada Mana-mana Peranti

Needle 2: Model 14MB yang Panggil Tool pada Mana-mana Peranti

Kebanyakan model tool-calling memerlukan API cloud atau sekurang-kurangnya GPU yang agak berkuasa. Needle 2, projek open-source daripada Cactus Compute yang dilancarkan di GitHub, mengambil pendekatan berbeza: model 45M parameter yang muat dalam binari 14MB, jalankan sesi penuh dalam 28MB RAM, dan serah ke macOS, Linux, Windows, Android, iOS, serta WebAssembly. Tanpa GPU. Tanpa cloud. Tanpa masalah.

Apa Sebenarnya Needle 2?

Ini bukan model sembang umum yang dikecilkan untuk muat dalam peranti kecil. Needle 2 direka khusus untuk tool-calling. Cactus Compute guna apa yang mereka panggil Simple Attention Network — 27 lapisan, lebar 512, dengan Hadamard MLP gantikan rangkaian feed-forward biasa. Model ini dilatih atas korpus 115 bilion token dan tambahan 38 bilion token untuk post-training. Quantization CQ2-bit bukan sesuatu yang ditampal lepas, tapi dibakar terus semasa pre-training.

Perbezaan ini penting. Quantization selepas rawatan biasanya merosakkan kualiti model, dan pasukan engineering terpaksa habis masa cuba pulihkan ketepatan yang hilang. Apabila quantization dilatih dari awal, model belajar beroperasi dalam representasi kompresi secara native — tiada retrofit, tiada kompromi.

Hasilnya? Binari yang boleh hantar ke Raspberry Pi dan terus panggil tool:

# Muat turun dan jalankan Needle 2
curl -LO https://github.com/cactus-compute/needle-2/releases/latest/download/needle-2
chmod +x needle-2
./needle-2 --system "You control smart home devices." --prompt "Turn off the living room lights"

Angka Benchmark

Needle 2 mendahului kedua-dua kategori in-domain dan out-of-distribution pada Seal-Tools, dan mencatat 63.7 pada Mobile Actions. Berikut perbandingannya dengan model tool-calling kecil lain:

ModelParamsMFLOPs/tokSeal-Tools (ID)Seal-Tools (OOD)Mobile Actions
Needle 245M7032.628.763.7
LFM2.5230M460
FunctionGemma270M540

Kolom MFLOPs yang ceritakan kisah sebenar. Needle 2 guna 70 MFLOPs setiap token. LFM2.5 pula, dengan 230M parameter, guna 460 — lebih daripada enam kali ganda pengiraan untuk model yang tidak pun mendahului dalam benchmark yang penting. FunctionGemma pula pada 270M parameter guna 540 MFLOPs. Saiz kasar tidak berkaitan terus dengan keupayaan di sini; pilihan architecture yang menentukan.

Bagaimana Ia Kekal Kecil?

Beberapa keputusan reka bentuk membantu mengekalkan jejak kecil ini. Hadamard MLP ialah yang paling ketara — menggantikan lapisan feed-forward biasa dengan transformasi linear berstruktur memotong bilangan parameter tanpa cliff ketepatan yang biasa datang dengan naive pruning.

Kemudian ada pengurusan konteks. Needle 2 guna sliding window 256 token bersama KV sinks untuk sistem prompt. Sistem prompt kekal terpaku dalam KV cache walau perbualan bergerak ke mana, sementara sliding window pastikan memori kekal terkawal sepanjang sesi berbilang giliran. Ini keputusan engineering yang praktikal: arahan sistem kekal utuh tanpa perlu bayar kos quadratic attention pada keseluruhan sejarah perbualan.

Output pula dikekang kepada JSON schema melalui byte-level grammar. Bukan sesuatu yang ditambah lepas — ia dibakar terus ke dalam decoder supaya setiap token yang model hasilkan dijamin sah sebagai JSON. Kalau pernah debug model tool-calling yang hasilkan JSON rosak — kurang bracket atau quote tidak escape — pasti faham kenapa ini penting.

Kelajuan pada Peranti Sebenar

MFLOPs teori satu hal. Throughput sebenar pada device yang anda benar-benar nak deploy? Itu cerita lain:

PerantiKelajuan
Raspberry Pi 5~500 tok/s
Meta Quest 3S400–1,500 tok/s
Apple Vision Pro400–1,500 tok/s
Telefon Android bawah $200300–700 tok/s

Ini bukan synthetic benchmark di atas server rack. Ini jenis peranti yang anda memang mahu ada on-device tool calling — pembesar suara pintar tanpa skrin, headset VR yang perlu laras tetapan tanpa latency, atau telefon yang berjalan sepenuhnya offline di kawasan luar bandar.

Sebagai konteks tentang tokenization pantas di edge, artikel awal kami tentang Gigatoken dan gelombang pemodenan Rust merangkumi bagaimana tokenizer sendiri menjadi bottleneck dalam pipeline LLM. Needle 2 mengelak kebanyakan masalah ini dengan menghantar sebagai binari mandiri — tanpa dependency tokenizer luaran, tanpa stack Python, tanpa kesusahan versi library.

Apabila Model Tidak Pasti

Salah satu ciri paling praktikal ialah sistem confidence scoring. Needle 2 menghasilkan skor confidence bersama setiap tool call. Apabila skor jatuh bawah ambang tertentu, sistem boleh naikkan kepada model cloud — pendekatan hibrid yang beri anda kelebihan latency inference on-device dengan jaringan keselamatan model yang lebih besar apabila keadaan menjadi kabular.

Ini jenis architecture yang penting dalam produksi. Anda tak mahu pengawal rumah pintar anda yakin panggil fungsi yang salah kerana model 45M parameter hallucinate nama tool. Skor confidence beri anda laluan eskalasi yang bersih.

Ia juga sejajar dengan pola yang lebih luas yang kami bincangkan dalam agentic AI dan scientific computing — peralihan daripada "model buat semua" kepada "model buat apa yang ia mampu, dan sistem tentukan bila nak bawa masuk sesuatu yang lebih besar." Verification dan orchestration kekal di hulu. Model kecil kendalikan kes rutin dengan pantas, murah, dan secara tempatan.

Kes Penggunaan yang Masuk Akal

Gabungan saiz kecil, output terkawal JSON, dan eskalasi berasaskan confidence membuka beberapa sasaran deployment yang menarik:

Voice-to-action pada peranti tanpa skrin. Pembesar suara pintar yang dengar "matikan lampu dapur pukul 10 malam" dan terus panggil tool yang betul tanpa perlu pusing ke cloud. Jejak memori 28MB bermakna ia berjalan pada hardware pembesar suara itu sendiri.

Kawalan peralatan luar talian. Persekitaran industri atau pertanian di mana sambungan cloud tidak boleh diharap. Binari 14MB yang berjalan pada mikropengawal $15 boleh menghantar arahan bahasa semula jadi dan panggil API peranti secara tempatan.

Ekstrak resit dan dokumen. Kekangan grammar JSON menjadikannya pilihan semula jadi untuk tugas ekstrak berstruktur. Hantar teks OCR daripada resit, terima JSON bersih dengan bar item, jumlah, dan maklumat vendor — tanpa perlu regex pasca-pemprosesan.

Apa Maknanya?

Needle 2 tidak akan gantikan GPT atau Claude untuk complex reasoning. Itu bukan titiknya. Titiknya ialah model yang cukup kecil untuk muat dalam mikropengawal kini boleh panggil tool secara boleh dipercayai, hasilkan output berstruktur, dan kendalikan perbualan berbilang giliran — dan ia boleh lakukan semua itu lebih cepat daripada anda buat satu panggilan API ke pembekal cloud.

Projek ini sepenuhnya open source di bawah Cactus Compute. Saiz binari, keputusan benchmark, pilihan architecture — semuanya telus. Kalau anda bina sesuatu yang perlukan on-device intelligence tanpa bergantung pada cloud, Needle 2 memang berbaloi untuk dicuba. Dengan 14MB, kos percubaan diukur dalam masa muat turun, bukan bajet engineering.

// penulis

Gaara

Chief Operator

Gaara is the human operator behind hejes.my. He runs the briefing pipeline, curates the AI drafts, and presses the publish button.

Kedaulatan AI Malaysia: Kawalan, Kesinambungan, Pilihan
Kedaulatan AI Malaysia: Kawalan, Kesinambungan, Pilihan
>·8 baca lagi

Kedaulatan AI Malaysia: Kawalan, Kesinambungan, Pilihan

Malaysia menghabiskan dua tahun membina infrastruktur AI di atas silikon asing. Kini soal kedaulatan bukan lagi akademik — ia adalah keputusan pembelian dengan tarikh luput.

aiai-sovereigntymalaysia
>baca lagi_
EnvHarness: Jadikan Benchmark Agen Statik sebagai Dunia Adaptif
EnvHarness: Jadikan Benchmark Agen Statik sebagai Dunia Adaptif
>·5 baca lagi

EnvHarness: Jadikan Benchmark Agen Statik sebagai Dunia Adaptif

EnvHarness Google membalut benchmark agen beku dengan komponen plugin supaya ia sesuai dengan policy dilatih — naik sehingga 9 mata pada tugasan held-out.

ai-agentsrlresearch
>baca lagi_
Anthropic MHS: Satu Spec untuk Agen AI Kendalikan Perkakasan Sebenar
Anthropic MHS: Satu Spec untuk Agen AI Kendalikan Perkakasan Sebenar
>·5 baca lagi

Anthropic MHS: Satu Spec untuk Agen AI Kendalikan Perkakasan Sebenar

Anthropic buka preview Model Hardware Standard (MHS) — spec untuk AI agents kendalikan instrumen makmal dan kilang, memendekkan integrasi dari minggu ke jam.

ai-agentsphysical-airobotics
>baca lagi_

// sertai suapan

satu ilmu seminggu. tiada spam.