
Perplexity Portable Computer: Agent AI Tempatan di DGX Spark
Perplexity Portable Computer: Agent AI Tempatan di DGX Spark
Perplexity baru-baru ini melancarkan sesuatu yang menarik — versi tempatan sepenuhnya untuk platform agentic Computer mereka. Keseluruhan stack berjalan atas hardware sendiri: orchestrator, subagent, inference engine, tools, dan sandbox. Tiada kaitan dengan cloud secara lalai. Tiada bil per-token untuk kerja tempatan. Produk ini dipanggil Portable Computer, berjalan di atas NVIDIA DGX Spark dan mesin Linux dengan GPU RTX. Kalau anda sedang bina sistem agentic, ini serasi dengan tulisan awal kami tentang framework agent open-source DeepSeek Harness.
Model, fail, semuanya kekal dalam peranti. Kalau satu langkah perlukan reasoning tahap frontier atau akses web langsung, sistem berhenti dan tanya — kemudian hantar langkah itu sahaja kepada salah satu daripada 15+ model cloud. Data sensitif tidak keluar tanpa kebenaran anda.
Apa Yang Ada Dalam Paket
Portable Computer bukan sekadar aplikasi chat tempatan dengan file picker. Ia datang lengkap:
- Model tempatan — Qwen 3.8 27B atau PPLX 27B (varian yang telah dilatih khas untuk Perplexity)
- Inference engine — vLLM di bawahnya, dioptimumkan untuk DGX Spark
- Agent harness — orchestrator, planner, tool router
- Tool sandbox — ditadbir oleh OS, hadkan akses filesystem, proses, dan rangkaian
- App connectors — Google Drive, Gmail, Slack, GitHub, Outlook
NVIDIA Nemotron 3.5 Lightning (30B MoE) akan datang tidak lama lagi. Model sendiri dan inference server custom juga disokong.
# Pemasangan pada DGX Spark — repository apt standard
sudo apt update
sudo apt install perplexity-portable
# Pertama kali menjalankan, ia muat turun model yang dipilih (17–19 GB)
portable-computer --model qwen-3.8-27b
Model Qwen 3.8 27B dihantar dengan quantization 3-bit — muat turun 17.4 GB, perlu 32 GB RAM. Varian PPLX 27B gunakan base yang sama tetapi telah dilatih khusus untuk harness Perplexity.
Seni Bina Tempatan-Dahulu
Keputusan rekaan terpenting: setiap tugas bermula pada peranti. Orchestrator LLM atur kerja, subagent LLM laksanakan, semua panggilan tool berjalan dalam sandbox yang dikawal OS. Kalau sandbox tak ada, tool execution terus ditutup — bukan diturunkan secara senyap.
Kalau satu langkah perlukan sesuatu yang melebihi keupayaan model tempatan — reasoning kompleks, carian web langsung, atau tugas yang perlu model frontier — orchestrator berhenti. Ia pilih konteks yang relevan, jalankan PII classifier, dan tunjukkan kepada pengguna tepat-apa yang akan keluar dari peranti. Hanya lepas pengguna approve barulah langkah itu dihantar ke model cloud. Model cloud itu cuma pulangkan panduan teks — tak pernah akses fail tempatan, tools, atau sejarah perbualan secara langsung.
# Aliran konsep — orchestrator tempatan-dahulu Portable Computer
from portable_computer import Orchestrator, Sandbox
orchestrator = Orchestrator(
local_model="qwen-3.8-27b",
sandbox=Sandbox(
filesystem="/home/user/projects",
network=False, # tiada outbound secara lalai
process_limit=16,
),
escalation="ask_first", # tanya pengguna sebelum cloud routing
pii_check=True, # imbas konteks sebelum hantar keluar
)
# Semua kerja berjalan tempatan kecuali eskalasi diluluskan
result = orchestrator.run("Analyze the financial docs in ~/Documents/1099/")
# Kalau tugas melebihi keupayaan lokal:
# -> imbas PII -> kelulusan pengguna -> routing ke model frontier -> respons teks sahaja
Nombor Benchmark
Perplexity jalankan ujian sendiri atas 53-tugasan Local Knowledge Work Bench — merangkumi deep research, analisis kewangan, dan penciptaan dokumen. Syarikat itu beritahu mereka merancang untuk open-source benchmark ini.
| Harness + Model | Skor | Token | Masa/tugasan |
|---|---|---|---|
| Portable Computer + Qwen 3.8 27B | 82.6% | 520k | 218s |
| Pi + Qwen 3.8 27B | 77.6% | 681k | 176s |
| Hermes + Qwen 3.8 27B | 74.0% | 634k | 292s |
| Portable Computer + PPLX 27B | 85.4% | 678k | ~250s |
Portable Computer capai ketepatan paling tinggi dengan token paling sedikit. Pi siapkan tugasan paling cepat — tapi ketepatan lebih rendah dan penggunaan token lebih banyak.
Untuk Terminal Bench 2.1 (tugas berat kod), larian tempatan sepenuhnya capai 59.6% dengan kos marginal hampir sifar. Dengan eskalasi cloud, ia naik ke 73.0% pada kira-kira $0.415 per rollout — berbanding 82.4% pada kira-kira $0.65 untuk Claude Opus 5 sahaja.
Keperluan Hardware
Spesifikasi minimum: GPU RTX dengan 24 GB VRAM — lebih kurang GeForce RTX 3090 atau lebih baru. DGX Spark ialah platform utama, dengan superchip GB10 Grace Blackwell, 128 GB unified memory, dan TDP 140W.
Nvidia tunjukkan dua Spark yang disambung atas shared memory boleh jalan model frontier open-source terkini macam DeepSeek. Empat Spark boleh kendalikan GLM 5.2 atau Nemotron Ultra. Lapan Spark yang disambung telah didemonstrasikan secara dalaman.
| Platform | Memory | VRAM Floor | Status |
|---|---|---|---|
| DGX Spark | 128 GB | N/A | Sudah available |
| RTX Pro workstations | Varies | 24 GB | Sudah available |
| GeForce RTX 3090+ | 24 GB | 24 GB | Disokong |
| Windows | Varies | 24 GB | September |
| macOS | — | — | Tiada dalam |
| perancangan |
Linux sahaja OS yang disokong pada pelancaran. Windows datang September. Apple Silicon tiada dalam perancangan — Perplexity kata mereka fokus kepada hardware Nvidia.
Kenapa Ini Penting
Dari segi ekonomi, jelas. Inference tempatan zero kos per-token. Untuk tugas yang loops banyak token — migrasi kod berskala repo, gelung verifikasi panjang, analisis dokumen beratus fail — jalan atas hardware sendiri hilangkan masalah billing terus.
Privasi pun sama jelas. Dokumen kewangan, fail undang-undang, rekod perubatan — jenis data yang orang segan nak upload ke cloud — semua kekal dalam peranti. PII classifier dan gate eskalasi eksplisit bermakna konteks sensitif hanya keluar bila pengguna cakap ya.
Nate, VP Kejuruteraan Perplexity, describe produk ini sebagai membawa "UI yang tepat sama kepada aplikasi tempatan sepenuhnya." Unjuran antara muka yang selalunya tunjukkan penggunaan kredit cloud "cuma terparkir di sifar, sebab semua ini berlaku dalam peranti."
Had Yang Sebenar
Benchmark ini datang daripada ujian Perplexity sendiri. Mereka akui model kompak 27B masih ketinggalan dengan jelas berbanding model frontier untuk tugas reasoning yang sukar. Eskalasi cloud "perkecilkan jurang tetapi tidak tutup sepenuhnya."
Batas VRAM 24 GB tolak keluar majoriti PC pengguna. Pengklusteran Spark tunggal belum available — masih dalam perancangan. Jurang antara 59.6% tempatan dan 82.4% cloud pada Terminal Bench 2.1 memang nyata.
Tapi hala tuju jelas. Model open-source semakin kuat dengan cepat — NVIDIA Nemotron 3.5 Lightning (30B), Qwen 3.6 (35B), Qwen 3.8 (27B) semua melebihi jangkaan untuk tugas agentic. DGX Spark beri mereka rumah. Portable Computer beri mereka harness yang benar-benar berfungsi.
Bagi developer yang nak jalan agentic workflow tanpa bil setiap token — ini stack tempatan paling lengkap yang ada hari ini. Bukan binary preview. Software yang benar-benar available, atas hardware yang benar-benar available, dengan laluan jelas kepada model lebih besar apabila ia muat dalam kapasiti memori.
// penulis
Chief Operator
Gaara is the human operator behind hejes.my. He runs the briefing pipeline, curates the AI drafts, and presses the publish button.
sektor berkaitan //

llama.cpp Sertai Hugging Face: Local AI Ada Rumah Sendiri
Pasukan ggml.ai di sebalik llama.cpp kini menyertai Hugging Face. Runtime kekal 100% open source, dan jambatan transformers ke GGUF bakal jadi lebih pendek.

NVIDIA Nemotron 3 Ultra: Model Terbuka 550B untuk Agentic AI
NVIDIA memperkenalkan Nemotron 3 Ultra — model MoE 550B dengan context window sehingga 1 juta token, percuma di OpenRouter, direka untuk agentic AI.

Kedaulatan AI Malaysia: Kawalan, Kesinambungan, Pilihan
Malaysia menghabiskan dua tahun membina infrastruktur AI di atas silikon asing. Kini soal kedaulatan bukan lagi akademik — ia adalah keputusan pembelian dengan tarikh luput.
// sertai suapan
satu ilmu seminggu. tiada spam.