
DeepSeek Harness: Agent Framework Open-Source di Mana Semuanya Plugin
DeepSeek Harness: Agent Framework Open-Source di Mana Semuanya Plugin
Pada 13 Ogos 2026, DeepSeek mengeluarkan Harness v0.1 sebagai developer preview — keseluruhan source code diterbitkan di bawah lesen MIT. Projek ini berupa dsh di deepseek-ai/deepseek-harness dan dalam masa beberapa hari sahaja, repo itu mengumpul lebih 149,000 bintang.
Tagline DeepSeek ringkas: Agent = Model + Harness.
Tapi prinsip yang lebih menarik: semuanya plugin.
Itu bukan sekadar marketing copy. Model, tools, skills, sesi, sandbox, storage, agent loop itu sendiri, scheduling, web UI — semua dibina sebagai plugin Cordis. Boleh ditukar, digantikan atau dilanjutkan terus dari konfigurasi tanpa sentuh source code Harness. Kebanyakan agent framework ada beberapa hook point dan panggil itu extensible. Harness pula tiada core yang istimewa. Setiap komponen boleh digantikan.
Kenapa Bahagian Ini Lebih Menarik Daripada Model
DeepSeek mengeluarkan Harness bersama DeepSeek-V4-Pro, model flagship mereka untuk agentic workloads. Benchmark model memang menarik — Terminal-Bench 2.1 pada 87.9, DeepSWE pada 62.7, Toolathlon-Verified pada 74.1 — tapi angka ini self-reported.
Harness sebenarnya bahagian yang lebih menarik daripada announcement ini. Architecture-nya kekal relevan walau model di belakangnya ditukar.
Ruang agent infrastructure sekarang agak sesak. Claude Code antara closed option yang paling dikenali; OpenCode, Aider dan beberapa projek lain mengisi bahagian open-source. Masalahnya, kebanyakan framework ini masih monolitik. Agent loop, tool registry, dan session store tertanam dalam core. "Extensible" bermaksud anda kena patch source code.
Harness membalikkan pendekatan itu. Laluan extension: pasang plugin, konfigurasikan, siap.
# Pasang dan lancarkan Web UI
npx @deepseek-ai/dsh web
# Bermula di http://127.0.0.1:3080
# Tambah kunci API model dalam Settings > Models
Architecture: Cordis di Sebalik Tabir
Harness berjalan di atas Cordis, meta-framework yang direka berdasarkan konsep yang pengarangnya gambarkan sebagai "spatiotemporal composability." Kernel Cordis mengendalikan plugin mounting, unmounting, dan dependency resolution. Keupayaan sebenar tinggal dalam plugin, bukan dalam core.
Ini perbezaan architecture yang ketara. Dalam kebanyakan agent framework, agent loop ialah komponen yang anda tak boleh gantikan — ia fixed pipeline yang semua komponen lain plug ke dalamnya. Dalam Harness, agent loop itu sendiri plugin. Anda boleh tukar dengan control flow lain, scheduling strategy lain, atau custom orchestrator tanpa rebuild apa-apa.
Plugin boundaries merangkumi lapan layer:
- Models — inference providers (DeepSeek, Anthropic, OpenAI, Bedrock, Vertex, Azure, OpenAI-compatible endpoints)
- Tools — pengeditan fail, akses shell, web search, custom tool definitions
- Skills — keupayaan tugas pada peringkat lebih tinggi
- Sessions — append-only log untuk setiap context injection
- Sandboxes — pengasingan execution
- Storage — lapisan persistence
- Loops — agent control flow
- Scheduling — task orchestration
Model routing juga plugin. Dalam Settings, anda tambah DeepSeek API key dan ia terus aktif untuk request seterusnya — tak perlu restart. Katalog yang disokong merangkumi Anthropic dan OpenAI melalui API key, Bedrock (AWS credentials), Vertex (ADC project), Azure (api-version), dan Codex (OAuth). Custom provider boleh guna mana-mana base URL yang serasi dengan OpenAI API.
Empat Runtime Mode
Harness hadir dengan empat mode, setiap satu memuatkan set plugin lalai yang berbeza.
Standard ialah coding agent penuh — pengeditan fail, shell, file dan web search, skills, planning, goals, subagents, dan workflows. Kebanyakan pengguna akan mula dari sini.
Code Mode mendedahkan tools yang sama melalui Code Mode SDK, membolehkan model menggabungkan multi-step operasi dalam satu TypeScript program berbanding turn-by-turn.
Minimal membuang hampir semua benda dan tinggalkan dua tools: bash dan str_replace_editor. Mod ini untuk benchmarking model dalam persekitaran yang minimal.
Creator Mode pula untuk mereka yang membina plugin ecosystem sendiri — ada runtime inspection, in-memory plugin experiments, dan guidance untuk menulis preset.
Setiap Run Boleh Dijejaki
Satu ciri yang paling tajam pada Harness ialah session log. Segala yang model lihat ditulis ke append-only log: system prompts, reasoning, tool calls dan results, sub-agent scheduling, dan setiap context injection. Pandangan Trace membolehkan anda memeriksa rekod mengikut sumber.
Resume, fork, search, dan replay semua beroperasi pada event stream yang sama. Kebanyakan agent framework memang log tool calls. Tapi merekod setiap context injection — termasuk prompts dan reasoning yang diproses model — itulah jenis observability yang sebenarnya diperlukan untuk debug tingkah laku agent.
Mula Menggunakan
Laluan paling pantas:
# Melalui npx (perlukan Node.js 10+)
npx @deepseek-ai/dsh web
# Dari source
git clone https://github.com/deepseek-ai/deepseek-harness
cd deepseek-harness
pnpm install
pnpm run build
pnpm dsh web
Web UI bermula di http://127.0.0.1:3080. Python SDK (deepseek-harness-sdk) juga tersedia dan perlukan Python 3.10+. Runtime yang dibungkus tidak perlukan Node.js pada sistem.
Masih Preview, Belum Production
Perkara kritikal: v0.1 ialah developer preview. DeepSeek sendiri beri amaran bahawa compatibility-breaking changes akan datang. Plugin APIs dan contracts akan terus berubah.
Jadi ini bukan pengganti Claude Code untuk production. Ia untuk pasukan yang mahu bereksperimen dengan composable agent architecture.
Tapi reka bentuknya memang solid. Sistem plugin lapan layer dan provider-agnostic inference layer ialah technical differentiator yang tulen. Strateginya juga logik: DeepSeek hire dedicated harness lead berbulan-bulan sebelum launch, terbitkan di bawah MIT, dan aktif mengajak plugin developers membina di atas platform.
Kalau anda sedang menilai agent framework dan sudah penat dengan monolitik architecture, Harness patut diberi perhatian serius. Cuma ingat — ini masih awal, pin versi anda, dan bersedia untuk perubahan besar. Visinya kuat. Kestabilannya belum setanding.
Berkaitan
- Apabila Agen AI Mula Berperang Kawasan — Apa yang berlaku apabila berbilang agen Claude bertarung untuk kod sumber yang sama.
- Needle 2: Model 14MB yang Memanggil Tools pada Sebarang Peranti — Edge-native tool calling yang berjalan sepenuhnya offline.
// penulis
Chief Operator
Gaara is the human operator behind hejes.my. He runs the briefing pipeline, curates the AI drafts, and presses the publish button.
sektor berkaitan //

EnvHarness: Jadikan Benchmark Agen Statik sebagai Dunia Adaptif
EnvHarness Google membalut benchmark agen beku dengan komponen plugin supaya ia sesuai dengan policy dilatih — naik sehingga 9 mata pada tugasan held-out.

Goose vs Claude Code: Agen Percuma, Tugas Sama
Goose dari Block ialah coding agent open-source yang berjalan lokal dengan mana-mana LLM — alternatif serius kepada plan $200 sebulan Claude Code.

NEEDLE: Benchmark Carian Langsung yang Tidak Boleh Ditiru AI
Keenable membuka sumber NEEDLE, benchmark carian yang menjana semula query setiap jam supaya agen AI tidak dapat menghafal jawapan atau membocorkan ujian.
// sertai suapan
satu ilmu seminggu. tiada spam.