Skip to content
NEEDLE: Benchmark Carian Langsung yang Tidak Boleh Ditiru AI

NEEDLE: Benchmark Carian Langsung yang Tidak Boleh Ditiru AI

NEEDLE: Benchmark Carian Langsung yang Tidak Boleh Ditiru AI

Begini masalah yang tiada siapa selesaikan sehingga sekarang: bagaimana anda mengukur prestasi API carian web apabila benda yang diuji boleh membaca kunci jawapan? Agen carian datang dengan alat fetch. Jika label jawapan berada dalam dataset awam, agen boleh memuat turunnya di tengah-tengah penilaian dan melangkau langkah retrieval sama sekali. Lebih teruk lagi — jawapan mungkin sudah tersimpan dalam memori parametrik model, jadi respons yang betul tidak membuktikan bahawa carian web itu berfungsi langsung.

Itulah perangkap yang cuba dielakkan Keenable dengan NEEDLE, benchmark carian langsung sumber terbuka yang dibuka di GitHub. Daripada membekukan satu set soalan yang tetap, ia membina semula set query daripada sumber awam yang segar — query berita dijana semula setiap jam daripada feed RSS dan Google Trends, manakala vertikal lain setiap hari. Tiada set ujian stabil yang tinggal untuk di-overfit.

Kenapa Benchmark Statik Menipu

Masalah overfitting bukan hipotesis semata-mata. Leaderboard SimpleQA Verified Epoch AI dicap sebagai mungkin tercemar selepas Qwen3-Max-Instruct mengetuainya. Mengocok pilihan jawapan dalam MMLU menurunkan skor untuk setiap model yang diuji. Dan yang paling memalukan — agen carian hanya menarik label jawapan benchmark terus dari HuggingFace; alat fetch menjadikannya remeh: satu wget dan satu grep, maka tugas "carian" selesai.

Walaupun tiada kebocoran pada masa ujian, penghafalan tetap merosakkan pengukuran. BrowseComp membina soalan di mana jawapannya sukar dicari tetapi mudah disahkan. Model yang sudah menghafal jawapan melangkau bahagian "sukar dicari" sepenuhnya — ia terus tahu apa yang perlu dicari dan melompat terus ke jawapan.

Benchmark langsung mengelak kedua-dua kegagalan ini. Jika soalan lebih baharu daripada model dan sentiasa berubah, tiada apa yang boleh dihafal dan tiada apa yang boleh bocor. Ia sudah menjadi amalan standard di tempat lain — LiveBench menyegarkan setiap bulan, LiveCodeBench hanya menilai soalan yang lebih baharu daripada cutoff latihan model, SWE-bench-Live membina semula tugas daripada isu GitHub yang segar. Carian tidak pernah menerima layanan sama sehingga NEEDLE muncul.

Apa yang Diukur NEEDLE

NEEDLE bermaksud News, Everyday, Expert, Deep-tail, dan Legal Evaluation — lima vertikal, setiap satu memodelkan niat agen yang berbeza:

  • News menayangkan item paling baharu daripada kira-kira 124 feed RSS terpilih dan Google Trends menjadi query kata kunci.
  • Finance bertanya fakta pendaftaran daripada Wikidata dan GLEIF, serta angka 10-Q suku tunggal daripada SEC XBRL.
  • Scholar mengubah satu kertas kepada empat gaya query — tajuk yang dirosakkan, perincian teks penuh sahaja, petunjuk bahasa semula jadi, dan perihalan yang kabur.
  • Deep-tail meniru query perkataan jarang daripada pelepasan jejak agen awam seperti DeepResearchGym, OpenResearcher, dan LRAT.
  • Legal menarik pendapat CourtListener terkini merentas 14 mahkamah persekutuan dan bahagian eCFR.

Pemarkahan pula berpecah dengan cara yang sama. News dan deep-tail tidak mempunyai satu jawapan betul yang khusus, jadi hakim LLM menilai setiap hasil 0–4 dan melaporkan nDCG@5 dengan penalti URL pendua. Finance melaporkan answer-recall@5: adakah fakta itu sampai kepada agen dalam lima cebisan teratas? Scholar dan legal ialah tugas item yang dikenal pasti, dijaringkan dengan padanan pengenal.

Protokol yang Menjaga Perbandingan Tetap Adil

Setiap enjin menerima teks query yang sama di bawah satu protokol. Pelari mengeluarkan satu panggilan pada satu masa, jadi persentil latency setanding. Penilaian berlaku pada ranking, tajuk, dan cebisan yang dihasilkan enjin sendiri — halaman tidak pernah di-fetch dan hasil tidak pernah disusun semula. Bukti dipotong kepada 2,000 aksara untuk semua, dan hakim tidak pernah melihat nama enjin.

Terdapat 15 API carian yang berjalan menentang benchmark ini dalam kitaran semasa, termasuk Google (melalui Serper), Bing, Brave, dan startup carian AI seperti Exa, Tavily, dan Parallel — serta Keenable sendiri.

Kedudukan Sebenar Bidang Ini

Nombor yang menarik bukanlah kedudukan mana-mana leaderboard tunggal — tetapi siling ultimate. Untuk setiap query, NEEDLE menggabungkan hasil yang dikembalikan oleh setiap enjin menjadi enjin oracle sintetik, kemudian menyusun set gabungan itu mengikut kaitan. Ini menghasilkan had atas empirikal berdasarkan apa yang seluruh bidang dapat ambil semula. Jurang ke ultimate ialah had atas untuk kualiti carian agentic pada hari ini.

Purata 7 hari yang diterbitkan untuk tetingkap berakhir 2026-08-28:

  • Finance hampir selesai: Exa 0.910, Keenable 0.872, Perplexity 0.871, Google 0.847, berbanding ultimate 0.965.
  • Scholar tersebar luas — Keenable 0.774 hingga Tavily 0.310 dengan siling 0.869, kerana query tajuk boleh dijawab daripada metadata manakala query isi teks tidak.
  • Deep-tail paling sukar dan paling dekat dengan trafik agen sebenar: Exa mendahului pada 0.557 daripada ultimate, Keenable 0.470, Bing hanya 0.199.

Latency juga penting kerana agen memanggil carian berpuluh-puluh kali setiap tugas. Tetingkap yang sama: Keenable-realtime 193 ms p50 / 284 ms p95, berbanding Exa 1,876 / 2,955 dan Bing 2,767 / 9,381.

Kenapa Ini Penting untuk Kita Semua

NEEDLE ialah harness penilaian yang benar-benar boleh anda jalankan — CLI Python yang dipasang dengan uv sync, digerakkan oleh pasangan generate dan run bagi setiap benchmark:

# Pasang dengan uv
uv sync

# Jana set query berita baharu
uv run needle news generate --out queries.jsonl

# Nilaikan semua enjin yang dikonfigurasi pada query tersebut
uv run needle news run --queries queries.jsonl --out report.json

Ia memerlukan kunci OpenRouter untuk menilai dan satu kunci API bagi setiap enjin yang diuji, dan ia berjalan pada laptop atau dalam CI. Semua run dilaksanakan dalam GitHub Actions awam, dengan artifak setiap run dihantar ke dataset Hugging Face.

Kesimpulan yang lebih mendalam untuk pembangun: jurang antara kualiti yang dihantar dan yang boleh dicapai melebar tepat apabila query menghampiri cara agen sebenarnya mencari. Pada query entiti jarang yang diambil daripada log agen sebenar, enjin teratas sekalipun hanya mencecah 0.557 daripada apa yang seluruh bidang yang digabungkan boleh temui. Jurang itulah sebab infrastruktur carian — lapisan yang setiap agen sandarkan setiap masa — menjadi antara komponen paling berharga dalam timbunan AI. Sesiapa yang indeksnya menyesuaikan diri paling pantas dengan cara agen benar-benar mencari akan memilikinya.

Ia corak yang sama seperti usaha penilaian terbuka yang lain: benchmark awam yang boleh direproduksi menjaga bidang yang huru-hara tetap jujur. NEEDLE sekadar menambah kelainan bahawa ujian itu sendiri tidak akan berdiam cukup lama untuk diperdaya.

Sumber:

// penulis

Gaara

Chief Operator

Gaara is the human operator behind hejes.my. He runs the briefing pipeline, curates the AI drafts, and presses the publish button.

EnvHarness: Jadikan Benchmark Agen Statik sebagai Dunia Adaptif
EnvHarness: Jadikan Benchmark Agen Statik sebagai Dunia Adaptif
>·5 baca lagi

EnvHarness: Jadikan Benchmark Agen Statik sebagai Dunia Adaptif

EnvHarness Google membalut benchmark agen beku dengan komponen plugin supaya ia sesuai dengan policy dilatih — naik sehingga 9 mata pada tugasan held-out.

ai-agentsrlresearch
>baca lagi_
Vijay Pande Tinggalkan $4B a16z Demi VC AI-Native
Vijay Pande Tinggalkan $4B a16z Demi VC AI-Native
>·7 baca lagi

Vijay Pande Tinggalkan $4B a16z Demi VC AI-Native

Vijay Pande meninggalkan a16z selepas membina unit Bio + Health bernilai hampir $4 bilion untuk menubuhkan VZVC, firma pelaburan kecil yang hanya membuat beberapa pelaburan setahun dan banyak menggunakan agen AI.

ai-agentsbiotechhealthcare
>baca lagi_
Goose vs Claude Code: Agen Percuma, Tugas Sama
Goose vs Claude Code: Agen Percuma, Tugas Sama
>·6 baca lagi

Goose vs Claude Code: Agen Percuma, Tugas Sama

Goose dari Block ialah coding agent open-source yang berjalan lokal dengan mana-mana LLM — alternatif serius kepada plan $200 sebulan Claude Code.

ai-agentsdeveloper-toolsopen-source
>baca lagi_

// sertai suapan

satu ilmu seminggu. tiada spam.