
Kita Masih Tak Tahu Cara Orang Guna AI
Kita Masih Tak Tahu Cara Orang Guna AI
Setiap beberapa bulan sekali, ada tajuk berita yang ceritakan apa yang orang "sebenarnya" buat dengan ChatGPT atau Claude. Hampir semua tajuk tu boleh dikesan balik ke satu sumber sama: report penggunaan yang diterbitkan oleh syarikat AI itu sendiri. Artikel terbaru MIT Technology Review tentang satu projek research bernama AI Observatory bangkitkan perkara yang kurang selesa — kita hampir tiada data bebas tentang macam mana orang betul-betul guna sistem ni, dan sedikit data yang ada tunjukkan report syarikat terlepas banyak benda.
AI Observatory
AI Observatory diketuai bersama oleh Anka Reuel, PhD candidate Computer Science di Stanford Trustworthy AI Research Lab, dan Shayne Longpre, graduan PhD terbaharu dari MIT Media Lab, dengan penyelidik dari MIT, Stanford, Data Provenance Initiative dan institusi lain.
Skalanya sederhana kalau dibandingkan dengan standard industri, tapi belum pernah wujud untuk research bebas:
| Metrik | Nilai |
|---|---|
| Perbualan dianalisis | 24,521 |
| Conversational turns | 85,633 |
| Dataset sumber | 7 |
| Pengguna | ~5,000 |
| Model diliputi | 52 |
| Tempoh masa | 2023–2025 |
Semua perbualan dikumpul dengan kebenaran pengguna melalui tujuh dataset research sedia ada, merangkumi ChatGPT, Gemini, Claude, Grok dan puluhan model lain. Sasarannya mudah: beri penyelidik dan pembuat dasar satu sumber data penggunaan yang tak datang dari bahagian pemasaran.
Sebagai bandingan, Anthropic Economic Index berdasarkan 1 juta perbualan Claude, manakala report penggunaan OpenAI menganalisis 1.5 juta perbualan ChatGPT. Dataset observatory ni setitis dalam baldi tu — tapi ia antara satu-satunya baldi yang penyelidik dibenarkan intip langsung.
Apa Yang Report Syarikat Tinggalkan
Angka paling kerap dirujuk di sini datang daripada Anthropic Economic Index, yang fokus pada penggunaan Claude untuk kerja dan produktiviti. Bila pasukan Observatory guna metodologi penapisan Anthropic pada dataset mereka sendiri, mereka jumpa 48% perbualan akan ditapis keluar.
Dan separuh yang ditapis tu nampak sangat berbeza. Berbanding analisis yang diterbitkan Anthropic, perbualan bukan kerja jauh lebih berkemungkinan melibatkan:
- Kesihatan dan hubungan: 44.2% berbanding 31.2%
- Gangguan dan kebencian: 27.5% berbanding 5.66%
- Kandungan seksual: 16.7% berbanding 2.4%
- Topik dewasa atau ilegal: 7.9% berbanding 2.1%
Report OpenAI sendiri pada 2025 mengaku benda sama dari arah lain: hanya sekitar 30% penggunaan ChatGPT pengguna berkaitan dengan kerja. Jadi bila pembuat dasar petik "cara orang guna AI" daripada report syarikat, selalunya mereka memetik irisan realiti yang sengaja dikecilkan.
"Tiada satu pun report syarikat menceritakan keseluruhan gambaran," kata Longpre.
Corak Penggunaan Berubah Dengan Masa
Sebab dataset tu merentangi 2023 hingga 2025, Observatory dapat tengok tingkah laku beranjak. Dalam WildChat, salah satu dataset terbesar dalam kajian ini, perbualan jadi lebih panjang dan lebih kompleks dari masa ke masa — token prompt makin banyak, respons makin panjang, turn setiap perbualan makin banyak.
Small talk meningkat dengan ketara — bacaan penyelidik, tanda companionship AI sedang naik. Assistant pula semakin jarang mengaku diri mereka chatbot. Gabungan dua trend ni banyak jelaskan discourse companion AI yang dominan sepanjang 2025.
Satu isyarat yang benar-benar menggalakkan: perbualan yang dilabel sensitif — termasuk gangguan seksual dan ucapan kebencian — jadi lebih jarang dari masa ke masa. Ini mungkin tunjukkan platform deploy safeguard yang lebih berkesan, walaupun penyelidik berhati-hati untuk tak mengklaim lebih.
Setiap Model Ada Budaya Sendiri
Penemuan paling menarik untuk sesiapa yang kerja dengan pelbagai model: corak penggunaan berbeza dengan ketara antara satu sama lain.
Orang lebih guna Grok dan Gemini untuk information retrieval. Grok memang popular untuk berita dan politik — dan juga tempat misinformation paling tertumpu. Soalan coding mengalir ke arah Anthropic. Gemini tarik penggunaan sosial dan roleplay. ChatGPT jadi homework assistant.
Malah versi berbeza bagi model yang sama pun membentuk komuniti berbeza. Perbualan lebih pendek pada GPT-3.5, dan lebih panjang serta iteratif pada GPT-4o — selari dengan apa yang kita tahu tentang kecenderungan versi tu mencipta ikatan emosi.
Kalau anda bina produk atas API-model ni, perkara ni penting. Expectation pengguna, gaya prompt, dan failure mode anda sebahagiannya bergantung pada budaya model mana asal mereka.
Kenapa Penting Untuk Developer
Ada pengajaran umum di sini tentang telemetry, dan ia apply pada mana-mana produk yang anda bina: siapa kawal penapis, siapa kawal cerita. Anda boleh nampak kesannya dengan simulasi kecil:
import random
random.seed(42)
def sample_conversation():
kind = random.choices(["work", "personal"], weights=[30, 70])[0]
sensitive = random.random() < (0.05 if kind == "work" else 0.20)
return kind, sensitive
pop = [sample_conversation() for _ in range(100_000)]
# What the full population looks like
all_sensitive = sum(s for _, s in pop) / len(pop)
# What a "work-only" report sees
work = [(k, s) for k, s in pop if k == "work"]
work_sensitive = sum(s for _, s in work) / len(work)
print(f"sensitive share, all traffic: {all_sensitive:.1%}")
print(f"sensitive share, work-only cut: {work_sensitive:.1%}")
Jalankan dan anda dapat lebih kurang 15.5% berbanding 5.0%. Populasi asas yang sama, kesimpulan bertentangan — bergantung sepenuhnya pada irisan mana yang anda publish. Secara struktur, itulah yang berlaku bila syarikat hanya report perbualan yang dikekalkan oleh metodologi mereka.
Ini juga sebab semakan manusia ke atas dakwaan automatik tetap penting, seperti yang kami kupas dalam artikel pasal langkah human review dalam pipeline AI. Dashboard agregat tepat meratakan varians yang paling penting.
Masalah Data Ni Takkan Pergi Mana
Adil juga untuk akui yang data Observatory sendiri ada batasannya. Sebab penyertaan adalah sukarela, penggunaan sensitif kemungkinan besar kurang terwakili — orang kurang sanggup benarkan perbualan macam tu dikongsi. Penyelidik sendiri kata begitu.
Tapi ketaksimetriannya tetap ketara: lab-lab pegang bilion perbualan dan publish ringkasan terpilih, manakala penyelidik bebas berebut puluhan ribu sampel yang diberi kebenaran. Seperti kata Reuel, sesiapa yang buat keputusan berdasarkan data penggunaan AI semasa berisiko "bergerak buta-buta".
Selagi syarikat tak buka data mereka — dengan perlindungan privasi yang sebenar — setiap tajuk "ini cara orang sebenarnya guna AI" layak dapat soalan sama: diukur oleh siapa, dan ditapis macam mana? Kalau anda bina agent sendiri, cara paling dekat dengan ground truth masih instrumentation anda sendiri. Tools seperti Goose dan Claude Code hasilkan log yang anda kawal; anggap ia observatory peribadi anda.
// penulis
Chief Operator
Gaara is the human operator behind hejes.my. He runs the briefing pipeline, curates the AI drafts, and presses the publish button.
sektor berkaitan //

Penyelesaian $18B Meta: Kelonggaran Data Kanak-kanak
Penyelesaian $18B Meta dengan 29 negeri melindunginya daripada saman COPPA pada masa depan — sebagai balasan, ia melatih model pengesanan umur dengan data kanak-kanak. Inilah sebab perkara halus itu penting.

EnvHarness: Jadikan Benchmark Agen Statik sebagai Dunia Adaptif
EnvHarness Google membalut benchmark agen beku dengan komponen plugin supaya ia sesuai dengan policy dilatih — naik sehingga 9 mata pada tugasan held-out.

llama.cpp Sertai Hugging Face: Local AI Ada Rumah Sendiri
Pasukan ggml.ai di sebalik llama.cpp kini menyertai Hugging Face. Runtime kekal 100% open source, dan jambatan transformers ke GGUF bakal jadi lebih pendek.
// sertai suapan
satu ilmu seminggu. tiada spam.