Tim lo nulis angka keyakinan — confidence score, “kemungkinan besar”, 70%.
Pernah dicek gak, seberapa sering yang 70% itu beneran kejadian 7 dari 10 kali?
Taruh CSV-nya di bawah. Laporannya jadi di layar ini juga.
TARUH CSV DI SINI
atau klik buat milih file · butuh kolom probabilitas + kolom hasil (0/1)
belum punya datanya? coba pakai data contoh
Data lo gak ke mana-mana.
Semua hitungan jalan di browser ini. Gak ada upload, gak ada server yang nerima
file-nya, gak ada analytics. Matiin wifi setelah halaman ini kebuka — dia tetap jalan.
Itu bukan janji di halaman privacy policy; itu cara halamannya dibikin.
Format CSV-nya
kolom
isi
nama yang dikenali
wajib
probabilitas 0..1 atau 0..100, ditulis sebelum tau hasilnya
harga pasar / konsensus — ini yang bikin laporannya jauh lebih tajam
pasarmarket_pricekonsensusconsensus
opsional
nama keputusannya, buat tabel “sepuluh meleset terparah”
labelnamapertanyaanquestion
Kenapa baseline 0.25 itu jebakan
Hampir semua alat kalibrasi bandingin Brier ke 0.25 — skor “nebak 50/50 terus”.
Kedengerannya masuk akal, sampai kejadiannya jarang.
Base rate 10%? Model yang asal jawab “tidak” terus udah dapet Brier 0.09.
Jauh di bawah 0.25, tanpa skill apa pun. Laporan yang bilang “bagus, di bawah 0.25”
di kasus itu lagi muji sesuatu yang gak ada.
Di sini lawannya dua, dan dua-duanya lebih berat:
base rate (br × (1−br) — Brier-nya “tebak angka rata-rata terus”)
dan harga pasar kalau kolomnya ada. Yang terberat yang mutusin vonis.
Kalau kalah sama pasar, vonisnya “KALAH DARI HARGA PASAR” — bukan “lebih baik dari
base rate” yang kebetulan juga benar.
Tiga hal yang laporannya gak mau lakuin
Gak ngeratain sampel tipis
Bucket yang cuma berisi 8 prediksi bisa kelihatan dramatis padahal itu noise.
Bucket di bawah 30 dikasih lingkaran putus-putus dan dikeluarin dari hitungan bias.
Gak bikin vonis lebih manis dari temuan
Termasuk warnanya. Kartu Brier baru hijau kalau menang lawan terberat yang
datanya ada — bukan kalau kebetulan lolos dari koin.
Gak nyimpulin dari data kecil
Di bawah 30 baris, laporannya bilang sendiri bahwa dia cuma nunjukin arah,
bukan kesimpulan.
Buat siapa
tim ML yang nulis confidence score tapi gak pernah ngecek kalibrasinya
tim risk, underwriting, credit scoring
tim forecasting demand, churn, fraud
PM yang nulis “kemungkinan besar rilis Q3” dan pengen tau track record-nya
siapa pun yang punya kolom confidence di database dan belum pernah mengujinya
Batasnya, dibilang di depan
Ini cermin, bukan nasihat investasi. Gak ada rekomendasi beli/jual, gak nyentuh
duit siapa pun.
Kalibrasi ≠ akurasi ≠ untung. Model yang kalibrasinya sempurna masih bisa rugi
kalau sizing-nya salah. Itu masalah lain.
Butuh prediksi yang ditulis sebelum hasilnya tau. Kalau angkanya diisi belakangan,
yang diukur bukan kalibrasi — itu ingatan.
Bawa pulang
Versi unduhan jalan di laptop sendiri, buat data yang gak boleh keluar dari jaringan
kantor. Isinya: mesin auditnya, rumusnya, dua SKILL.md buat Claude Code, data
contoh, dan laporan contoh. Cuma butuh Node — gak butuh database, gak manggil internet.
Alat di atas ngasih angkanya. Yang sering lebih berguna itu bacaannya: kenapa
miringnya numpuk di rentang tertentu, bucket mana yang beneran bisa disimpulin,
dan apa yang berubah dibanding bulan lalu.