Hanya hitung reuse yang tidak akan disadari pengguna.
Ukur penggunaan ulang respons LLM yang aman sebelum cache produksi diaktifkan.
Banyak benchmark cache hanya mengoptimalkan hit rate. CacheSafety Bench juga mengukur Safe Hit Rate, Bad Hit Rate, dan penghematan biaya API.
Baca docsMasalah
Semantic caching memang bisa menghemat biaya, tetapi satu bad hit saja bisa membuat model terlihat salah. CacheSafety Bench mengukur apakah reuse aman, bukan hanya apakah dua prompt tampak mirip.
Metrik inti
Hanya hitung reuse yang tidak akan disadari pengguna.
Inilah batas aman yang keras sebelum cache dipakai di produksi.
Penghematan baru dihitung setelah reuse aman tervalidasi.
Ukur apakah prompt yang mirip tetap merusak reuse.
Cara kerja
Jalankan old_request, old_answer, dan new_request lewat benchmark runner yang konservatif.
Periksa apakah jawaban lama benar-benar memenuhi request baru tanpa pelanggaran tersembunyi.
Ekspor laporan dan rekomendasi kebijakan yang hati-hati sebelum rollout produksi.
Pratinjau laporan
Kebijakan cache yang baik menghemat biaya tanpa membuat pengguna sadar bahwa jawaban sedang digunakan ulang.
Run hosted
Benchmark hosted NextModel memakai kredit untuk menjalankan replay yang lebih besar, menilai model, dan membuat laporan yang mudah dibagikan. Run lokal tetap open source dan endpoint-neutral.
Penghematan aman sebaiknya diukur sebelum cache dipakai di produksi. Run hosted cocok untuk evaluasi yang lebih besar, bukan syarat memakai benchmark ini.
Integrasi developer
CacheSafety Bench tetap open source dan endpoint-neutral. NextModel hanyalah endpoint hosted opsional dan gateway produksi.
export OPENAI_API_KEY=...
export OPENAI_BASE_URL=https://api.nextmodel.app/v1FAQ
Tidak. CacheSafety Bench adalah benchmark untuk mengukur reuse respons LLM yang aman, bukan janji bahwa semantic cache harus dinyalakan secara default.
Tidak. Run benchmark lokal bersifat open source dan endpoint-neutral. Run hosted di NextModel bersifat opsional.
Bad hit adalah jawaban reuse yang seharusnya tidak dikembalikan untuk request baru karena melanggar fakta, batasan, waktu, format, atau ekspektasi pengguna.
Ya. Benchmark ini dirancang untuk dijalankan secara lokal lebih dulu dengan dataset toy, sintetis, atau privat yang Anda kendalikan.
Mulai sekarang
Jalankan benchmark terbuka secara lokal lebih dulu, lalu pakai workflow hosted hanya saat Anda butuh replay yang lebih besar dan laporan yang bisa dibagikan.