Kira hanya penggunaan semula yang pengguna tidak sedari.
Ukur penggunaan semula respons LLM yang selamat sebelum cache produksi diaktifkan.
Kebanyakan benchmark cache hanya mengoptimumkan hit rate. CacheSafety Bench turut mengukur Safe Hit Rate, Bad Hit Rate dan penjimatan kos API.
Baca docsMasalah
Semantic caching boleh menjimatkan kos, tetapi satu bad hit sudah cukup untuk membuat model kelihatan salah. CacheSafety Bench mengukur sama ada penggunaan semula itu selamat, bukan sekadar sama ada dua prompt kelihatan serupa.
Metrik teras
Kira hanya penggunaan semula yang pengguna tidak sedari.
Inilah had keselamatan keras sebelum cache produksi.
Kira penjimatan hanya selepas penggunaan semula selamat disahkan.
Ukur sama ada prompt yang serupa masih memecahkan penggunaan semula.
Cara ia berfungsi
Jalankan old_request, old_answer dan new_request melalui benchmark runner yang konservatif.
Semak sama ada jawapan lama benar-benar memenuhi request baru tanpa pelanggaran tersembunyi.
Eksport laporan dan cadangan polisi yang berhati-hati sebelum rollout produksi.
Pratonton laporan
Polisi cache yang baik menjimatkan kos tanpa membuat pengguna sedar jawapan itu digunakan semula.
Run hosted
Benchmark hosted NextModel menggunakan kredit untuk replay yang lebih besar, judge models dan laporan yang boleh dikongsi. Run tempatan kekal open source dan endpoint-neutral.
Penjimatan selamat perlu diukur sebelum cache produksi dihidupkan. Hosted runs sesuai untuk penilaian yang lebih besar, bukan syarat untuk menggunakan benchmark ini.
Integrasi developer
CacheSafety Bench kekal open source dan endpoint-neutral. NextModel hanyalah hosted endpoint pilihan dan production gateway.
export OPENAI_API_KEY=...
export OPENAI_BASE_URL=https://api.nextmodel.app/v1FAQ
Tidak. CacheSafety Bench ialah benchmark untuk mengukur penggunaan semula respons LLM yang selamat, bukan janji bahawa semantic cache patut dihidupkan secara lalai.
Tidak. Run benchmark tempatan adalah open source dan endpoint-neutral. Hosted runs pada NextModel adalah pilihan.
Bad hit ialah jawapan guna semula yang tidak sepatutnya dipulangkan untuk request baharu kerana ia melanggar fakta, kekangan, timing, format atau jangkaan pengguna.
Ya. Benchmark ini direka untuk dijalankan dahulu secara tempatan menggunakan toy, synthetic atau private datasets yang anda kawal.
Mula sekarang
Jalankan benchmark terbuka secara tempatan dahulu, kemudian gunakan hosted workflow hanya apabila anda perlukan replay jobs yang lebih besar dan laporan yang boleh dikongsi.