专注大模型缓存与推理系统评测五年。主导设计并维护 CacheSafety Bench 的核心指标(SH/BH/TR),完成多轮跨模型横向对比实验。此前在推理框架团队负责性能基线建设,熟悉缓存命中率、语义相似度与端到端延迟的测量方法论。主张「可复现、可审计」的评测标准,所有公开数据均附带完整复现脚本。在评测工作中同步积累了大量真实成本数据与模型选型经验,因此兼写成本估算与 API 选型相关内容。
CacheSafety Bench · semantic caching · bad-hit-rate analysis · 成本估算 · 模型选型