高级特性/Prompt Caching
Prompt Caching
提示词缓存能力、适用模型和成本优化建议。
概览
Prompt Caching 可复用长系统提示词、文档上下文和工具定义,降低重复请求成本和延迟。
配置方式
不同上游模型的缓存策略不同。建议把稳定前缀放在消息前部,避免每次请求都改变缓存片段。
下一步
如果调用量大,记录 cache hit rate、输入 token 和首 token 延迟,用数据判断是否值得调整 prompt 结构。
相关链接
· 浏览模型广场 了解所有支持的模型
· Playground 中实时调试
· 阅读智能路由策略 深入了解