成本问题
LLM API 成本可能迅速增长。服务 1 万用户的中等应用每月可能花费 $500-2000。以下是降低方法。
1. 积极缓存
- 使用语义缓存处理相同或相似的查询。
- 对热路径使用 Redis 或内存 LRU。
- 大多数应用缓存命中率:30-60%。
2. 简单任务用小模型
- 将简单查询路由到 GPT-5-mini 或 Haiku(便宜 10 倍)。
- 复杂推理保留给 GPT-5 或 Claude。
3. 优化提示词
- 更短的系统提示 = 更少的输入 token。
- 删除冗余指令。
4. 批量请求
- OpenAI 和 Anthropic 提供 50% 折扣的批量 API。
5. 限制上下文窗口
- 只发送相关上下文,不发送整个文档。
6. 监控和设定预算
7. 微调替代提示
8. 使用流式传输
9. 高流量自托管
10. 谈判企业方案
快速见效:语义缓存
很多 API 调用是重复或近似重复的。语义缓存存储之前输入及其响应的向量嵌入。新请求到达时,计算其嵌入并与缓存比对。如果余弦相似度超过 0.95,直接返回缓存响应。仅此一项就能降低 30–60% 的成本。
模型路由:80/20 法则
不是每个请求都需要 GPT-5 或 Claude Sonnet。把简单请求(格式化、短回答、分类)路由到更便宜的模型如 GPT-5-mini 或 Claude Haiku。复杂推理、长文生成或高精度任务才用贵的模型。入口处的简单分类器可以按复杂度排序并路由。
批处理与异步处理
如果用例不需要实时响应,就批量处理。OpenAI 的批量 API 提供 50% 折扣。在低峰期处理可获得更优惠价格。同样,有选择地使用流式——流式适合聊天 UI 但对后台处理浪费资源。