成本问题

LLM API 成本可能迅速增长。服务 1 万用户的中等应用每月可能花费 $500-2000。以下是降低方法。

1. 积极缓存

  • 使用语义缓存处理相同或相似的查询。
  • 对热路径使用 Redis 或内存 LRU。
  • 大多数应用缓存命中率:30-60%。

2. 简单任务用小模型

  • 将简单查询路由到 GPT-5-mini 或 Haiku(便宜 10 倍)。
  • 复杂推理保留给 GPT-5 或 Claude。

3. 优化提示词

  • 更短的系统提示 = 更少的输入 token。
  • 删除冗余指令。

4. 批量请求

  • OpenAI 和 Anthropic 提供 50% 折扣的批量 API。

5. 限制上下文窗口

  • 只发送相关上下文,不发送整个文档。

6. 监控和设定预算

7. 微调替代提示

8. 使用流式传输

9. 高流量自托管

10. 谈判企业方案

快速见效:语义缓存

很多 API 调用是重复或近似重复的。语义缓存存储之前输入及其响应的向量嵌入。新请求到达时,计算其嵌入并与缓存比对。如果余弦相似度超过 0.95,直接返回缓存响应。仅此一项就能降低 30–60% 的成本。

模型路由:80/20 法则

不是每个请求都需要 GPT-5 或 Claude Sonnet。把简单请求(格式化、短回答、分类)路由到更便宜的模型如 GPT-5-mini 或 Claude Haiku。复杂推理、长文生成或高精度任务才用贵的模型。入口处的简单分类器可以按复杂度排序并路由。

批处理与异步处理

如果用例不需要实时响应,就批量处理。OpenAI 的批量 API 提供 50% 折扣。在低峰期处理可获得更优惠价格。同样,有选择地使用流式——流式适合聊天 UI 但对后台处理浪费资源。