为什么用无服务器 AI?
传统 GPU 服务器昂贵且大部分时间闲置。无服务器推理让你按实际使用量付费。
平台
### Modal
- Python 原生无服务器云。
- 少量代码改动即可获得 GPU。
### Replicate
- 通过 API 运行开源模型。
- 无需基础设施管理。
### Cloudflare Workers AI
- 全球边缘部署模型。
- 终端用户低延迟。
### Banana / Together AI
- 专精 LLM 推理。
- 从零到数千请求自动扩缩。
架构模式
- 冷启动缓解:使用模型缓存和预热。
- 请求队列:扩容期间缓冲请求。
- 边缘 + 云:简单模型在边缘,复杂模型在云端。
不适合无服务器的场景
- 持续高吞吐工作负载(>80% GPU 利用率)。
- 模型太大超出可用 GPU 内存。
- 需要 <50ms 响应的延迟敏感应用。
最常见模式是 API Gateway → Lambda/Cloud Function → 模型端点。GPU 推理使用 Modal、Replicate 或 AWS Lambda with GPU(即将推出)。CPU 推理(小模型、量化)用标准 Lambda 函数即可。
冷启动优化
冷启动是无服务器 AI 的最大挑战。策略:
- 预置并发:保持预热实例(AWS),但有额外成本。
- 模型缓存:将模型存储在 /tmp 或 EFS。如果容器预热,Lambda 可跨调用重用文件。
- 更小模型:100MB 模型加载约 200ms;2GB 模型约 4 秒。使用量化模型(GGUF Q4)最小化大小。
- SnapStart:AWS Lambda SnapStart 将 Java 推理服务器的冷启动减少 90%。