在使用 OpenAI 模型时,有多种方法可以降低成本。成本和延迟通常是相互关联的;减少 Token 使用量和请求次数通常会带来更快的处理速度。OpenAI 的 Batch API(批量 API)和弹性处理(flex processing)是降低成本的额外手段。
成本与延迟
为了减少延迟和成本,请考虑以下策略:
- 减少请求:限制完成任务所需的请求数量。
- 最小化 Token:降低输入 Token 的数量,并针对较短的模型输出进行优化。
- 选择较小的模型:使用能在降低成本和延迟的同时保持准确性的模型。
若要深入了解这些策略,请参阅我们的延迟优化指南。
Batch API(批量 API)
异步处理任务。Batch API 提供了一套简单的端点,允许您将一组请求收集到一个文件中,启动批量处理作业来执行这些请求,在后台请求执行期间查询该批次的状态,并最终在批处理完成后检索收集的结果。
弹性处理
在响应时间较慢且资源偶尔不可用的情况下,以显著降低的价格获得聊天补全(Chat Completions)或响应请求。非常适合非生产环境或优先级较低的任务,例如模型评估、数据丰富或异步工作负载。