主导航

遗留 API

成本优化

提高效率并降低成本。

在使用 OpenAI 模型时,有多种方法可以降低成本。成本和延迟通常是相互关联的;减少 Token 使用量和请求次数通常会带来更快的处理速度。OpenAI 的 Batch API(批量 API)和弹性处理(flex processing)是降低成本的额外手段。

成本与延迟

为了减少延迟和成本,请考虑以下策略:

  • 减少请求:限制完成任务所需的请求数量。
  • 最小化 Token:降低输入 Token 的数量,并针对较短的模型输出进行优化。
  • 选择较小的模型:使用能在降低成本和延迟的同时保持准确性的模型。

若要深入了解这些策略,请参阅我们的延迟优化指南。

Batch API(批量 API)

异步处理任务。Batch API 提供了一套简单的端点,允许您将一组请求收集到一个文件中,启动批量处理作业来执行这些请求,在后台请求执行期间查询该批次的状态,并最终在批处理完成后检索收集的结果。

开始使用 Batch API →

弹性处理

在响应时间较慢且资源偶尔不可用的情况下,以显著降低的价格获得聊天补全(Chat Completions)或响应请求。非常适合非生产环境或优先级较低的任务,例如模型评估、数据丰富或异步工作负载。

开始使用弹性处理 (flex processing) →

© . This website operates independently and is not affiliated with or endorsed by OpenAI, Inc. All brand names, logos, and trademarks are the property of their respective owners.