请按照本指南操作,以最少的沟通成本从首个样本完成生产环境的数据流交付。有关完整架构和字段定义,请参阅产品规范 (Products spec)。
信息流模型与交付
支持的信息流类型
- 全量快照 (Full snapshot) 信息流:作为单一事实来源的完整目录导出。
- 建议频率:至少每日更新一次。
交付与文件要求
| 主题 | 指导建议 |
|---|---|
| 交付模型 | 通过 SFTP 将数据推送到 OpenAI。 |
| 格式 | 推荐使用 parquet(最好采用 ztsd 压缩)。同时也支持 jsonl.gz、csv.gz 和 tsv.gz。 |
| 编码 | UTF-8 |
| 文件名稳定性 | 使用固定的文件名。每次更新时保留相同的文件名,并通过覆盖方式更新最新快照,而非每次运行都创建新文件名。 |
| 更新行为 | 如果使用多个分片 (Shard) 文件,请保持该分片集稳定,并在每次更新时替换相同的分片文件。 |
| 分片大小 | 建议每个分片最多包含 50 万个条目;目标分片文件大小建议在 500MB 以下。 |
注意常见导入失败原因
- 缺少必填字段
- 过时或不符合规范的字段名称
- 错误的字段值格式
明确处理移除操作
- 如需移除某个产品,请设置
is_eligible_search=false或在下一次全量快照中移除该记录。
作为快照流水线运营
- 以可预测的节奏(至少每日)发布全量快照。
使用推送式交付与固定文件名
- 通过支持的渠道推送信息流。
- 每次发布时重复使用相同的文件路径/名称并执行原位覆盖。
- 如果多个品牌的信息流共用一个存储位置,请使用带有清晰品牌前缀的文件名。
分阶段进行验证
- 先从一个小样本(约 100 个条目)开始。
- 确保每个样本行中包含所有必填字段。
- 对首个全量快照进行质量评估 (QA)。
- 验证无误后,转入稳定的自动化流程。