及 提示词优化器 是控制台中的一个聊天界面,您可以在其中输入提示词,我们会在根据当前最佳实践进行优化后再返回给您。将提示词优化器与 数据集 结合使用,是自动改进提示词的强大方式。
准备您的数据
- 设置一个包含您想要优化的提示词的 数据集 以及一个评估数据集。
- 在数据集中创建至少三行带有响应的数据。
- 针对每一行,创建至少一个评分器结果或人工标注。
提示词优化器可以使用您数据集中的以下内容来改进提示词:
- 标注(“好/坏”以及您添加的其他自定义标注列)
- 在 output_feedback 中填写的文本反馈
- 评分器的结果
为了获得理想的效果,请添加包含“好/坏”评级以及详细、具体反馈的标注。创建能够精确捕获您对提示词期望属性的 评分器 (graders)。
优化您的提示词
准备好数据集后,即可开始进行优化。
- 在提示词窗格的底部,点击 Optimize。这将为优化后的结果创建一个新标签页,并在后台启动优化过程。
- 当优化后的提示词准备就绪时,即可查看并测试新的提示词。
- 重复此过程。虽然单次优化运行就可能达到您期望的结果,但建议尝试在新的提示词上重复优化过程——即生成输出、标注输出、运行评分器并再次优化。
提示词优化的效果很大程度上取决于评分器的质量。我们建议针对您发现提示词失败的每个期望输出属性,构建定义明确的细分评分器。
在将优化后的提示词用于生产环境之前,务必对其进行评估和手动审核。虽然提示词优化器通常能显著提升提示词的效果,但在特定输入下,优化后的提示词仍有可能表现得比原始提示词差。
后续步骤
如需更多灵感,请访问 OpenAI 开发指南 (Cookbook),其中包含示例代码和第三方资源链接,或者了解更多关于我们评估工具的信息。
Cookbook:利用评估构建具有韧性的提示词
使用评估运行持续改进的飞轮。
使用 evals 进行评估
对比外部模型进行评估、通过 API 与 evals 交互等。
评分器 (Graders)
构建复杂的评分器以提高评估的有效性。
微调 (Fine-tuning)
提升模型生成针对特定用例定制响应的能力。