11月15日,Anthropic 推出了在开发者控制台中直接改进提示词(prompts)和管理示例的功能。试用:https://console.anthropic.com/dashboard

Image

先看我用的一步步效果,我之前有一个帮我学习英语的的prompt,我让他给我修改。

  • 步骤 1:提交原始提示词

    Image

  • 步骤 2:理解提示词意图,制定计划

    Image

  • 步骤 3:撰写草稿(初步优化)

    Image

  • 步骤 4:优化计划

    Image

  • 步骤 5:撰写最终提示词

    Image

  • 步骤 6:生成最终版本

    Image

  • 步骤 7:在 Workbench 中试用

    Image

  • 步骤 8:生成 Response

    Image

核心功能及效果

提示词优化工具通过以下几种方法强化现有提示词,使模型的生成效果更加精准和可靠:

  1. 连贯性推理(Chain-of-thought reasoning):在提示词中添加专门的推理部分,引导 Claude 系统化地思考问题,从而提高回答的准确性和一致性。
  2. 示例标准化:转化为一致的 XML 格式
  3. 示例丰富化:加入连贯性推理部分,使其与新结构的提示词保持一致
  4. 提示词重写:优化其结构,修正语法或拼写中的细微错误,使表达更加清晰明了。
  5. 预填充信息(Prefill addition):在提示中添加 Assistant 消息的预填充部分,用于引导 Claude 的操作,确保输出结果符合指定格式。

动态反馈,持续改进:

生成的新提示词后,用户可以向 Claude 提供反馈,指出哪些部分有效,哪些部分需要改进。这种迭代式优化机制进一步提升了提示词的适用性和性能。

测试结果:显著提升模型表现

在内部测试中,提示词优化工具展示了以下显著成果:

  • 多标签分类任务:准确率提升了 30%。
  • 摘要生成任务:字数控制达到了 100% 的合规率。

多示例管理功能:提升响应质量的利器

在提示词中添加示例是提升模型响应质量的最有效方法之一,尤其是在需要 Claude 严格遵循特定输出格式时。可以直接在 Workbench 中以结构化格式管理这些示例,方便地添加、编辑和优化它们,以进一步提高响应质量。

Image

功能亮点:

  1. 轻松管理示例:通过 Workbench 以清晰的输入/输出对形式添加新示例或编辑现有示例。
  2. 示例自动生成:利用 Claude 的示例生成功能。Claude 会自动创建合成输入,并为您提供输出草稿,大大简化添加示例的流程。
  3. 清晰的视觉化操作:通过 Anthropic 控制台中的可视化界面,可以直观地查看、管理和调整提示词示例,确保每一步操作都清晰明了。

添加示例带来的优势

  • 准确性提升:减少模型对指令的误解,确保任务完成的精准性。
  • 一致性增强:输出格式始终符合预期,无论任务多么复杂。
  • 性能优化:显著提升 Claude 在处理复杂任务时的能力。

提示词评估与理想输出:打造更高效的提示词

Anthropic 提供的提示词评估工具,让用户可以在各种场景下测试提示词的效果。为了帮助开发者基准测试并改进提示性能,在 Evaluations 标签页中新增了可选的“理想输出”列,协助新用户有效地对模型输出进行评估和评分。

Image

功能详解:

  1. 理想输出列:开发者可以在理想输出列中定义预期结果,然后根据模型输出的质量使用 5 分制进行评分。这种方法能帮助您直观地对提示词效果进行量化评估。
  2. 动态反馈与迭代改进:通过测试新的提示词,可以向提示词优化工具提供进一步的反馈,指出哪些地方仍需改进。优化工具会根据反馈调整提示词及示例内容,确保输出质量更贴近预期。
  3. 灵活格式修改:提示词优化工具支持根据特定需求修改输出格式。例如,可以请求将 XML 格式的输出转换为 JSON 格式。