人人可做提示工程师!Claude上新:一键生成、测试和评估prompt

人工智能 新闻
Anthropic 提示工程师 Alex Albert 表示:这是他们过去几周投入了大量工作才得到的成果,现在 Claude 在提示工程(Prompt Engineering)方面表现得非常好。

在构建 AI 应用时,prompt 质量对结果有着重大影响。但制作高质量的 prompt 具有挑战性,需要研究者深入了解应用需求,并具备大型语言模型方面的专业知识。为了加快开发速度并改善结果,AI 初创公司 Anthropic 简化了此流程,可以让用户更轻松地制作高质量的 prompt。

具体来说,研究者为 Anthropic Console 添加了新功能,可以生成、测试和评估 prompt。

Anthropic 提示工程师 Alex Albert 表示:这是他们过去几周投入了大量工作才得到的成果,现在 Claude 在提示工程(Prompt Engineering)方面表现得非常好。

图片

难写的 prompt,交给 Claude

在 Claude 中,写一个好的 prompt 就像描述任务一样简单。控制台提供了一个内置的 prompt 生成器,由 Claude 3.5 Sonnet 提供支持,允许用户描述任务并让 Claude 生成高质量的 prompt。

生成 prompt。首先点击 Generate Prompt,进入 prompt 生成界面:

图片

然后输入任务描述,Claude 3.5 Sonnet 将把任务描述转换为高质量的 prompt。例如「 撰写一个用于审查入站消息的 prompt…… 」,点击生成 prompt 就可以了。

图片

生成测试数据。如果用户有了 prompt,可能需要一些测试用例来运行它。Claude 可以生成那些测试用例。

图片

用户可以根据需要修改测试用例,并一键运行所有测试用例,还可以查看并调整 Claude 对每个变量生成要求的理解,以实现对 Claude 生成测试用例更细粒度的控制。

这些功能让优化 prompt 变得容易,因为用户可以创建 prompt 的新版本并重新运行测试套件以快速迭代和改进结果。

此外,Anthropic 还按照 5 分制为 Claude 响应质量设置了评分。

图片

评估模型。如果用户对 prompt 感到满意,之后可以在「评估」选项卡中一次针对各种测试用例运行它。用户可以从 CSV 导入测试数据,也可以直接使用 Claude 为用户生成合成测试数据。

图片

比较。用户还可以在测试用例中相互测试多个 prompt,并对更好的响应进行评分,以跟踪哪个 prompt 表现最佳。

图片

AI 博主 @elvis 表示:Anthropic Console 是一项出色的研究,其自动化设计和优化 prompt 的过程可以节省大量时间。虽然生成的提示可能并不完美,但给了用户一个快速迭代的起点。此外,生成测试用例功能也很有帮助,因为开发者可能没有可供测试的数据。

图片

看来,以后写 prompt 这个活,可以交给 Anthropic 了。

了解更多内容,请查看文档:https://docs.anthropic.com/en/docs/build-with-claude/prompt-engineering/overview

责任编辑:张燕妮 来源: 机器之心
相关推荐

2023-10-12 00:01:01

2023-03-21 21:22:27

提示工程预测NLG

2013-08-22 10:23:15

程序员开发

2023-07-27 13:43:10

2011-03-14 13:40:02

移动Web架构人人网

2022-11-14 10:04:36

AI模型

2009-02-11 13:15:54

软件工程师女工程师google

2023-04-06 13:44:41

抠图AI

2024-08-23 08:40:00

2012-11-26 17:09:42

Windows 8

2022-12-29 16:41:10

PPT

2022-08-02 14:27:01

HDF驱动框架驱动开发

2024-03-15 14:34:12

Oracle数据库一键巡检

2019-10-11 11:00:53

Nginx神器前端

2013-08-28 15:33:36

产品经理产品工程师

2015-02-09 15:25:52

换肤

2012-10-18 14:41:31

2011-01-10 17:54:54

360黑屏木马

2024-09-02 14:20:00

模型测试

2023-12-19 15:45:07

Linux工具
点赞
收藏

51CTO技术栈公众号