1 00:00:00,000 --> 00:00:05,000 此视频由 学习AI的1000天 翻译制作(抖音,B站,YouTube) 邮箱: szqshan@gmail.com | 微信: szqshan 网址: www.xueai.org 2 00:00:00,031 --> 00:00:02,575 我们来做一个练习,改进我们的提示词 3 00:00:02,595 --> 00:00:05,158 评估工作流程。这是我要给你的任务 4 00:00:05,198 --> 00:00:07,804 我想通过为我们的模型评估器提供更多关于 5 00:00:07,944 --> 00:00:10,747 好的解决方案应该是什么样子的上下文,来稍微改进它 6 00:00:10,929 --> 00:00:13,432 这样就能知道什么样的解决方案才是好的。 7 00:00:14,073 --> 00:00:16,638 乍一看,这可能听起来有点挑战性,但实际上 8 00:00:16,718 --> 00:00:19,282 你只需要经过两个步骤就能添加 9 00:00:19,301 --> 00:00:21,966 这个额外的上下文。在第一步中, 10 00:00:22,065 --> 00:00:24,987 我建议你回到我们生成数据集的提示词, 11 00:00:25,068 --> 00:00:27,890 在那个提示词中,尝试要求它提供一些 12 00:00:27,931 --> 00:00:30,794 解决方案标准,并将其包含在每个测试用例中。 13 00:00:30,814 --> 00:00:33,316 理想情况下, 14 00:00:33,496 --> 00:00:36,018 我们的测试用例输出现在应该有 15 00:00:36,078 --> 00:00:38,761 一些额外的解决方案标准键, 16 00:00:38,841 --> 00:00:41,622 可能看起来像你在这里看到的。它可能会说 17 00:00:41,683 --> 00:00:44,625 关于好的解决方案应该是什么样的。也许你会说, 18 00:00:44,665 --> 00:00:47,709 一个好的解决方案应该包括这个特征和那个特征 19 00:00:47,808 --> 00:00:50,674 以及这个特征。一旦我们有了这些额外的 20 00:00:50,735 --> 00:00:53,439 解决方案标准,我们就可以将其插入到 21 00:00:53,460 --> 00:00:56,543 我们的模型评分提示词中。 22 00:00:56,603 --> 00:00:59,247 你可能会找到该提示词的现有区域, 23 00:00:59,287 --> 00:01:01,851 我们在那里放入要评估的解决方案,然后 24 00:01:01,911 --> 00:01:04,855 就在它之后,你可能会添加新生成的 25 00:01:04,896 --> 00:01:07,459 解决方案标准。这就是 26 00:01:07,500 --> 00:01:10,224 让我们的模型评估器更好地了解 27 00:01:10,243 --> 00:01:12,927 好的解决方案实际上应该是什么样子 28 00:01:12,968 --> 00:01:15,843 所需要的全部。像往常一样,我建议你 29 00:01:15,862 --> 00:01:18,427 现在暂停视频,尝试做这个练习。 30 00:01:19,269 --> 00:01:21,993 否则,我们现在就要讲解决方案了。 31 00:01:22,474 --> 00:01:25,140 解决方案真的就是这两个单独的步骤。 32 00:01:25,280 --> 00:01:28,004 应该很简单。首先, 33 00:01:28,064 --> 00:01:30,769 在我的笔记本中,我要找到我们的生成数据集函数。 34 00:01:30,829 --> 00:01:33,454 在那里,我会找到我们放入的那个很长的提示词。 35 00:01:33,495 --> 00:01:36,076 然后当我们要求每个 36 00:01:36,096 --> 00:01:38,640 不同的测试用例时,除了任务和输出格式之外, 37 00:01:38,700 --> 00:01:41,284 我还想要获得一些解决方案标准。 38 00:01:41,384 --> 00:01:44,067 39 00:01:45,170 --> 00:01:47,753 然后我会在这里放一个字符串,给我们的模型 40 00:01:47,793 --> 00:01:50,918 一个提示,告诉它这个键应该实际是什么。 41 00:01:50,938 --> 00:01:54,802 我要求一些评估解决方案的 42 00:01:54,843 --> 00:01:59,329 关键标准。 43 00:01:59,370 --> 00:02:02,513 差不多就是这样。现在我要重新运行 44 00:02:02,534 --> 00:02:05,269 这个单元格。我要转到下面的单元格 45 00:02:05,310 --> 00:02:07,823 并重新生成 46 00:02:07,843 --> 00:02:11,807 数据集。好的, 47 00:02:11,828 --> 00:02:15,032 几秒钟后,应该就完成了。搞定了。 48 00:02:15,072 --> 00:02:17,615 现在我们应该有一个更新的 dataset.json 49 00:02:17,675 --> 00:02:20,359 文件。我要打开那个文件。现在我应该看到 50 00:02:20,399 --> 00:02:23,081 这里有一些更新的任务,仍然带有格式,但 51 00:02:23,141 --> 00:02:25,944 现在我也有了一些解决方案标准。 52 00:02:25,965 --> 00:02:28,508 当然,我们可以阅读解决方案标准, 53 00:02:28,549 --> 00:02:31,132 你的看起来会和我的不同,但它会 54 00:02:31,151 --> 00:02:33,754 给出一些关于好的解决方案 55 00:02:33,794 --> 00:02:36,361 实际应该是什么样子的想法。接下来是 56 00:02:36,521 --> 00:02:39,167 第二步。我们要找到我们的模型评分函数 57 00:02:39,206 --> 00:02:41,711 ,特别是其中的提示词。 58 00:02:42,233 --> 00:02:44,877 我们要包含这个新生成的解决方案标准。 59 00:02:44,918 --> 00:02:47,622 再次,只是为了告诉模型评估器 60 00:02:47,924 --> 00:02:50,468 好的解决方案是什么样子的。为此, 61 00:02:50,508 --> 00:02:53,955 我将回到笔记本。我会向下滚动并 62 00:02:54,014 --> 00:02:56,520 找到那个模型评分函数。 63 00:02:56,539 --> 00:02:59,508 就在这里。我要找到提示词。我们 64 00:02:59,549 --> 00:03:02,151 已经放入了原始任务, 65 00:03:02,312 --> 00:03:04,814 生成的输出。然后在那之后,我要 66 00:03:04,835 --> 00:03:07,657 给模型一些说明,只是说,这里是 67 00:03:07,677 --> 00:03:10,381 你应该用来评估解决方案的一些标准。 68 00:03:11,322 --> 00:03:13,903 评估解决方案 69 00:03:14,125 --> 00:03:17,649 应该使用的标准。 70 00:03:18,610 --> 00:03:21,132 我要加一些标签。我会告诉你 71 00:03:21,171 --> 00:03:24,175 为什么要添加这些标签,很快 72 00:03:24,216 --> 00:03:27,258 我们就会开始讨论提示词工程。 73 00:03:27,457 --> 00:03:30,141 然后我要从测试用例中插值, 74 00:03:30,984 --> 00:03:34,449 我们的解决方案标准。 75 00:03:34,468 --> 00:03:37,312 记住那个键,我们的测试用例实际上就是这些 76 00:03:37,493 --> 00:03:40,078 对象,每个对象一个一个。所以我们知道 77 00:03:40,117 --> 00:03:42,741 因为我们在这个文件里看到了,在那个字典里有一个 78 00:03:42,782 --> 00:03:45,306 解决方案标准的键。所以 79 00:03:45,325 --> 00:03:47,830 我们取那个句子并把它放在 80 00:03:48,390 --> 00:03:50,895 这里。好的, 81 00:03:50,914 --> 00:03:54,617 现在是时候运行单元格了。 82 00:03:54,638 --> 00:03:57,520 我们要重新运行我们的管道,看看一切 83 00:03:57,561 --> 00:04:01,506 是如何工作的。我会 84 00:04:02,366 --> 00:04:04,929 向下滚动到运行评估函数。然后在那之后就是 85 00:04:04,949 --> 00:04:07,632 我们实际执行所有操作的地方。我要运行它。 86 00:04:08,372 --> 00:04:10,936 然后我们得到了更新的分数。现在, 87 00:04:10,955 --> 00:04:13,598 我想快速打印出结果,这样我们就能 88 00:04:13,658 --> 00:04:16,221 看到这将如何影响实际输出。 89 00:04:16,742 --> 00:04:19,324 我们再做一次 JSON dumps 的打印, 90 00:04:19,706 --> 00:04:25,105 结果缩进为 2。 91 00:04:25,144 --> 00:04:27,651 现在我们可以看到我们模型的输出, 92 00:04:27,672 --> 00:04:30,218 这是实际产生的输出。这是我们的测试用例, 93 00:04:30,259 --> 00:04:32,785 我们可以看一下任务和解决方案标准。 94 00:04:33,487 --> 00:04:36,293 这是分数,在这种情况下是 9,现在希望 95 00:04:36,314 --> 00:04:38,940 我们的推理部分,由模型评估器产生, 96 00:04:39,281 --> 00:04:41,788 会比以前更详细一些, 97 00:04:42,108 --> 00:04:44,394 因为我们包含了那些解决方案标准。 98 00:04:38,941 --> 00:04:44,394 此视频由 学习AI的1000天 翻译制作(抖音,B站,YouTube) 邮箱: szqshan@gmail.com | 微信: szqshan 网址: www.xueai.org