分享
谷歌Gemini多模态提示词培训课——Part3
输入“/”快速插入内容
谷歌Gemini多模态提示词培训课——Part3
用户4771
用户4771
用户6351
用户6351
2024年11月4日修改
本系列课程是Deeplearning联合谷歌Gemini团队开发的免费在线课程,课程中使用了Gemini模型作为教学模型,教授大家如何使用多模态提示词与模型交互。由于课程内容中有很多在国内无法应用的部分,在其之中也缺乏了某些概念。有鉴于此,我截取了部分教程内容,并适当混合了一些入门概念。将其进行重新整理和刊发,以增强其普世价值。(如有需要,请访问
原版在线课程
)
在本节课程中你可以学到:
1.
通过实践,与视频内容交互,辅助工作与学习
2.
通过实践,学习Function Calling概念与实际应用
💡
扩展阅读:
Gemini API快速入门
💡
扩展阅读:
在线课件与谷歌云配置方法
一、 与视频交互
1.1 交互前的配置
像之前课程中的设置一样,让我们先为连接Gemini API做下配置。就像在之前的用例中一样,我们将使用 Gemini Pro Vision。这个模型能够处理图像、视频和文本。
1.2 第一个示例——使用Gemini辅助数字营销
在这个示例中,你将扮演一名数字营销专员,你的任务是准备一个视频以发布到网站上。为了完成这项工作,我们需要从视频中提取几个关键元素:标题、描述,以及一些用于网站后台的元数据。
就像我们在之前学到的那样,我们需要加载数据,但这次我们要处理的是一个关于 Vertex 和 LinkedIn 的视频。所以我们需要准备几样东西:视频的 URI
、
URL和Path。运行相关代码后,你就可以使用 IPython 在笔记本中查看这个视频了。
现在,我们要从 URI 加载视频。这个过程需要用到我们之前使用过的一些类。首先,我们需要导入 Part 类,接下来,我们使用 Part 类从之前指定的 URI 加载视频。在这个例子中,我们的视频文件类型是 MP4。不过,正如之前提到的,Gemini 模型也支持其他文件格式。
现在你已经导入了视频,是时候写提示了。我们可以首先为模型指定角色,以确保模型有更多的上下文。
定义完角色后,我们需要明确指定模型要执行的任务。以下是我们需要模型完成的具体任务: