IBM 生成式人工智能工程入门笔记(二)
学习资源与活动 💡
本课程融合了概念讲解视频和辅助阅读材料。观看所有视频以充分掌握学习材料的潜力。
你将体验到动手实验和一个最终项目,这些活动展示了生成式人工智能在多个领域的常见用例。每节课末尾都有练习测验,帮助你巩固所学知识。课程结束时,你还需要完成一个计分测验。
课程还提供了讨论论坛,方便你与课程工作人员联系并与同伴交流。最有趣的是,通过专家观点视频,你将听到经验丰富的从业者分享他们对生成式人工智能不同方面的见解。
总结与展望 🌟
本节课中,我们一起学习了生成式人工智能的初步介绍、课程目标与结构。当生成式人工智能正在全球范围内增强个人、组织和社区的创造力与专业能力时,本课程为你提供了一个创造新体验的绝佳机会。
生成式人工智能工程:P35:为什么学习生成式AI与IBM
在本节课中,我们将探讨生成式人工智能(Generative AI)为何成为当前技术浪潮的核心,以及为何掌握相关技能对个人职业发展至关重要。我们将了解生成式AI的广泛影响、企业应用需求,以及IBM在推动负责任AI实践中的角色。
生成式人工智能正受到每一位领导者、每一个组织、企业或政府的关注。伴随关注而来的是机遇。各组织正在寻找理解这项技术,并且最重要的是,具备应用该技术技能的人才。
与以往许多趋势性技术不同,生成式人工智能几乎触及了每个行业中的每一个岗位。生成式AI技能预计将变得非常重要,不仅对计算机科学家如此,对所有人都是如此。这些技能将变得像文字处理、电子表格甚至基本商业素养一样必不可少。这正是“生成式AI普及化”课程项目设立的原因。
目前,人工智能领域正涌现大量新的关注点。企业正将目光超越消费级AI应用。聊天机器人界面是展示生成式AI潜力的绝佳方式,而现实用例则是将生成式AI嵌入现有流程,使其成为几乎每个业务工作流程中不可或缺的功能。
IBM很自豪能够帮助企业将生成式AI整合到其运营中。通过这些课程项目,你将获得的技能应能助力你的职业生涯,并可以立即应用到你的工作中。
企业对生成式AI的潜力感到兴奋,但同时也对其潜在风险感到担忧。这些课程项目将赋予你处理AI伦理问题的技能,这些技能根植于IBM开创的负责任方法。
本节课中,我们一起学习了生成式AI的普遍重要性及其对各类职业的影响。我们了解到,掌握生成式AI技能正成为一项基础能力,而企业不仅关注其应用潜力,也重视以负责任的方式部署它。IBM提供的学习路径旨在帮助学习者获得可直接应用的实用技能,并为应对相关的伦理挑战做好准备。
036:生成式AI基础专业课程介绍 🚀
在本节课中,我们将介绍IBM的《生成式人工智能工程》专业课程。该课程旨在帮助初学者全面了解生成式AI的核心概念、工具和应用,无需任何技术背景。通过学习,你将掌握如何利用生成式AI提升个人技能与职业发展。
你是否知道,全球的营销人员已经在使用生成式AI来创作内容、撰写文案、激发创意、分析市场数据以及生成图像?
根据彭博社的预测,到2032年,生成式AI市场的规模预计将达到1.3万亿美元。
因此,深入了解生成式AI对你而言至关重要。
那么,生成式AI适合所有人学习吗?答案是肯定的。
你可以利用其潜力,为自己创造更好的职业前景和生活。
本专业课程面向所有对探索生成式AI力量充满热情的人,无需具备先前的AI技术知识或背景。
即使是初学者也能从中受益,因为它全面涵盖了生成式AI的基本概念、模型、工具和应用。
在本课程结束时,你将能够:
-
解释生成式AI基础模型的基本概念、能力、模型、工具、应用和平台。
-
讨论提示工程,并应用强大的提示工程技术来编写有效的提示,从而从AI模型中生成期望的结果。
-
讨论生成式AI的局限性,并解释其伦理关切及负责任使用的考量。
-
认识到生成式AI在提升你职业生涯和帮助改进工作场所方面的能力。
课程结构 📚
本专业课程包含五门精心设计的自定进度课程,每门课程需要3到5小时完成。
课程1:生成式AI导论与应用 🌐
上一节我们概述了课程目标,本节中我们来看看第一门课的具体内容。
课程1是你理解生成式AI能力的第一步,其能力涵盖文本、图像、音频、视频、虚拟世界、代码和数据等多个领域。
你将了解不同行业如何应用常见的生成式AI模型和工具,例如:
-
GPT
-
DALL-E
-
Stable Diffusion
-
IBM Granite
-
Synthesia
课程2:提示工程精要 ✍️
在了解了生成式AI的广泛应用后,接下来我们将学习如何有效地与AI交互。
课程2介绍了提示工程的概念,以及它如何帮助你释放如ChatGPT这类生成式AI工具的全部潜力。
你将探索开发有效提示的技术、方法和最佳实践,并使用以下常用工具:
-
IBM Watsonx Prompt Lab
-
Spellbook
-
Dust
课程3:生成式AI的核心构建模块 ⚙️
掌握了与AI对话的技巧后,我们需要深入理解其背后的原理。
课程3专注于生成式AI的核心概念和构建模块,例如:
-
深度学习
-
基于Transformer架构的大语言模型
-
扩散模型
-
基础模型
你还将了解不同的生成式AI平台,如IBM Watsonx.ai和Hugging Face。
课程4:生成式AI的伦理与局限 ⚖️
理解了技术原理,我们还需审视其带来的社会影响。
在课程4中,你将探讨与生成式AI相关的伦理考量。例如:
-
它对数据隐私和安全、版权侵权、劳动力以及环境有何影响?
-
你将描述其局限性,例如数据偏见、缺乏可解释性、透明度和可理解性。
-
识别生成式AI的常见滥用,如深度伪造和幻觉。
课程5:生成式AI的未来与你的职业 🚀
探讨了挑战之后,让我们展望未来,看看生成式AI将如何塑造新的机遇。
最后,课程5讨论了生成式AI的未来。你难道不想知道在那个未来里,你的职业机会有哪些吗?
你将学习生成式AI如何影响和增强不同行业中的现有职能、技能和工作角色,以及如何利用生成式AI构建自己的应用程序,创造新的商业机会。
本专业课程的内容旨在吸引并赋能你。
学习方法与实践 🛠️
通过观看精选的概念视频、聆听AI专家分享他们的见解和技巧,以及在实践实验室和项目中练习技术,你将在日常生活中使用生成式AI工具和应用程序时感到更加自信。
目前,65% 的生成式AI用户是千禧一代或Z世代,72% 是在职人士。通过本专业课程的学习,你将准备好加入生成式AI变革者的行列。
生成式AI,适合每一个人。
总结
本节课中,我们一起学习了IBM《生成式人工智能工程》专业课程的完整介绍。该课程共分为五个部分,从应用入门、提示工程、核心技术、伦理考量到未来展望,为初学者提供了一条清晰的学习路径。课程强调实践与理论结合,旨在帮助学习者自信地掌握并应用生成式AI技术,把握未来的职业发展机遇。
037:生成式AI简介 🧠
在本节课中,我们将要学习生成式人工智能的基本概念、其发展历程,以及它与判别式人工智能的区别。我们将从人工智能的基础定义开始,逐步深入到生成式AI的核心模型和应用。
概述
人工智能已经存在多年,它塑造了我们生活的方方面面,并彻底改变了我们的工作和生活方式。其核心定义是机器对人类智能的模拟。AI模型从海量现有数据中学习,这个过程被称为训练。人工智能主要有两种基本方法:判别式AI和生成式AI。
判别式人工智能
判别式AI是一种学习区分不同数据类别的方法。它通过分析带有标签的训练数据来学习模式,并用于对新数据进行分类或预测。
以下是判别式AI的工作原理:
-
训练过程:模型接收一组训练数据,其中每个数据点都带有其所属类别的标签。
-
决策边界:模型学习在数据特征空间中划分不同类别的“决策边界”。
-
预测:对于新的数据点,模型通过判断其落在决策边界的哪一侧来预测其类别。
判别式AI模型利用高级算法来区分、分类、识别模式,并根据训练数据得出结论。一个典型的例子是电子邮件垃圾邮件过滤器,它可以区分垃圾邮件和非垃圾邮件。
判别式AI模型最适合应用于分类任务。然而,它们无法理解上下文,也无法基于对训练数据的上下文理解来生成新的内容。
生成式人工智能
上一节我们介绍了判别式AI的分类能力,本节中我们来看看生成式AI如何更进一步。生成式AI模型学习基于训练数据生成全新的内容。它们能够捕捉训练数据的底层分布,并生成新颖的数据实例。
生成式AI的工作流程始于一个“提示”。这个提示可以是文本、图像、视频或模型能够处理的任何其他输入。作为输出,模型会生成新的内容,包括文本、图像、音频、视频、代码和数据。
生成式AI的输出形式可以与提示相同,例如“文本到文本”;也可以与提示不同,例如“文本到图像”或“图像到视频”。
这里有一个简单的例子来理解判别式AI和生成式AI的区别:
-
判别式AI 最适合回答诸如“这张图片画的是鸟巢还是蛋?”这类问题。
-
生成式AI 则会响应诸如“画一张里面有三个蛋的鸟巢图像”这样的提示。
如果说判别式AI模仿了我们的分析和预测能力,那么生成式AI则更进一步,模仿了我们的创造能力。正如《哈佛商业评论》的评论所暗示的:AI不仅可以提升我们的分析和决策能力,还可以增强创造力。
生成式AI的模型基础
生成式AI的创造能力来源于其核心模型。这些模型可以被视为生成式AI的构建模块。
以下是几种关键的生成式AI模型:
-
生成对抗网络:包含一个生成器和一个判别器相互竞争学习的框架。
-
变分自编码器:通过学习数据的压缩表示来生成新数据。
-
Transformer模型:基于自注意力机制,擅长处理序列数据,是大型语言模型的基础。
-
扩散模型:通过逐步去噪过程从随机噪声中生成高质量图像。
判别式模型和生成式模型都是使用深度学习技术创建的。深度学习涉及训练人工神经网络从海量数据中学习。人工神经网络是由称为神经元的较小计算单元组成的集合,其建模方式类似于人脑处理信息的过程。
生成式AI的演进
生成式AI并非一个新概念,其根源可追溯到机器学习的起源。在20世纪50年代末,科学家们提出机器学习时,就探索了使用算法创建新数据。到了20世纪90年代,神经网络的兴起为生成式AI注入了新的进展。
进入21世纪10年代初,在大型数据集和增强计算能力的支持下,深度学习进一步推动了生成式AI的发展。2014年,随着伊恩·古德费洛及其同事引入GANs,生成式AI发生了变革。GANs以及VAEs、Transformers等模型为生成式AI的增长以及基础模型和工具的开发奠定了基础。
基础模型是具有广泛能力的AI模型,可以被调整以创建针对特定用例的、更专业的模型或工具。其中一类特定的基础模型称为大型语言模型,它们经过训练以理解人类语言,并能处理和生成文本。
2018年,OpenAI推出了基于Transformer的LLM,称为生成式预训练Transformer。多年来,不同的LLM,如GPT系列中的GPT-3和GPT-4、Google的PaLM、Meta的Llama等,显著增强了生成式AI生成连贯且相关文本的能力。在其他用例的模型方面也有类似的发展,例如用于图像生成的Stable Diffusion和DALL-E模型。
应用与影响
多种生成式模型的发展,催生了针对不同用例的生成式AI工具市场的增长。
以下是不同领域的生成式AI工具示例:
-
文本生成:ChatGPT, Bard
-
图像生成:DALL-E 2, Midjourney
-
视频生成:Synthesia
-
代码生成:GitHub Copilot, AlphaCode
快速涌现的模型和工具为生成式AI在各个领域的应用开辟了广阔的空间。引用麦肯锡关于生成式AI经济潜力的报告:“生成式AI有潜力改变工作的结构,通过自动化部分个人活动来增强个体工人的能力。”该报告还预测,生成式AI对生产力的影响可能为全球经济增加数万亿美元的价值。
总结
本节课中我们一起学习了生成式AI的核心知识。我们了解到,生成式AI模型能够基于其训练数据生成全新的内容。此外,生成式AI的创造能力建立在诸如GANs、VAEs、Transformers和扩散模型等模型之上。基础模型可以被调整以创建针对特定用例的专业模型或工具。最后,我们认识到生成式AI模型和工具在不同领域和行业中拥有广泛的应用前景。
生成式人工智能工程:P38:生成式AI的能力 🚀
在本节课中,我们将学习生成式人工智能(Generative AI)的核心能力,并探讨这些能力在现实世界中的应用场景。生成式AI能够创造全新的内容,其应用范围广泛,潜力巨大。
文本生成能力 📝
上一节我们概述了生成式AI的多种能力,本节中我们首先来看看其文本生成能力。这是指AI生成清晰、流畅且符合上下文语境的文本回复的能力。
生成式AI文本生成能力的核心是先进的大型语言模型(LLMs)。这些模型在大型数据集上进行训练,能够学习数据中的模式和结构,从而生成连贯且相关的文本。
以下是LLMs能够执行的一些主要任务:
-
文本补全:根据已有内容续写文本。
-
摘要:将长文本浓缩为简短摘要。
-
问答:根据给定信息回答问题。
-
翻译:在不同语言之间进行翻译。
-
代码生成:根据描述生成代码片段。
-
图文配对:理解图像内容并生成描述文本,或根据文本生成图像。
一些知名的LLMs包括OpenAI的GPT(Generative Pre-trained Transformer)和Google的PaLM(Pathways Language Model)。它们为聊天机器人、虚拟助手等提供了强大的对话交互能力。
图像生成能力 🎨
接下来,我们探讨生成式AI的图像生成能力。这指的是AI能够合成具有艺术感且逼真的图像,这些图像与真实照片非常相似。
生成式模型基于深度学习技术(如生成对抗网络和变分自编码器)来生成高质量的图像。生成的图像展现出逼真的纹理、自然的色彩和精细的细节,给人以真实拍摄的印象。
以下是几个应用实例:
-
StyleGAN:可以生成高质量、高分辨率的虚构人脸、动物或自然景观图像。
-
DeepArt:能够根据简单的草图创作出完整的艺术作品。
-
DALL-E:可以根据用户的文字描述生成全新的图像。
除了艺术、设计、娱乐和游戏领域,生成图像还可用于增强训练数据集,并辅助医学成像和科学可视化研究。
音频生成能力 🎵
现在,让我们看看生成式AI在音频领域的生成能力。生成式模型可以创作新的音乐作品,使用文本转语音技术将文本转换为音频,并创造合成语音及自然的人声。
这些模型能够转换、修改、净化人声,降低噪音并提升音频质量。它们还能相当逼真地模仿人类声音。
以下是几个具体应用:
-
WaveGAN:可以生成新的、逼真的原始音频波形,包括语音、音乐和自然声音。
-
MuseNet:能够结合多种乐器、风格和流派,生成新颖的音乐作品。
-
Tacotron 2 和 Mozilla TTS:使用先进的TTS系统创建合成语音,模仿人类的音调、音高、节奏和表达。
AI生成的音频在媒体创作、娱乐、教育培训、游戏及虚拟现实等多个领域都有广泛应用。
视频生成能力 🎬
上一节我们介绍了音频生成,本节中我们来看看视频生成能力。生成式AI模型能够创建动态、清晰的视频,范围从基础动画到复杂场景。
这些模型通过结合时间连贯性和自然语言处理技术,将图像转化为动态视频。时间连贯性确保了视频在时间维度上意义和上下文的一致性,从而使得视频中的运动平滑、过渡自然。
例如,VideoGPT模型可以根据用户提供的文字提示生成新视频。用户可以指定期望的内容来引导视频生成过程,包括视频补全、编辑、合成、预测和风格迁移等。
生成的视频可应用于艺术、娱乐、教育、游戏、医学及研究等多个领域。
代码生成能力 💻
生成式AI不仅能生成多媒体内容,还能生成代码。接下来,我们探讨其代码生成能力。生成式模型可以根据所需功能,生成新的代码片段、函数或完整程序。
这些模型在现有代码库上进行训练,能够完成或创建代码、重构代码、识别并修复代码错误、测试软件以及生成包括注释、函数描述和使用示例在内的文档。
例如,GitHub Copilot 和 IBM Watson Code Assistant 都是基于AI的编程助手,可以帮助自动补全代码、处理复杂任务,并根据输入生成代码。
AI生成的代码可用于软件开发、机器学习、数据分析、机器人自动化以及游戏和AR/VR环境开发等领域。开发者可以利用代码生成能力来更高效地编写、调试和测试代码。
数据生成与增强能力 📊
除了生成代码,生成式AI还能生成和增强数据。现在,让我们探索其数据生成与增强能力。生成式模型可以生成新数据并扩展现有数据集。
生成合成数据集有助于增加数据的多样性和可变性,从而带来更稳健、更有效的模型性能。
这些模型可以为图像、文本、语音、表格数据、时间序列数据等多种类型生成新样本并增强数据集。
数据生成与增强能力在医疗健康、游戏、教育培训、艺术创作以及自动驾驶等众多领域都有重要应用。
虚拟世界创造能力 🌐
生成式AI另一个强大的能力是创造高度逼真且复杂的虚拟世界。你可以创建模拟真实行为、表情、对话甚至决策的虚拟化身。
你还可以创建具有逼真纹理、声音和物体的复杂虚拟环境,这些环境遵循物理世界的规律。元宇宙平台利用生成式模型为用户创造独特且个性化的体验。
生成式AI还能创造具有独特个性的虚拟身份,为虚拟化身赋予特定的个人特质,并体现在其行为和对话中。
虚拟世界创造能力在游戏、娱乐、教育、增强/虚拟现实、元宇宙平台以及虚拟偶像和数字人格等领域有着广泛的应用前景。
总结 📚
本节课中,我们一起学习了生成式人工智能模型的多种核心能力及其在现实世界中的应用。
生成式AI能够:
-
生成连贯且符合语境的文本内容。
-
创造逼真的高质量图像。
-
合成语音、创作新音频和动态视频。
-
生成和补全代码。
-
合成新数据以增强现有数据集。
-
创造高度逼真和复杂的虚拟世界,包括虚拟化身和数字人格。
这些能力共同构成了生成式AI强大的创造力基础,并正在不断拓展其应用边界。
039:生成式AI的应用 🚀
在本节课中,我们将学习生成式人工智能在不同领域的具体应用。通过了解这些应用案例,你将能够认识到生成式AI如何改变各行各业的工作流程与效率。
概述
生成式AI的能力正被广泛应用于多个关键领域。本节将重点介绍其在IT与DevOps、娱乐、教育、银行与金融、医疗保健、人力资源以及通用工作场景中的应用。我们将逐一探讨每个领域的具体工具和案例。
IT与DevOps领域的应用
上一节我们介绍了生成式AI的概览,本节中我们来看看它在IT与DevOps领域的应用。生成式AI通过自动化代码生成、测试和运维任务,显著提升了软件交付流程和基础设施管理的效率。
以下是生成式AI在IT与DevOps中的主要应用方向:
-
代码生成:生成式AI的代码生成能力减少了手动编码的工作量和在重复性任务上花费的时间。
-
代码审查:由生成式AI驱动的代码审查工具(如GitHub Copilot和Synk DeepCode)会检查代码库和编码标准,以提升代码质量和可维护性。
-
自动化测试:生成式模型可以生成模拟用户行为的合成测试用例和测试数据。测试用例的多样性影响着软件的效率、可靠性和健壮性。诸如Applitools和Testim等工具通过确保测试数据的深度和多样性来保证充分的测试覆盖率。
-
监控与异常检测:诸如IBM的Watson AIOps和Mugsoft AIOps等工具会分析系统日志、指标和其他数据,以监控和检测代码中的异常。这有助于进行主动维护和故障排除,减少停机时间并防止关键故障。
-
自动化文档与部署:GitLab Duo通过自动创建发布说明、变更日志以及更新部署模板和脚本来支持持续集成与部署(CI/CD)流程。
IT与DevOps领域的其他应用还包括自然语言界面、自动化基础设施管理和预测性维护。
娱乐领域的应用
了解了生成式AI如何优化技术流程后,我们转向创意产业。在娱乐领域,生成式AI工具能够创造多样化的合成内容,并实现内容的个性化。
以下是生成式AI在娱乐领域的主要应用:
-
内容生成:生成式AI工具可以生成各种合成内容,例如音乐、剧本、故事、视频、电影和电子游戏。它们还能翻译、本地化和个性化内容。
-
游戏与体验开发:诸如Side Effects公司的Houdini等游戏开发工具利用生成式AI的力量来创建游戏、动画、增强现实和虚拟现实体验,以及具有独特行为的角色。
-
虚拟形象:最近,由生成式AI驱动的虚拟影响者和虚拟形象也日益流行,它们能与用户互动,创造引人入胜的体验。
教育领域的应用
生成式AI的另一个重要影响领域是教育。从内容生成到个性化学习体验,再到模拟实践学习,其影响是巨大的。
以下是生成式AI在教育领域的主要应用:
-
语言与内容:凭借其语言能力,它们可以提供语言翻译,使内容能以不同语言访问。
-
个性化学习:它们可以批改作业以提供即时反馈,并创建支持个体学习者节奏和优势的学习路径与评估策略。
-
学习分析:可以根据学习者的表现和偏好生成分类法。生成式算法可以检测特殊需求和学习障碍,以帮助学习者和教育者制定特定的课程计划。
-
进度追踪:生成式算法也被用于随时间追踪学习者的进度,这被称为知识追踪。这有助于为个体需求提供合适的节奏和内容。
辅导支持、虚拟和模拟环境以及包容性教育也从中受益。例如,Nolej能在几分钟内提供AI生成的电子学习内容,包括针对目标主题的互动视频、术语表、练习题和摘要。Duolingo是一个语言学习平台,它使用GPT-3来纠正法语语法并为英语创建测试项目。
银行与金融领域的应用
银行和金融机构极大地受益于生成式AI自动检测风险、生成见解和提供具备金融知识的建议的能力。
以下是生成式AI在金融领域的主要应用:
-
行业专用模型:Kore.ai是首个银行业专用的LLM,它帮助银行应用程序提供类人的、具备金融知识的响应。
-
风险评估:例如,DataRobot可以通过模拟潜在的欺诈场景来生成合成用例,以检测信用风险、欺诈风险和市场波动,用于信用评分。
-
自动化决策:Personetics和AIO Logic利用生成式模型来检测风险、确定利率并构建定制贷款。它们自动化评估客户信用度,并设定信用额度或保险保费。
-
市场分析:由生成式AI驱动的工具,如BloombergGPT,可以分析新闻文章、社交媒体和其他分类文本数据,以执行市场情绪分析并更有效地管理投资组合。
-
客户服务:生成式AI工具建立了对话系统,并使用机器人顾问、聊天机器人和虚拟助手来协助财务规划。
监管合规与报告、财务预测、投资组合优化、反洗钱和算法交易是一些从中大大受益的领域。需要注意的是,其中一些应用和工具同时利用了生成式和判别式AI模型。
医疗保健领域的应用
现在让我们讨论生成式AI在医学和医疗保健研究、药物发现、诊断和患者护理方面的一些应用。
以下是生成式AI在医疗领域的主要应用:
-
医学影像与诊断:凭借其生成类似于患者数据的合成图像的能力,生成式模型提高了用于医学图像分析的深度学习模型的鲁棒性。这些模型可以为数据非常有限的罕见医疗状况合成数据。这有助于促进研究、训练AI模型并为罕见病例开发新的诊断工具。
-
药物发现:在药物发现中,这些模型通过生成新分子、加速药物发现过程并降低开发成本来提供帮助。
-
远程医疗:远程医疗和远程监控也受益于生成式AI驱动的对话工具。例如,Rasa可以与患者建立具备医学知识的对话,以提供即时的医疗设备、健康相关支持以及个性化的治疗计划。
该领域的其他方面包括电子健康记录管理、医疗保健欺诈检测以及医学模拟和培训。
人力资源领域的应用
让我们看看生成式AI如何赋能人力资源部门,使其自动化重复性任务、提供有价值的见解并简化HR流程。
以下是生成式AI在人力资源领域的主要应用:
-
任务自动化:例如,Watson X Orchestrate帮助自动化HR任务,如创建职位需求、筛选和列出相关简历、安排面试、候选人入职等。
-
人才招聘:Talenteria专注于人才招聘。
-
员工互动:Lina AI使用对话式AI系统来自动化HR任务和员工互动。
-
绩效管理:Mcorva通过自动生成绩效文档和评估来专注于工作场所和绩效管理。
生成式AI在HR中的其他应用包括培训与发展、分析与决策以及合规与政策实施。
对工作方式的影响
虽然我们今天只谈到了几个领域,但人们最终相信生成式AI将对所有行业产生重大影响。另一个影响巨大的领域是我们的工作方式。
根据麦肯锡关于生成式AI经济潜力的报告,当前的生成式AI和其他技术有潜力自动化当今占用员工60%至70%时间的工作活动。到2030年至2060年间,今天多达一半的工作活动可能被自动化。生成式AI日益增长的理解自然语言的能力最终将影响甚至通常与高等教育和习得技能相关的知识型工作。
总结
本节课中,我们一起学习了生成式AI在各个领域的流行应用。然而,重要的是要注意,生成式AI的潜在应用在所有行业和生活的各个方面几乎是无限的。
-
在IT与DevOps中,应用包括代码生成、代码审查、自动化测试、监控与异常检测、自动化文档以及持续集成与部署流程。
-
在娱乐领域,生成式AI通过生成各种合成内容以及翻译、本地化和个性化内容,提供了令人兴奋的可能性。
-
在教育领域,生成式AI改变了教育的覆盖范围和质量,影响着学习者、教育者和教育技术。
-
在金融领域,应用领域包括风险评估、信用评分、情绪分析、投资组合管理、合规、预测、交易和客户服务。
-
在医学和医疗保健领域,我们看到应用包括医学研究、诊断、医学培训、患者护理和远程医疗。
-
在人力资源领域,应用涉及人才招聘、员工互动、绩效管理、培训与发展、HR分析和政策实施。
-
在工作场所,生成式AI的应用正在改变我们的工作方式,使我们更高效、更成功。
040:6_文本生成工具 📝
在本节课中,我们将要学习生成式人工智能在文本生成方面的基础知识,了解核心模型的能力,并介绍几种流行的文本生成工具。
概述
文本生成是生成式人工智能的核心应用之一。其核心是大型语言模型,它们通过学习海量数据中的模式和结构,能够理解上下文、语法和语义,从而生成连贯且符合语境的文本。本节我们将探讨这些模型的基本原理,并介绍包括ChatGPT和Bard在内的多种实用工具。
文本生成的基础:大型语言模型(LLMs)
上一节我们介绍了生成式AI的概览,本节中我们来看看其文本生成能力的核心——大型语言模型。
基于在训练期间学习到的模式和结构,LLMs能够解释上下文、语法和语义,以生成连贯且符合语境的文本。通过分析词语和短语之间的统计关系,LLMs能够为任何给定的语境调整出富有创造性的写作风格。
LLMs是许多文本生成模型的基础,其中两个著名的例子是:
-
生成式预训练变换器(GPT)
-
PaLM(Pathways Language Model)
这些模型已经进化为多模态模型,提供了多种能力。
流行的文本生成工具
了解了LLMs的基础后,我们通过两个流行的工具来具体了解这些模型的能力。
ChatGPT 🤖
ChatGPT基于GPT系列大型语言模型,并使用了先进的自然语言处理技术。虽然最初ChatGPT仅接受文本提示作为输入来生成新内容,但在新版本中,它已能同时接受图像和文本输入。ChatGPT为文本生成提供了多样化的能力。
以下是ChatGPT的一些核心能力:
-
上下文对话:能够进行流畅且基于上下文的对话。
-
创意任务协助:可以帮助完成各种创意任务,例如生成演示文稿大纲。
-
多语言支持:虽然最擅长英语,但能理解并响应多种其他语言。
-
学习辅助:可以作为学习新语言或任何科目的有用工具。
例如,你可以输入提示:“帮我创建一个展示学习平台功能的幻灯片”,ChatGPT会为特定幻灯片提供标题、内容和视觉元素的建议。
Google Bard 🎭
另一个流行的文本生成工具是Google Bard。它基于Google的先进语言模型PaLM。PaLM是Transformer模型与Google Pathways AI平台的结合。Pathways AI基于“路径”架构,即负责特定任务(如NLP或机器翻译)的专用模块。除了庞大的文本和代码训练数据集,它还能从互联网上的资源中提取信息来响应提示。
以下是尝试使用Bard探索其能力的示例:
-
信息总结:尝试使用提示来获取某个主题的最新新闻摘要,例如“提供关于乌克兰战争的最新新闻摘要”。它会提供多个草稿作为响应,你可以选择其一或重新生成。
-
创意生成与问题解决:提示它“为推广一个时尚品牌提供数字营销活动的策略”,它会提供该营销活动的分步方法。
其他文本生成工具与用例
除了ChatGPT和Bard,文本生成工具还能应用于其他有价值的场景。
以下是它们的一些扩展应用:
-
数学与问题解决:可以帮助处理基础数学、统计和通过这些科目解决问题。
-
金融分析:精通金融分析、投资研究、预算制定等。
-
代码生成:可以生成代码并跨各种编程语言和框架执行代码相关任务。
在与ChatGPT和Bard互动后,你会发现:ChatGPT在生成动态响应和维持对话流方面更有效;而Bard由于能通过Google搜索和Google学术访问网络资源,在研究某个主题的最新新闻或信息时可能是更好的选择。
需要意识到,包括GPT和PaLM在内的生成式AI模型正在不断进化,因此它们的能力和特性可能会发生变化。
专用文本生成工具
除了通用工具,还有针对特定用途的文本生成工具。
以下是几个例子:
-
Jasper:生成符合品牌声音的、任意长度的高质量营销内容。
-
Writesonic:为不同类型的文本(如文章、博客、广告和营销文案)提供特定模板。
-
Copy.ai:擅长创建社交媒体、营销和产品描述的内容。
此外,还有用于特定用例的工具:
-
摘要工具:例如
resumer,通过提取关键思想或概念来生成文本摘要。 -
分类工具:例如
youclassifier,用于为一段文本分配一个或多个类别。 -
情感分析工具:例如Brand24和Repustate,用于生成反映人类语言中所表达的基础情感的文本。
-
多语言翻译工具:例如Language Weaver和Yandex Translate。
隐私考量与开源替代方案
一个重要注意事项是,许多开源的生成式AI工具会收集和审查与其共享的数据以改进其系统。这是与这些工具交互时的一个重要考虑因素,以避免共享任何机密或敏感信息。
那么,我们是否有开源且保护隐私的替代方案?答案是肯定的。
以下是几个例子:
-
GPT4All:可以安装在你的机器上,作为无需互联网或图形处理单元的、具有隐私意识的聊天机器人运行。
-
H2O AI 和 PrivateGPT:这些聊天机器人旨在通过在没有互联网连接的情况下在本地机器上运行(利用LLMs的能力)来保护用户隐私。
不仅如此,你还可以通过将这些工具链接到你组织的文档和数据库,来定制它们以在特定组织内部使用。
文本生成工具的优势
生成式AI文本生成工具提供了多项好处:
-
学习辅助:提供分步解释,是良好的学习助手。
-
提升效率:能够快速生成不同形式的文本,为作者和创作者提高效率。
-
激发创意:增强创造力并激发新想法。
-
虚拟助手:通过实现引人入胜的互动对话,可用作虚拟助手和聊天机器人。
-
提高生产力:通过自动化重复性写作任务,可以提高组织的生产力。
-
促进全球化沟通:通过多语言支持,实现全球受众的沟通和内容本地化。
总结
本节课中我们一起学习了:
-
LLMs通过解释上下文、语法和语义来生成连贯且符合语境的文本,它们是许多文本生成工具的基础。
-
两个流行的文本生成工具是OpenAI的ChatGPT(基于GPT)和Google的Bard(基于PaLM)。两者都能生成不同类型的文本、翻译语言并以互动和信息丰富的方式回答问题。
-
我们还讨论了其他工具,如Jasper、Copy.ai、Writesonic。
-
开源的、保护隐私的文本生成器包括GPT4All、H2O AI和PrivateGPT。
通过理解这些工具的基本原理和应用,你可以开始利用生成式AI的强大能力来辅助写作、学习、创作和解决各种问题。
041:图像生成工具 🖼️
在本节课中,我们将学习生成式人工智能在图像生成领域的基本能力,并介绍几种主流的图像生成模型与工具。通过本课,你将能够描述这些模型的核心功能,并了解如何利用它们来创建和修改图像。
概述
生成式AI图像生成模型能够根据文本描述创建全新的图像,并能对真实或生成的图像进行定制化修改,以获得期望的输出。例如,你可以生成一个“戴着帽子、手里拿着书的小孩”的图像,随后还可以更改书中封面的颜色。
文本到图像生成
上一节我们概述了图像生成的基本概念,本节中我们来看看如何通过文本提示来生成图像。
你可以使用免费的AI图像生成器(例如FreePik)来创建图像。操作时,需要输入一段描述你想要的图像的文本提示。提示词描述的准确性和用词会直接影响生成图像的质量。
例如,输入提示词:“一艘船在日落时分的平静湖面上航行,周围是郁郁葱葱的绿植和宁静的天空”。选择风格后,即可生成图像。工具通常会生成多个版本供你选择、下载,你也可以通过修改提示词来生成其他图像。
图像生成模型的更多可能性
除了基础的文本生成图像,图像生成模型还具备多种高级功能。
以下是几种关键的图像处理能力:
-
图像到图像转换:指将图像从一个领域转换到另一个领域,同时保留原始内容和风格。例如:
-
将草图转换为逼真图像。
-
将卫星图像转换为地图。
-
提升安防摄像头图像的分辨率和细节。
-
应用于医学影像增强。
-
-
风格迁移与融合:提取一张图像的风格,并将其应用到另一张图像上,从而创建混合或融合图像。例如,将一幅画作的风格应用到一张照片上。
-
图像修复:重建图像中缺失或损坏的部分,使其变得完整。可用于:
-
艺术品修复。
-
取证分析。
-
移除图像中不需要的物体,同时保持画面的连续性和上下文。
-
将虚拟物体融合到真实场景中(增强现实)。
-
-
图像外绘:通过生成与原始图像连贯的新部分来扩展原始图像。可用于:
-
生成更大尺寸的图像。
-
提升图像分辨率。
-
创建全景视图。
-
主流图像生成模型
图像生成和修改能力的演进,离不开背后驱动模型的不断发展。
以下是几个重要的图像生成模型:
-
OpenAI的DALL-E 🎨
-
基于GPT模型,在大型图像及其文本描述数据集上训练而成。
-
能够生成多种风格的高分辨率图像,包括逼真的照片和绘画。
-
新版DALL-E提供了生成多种图像变体以及通过图像修复和外绘进行图像转换的能力。
-
-
Stable Diffusion 🌊
-
一个开源的“文本到图像”扩散模型。
-
扩散模型是一种能创建高分辨率图像的生成模型。
-
核心功能是基于文本提示生成图像,但也可用于图像到图像转换、修复和外绘。
-
-
NVIDIA的StyleGAN 👾
-
该模型将图像内容建模和图像风格建模分离开,从而能精确控制风格,并操纵特定特征(如姿势或面部表情)。
-
已演进到能生成具有更逼真细节的更高分辨率图像。
-
可用的图像生成工具
了解了核心模型后,我们来看看一些可供使用的具体工具。
你可以使用Crayon、FreePik和Pixlr等免费工具来探索生成式AI的文本到图像生成能力,这些工具能以不同的形式和风格生成图像。
此外,还有一些专注于艺术风格的工具:
-
DeepArt.io 是一个在线平台,可以将照片转化为不同艺术风格的作品。
-
MidJourney 是一个平台,它构建了一个图像生成者社区,帮助艺术家和设计师使用AI创作图像,并探索彼此的作品。
许多生成式AI图像生成器还提供API接口,允许将它们的功能集成到不同的软件程序和工具中。一些提供API的流行图像生成器包括DALL-E、MidJourney和Crayon。
科技巨头的参与
技术巨头如微软和Adobe也已涉足AI图像生成器领域。
-
Microsoft Bing Image Creator 🖥️
-
基于DALL-E模型。
-
你可以通过访问Bing.com/create或通过Microsoft Edge浏览器使用该工具,这使得Microsoft Edge成为首个集成AI图像生成器的浏览器。
-
-
Adobe Firefly 🔥
-
这是一系列生成式AI工具,旨在与Adobe Creative Cloud应用程序(如Photoshop和Illustrator)集成。
-
Firefly使用Adobe Stock图片、开源许可内容和公共领域内容进行训练。
-
它能接受超过100种语言的文本提示,并包含多种工具,允许你操控颜色、色调、光照、构图,以及使用生成式填充、文本效果、生成式重新着色、3D转图像和图像扩展等功能。
-
总结
本节课中,我们一起学习了生成式AI模型和工具如何通过文本和图像提示来生成新图像。它们还提供了图像到图像转换、风格迁移、图像修复和外绘等能力。几个著名的图像生成模型包括DALL-E、Stable Diffusion和StyleGAN。目前有多种图像生成工具可用,提供多样化的图像生成和转换功能,其中一些还能通过API进行集成。我们还了解到,Adobe Firefly是一个旨在与Adobe创意云应用程序集成的生成式AI工具家族。
042:音频和视频生成工具 🎵🎬
在本节课中,我们将学习生成式人工智能在音频和视频领域的应用工具。我们将了解这些工具如何创建有影响力的媒体内容,并探索它们重新构想虚拟世界的能力。
市场前景与概述
根据Market US的估计,生成式AI音乐市场在2022年价值2.29亿美元,预计将以28.6%的高复合年增长率增长,到2032年将达到26.6亿美元。生成式AI音乐正是利用生成式AI的音频能力创造的。近年来,这些能力正在帮助公司和个人,无论是新手还是经验丰富者,简化流程,将他们复杂的构想变为现实。
想象一下,如果你一直拖延开始制作播客,或者想为你的混音添加一些音效,那么你将会爱上生成式AI音频工具。
音频生成工具 🎤
生成式AI音频工具主要分为三类:语音生成工具、音乐创作工具以及音频质量增强工具。
语音生成工具
语音生成工具主要是文本转语音工具,它们将文本转换为音频。虽然朗读技术并非全新,但生成式AI架构升级了这项技术的工作方式。
以下是其工作原理:
-
深度学习算法在大量人类语音数据集上进行反复训练。
-
这使得算法能够分解并高效复制发音、语速、情感和语调等声音特征。
-
因此,生成式AI TTS工具能创造出更准确、更自然的语音,这对有视觉障碍、语言障碍或其他阅读困难的人士尤其有帮助。
从趣味性角度看,这些工具可以帮助你“听”文章、反馈和笔记,这可能比阅读更轻松。它们也能帮助你更好地沟通。
如果你想以一种出众的方式为你的演示文稿配音,你可以登录诸如 LOvo、Cynthsia、Merrf.ai 或 Listener 等平台。这些工具提供了庞大的AI语音库、多种语言和情感选择,你甚至可以创建独特的声音或克隆自己的声音。
一些工具还允许你编辑音轨、发音、语调和语速,以创造出听起来专业的最终产品。
音乐创作工具 🎹
假设在一个阳光明媚的下午,你内心的业余音乐家感到灵感迸发。你可以尝试Meta的AudioCraft,这是一个在音效和20,000小时Meta自有或授权音乐上预训练的生成式AI工具。
此外,还有Shutterstock的Amper Music、AIVA、Soundful、Google的Magenta以及G4驱动的Wave工具。这些工具让你可以从广泛的音乐库、不同的音乐流派、乐器风格和旋律中进行选择。
你只需要输入一个基于你需求的文本提示,工具就能:
-
谱写简短的旋律或即兴重复段。
-
建议或添加乐器。
-
创作一首新歌。
-
为你的下一个YouTube或Instagram视频制作配乐。
生成式AI还可以帮助你混音、母带处理,并将最终的音乐作品发布到流行的流媒体平台上。
音频增强工具 🔊
你甚至可以使用音频增强工具。这些工具经过预训练,能够识别特定声音,可以为你的音频添加有趣的声音或去除不需要的噪音。
例如:
-
Descript 可以帮助你消除背景噪音、增强低质量录音并添加所需的音效。
-
Adobe AI 可以清理文件中的 unwanted noise。
许多音乐生成工具也具备音频编辑和增强功能。
视频生成工具 🎥
上一节我们介绍了音频工具,本节中我们来看看视频生成工具。有些项目需要的不仅仅是精选的音效。在2022年,Runway AI 就利用生成式AI能力制作了奥斯卡获奖电影《瞬息全宇宙》。
即使你不制作大型电影,也可以在日常生活中使用生成式AI视频工具。
假设你正在制作一部关于你所在城市树木缺乏的纪录片。你可以登录 Runway的Gen1工具,它将现有的视频片段转换成不同的风格;或者使用 Runway的Gen2工具,通过文本、图像或视频输入来创建视频。
或者,你也可以使用 E视频工具包 或 Synthesia应用。以下是这些工具的功能:
-
如果你没有任何素材,可以上传照片。
-
使用文本提示来生成你需要的图像。
-
录制旁白。
-
增强你的音频。
-
转换视频文件格式。
-
发布你的视频。
Synthesia甚至允许你创建自定义头像,以增强品牌辨识度。
重塑虚拟世界 🌐
生成式AI可以增强你的虚拟世界体验。你可以创建具有混合特征和异域景观的独特、富有想象力的虚拟世界。生成模型还能实时响应,提高模拟的准确性。
元宇宙平台利用生成式AI来创造更个性化、更具吸引力的用户体验。游戏元宇宙允许你快速生成3D对象,甚至创建配备特定人格特征的虚拟形象,这些特征会反映在他们的表情、行为和决策中。
例如:
-
The Sandbox 是一个元宇宙,用户可以在其中即时构建、拥有并向全球推广他们的游戏。
-
Scenario AI 帮助创建和连接定制的移动游戏资产。
总结 📝
本节课中,我们一起学习了生成式AI音频和视频工具如何产生影响。通过一个简单的文本提示,你可以:
-
生成多种语言的人声级语音。
-
录制歌曲。
-
添加音效或去除 unwanted noise。
-
制作视频和动画。
-
构建增强版和充满异域风情的虚拟世界。
这些工具极大地降低了媒体内容创作的门槛,让每个人都能更轻松地将创意变为现实。
043:代码生成工具 🛠️
在本节课中,我们将要学习生成式人工智能在代码生成领域的应用。我们将探讨其基本能力、常用工具的优势与局限,并了解如何利用这些工具来提升开发效率。
概述
生成式人工智能模型和工具能够根据自然语言输入生成代码。这些模型基于深度学习和自然语言处理技术,能够理解上下文并生成符合语境的代码。
上一节我们介绍了生成式AI的基本概念,本节中我们来看看它在代码生成方面的具体能力。
代码生成的核心能力
基于深度学习和自然语言处理,代码生成工具具备以下多种能力:
以下是代码生成工具的主要功能列表:
-
生成新代码:根据文本提示生成全新的代码片段或完整程序。
-
代码补全:预测并补全部分编写的代码片段。
-
代码优化:生成现有代码的优化版本。
-
代码转换:将代码从一种编程语言转换为另一种。
-
生成文档:为代码生成摘要和注释,以改进文档。
-
提供解决方案:根据描述的问题,推荐完整的编程解决方案,包括算法、数据结构和编程方法。
GPT的代码生成能力
让我们深入探索GPT在代码生成方面的能力。OpenAI的GPT在类人文本生成方面表现出色,在代码创建上也展示了令人印象深刻的能力。
生成简单代码
以下是一个通过基于GPT的ChatGPT生成简单Python代码的例子。
当你输入文本提示:“写一个Python代码来生成问候某人的消息”,ChatGPT会生成相应的Python代码。
def greet_person(name):
message = f"Hello, 数据科学与人工智能笔记(一)! Welcome."
return message
<https://github.com/OpenDocCN/dsai-notes-pt1-zh/raw/master/docs/ibm-genai-engi-intro/img/72185c4623cc377877f7563d07362b8a_14.png>
<https://github.com/OpenDocCN/dsai-notes-pt1-zh/raw/master/docs/ibm-genai-engi-intro/img/72185c4623cc377877f7563d07362b8a_15.png>
<https://github.com/OpenDocCN/dsai-notes-pt1-zh/raw/master/docs/ibm-genai-engi-intro/img/72185c4623cc377877f7563d07362b8a_16.png>
# 示例用法
print(greet_person("Alice"))
有趣的是,它还会提供关于如何运行此代码的指导。
有效提示的关键
为了生成有效的代码,提供清晰的提示至关重要。你需要指定编程语言,并提供其他相关的要求和约束。
调试代码
为了演示GPT如何帮助调试代码,可以在ChatGPT中输入一段错误的代码作为文本提示。
当一段错误的代码和文本被提示给ChatGPT时,它会提供正确的代码并解释所做的修正。
其他能力
GPT还能够实现代码的跨语言翻译,并生成代码文档和注释以提高可读性。
工具的演进与局限
基于GPT的模型和工具已经发展到能够生成更长、更准确的代码。这使得开发者可以利用这些模型和工具来开发应用程序、网站和插件。
此外,GPT的演进使得从图像生成代码成为可能。例如,你可以输入一个课程大纲的图像,来为一个功能完整的应用程序生成代码。
Google Bard也提供了代码生成和调试能力,支持超过20种编程语言。
优势与适用场景
ChatGPT和Bard是学习新编程语言的宝贵工具,因为它们能提供逐步的、详细的解释,有助于更好地理解。
它们在生成具有基本逻辑和编程概念的代码方面表现出色。
局限性
然而,这些工具可能无法从零开始生成大型或复杂的代码。
虽然这些工具理解编程概念和语法,但它们可能无法完全理解语义。因此,生成的代码可能在技术上是准确的,但仍可能无法按预期运行。
需要注意的是,这些模型的知识受限于其训练数据。特定版本的GPT可能不了解其训练之后发布的编程框架和库。例如,GPT-3.5的知识截止日期是2021年9月。
因此,如果你需要生成更新颖的代码,可以考虑使用专门为代码生成设计的模型和工具。
专用代码生成工具
不同的代码生成器提供特定的功能和特性。然而,当需求是让混合云开发者能为多样化需求编写代码时,IBM Watson Code Assistant是一个选择。
以下是几款主流的专用代码生成工具:
-
GitHub Copilot:由OpenAI Codex驱动,这是一个生成式预训练语言模型。它帮助开发者生成基于解决方案的代码。Copilot在自然语言文本和公开可用的源代码(包括GitHub仓库)上进行了训练。它可以作为扩展集成到流行的代码编辑器(如Visual Studio)中。它能生成遵循最佳实践和行业标准的代码片段。
-
Polycoder:一个开源的AI代码生成器。它基于GPT模型,并在用12种编程语言编写的各种GitHub仓库数据上进行了训练。它在编写C语言代码方面特别准确。Polycoder提供了一个广泛的内置模板库,可作为各种用例代码生成的蓝图。Polycoder可以帮助精确地创建、审查和优化符合要求的代码片段。
-
IBM Watson Code Assistant:建立在IBM watsonx.ai基础模型之上,适用于任何技能水平的开发者。你可以将Watson Code Assistant与代码编辑器集成。它使开发者能够通过实时推荐、自动完成功能和代码重构辅助,准确高效地编写代码。此外,你可以将代码或项目文件输入Watson Code Assistant进行分析。它能识别模式、提出改进建议并生成代码片段或模板。开发者可以根据特定项目需求自定义生成的代码。
还有许多其他AI驱动的代码生成器和代码助手工具可用于帮助开发者更快地编写准确的代码。
例如,Amazon Code Whisperer可以集成到代码编辑器中,并提供实时代码推荐。Tabnine有助于实现准确的代码补全。Replit是一个平台,为用户提供编码、学习和协作的交互空间。
优势与注意事项
具有自动代码编写和优化功能的基于AI的代码生成器,帮助开发者提高了生产力和代码质量。它们支持快速原型设计以迭代设计想法。这些工具还通过支持多语言代码翻译,有助于实现跨平台兼容性和迁移。
基于AI的代码生成器遵循一致的模式和编码标准。它们可以建议重构模式以遵循最佳实践。
然而,应谨慎使用这些工具,以确保AI生成的代码不会导致伦理问题。例如,安全漏洞,因为这些工具可能被用于生成恶意代码,或者基于训练数据产生数据偏见。
总结
本节课中我们一起学习了基于生成式AI的模型和工具可以从文本和图像提示生成新代码、优化现有代码并生成基于解决方案的代码。ChatGPT和Bard适用于简单的代码生成、调试和学习编程。
GitHub Copilot、Polycoder和IBM Watson Code Assistant等主流代码生成器提供了多样化的功能,如实时推荐、代码重构和解决方案模板。总的来说,代码生成器提高了生产力,加速了开发周期,促进了编码最佳实践,并培养了统一的编码标准。
044:课程介绍 🎬
在本节课中,我们将要学习提示工程的基础知识,并了解本课程的整体结构、学习目标以及你将掌握的核心技能。
概述
一位专家,如果你问对问题,他就能给出所有答案。有趣的是,这正是我们为生成式人工智能模型设计提示词所遵循的原则。我们使用这些提示词来查询和提问人工智能应用,例如聊天机器人、图像、音频或视频生成工具,甚至虚拟世界。提示词能够优化生成式人工智能模型的响应。其力量在于你所提出的问题。知道如何编写有效且直接的提示词,将使你能够生成更精确、更相关的内容。
现在,一个好问题是:完成本课程后,我能做什么?
课程目标
本课程面向所有初学者,无论是专业人士、爱好者、从业者还是学生,只要对学习如何编写有效提示词抱有真诚的兴趣。这是一门面向所有人的课程,无论你的背景或经验如何。
在本课程结束时,你将能够:
-
解释提示工程在生成式人工智能模型中的概念和重要性。
-
应用创建提示词的最佳实践。
-
评估常用的提示工程工具。
-
应用常见的提示工程技术和方法来编写有效的提示词。
课程结构
这是一门精炼的课程,包含三个模块,每个模块需要一到两个小时完成。
以下是课程模块的详细内容:
模块一:提示工程基础
在课程的第一个模块中,你将学习提示工程的概念,从如何定义提示词及其构成元素开始。你将学习应用编写有效提示词的最佳实践,并评估常见的提示工程工具,例如 IBM Watson X Prompt Lab、Spellbook 和 Dust。
模块二:提示工程方法与技术
在模块二中,你将学习各种提示工程方法,例如访谈模式、思维链和思维树。你将发现巧妙设计提示词的技术,例如 零样本 和 少样本,以产生精确且相关的响应。
模块三:实践与评估
模块三要求你参与一个最终项目,并提供一个计分测验来检验你对课程概念的理解。你还可以访问课程术语表,并获得关于后续学习步骤的指导。
学习资源与活动
本课程精心编排了概念视频和辅助阅读材料。观看所有视频以充分掌握学习材料的潜力。
你将享受实践实验室和最终项目,这些活动展示了如何在 IBM 生成式人工智能教室中通过创建有效的提示词来优化结果。课程包含练习测验,帮助你巩固学习。课程结束时,你还需要完成一个计分测验。
课程还提供了讨论论坛,方便你与课程工作人员联系并与同伴互动。最有趣的是,通过专家观点视频,你将听到经验丰富的从业者分享他们对提示工程中使用的工具、方法以及编写有效提示词的艺术的见解。
总结
本节课中,我们一起学习了本课程的概览。我们了解到,提示工程的核心在于提出正确的问题以引导AI生成最佳答案。本课程旨在帮助你掌握定义提示词、应用最佳实践、使用工具以及实施高级技术的能力。课程通过模块化的结构、丰富的实践项目和专家见解,为你提供了全面的学习路径。
你准备好学习关于编写提示词的一切知识,以释放生成式人工智能的全部潜力了吗?让我们开始吧。
生成式人工智能工程:P45:什么是提示
在本节课中,我们将学习提示(Prompt)的基本概念及其构成要素。理解如何编写有效的提示对于引导生成式AI模型产生期望的输出至关重要。
生成式AI模型的一个重要能力是其输出与人类创作的内容高度相似:相关、符合语境、富有想象力、细致入微且语言准确。而生成这种输出的关键因素之一就是提示。
那么,什么是提示?提示是你提供给生成式模型的任何输入,用以产生期望的输出。你可以将其视为给模型的指令。例如:
-
写一小段文字描述你最喜欢的度假胜地。 -
编写HTML代码,为在线表单生成一个城市下拉选择框。
这些都是用于产生特定输出的直接提示。提示也可以是一系列逐步细化输出的指令,以达到期望的结果。例如:
-
写一个关于火星上学生生活的短篇故事。 -
他在研究期间面临了哪些挑战?
从这些例子可以看出,提示包含问题、上下文文本、引导模式或示例,以及基于这些自然语言请求为模型提供的部分输入。生成式AI模型根据这些提示收集信息、进行推理并提供创造性的解决方案。这些指令帮助模型基于提供的输入,产生相关且合乎逻辑的回应或输出。
为了更好理解,让我们看更多例子。
假设你希望模型写一个关于农民在10年内成为成功商人的奋斗与成就的短篇故事。如果你的提示是“来自小镇的富人故事,他的奋斗与成就”,它会产生一个通用的输出。这被称为朴素提示,即以最简单的方式向模型提问。
为了向模型传达你的意图,你可以进行简单的调整,从而显著改善结果。你的提示需要包含上下文、恰当的结构,并且易于理解。
因此,你可以将提示重写为:
写一个关于农民在10年内成为富有且有影响力的商人的奋斗与成就的短篇故事。
再看另一个例子,你想让模型生成你想象中的日落风景图像。将提示写为“山间的日落图像”可能无法给出期望的输出。这个提示过于简短,缺乏对你脑海中图像的详细描述。
你可以将提示重写为:
生成一幅描绘宁静日落的图像,场景是坐落在群山之间的河谷。
要掌握编写有效提示的艺术,让我们逐一理解一个结构良好的提示的构成要素。
以下是构成一个结构良好提示的核心要素:
-
指令
为模型提供关于你希望执行任务的明确指导,引导生成式AI模型的行为,以影响其回应的形成。
例如:
写一篇600字的文章,分析全球变暖对海洋生物的影响。
-
上下文
上下文有助于建立构成指令背景的环境,并为生成相关内容提供框架。
为了理解这一点,让我们为上一个例子中的提示添加一些上下文:
近几十年来,全球变暖发生了显著变化,导致海平面上升、风暴强度增加和天气模式改变。这些变化对海洋生物产生了严重影响。写一篇600字的文章,分析全球变暖对海洋生物的影响。这个提示将帮助模型生成与上下文一致的输出。
-
输入数据
这是你作为提示的一部分提供的任何信息。生成式模型可以将其用作参考,以获得包含特定细节或想法的回应。
为了提供输入数据,同一个提示可以重构如下:
你已获得一个包含太平洋温度记录和海平面测量的数据集。写一篇600字的文章,分析全球变暖对太平洋海洋生物的影响。 -
输出指示器
输出指示器为评估模型生成输出的属性提供了基准。它可以概述你期望输出具备的语气、风格、长度和其他品质。
在提示“写一篇600字的文章,分析全球变暖对海洋生物的影响”中,输出指示器指定生成的输出应为一篇600字的文章。它将根据分析的清晰度以及相关数据或案例研究的纳入情况进行评估。
这些要素中的每一个都在帮助生成式AI模型理解你的需求并给出期望的输出方面发挥着作用。
本节课中,我们一起学习了提示是提供给生成式模型以产生期望输出的任何输入或一系列指令。这些指令有助于引导模型的创造力,并协助产生相关且合乎逻辑的回应。一个结构良好的提示的构成要素包括指令、上下文、输入数据和输出指示器。这些要素帮助模型理解我们的需求并生成相关的回应。
046:什么是提示工程 🧠
在本节课中,我们将学习提示工程的定义、重要性以及如何通过一个结构化的流程来设计有效的提示,以引导生成式AI模型产生更相关、更准确的输出。
概述
提示工程是设计有效提示的过程,旨在引导生成式AI模型生成更优质、更符合预期的回答。它结合了批判性分析、创造力和技术敏锐度。如果提示不够精确,模型可能会产生不充分甚至错误的结果。
提示工程的过程
上一节我们介绍了提示工程的基本概念,本节中我们来看看如何通过一个迭代的、结构化的流程来创建有效的提示。
以下是创建有效提示的逐步流程:
-
定义目标
流程的第一步是确立一个清晰的目标。你必须明确希望模型生成什么内容。
- 示例目标:概述人工智能在汽车领域的益处与风险。
-
创建初始提示
根据定义的目标,现在是时候创建初始提示了。它可以是一个问题、一个指令或一个场景。
- 示例初始提示:
写一篇分析人工智能融入汽车行业所带来的益处和缺点的文章。
- 示例初始提示:
-
测试提示
接下来,需要测试你创建的提示并分析其响应。响应可能相关,但可能缺乏你所追求的特定视角。
- 示例分析:对初始提示的响应直接列出了人工智能在汽车行业的益处和缺点,但未强调可能出现的伦理问题,也没有讨论其正面和负面影响。
-
分析响应
你必须仔细审查响应,检查其是否符合你的目标。如果不符合,请记下不足之处。
- 示例不足:初始提示未能全面涵盖人工智能在汽车行业相关的益处和风险范围。
-
优化提示
利用通过测试和分析获得的知识,现在可以修改提示了。这可能包括增强其特异性、添加上下文或重新措辞。
-
示例优化提示:
写一篇信息性文章,讨论人工智能在革新汽车行业中的作用。需涉及关键方面,如益处、缺点、伦理考量以及正面和负面影响。涵盖特定领域,如自动驾驶和实时交通分析,同时审视潜在挑战,如技术复杂性和网络安全问题。
-
-
迭代流程
最后三个步骤(测试、分析、优化)需要重复进行,直到你对模型的响应感到满意为止。
-
示例最终提示:
写一篇文章,重点阐述人工智能如何重塑汽车行业。聚焦于自动驾驶和实时交通分析等领域的积极进展,同时深入探讨与复杂技术方面相关的担忧,例如决策算法和潜在的网络安全漏洞。强调这些担忧可能对车辆安全产生的影响。确保分析透彻、有实例支撑并能引发批判性思考。
-
提示工程的重要性与相关性
了解了提示工程的流程后,我们来看看它在生成式AI模型应用中的核心价值。
-
优化模型效率:提示工程有助于设计智能提示,让用户无需大量重新训练即可充分利用模型的能力。
-
提升特定任务性能:提示工程使生成式AI模型能够生成细致入微且符合上下文的响应,从而在特定任务中更加有效。
-
理解模型限制:通过每次迭代优化提示并研究模型的相应响应,可以帮助我们理解其优势和弱点。这些知识可以进一步指导未来的功能增强或模型整体开发。
-
增强模型安全性:熟练的提示工程可以防止因提示设计不当而导致生成有害内容的问题,从而增强模型使用的安全性。
总结
本节课中我们一起学习了提示工程的核心内容。我们了解到,提示工程是设计有效提示以充分利用生成式AI模型能力、产生最佳响应的过程。我们还学习了通过定义目标、创建提示、测试、分析、优化和迭代来优化提示的流程。最后,我们探讨了提示工程在优化模型效率、提升任务性能、理解模型限制和增强安全性方面的重要性。
047:提示创建的最佳实践 🎯
在本节课中,我们将学习如何应用最佳实践来创建有效的提示,并通过多个示例解释起草和优化提示的过程。
撰写有效的提示对于充分发挥生成式人工智能模型的潜力、生成相关且准确的回应至关重要。通过应用创建有效提示的最佳实践,你可以监督生成输出的风格、语气和内容。这些最佳实践主要围绕四个核心维度展开:清晰度、上下文、精确度以及角色扮演或人物模式。
清晰度 ✨
上一节我们介绍了创建有效提示的四个维度。本节中,我们首先来看看清晰度。清晰的提示有助于模型准确理解你的意图。
为了确保提示的清晰度,请记住以下几点:
-
使用简单直接的语言:简单明了的语言可以轻松传达指令。因此,应撰写明确且易于理解的提示。
-
避免专业术语:特殊术语可能会使模型或用户感到困惑。因此,应使用能被广泛受众理解的简单词汇来撰写提示。
-
明确任务描述:模糊的提示可能导致回应与你的意图不符。因此,你必须清晰地描述模型需要执行的任务。
让我们通过一个例子来理解这一点。
原始提示:
讨论在植物完全无叶柄的托叶上借助阳光发生的烹饪过程。同时提及一种绿色的东西,以及光、空气和水对植物地上部分的重要性。
这个提示存在许多问题。它没有明确提及你想要讨论的过程,包含了复杂的术语使其难以理解,同时也非常模糊,没有清晰地描述手头的任务。
优化后的提示:
解释植物光合作用的过程,详细说明叶绿素的作用,以及阳光、二氧化碳和水如何促成这一生物功能。
优化后的提示使用了简单、清晰、简洁的语言,并明确表示你想要讨论植物光合作用的过程。
上下文 📖
接下来,我们探讨第二个重要维度:上下文。上下文总是能帮助模型理解情境或主题。
这可以涉及对需要回应的环境进行简要介绍或解释。相关的信息或具体细节,如人物、地点、事件或概念,有助于引导模型的理解。因此,在撰写提示时,融入这些细节非常重要。
例如,以下提示没有包含足够的上下文和具体细节来引导模型的理解:
原始提示:
写下1775年革命战争爆发期间发生了什么。
为了建立正确的上下文并包含相关信息,我们可以这样改写:
优化后的提示:
描述导致美国革命战争的历史事件,重点关注波士顿倾茶事件、萨拉托加战役等关键事件。强调美洲殖民地与英国政府之间的紧张关系,并解释这些事件如何导致了1775年革命战争的爆发。
精确度 🎯
创建有效提示的另一个重要维度是精确度。精确度有助于在提示中勾勒出你的请求。
如果你在寻找特定类型的回应,请清晰地表达出来。在提示中融入示例可以帮助模型理解你期望何种回应,并引导其思考过程。
例如,在以下提示中,没有精确地勾勒出特定类型的回应,也没有提供示例:
原始提示:
谈谈经济学中的供求关系及其影响。
为了确保精确度,我们可以这样改写:
优化后的提示:
解释经济学中的供求概念。描述需求增加如何影响价格,并借助一个说明性示例,例如智能手机市场。同样,通过类比石油生产中断等情况,解释供应减少对价格的影响。
这个提示清晰地表达了你想借助示例来解释一个概念。
角色扮演 👤
最后,我们来讨论最后一个维度:角色扮演或人物模式。从特定角色或人物视角撰写的提示,可以帮助模型生成与该视角一致的回应。
必要的上下文细节使模型能够有效地扮演特定角色。因此,如果你要求模型从历史人物、虚构角色或特定职业的角度进行回复,那么请提供相关的上下文细节。
让我们看这个例子:
原始提示:
写一篇日志,描述一个未知外星行星上奇特的动植物。
这个提示只会给出关于外星行星的科学细节,而不会从专业人士的角度解释其答案。
你可以这样改写提示:
优化后的提示:
假设你是一名刚刚降落在一个未知外星行星上的宇航员。写一篇日志,描述你遇到的奇特动植物,例如天空的颜色和回荡在外星景观中的陌生声音。表达你在记录这段非凡旅程时的兴奋、好奇以及一丝忧虑。
在这个例子中,你明确给出了上下文细节,并假设自己是一名宇航员。因此,这个提示将生成与宇航员视角一致的回应。
总结 📝
本节课中,我们一起学习了为生成式人工智能模型撰写有效提示的重要性,它能帮助我们监督输出的风格、语气和内容。撰写有效提示的最佳实践可以在四个维度上实施:清晰度、上下文、精确度和角色扮演。
-
清晰度包括使用简单、简洁的语言。
-
上下文提供背景和所需细节。
-
精确度意味着具体化并提供示例。
-
角色扮演可以通过假设一个人物角色并提供相关上下文来增强回应。
这些实践可以根据具体需求进行调整,以获得最佳结果。
生成式人工智能工程:P48:常见的提示工程工具 🛠️
在本节课中,我们将要学习常见的提示工程工具。你将能够描述这些工具的通用功能,并解释几种常见工具的具体能力。
提示工程是设计精确且符合上下文的提示词,以与生成式AI模型交互,从而生成相关且准确输出的过程。为了辅助这一过程,存在多种提示工程工具。这些工具提供了丰富的功能和特性,旨在优化提示词的创建,以获得期望的结果。它们对于可能不精通自然语言处理技术,但又希望在使用生成式AI模型时达成特定目标的用户尤为有用。
通用功能介绍
让我们先来探索各类提示工程工具提供的通用功能。
以下是这些工具通常具备的核心功能:
-
提示建议:许多工具能够根据给定的输入或期望的输出,为用户提供提示词建议。
-
结构优化:这些工具可以建议如何构建提示词,以实现更好的上下文沟通,帮助用户设计出能让模型充分理解用户意图的提示。
-
迭代精炼:用户可以根据工具的初始响应,迭代式地优化提示词,以找到最有效的版本。
-
偏见缓解:提示工程工具可能提供功能,帮助减轻生成式AI模型响应中的偏见。它们可以指导用户如何设计提示词,以减少产生偏见或不恰当输出的可能性。
-
领域适配:这些工具可以帮助创建针对特定领域(如法律、医疗或技术)的提示词。
-
预设库:一些工具提供了针对各种用例的预定义提示词库,用户可以根据具体需求进行定制。
上一节我们介绍了提示工程工具的通用功能,本节中我们来看看几个具体的工具实例。
常见工具详解
以下是几个在提示工程领域较为常见的工具:
-
IBM Watson X AI Prompt Lab
-
描述:这是IBM Watson X AI平台中的一个集成工具。该平台包含一系列工具,用于轻松训练、调优、部署和管理基础模型。
-
核心功能:Prompt Lab 使用户能够基于不同的基础模型进行提示词实验,并根据需求构建提示词。它提供了针对不同用例(如摘要、分类、生成和提取)的示例提示,帮助用户快速上手。用户可以通过添加指令和示例来训练模型,展示模型应如何响应输入。
-
-
Spellbook (by Scale AI)
-
描述:这是一个集成开发环境。
-
核心功能:使用Spellbook,用户可以基于大语言模型构建应用程序,并为各种用例(如文本生成、提取、分类、问答、自动补全和摘要)进行提示词实验。它包含一个提示编辑器,允许用户编辑和测试提示词。用户可以利用提示模板来使用结构化提示生成文本,也可以访问预构建的提示作为示例。
-
-
Dust
-
描述:一个提供Web用户界面的工具。
-
核心功能:它用于编写提示词并将它们链接在一起。用户可以管理不同版本的链式提示。Dust还提供了一种自定义编码语言和一组标准模块,用于处理LLM提供的输出。此外,它还支持集成其他模型和服务。
-
-
Prompt Perfect
-
描述:一个用于优化提示词的工具。
-
核心功能:可用于为不同的大语言模型或文生图模型优化提示。它支持常见的文本模型(如GPT、Stable LM、LLaMA)和图像模型(如DALL-E、Stable Diffusion)。优化时,用户首先需要选择要为其优化提示的相关模型,因为不同模型有不同的优化策略。用户还可以选择与预览质量、语言和审核相关的插件。在编写提示时,可以尝试自动补全功能。工具会展示用户编写的原始提示和由Prompt Perfect生成的优化后提示。在“Streamline”模式下,用户可以逐步优化和精炼提示词:编写 -> 优化 -> 再次编辑 -> 再优化,直到满意为止。
-
除了上述专用工具,一些其他流行的平台和接口也提供了提示工程资源或实验环境。
以下是其他有用的资源与平台:
-
GitHub:拥有大量关于提示工程和LLM的代码仓库。这些仓库中提供的指南、示例和工具有助于提升提示工程技能。
-
OpenAI Playground:一个基于Web的工具,帮助用户使用OpenAI的各种模型(如GPT系列)来实验和测试提示词。
-
Playground AI:一个平台,帮助用户使用Stable Diffusion模型实验文本提示以生成图像。
-
LangChain:一个Python库,提供了构建和链接提示词的功能。
-
提示词市场 (如 PromptBase):有趣的是,提示词也可以进行买卖。PromptBase就是一个例子,它支持为流行的生成式AI工具和模型(如Midjourney、ChatGPT、DALL-E、Stable Diffusion和LLaMA)买卖提示词。用户可以根据自己的需求购买针对特定模型或工具的提示词(例如,购买一个用于在Midjourney中生成漫画角色的提示词)。如果用户拥有出色的提示词编写技能,也可以上传并出售提示词。该平台还支持直接在其平台上编写提示词并在其市场上出售。
总结
本节课中,我们一起学习了提示工程工具。我们了解到,这些工具提供了多种特性和功能来优化提示词,包括提供建议、优化结构、支持迭代精炼、缓解偏见、适配特定领域以及提供预设提示库。我们还介绍了几种常见的工具和平台,例如IBM Watson X AI Prompt Lab、Spellbook、Dust和Prompt Perfect,以及其他有用的资源和市场。掌握这些工具将帮助你更高效地与生成式AI模型进行交互。
049:文本到文本的提示技术 📝
在本节课中,我们将学习如何通过文本提示技术来提升大型语言模型的可靠性与输出质量。我们将探讨多种核心提示技巧,并了解有效使用文本提示所带来的益处。
近年来,自然语言处理领域因大型语言模型的应用而取得了显著进步。然而,随着模型规模和复杂度的持续增长,关于其可靠性、安全性和潜在偏见的担忧也随之浮现。有效使用文本提示是应对这些关切的一种有前景的解决方案。文本提示是精心设计的指令,用于引导大型语言模型的行为以生成期望的输出。但生成内容的质量和相关性,取决于提示的有效性以及模型本身的能力。
接下来,让我们深入探讨那些能使文本提示更有效、并能提升大型语言模型输出可靠性的具体技术。
任务明确化 🎯
文本提示应明确地向大型语言模型指定目标,以提高回答的准确性。例如,提示“将这句英文翻译成法语”就是一个实现任务的清晰指令。
上下文引导 🧭
这是一种通过文本提示为大型语言模型提供具体指令以生成相关输出的技术。例如,如果你希望模型生成一篇关于纽约市地标的短文,一个像“写一段关于纽约市的短文”这样的提示可能会得到一个笼统的回应,可能无法涵盖你想要的内容。另一方面,一个更具体的提示,如“写一段关于纽约市的短文,重点介绍其标志性地标”,由于提示中包含了上下文,将能生成更合适的输出。
领域专业知识 ⚕️
当需要大型语言模型在专业领域(如医学、法律或工程学)生成内容时,领域专业知识对于提升模型的可靠性至关重要。在这些领域,准确性和精确性至关重要。文本提示可以使用特定领域的术语。例如,假设你想获取关于甲状腺功能减退症的医学信息,你的提示可以这样写:“请解释甲状腺功能减退症的病因、症状和治疗方法,包括最新的研究和医学指南。”
偏见缓解 ⚖️
这是一种通过文本提示提供明确指令以生成中性回应的技术。例如,假设你担心模型在回应关于领导力特质的写作提示时存在性别偏见。为了解决这个问题,你可以使用这样的文本提示:“写一段100字的关于领导力特质的段落,不偏向任何性别。提供来自所有性别的平等特质示例。”
框架设定 📐
这是另一种通过文本提示引导大型语言模型在所需边界内生成回应的技术。假设你希望模型总结一篇关于气候变化的冗长文章,你的文本提示可以是:“提供一篇关于气候变化文章的100字摘要,重点关注其主要发现和建议。”
你知道吗?如今,经过海量数据训练并被调整以遵循指令的大型语言模型,可以执行零样本学习任务。
零样本提示 🚀
零样本提示是一种方法,生成式人工智能模型无需针对这些特定提示进行先验训练,即可对提示生成有意义的回应。例如,提示可以是:“选出这句话中的形容词。句子是:Anita bakes the best cakes in the neighborhood。” 这里的输出将是“best”。
然而,通常你无法通过一次提示就获得理想的回应,可能需要迭代。这就引出了用户反馈循环技术。
用户反馈循环 🔄
在这种技术中,用户对文本提示提供反馈,并根据大型语言模型生成的回应迭代地优化提示。这个循环允许用户逐步改进模型的输出质量,直到达到期望的状态。例如,用户通过文本提示要求模型写一首诗。大型语言模型生成了一首诗。用户说:“让它更有趣一些。” 大型语言模型调整诗歌以包含更多幽默元素。用户认可了修改后的诗歌。
类似地,对于复杂的任务,当你无法清晰描述需求时,会使用一种称为少样本提示的技术。
少样本提示 📚
少样本提示支持上下文学习,即在提示中提供示范,以引导模型获得更好的性能。这些示范作为后续示例的条件,在这些示例中你希望模型生成回应。例如,假设模型的任务是生成简短的旅行推荐。作为少样本提示,你为模型提供以下引导性上下文:“推荐一个以美丽海滩闻名的夏季旅行目的地。推荐一个以美丽秋叶闻名的秋季旅行目的地。” 在使用这些少样本提示后,模型可以为其他类型的假期生成旅行推荐。例如,如果任务是“推荐一个值得探索的城市”,模型将生成答案:“考虑参观像巴黎这样充满活力的城市,以其丰富的历史、艺术和标志性地标而闻名。” 这就是模型如何基于少样本提示中提供的最少训练数据,为不同类型的假期生成旅行推荐。
使用我们刚刚讨论的方法将文本提示与大型语言模型结合使用,会带来诸多好处。让我们看看其中一些。
使用文本提示的好处 ✨
大型语言模型的可解释性得到增强。可解释性指的是用户理解和解释模型决策过程及其生成输出背后原因的程度。可解释性帮助用户、开发者和利益相关者理解模型如何工作、为何做出某些预测或生成特定文本,以及它在各种应用中是否值得信赖。可解释性对于解决与人工智能相关的伦理问题至关重要。它帮助所有利益相关者评估并确保大型语言模型的行为符合特定领域的伦理准则和法律要求。
除了提高大型语言模型的可靠性和可解释性之外,有效的文本提示还能在用户和大型语言模型之间建立信任。当用户能够理解大型语言模型的工作原理,并看到他们的指令对模型行为的直接影响时,就会在用户和大型语言模型之间促成透明且有意义的互动。
总结 📋
本节课中,我们一起学习了各种可以通过文本提示提升大型语言模型可靠性和质量的技术。具体来说,我们探讨了任务明确化、上下文引导、领域专业知识、偏见缓解、框架设定和用户反馈循环。我们还学习了零样本和少样本提示技术。最后,我们了解了有效使用文本提示与大型语言模型的若干好处,例如增强模型的可解释性、解决伦理考量以及建立用户信任。
050:面试模式方法 🎤
在本节课中,我们将学习提示工程中的“面试模式方法”。这是一种通过模拟对话或访谈风格与模型互动来设计提示词的策略,旨在引导生成式AI模型产生更具体、更符合需求的回答。
概述
上一节我们介绍了提示工程的基本概念,本节中我们来看看一种更高级的交互策略——面试模式方法。这种方法的核心在于通过一系列精心设计的问答,引导模型逐步深入理解用户需求,从而生成高度优化的响应。
面试模式方法的工作原理
面试模式方法要求对提示词进行细致的优化,以确保模型生成的回答能精确满足你的目标。其典型流程如下:
-
用户提供初始指令:你首先向模型提供一个明确的角色和任务指令。
-
模型发起追问:模型根据你的指令,开始向你提出一系列必要的后续问题。
-
用户回答问题:你逐一回答模型提出的问题,提供更多细节。
-
模型处理并生成最终响应:模型根据你提供的所有信息,进行处理和整合,最终生成一个高度优化的回答。
核心公式可以概括为:
最终响应 = 模型处理(初始指令 + 用户对追问的回答)
你提供的信息越详细、越具体,最终得到的结果就越好。
应用示例:旅行顾问
为了更好地理解,我们来看一个具体的例子。假设你希望模型扮演一位旅行顾问,为你规划一次假期的旅行行程。
以下是你可以给模型的初始提示指令:
你将扮演一位经验丰富的旅行专家。你的目标是与我进行一次全面的旅行规划对话。请首先提出一系列详细的问题(一次一个),以收集所有必要信息,从而根据我的具体偏好、兴趣和预算,制定出最量身定制且令人难忘的旅行行程。
在收到这个指令后,模型会开始提出一系列后续问题,例如:
-
你最喜欢去哪种类型的旅行目的地?
-
你能描述一下你理想假期的活动和体验吗?
-
你通常如何规划旅行?在选择目的地时,哪些因素对你最重要?
-
在规划旅行目的地时,你是否对特定的文化或历史方面感兴趣?
-
旅行时你偏好哪种住宿选择?为什么?
-
你如何平衡预算考虑与获得难忘旅行体验的愿望?
在这个例子中,每个问题都建立在前一个问题的基础上,形成了一场关于旅行偏好的结构化、信息丰富的对话。根据你对这些问题的回答,模型将规划出一个符合你偏好和需求的、令人难忘的旅行行程。
面试模式方法的优势
通过本视频的学习,我们了解到面试模式方法优于传统的单次提示方法,因为它允许在与生成式AI模型互动时进行更动态、更迭代的对话。
与提供单一的静态提示不同,面试模式涉及与模型进行来回的信息交换。这有助于实时澄清疑问并引导模型的响应方向,从而增强了用户优化结果的能力。
总结
本节课中,我们一起学习了提示工程中的面试模式方法。我们了解了它的工作原理,即通过模拟访谈式的问答互动,逐步引导模型获取详细信息以生成精准响应。我们还通过一个旅行规划的例子,具体演示了如何应用这种方法。最后,我们总结了该方法的优势在于其动态交互性,能够显著提升生成结果的针对性和质量。
生成式人工智能工程:P51:思维链方法 🧠
在本节课中,我们将学习一种名为“思维链”的提示工程方法。这种方法通过构建一系列提示来引导生成式AI模型,使其能够理解复杂任务的逻辑,并生成连贯、准确的回答。
思维链是一种基于提示的学习方法。它通过构建一系列提示或问题,来引导模型生成期望的回应。使用这种方法,可以展示生成式AI模型的认知能力,并更好地解释其推理过程。
它涉及将复杂任务分解为更小、更简单的步骤,通过一系列更直接的提示来实现。每个提示都建立在前一个提示的基础上,共同引导模型走向预期的结果。
在直接向模型提问之前,你需要先向它提供一系列相关的问题及其对应的解决方案。这一连串的提示有助于模型思考问题,并运用相同的策略来正确回答更多类似问题。简单来说,提示中需要包含一个问题及其准确答案,以便为模型提供所需的上下文和逐步推理过程。然后,再提出一个不同的问题,要求模型使用相同的推理思路来解答。
为了更好地理解,我们来看一个例子。
思维链应用示例
假设你向模型提出一个数学问题:“马修有6个鸡蛋。他又买了两盘鸡蛋,每盘有12个。他现在有多少个鸡蛋?”对于复杂问题,模型的逻辑可能会出错。
为了训练模型掌握解决此类问题所需的适当推理,你可以先构建一个类似的问题作为示例:“玛丽有8个萝卜。她用了5个萝卜做晚餐。第二天早上,她又买了10个萝卜。她现在有多少个萝卜?”
关键点在于,你必须同时提供正确的逻辑解决方案:
-
玛丽最初有8个萝卜。
-
她用掉了5个,所以剩下
8 - 5 = 3个萝卜。 -
第二天她又买了10个,所以现在总共有
3 + 10 = 13个萝卜。
这将帮助模型理解其中涉及的逻辑,从而得出正确的解决方案。
因此,你最终的提示应包含以下内容:
-
一个相关的问题及其适当的解决方案。
-
然后,提出另一个可以用相同逻辑或推理来解决的问题。
在这个提示中,你可以看到有一个问题、该问题的逻辑解决方案,以及另一个可以用相同逻辑解决的新问题。
构建思维链提示的步骤
以下是构建有效思维链提示的关键步骤:
-
选择示例问题:挑选一个与你的目标问题在结构和逻辑上相似的问题。
-
提供逐步解答:为示例问题写出清晰、逐步的推理过程和最终答案。
-
提出目标问题:在示例之后,提出你真正希望模型解答的问题。
-
引导应用逻辑:明确或隐含地指示模型使用从示例中学到的推理方式来解答新问题。
一个典型的思维链提示结构如下:
问题:[示例问题]
解答:[逐步推理] 因此,答案是 [答案]。
问题:[你的目标问题]
解答:
思维链的优势
上一节我们介绍了思维链的具体构建方法,本节我们来看看这种方法带来的主要好处。
-
提升推理透明度:模型被迫展示其思考步骤,而不仅仅是给出最终答案,这使得其输出更易于理解和验证。
-
提高复杂问题准确率:对于需要多步推理的数学、逻辑或规划问题,思维链能显著提升答案的正确性。
-
引导模型思考方式:通过提供推理范例,你实际上是在“教”模型如何像人类一样一步步地解决问题。
本节课中,我们一起学习了“思维链”提示工程方法。我们了解到,这种方法通过为模型提供相关示例问题及其分步解决方案,来强化生成式AI模型的认知能力,并引导其进行逐步思考。其核心在于训练模型掌握解决某类问题的底层逻辑,从而能够将相同的逻辑应用于解决更多类似的问题。掌握思维链技巧,是构建高效、可靠AI提示的关键一步。
052:思维树方法 🌳
在本节课中,我们将学习一种创新的提示工程技术——思维树方法。我们将了解其基本原理、运作方式,并通过一个具体示例学习如何应用它来生成更精准、更具逻辑性的AI回复。
思维树方法是一种旨在扩展“思维链”提示法能力的创新技术。它使生成式AI模型能够展现出更高级的推理能力。该方法涉及将提示或查询分层构建,类似于树状结构,以指定模型所需的思考或推理路径。当您需要向模型提供明确的指令或约束,以确保其生成期望的输出时,这种方法尤其有用。此方法在解锁新解决方案和解决复杂问题方面具有巨大潜力。
上一节我们介绍了思维树方法的基本概念,本节中我们来看看它的具体工作原理。
思维树方法的工作原理是生成多条思考路径,类似于决策树,以探索不同的可能性和想法。与传统的线性方法不同,该技术允许模型同时评估并探索多条路径。每个想法或思路会像树枝一样分叉,形成一个相互关联的思考树状结构。模型通过评估每条可能的路径,根据其对结果的预测分配数值,并剔除前景较小的思路,最终确定最有利的选择。
为了更好地理解,我们将通过一个示例来说明。
假设您希望模型为一家电子商务企业设计吸引和留住熟练远程员工的招聘与保留策略,并要求模型运用思维树方法来完成。
您可以向模型提供以下提示指令:
想象三位不同的专家来回答这个问题。
所有专家都会写下他们思考的一个步骤,然后与小组分享。
然后所有专家继续进行下一步,依此类推。
如果有任何专家在任何时候意识到自己错了,那么他们就会退出。
除了上述提示指令,您还需要给出原始问题提示:
扮演人力资源专家的角色,为一家电子商务企业设计一个招聘与保留策略,重点是吸引和留住熟练的远程员工。
构建这样的提示指令将使生成式AI模型能够考虑一个逐步的过程并进行逻辑思考。它还会让模型考虑中间想法,在此基础上进行构建,并探索可能通向不同结果的“分支”。这种做法将最大化模型的使用和潜力,从而产生更有用的结果。
本节课中我们一起学习了思维树方法。这是一种在思维链方法基础上发展起来的创新技术,它涉及将提示分层构建成类似树状的结构,以指导模型的推理和输出生成。当需要明确的指令或约束来获得期望的输出时,这种方法尤其有价值。它使模型能够同时探索各种可能性和想法,像决策树一样分叉展开。
053:文本到图像的提示技术 🎨
在本节课中,我们将要学习如何通过特定的文本提示技术,来提升生成式AI模型所创建图像的质量和表现力。我们将逐一探讨五种核心的图像提示技术,帮助你写出更有效的图像生成指令。
图像是沟通的重要组成部分,广泛应用于营销、广告、教育、新闻等诸多领域。然而,有些图像在传达情感方面比其他图像更为出色。图像提示就是你希望生成图像的文本描述。它可以简单到一个单词或短语,也可以更详细地描述图像的构图、色彩和氛围。为了增强通过生成式AI模型获得的图像的影响力,使其更具说服力和吸引力,你可以使用图像提示技术。这些技术旨在提升生成式AI模型所产图像的质量、多样性和相关性。
有多种图像提示技术可用于改善图像的影响力。接下来,我们将逐一学习这些技术。
风格修饰词 🖌️
风格修饰词是用于影响生成式AI模型所产图像的艺术风格或视觉属性的描述符。这些描述符可以帮助模型在遵循输入提示结构和内容的同时,产出具有创新风格的图像。
你可以修改图像的各种视觉元素,如颜色、对比度、纹理、形状和大小,从而生成具有美学吸引力、视觉愉悦的输出。你的提示可以包含关于各种艺术风格、艺术时期、摄影技术、所用艺术材料类型,甚至是你希望模型模仿的知名品牌或艺术家特征的信息。所有这些信息都能帮助生成模型理解期望的输出图像外观或风格。
以下是图像提示中使用的风格修饰词示例。这些提示中使用的风格修饰词已被高亮标出。
-
提示示例 1:
一只猫,**赛博朋克风格**,霓虹灯,未来城市背景 -
提示示例 2:
宁静的湖泊,**水墨画风格**,山峦倒影 -
提示示例 3:
一幅**梵高风格**的向日葵静物画
质量提升词 📈
高质量图像相比低质量图像更具说服力和可信度。低分辨率图像通常会出现模糊和像素化,使观看者难以辨别其中的细节。另一方面,高分辨率图像保证了基本的可见性和可读性。使用高质量的图形设计可以提升图像的感知价值。
质量提升词是用于图像提示中的术语,旨在增强视觉吸引力,并提高输出的整体保真度和清晰度。这些特定术语可以指导生成式AI模型执行降噪、锐化、色彩校正和分辨率增强等步骤。
你可以在图像提示中使用诸如高分辨率、超详细、锐利、互补色等许多术语作为质量提升词。它们可以增强图像的特定特征,从而产生更连贯的输出。
让我们看一些例子来理解如何在图像提示中使用质量提升词。诸如突出纹理、4K分辨率、锐利、清晰细节、精细线条、互补色、模糊背景和脱颖而出等术语,就是给定图像提示中使用的质量提升词。
-
提示示例 1:
一只老虎的特写,**4K分辨率**,**锐利**,**突出纹理** -
提示示例 2:
现代客厅,**互补色**,**清晰细节**,**模糊背景**使家具**脱颖而出**
重复强调法 🔁
上一节我们介绍了如何通过质量提升词优化图像细节,本节中我们来看看如何通过重复来强化概念。重复技术利用了迭代采样的原理,以增强模型生成图像的多样性。
重复涉及在图像中强调特定的视觉元素,为模型创造一种熟悉感,使其能够专注于你想要突出的特定想法或概念。这可以通过在图像提示中重复相同的单词或相似的短语来实现。重复有助于强化通过图像传达的信息,并增加模型对概念的“记忆”。
模型并非仅根据提示生成一张图像,而是生成多张具有细微差别的图像,从而产生一组多样化的潜在输出。当生成模型面对抽象或模糊的提示,而存在多种有效解释可能时,这种技术尤其有价值。
让我们看一些在图像提示中使用重复词的例子。诸如微小、密集、巨大、广阔、宁静、清澈和茂盛等词被重复多次,以聚焦于特定的想法。
- 提示示例:
一片**茂盛**、**茂盛**、**茂盛**的绿色森林,阳光透过**密集**的树叶
加权术语 ⚖️
加权术语指的是使用那些能够产生强烈情感或心理影响的词语或短语。例如,免费、限时优惠和保证等词常用于广告中,以引发紧迫感、安全感和信任感。同样,奢华、高端和独家等词用于营造专属感和精致感。
生成式AI模型允许你为正则或负则术语赋予权重,以强调或弱化某种情感。在图像提示中使用加权术语有助于创建令人难忘、有说服力的图像,并能引发观众的情感共鸣。
以下是一些在图像提示中使用加权术语的示例。
如你在第一个示例中所见,词语温暖被赋予了正权重10,而噼啪作响的权重是正8。这意味着生成模型必须更侧重于温暖一词,而对噼啪作响的关注稍少一些。同样,在第二个示例中,词语闪烁被赋予了正6权重,而霓虹灯照亮的权重是正8。因此模型应更侧重于霓虹灯照亮。在最后一个示例中,词语彩色被赋予了负6权重,而异国情调被赋予了正10权重。这意味着模型必须强调异国情调一词,并弱化彩色一词。
-
提示示例 1:
(温暖:10) 壁炉,(噼啪作响:8) 的火焰 -
提示示例 2:
雨夜的城市街道,(闪烁:6) 的灯光,(霓虹灯照亮:8) 的招牌 -
提示示例 3:
(彩色:-6) 的羽毛,(异国情调:10) 的鸟
畸形修复提示 🛠️
本节我们将学习最后一种技术,用于处理生成图像中可能出现的缺陷。这种技术用于修改可能影响图像效果的畸形或异常。
图像中的畸形可能包括扭曲(特别是在人体部位如手或脚上)、像素化或其他会损害视觉吸引力和图像整体质量的问题。这可以通过使用恰当的负面提示在一定程度上得到缓解。
以下是图像提示中使用的畸形修复提示技术示例。你可以看到,在所有这些示例中,都使用了恰当的负面词语来缓解图像畸形问题。
-
提示示例 1:
一个美丽的天使,翅膀展开,**避免畸形的手和脚** -
提示示例 2:
未来主义机器人,金属质感,**无模糊,无像素化** -
提示示例 3:
人物肖像,面部特写,**避免扭曲的比例,避免奇怪的表情**
总结 📝
本节课中我们一起学习了图像提示技术在提升生成式AI模型图像生成能力方面起着至关重要的作用。风格修饰词、质量提升词、重复强调法、加权术语和畸形修复提示是五种可用于改善生成图像影响力的技术。通过结合使用这些技术,可以创建更令人难忘、更具吸引力、更有说服力的视觉效果,从而有效地传达预期信息。
054:数据类型
概述
在本节课中,我们将要学习Python编程语言中的核心概念之一:数据类型。我们将了解Python如何表示不同类型的数据,并探讨几种最常用的数据类型,包括整数、浮点数、字符串和布尔值。
什么是数据类型?🤔
数据类型是Python用来表示不同种类数据的方式。
在Python中,你可以拥有不同的数据类型。它们可以是像11这样的整数,像21.213这样的实数,甚至可以是单词。整数、实数和单词都可以表示为不同的数据类型。
以下图表总结了上述示例对应的三种数据类型。第一列表示表达式,第二列表示其数据类型。
我们可以通过使用type命令来查看Python中数据的实际类型。
# 使用type()函数查看数据类型
print(type(11)) # 输出: <class 'int'>
print(type(21.213)) # 输出: <class 'float'>
print(type("Hello")) # 输出: <class 'str'>
整数类型 (int) 🔢
整数可以是负数或正数。需要注意的是,整数有一个有限的范围,但这个范围非常大。
以下是一些整数的例子:
-
5 -
-10 -
0 -
1000
浮点数类型 (float) 📊
浮点数代表实数。它们不仅包括整数,还包括整数之间的数字。
考虑0和1之间的数字。我们可以选择它们之间的数字,这些数字就是浮点数。同样地,考虑0.5和0.6之间的数字,我们也可以选择它们之间的数字,这些也是浮点数。
我们可以继续这个过程,为不同的数字进行“放大”观察。当然,这个过程存在精度限制,但这个限制非常小。
类型转换 (Type Casting) 🔄
你可以在Python中改变表达式的类型,这被称为类型转换。
你可以将一个整数转换为浮点数。例如,你可以将整数2转换或“强制转换”为浮点数2.0。这本质上没有改变数值。
# 将整数转换为浮点数
int_num = 2
float_num = float(int_num)
print(float_num) # 输出: 2.0
print(type(float_num)) # 输出: <class 'float'>
但是,如果你将一个浮点数转换为整数,则必须小心。例如,如果你将浮点数1.1转换为整数1,你会丢失小数部分的信息。
# 浮点数转整数会丢失小数部分
float_num = 1.1
int_num = int(float_num)
print(int_num) # 输出: 1
如果一个字符串包含一个整数值,你可以将其转换为int类型。
# 包含整数的字符串可以转换为int
str_num = "123"
int_num = int(str_num)
print(int_num) # 输出: 123
如果我们尝试转换一个包含非整数值的字符串,将会得到一个错误。
# 包含非整数的字符串转换会报错
# str_num = "123.4"
# int_num = int(str_num) # 这会引发 ValueError
你也可以将一个整数或浮点数转换为字符串。
# 将数字转换为字符串
int_to_str = str(456)
float_to_str = str(78.9)
print(type(int_to_str)) # 输出: <class 'str'>
print(type(float_to_str)) # 输出: <class 'str'>
布尔类型 (bool) ✅❌
布尔值是Python中另一个重要的数据类型。一个布尔值可以取两个值。
第一个值是True(请注意,我们使用大写字母T)。布尔值也可以是False(使用大写字母F)。
使用type命令查看布尔值,我们会得到bool,这是boolean的缩写。
# 布尔类型
print(type(True)) # 输出: <class 'bool'>
print(type(False)) # 输出: <class 'bool'>
如果我们把布尔值True转换为整数或浮点数,会得到1。
# 布尔值转数字
print(int(True)) # 输出: 1
print(float(True)) # 输出: 1.0
如果我们把布尔值False转换为整数或浮点数,会得到0。
# 布尔值转数字
print(int(False)) # 输出: 0
print(float(False)) # 输出: 0.0
反之,如果你将数字1转换为布尔值,会得到True。类似地,如果将数字0转换为布尔值,会得到False。
# 数字转布尔值
print(bool(1)) # 输出: True
print(bool(0)) # 输出: False
总结
本节课中,我们一起学习了Python中的基本数据类型。我们了解了整数(int)、浮点数(float)、字符串(str) 和布尔值(bool) 这四种核心类型,并掌握了如何使用type()函数查看类型,以及如何进行安全的类型转换。理解数据类型是编写正确、高效Python代码的基础。建议通过实验练习更多例子,或查阅Python官方文档以了解Python支持的其他数据类型。
055:表达式与变量 🧮
在本节课中,我们将学习Python编程中的两个基础概念:表达式和变量。理解它们是编写任何程序的第一步。
概述
表达式是计算机执行的操作描述,而变量则用于存储数据值。我们将从基本的算术运算开始,逐步了解如何使用变量来保存和操作这些运算的结果。
更多推荐

所有评论(0)