IBM 人力资源的生成式人工智能笔记(一)
001:课程介绍 🎬
在本节课中,我们将要学习生成式人工智能(AI)的基础介绍,了解其核心概念、应用潜力以及本课程的结构与学习目标。
想象一个由AI驱动的世界,它能让我们工作更高效、寿命更长、能源更清洁。这个世界已经到来。生成式AI对我们生活方式的各个方面都产生了巨大影响。
生成式AI模型能够模仿人类的思维和创造力,生成新颖的内容并执行复杂的任务。组织可以利用生成式AI提高生产力和盈利能力。个人可以使用生成式AI工具提升效率、为工作增添实际价值、节省成本并最大化品牌价值。
如果你尚未接触过生成式AI,那么这门课程正适合你。我们欢迎所有对快速发展的生成式AI领域抱有真诚兴趣的专业人士、爱好者、人力资源从业者和学生。无论你的背景或经验如何,这都是一门面向所有人的课程。
本课程旨在让你扎实理解生成式AI的能力、应用以及常见的模型和工具。课程结束时,你将能够描述生成式AI的能力及其在现实世界中的用例,识别不同领域和行业中生成式AI的应用,并探索常见的生成式AI模型和工具。
本课程是一个包含三个模块的聚焦课程。预计每个模块需要花费一到两个小时完成。
以下是本课程三个模块的主要内容概览:
-
模块1:你将学习生成式AI的核心概念,了解其在不同领域的应用案例,并理解其在生成文本、图像、代码、音频和视频方面的能力。
-
模块2:你将探索信息技术、娱乐、教育、金融和医疗保健等不同行业如何利用生成式AI。此外,在本模块中,你还将学习用于生成文本、图像、代码、音频和视频的常见模型和工具(如ChatGPT、DALL-E和Synthesia)的能力与特性。
-
模块3:你需要参与一个最终项目,并完成一个计分测验来检验你对课程概念的理解。你也可以访问课程术语表,并获得关于后续学习路径的指导。
本课程融合了概念讲解视频和辅助阅读材料。观看所有视频以充分掌握学习材料的潜力。你将体验到动手实验和一个展示生成式AI在多个领域常见用例的最终项目。每节课后都有练习测验帮助你巩固学习。课程结束时,你还需要完成一个计分测验。课程还提供讨论论坛,方便你与课程工作人员联系并与同学互动。最有趣的是,通过专家观点视频,你将听到经验丰富的从业者分享他们对生成式AI不同方面的见解。
当生成式AI正在全球范围内增强个人、组织和社区的创造力表达与专业能力时,这门课程为你提供了一个创造新体验的机会。
本节课中,我们一起学习了生成式AI的引入及其变革潜力,并概述了本课程的目标、结构和学习方法。我们了解到,生成式AI不仅是一个技术概念,更是提升个人和组织效能的重要工具。
002:为何选择IBM学习生成式AI
在本节课中,我们将探讨生成式AI为何成为各行业关注的焦点,以及为何选择IBM作为学习这项关键技能的平台。我们将了解生成式AI的广泛影响、企业对相关技能的需求,以及IBM在负责任地推进AI应用方面的独特优势。
生成式AI是每位领导者都在思考的问题。无论是在企业还是政府机构中,每个组织都在关注它。
随着关注而来的是机遇。各组织正在寻找理解这项技术的人才。
更重要的是,他们需要具备应用这项技术技能的人才。与以往许多流行技术不同,生成式AI几乎触及了每个职业中的每个角色。
生成式AI技能预计将变得非常重要,不仅对计算机科学家如此,对每个人都是如此。这些技能将变得像文字处理、电子表格甚至基本商业素养一样必不可少。因此,这些课程项目旨在让“每个人都掌握生成式AI”。
目前,人们对AI产生了许多新的兴趣。企业正在超越消费级AI的范畴进行探索。聊天机器人界面是展示生成式AI潜力的绝佳方式。
然而,现实生活中的用例是将生成式AI嵌入到现有流程中,使其成为几乎每个业务工作流程不可或缺的一部分。IBM很自豪能够帮助企业将生成式AI整合到其运营中。
作为这些课程项目的一部分,你将获得的技能应该有助于你的职业发展,并能立即应用到你的工作中。
企业对生成式AI的潜力感到兴奋,但同时也对其潜在风险感到担忧。这项使命至关重要,不容有失。
这些课程项目将为你提供处理AI伦理问题的技能,这些技能基于一种负责任的方法,这种方法真正始于IBM。
本节课中,我们一起学习了生成式AI的普遍重要性及其对各行各业的影响。我们了解到,掌握生成式AI技能正变得像使用办公软件一样基础,而IBM的课程不仅能提供实用的技术应用知识,还特别强调以负责任和合乎伦理的方式使用AI,这正是企业在采用新技术时所寻求的关键保障。选择IBM学习,意味着同时获得前沿技术能力和可信赖的实施框架。
003:2_生成式AI基础专项课程介绍
在本节课中,我们将介绍IBM的“生成式AI基础”专项课程。该课程旨在帮助初学者全面了解生成式AI的核心概念、工具和应用,无需任何技术背景。
你是否知道,全球的营销人员已经在使用生成式AI来创作内容、撰写文案、激发创意、分析市场数据以及生成图像?
根据彭博社的预测,生成式AI市场预计到2032年将达到1.3万亿美元。因此,深入了解生成式AI对你而言至关重要。
那么,生成式AI适合所有人吗?答案是肯定的。你可以利用其潜力,为自己创造更好的职业和生活。本专项课程适合任何对探索生成式AI力量充满热情的人,无需具备AI技术知识或背景。即使是初学者也能从中受益,因为它全面涵盖了生成式AI的基本概念、模型、工具和应用。
完成本专项课程后,你将能够:
-
解释生成式AI基础模型的基本概念、能力、模型、工具、应用和平台。
-
描述提示工程,并应用强大的提示工程技术来编写有效的提示,从而从AI模型中生成期望的结果。
-
讨论生成式AI的局限性,解释其伦理关切和负责任使用的考量。
-
认识到生成式AI在提升你职业生涯和帮助工作场所实施改进方面的能力。
本专项课程包含五门自定进度的课程,每门课程需要3到5小时完成。
上一节我们概述了课程的整体目标,本节中我们来看看具体的课程结构安排。
以下是五门课程的核心内容简介:
课程1:生成式AI导论
这是你理解生成式AI能力的第一步,其能力涵盖文本、图像、音频、视频、虚拟世界、代码和数据等多个领域。你将了解不同行业如何应用常见的生成式AI模型和工具,例如GPT、DALL-E、Stable Diffusion、IBM Granite和Synthesia。
课程2:提示工程
本课程介绍提示工程的概念,以及它如何帮助你释放ChatGPT等生成式AI工具的全部潜力。你将探索开发有效提示的技术、方法和最佳实践,并使用IBM Watsonx、Prompt Lab、Spellbook和Dust等常用工具进行实践。
课程3:生成式AI的核心概念
本课程聚焦于生成式AI的核心概念和构建模块,例如深度学习、基于Transformer架构的大语言模型、扩散模型和基础模型。你还将了解不同的生成式AI平台,如IBM Watsonx.ai和Hugging Face。
课程4:生成式AI的伦理与限制
在课程3学习了技术基础后,本课程将探讨与生成式AI相关的伦理考量。你将了解它对数据隐私与安全、版权侵权、劳动力以及环境的影响。同时,你将描述其局限性,如数据偏见、缺乏可解释性、透明度和可理解性,并识别生成式AI的常见误用,例如深度伪造和幻觉。
课程5:生成式AI的未来
最后,本课程讨论生成式AI的未来。你难道不想知道在那个未来里你的职业机会是什么吗?你将学习生成式AI如何影响和增强不同行业现有的职能、技能和工作角色,以及如何利用生成式AI构建自己的应用程序以创造新的商业机会。
本专项课程的内容旨在吸引并赋能你。通过观看精选的概念视频、聆听AI专家分享他们的见解和技巧,以及在实验和项目中实践技术,你将在日常生活中使用生成式AI工具和应用程序时感到更加自信。
目前,65%的生成式AI用户是千禧一代或Z世代,72%的用户是在职人士。通过本专项课程的学习,你将准备好加入生成式AI变革者的行列。
生成式AI属于每一个人。
本节课中,我们一起学习了IBM“生成式AI基础”专项课程的完整介绍。我们了解了课程的目标、适合人群、学习成果以及五门核心课程的具体内容。从基础概念到提示工程,从技术原理到伦理实践,再到未来展望,该课程为初学者提供了一条清晰的学习路径,帮助你自信地开启生成式AI之旅。
004:专家观点与领域专家介绍 👥
在本节课中,我们将认识几位在人工智能领域,特别是生成式AI方向拥有丰富经验的专家。他们将介绍自己的背景、专业领域以及对生成式AI的看法,帮助我们更好地理解这一技术在实际应用中的价值。
上一节我们了解了生成式AI的基本概念,本节中我们来看看行业专家们如何介绍自己。
以下是各位专家的自我介绍,包括他们的姓名、职位和所属组织。
-
Hello, 我是 Abyi Goneja, 我是人工智能领域的主题专家,同时也是 IID 的一名人工智能研究员。
-
Hello, 我是 Sapida Sazader, 我是 IBM 某 K 工程团队的 AI 引擎工程师。我很高兴能在这里与大家探讨生成式AI。
-
我是 Bradley Steinfeld, 我是 IBM 的一名高级软件架构师。
-
Hello, 我是 Mali, 我在人工智能和数据工程领域拥有超过12年的经验。我目前是 Simply Contract Technologies 的一名数据架构师。
-
Hi, 我是 Marty Briley, 我是 Evergreen AI 的首席执行官兼创始人。
在认识了各位专家之后,接下来让我们深入了解他们的专业背景,包括多年的行业经验和相关资质。
以下是专家们对其背景和经验的分享。
-
Abyi Goneja: 关于我的背景,我在加拿大滑铁卢大学获得了人工智能领域的博士学位,在此之前,我正在攻读机器人学硕士学位。完成学业后,我开始在这一领域工作,从事大数据分析。之后移居美国,我仍然在同一领域工作。最近,随着大语言模型和生成式AI这一新趋势的出现,我一直在致力于为我们的客户在不同的用例中实施和应用这项技术。
-
Bradley Steinfeld: 我在 IBM 工作了超过10年,大部分时间都在教育领域的 Skills Network 团队工作。
-
Marty Briley: 我们在 Evergreen AI 从事多项业务,但我们专注于生成式AI。我们提供生成式AI培训、生成式AI战略咨询,以帮助您理解生成式AI在您组织中的定位。我们还有一个小型开发部门,可以帮助进行一些集成工作。但我为我们拥有的培训项目感到自豪,这些课程旨在培训您组织中的每个人,包括“AI基础”、“面向领导者的AI”和“面向高管的AI”。这些课程展示了如何利用现有工具来完成工作,适用于那些希望了解如何在当前工作流程中使用AI以提升工作效率、实现百倍改进的人。
-
Mali: 我曾在银行、金融、电子商务、制造和制药等多个行业工作。每个行业独特的挑战都丰富了我的专业知识和视角,让我认识到数据和人工智能所能带来的切实影响,而不仅仅是处理数据和算法。在我的职业生涯中,我投入了大量时间进行指导和培训,培养有抱负的AI专业人员和数据科学家。我的目标是培养新一代的专家,准备好应对我们数字世界中不断演变的挑战。我很高兴能与大家合作、学习并做出有意义的贡献。感谢大家的欢迎,我期待与大家一起踏上这段激动人心的旅程。
本节课中我们一起学习了多位生成式AI领域专家的背景介绍。通过了解他们的专业路径、行业经验以及对AI应用的见解,我们可以更直观地感受到生成式AI技术的多样性和实际应用潜力,为后续深入学习其具体应用场景打下基础。
005:生成式AI导论 🧠
在本节课中,我们将要学习生成式人工智能的基本概念、其发展历程,以及它与判别式AI的核心区别。我们将从AI的基础定义开始,逐步深入到生成式AI的工作原理、关键模型及其广泛的应用前景。
人工智能概述
人工智能,或称AI,已经存在多年,它塑造了我们生活的方方面面,并彻底改变了我们的工作和生活方式。
从本质上讲,AI可以定义为机器对人类智能的模拟。AI模型从海量的现有数据中学习,这个学习过程被称为训练。
人工智能的两种基本方法
人工智能有两种基本方法:判别式AI和生成式AI。
上一节我们介绍了AI的基本定义,本节中我们来看看这两种核心方法有何不同。
判别式AI
判别式AI是一种学习区分不同数据类别的方法。以下是其工作原理:
-
训练过程:一个判别式AI模型会获得一组训练数据,其中每个数据点都带有其类别的标签。
-
预测过程:模型通过判断新数据点落在决策边界的哪一侧,来预测其类别。
-
核心能力:判别式AI模型使用高级算法来区分、分类、识别模式,并根据训练数据得出结论。
一个判别式AI模型的应用实例是电子邮件垃圾邮件过滤器,它可以区分垃圾邮件和非垃圾邮件。
判别式AI模型最适合应用于分类任务。然而,它们无法理解上下文,也无法基于对训练数据的上下文理解来生成新内容。
生成式AI
而这正是生成式人工智能的用武之地。
生成式AI模型学习根据训练数据生成新的内容。它们能够捕捉训练数据的底层分布,并生成新颖的数据实例。
以下是生成式AI的工作流程:
-
输入提示:生成式AI从一个提示开始。这可以是文本、图像、视频或模型能够处理的任何其他输入。
-
生成内容:作为输出,模型会生成新的内容,包括文本、图像、音频、视频、代码和数据。
-
输出形式:生成式AI可以生成与提示相同形式的输出(例如,文本到文本),也可以生成与提示不同形式的输出(例如,文本到图像或图像到视频)。
这里有一个简单的例子来理解判别式AI与生成式AI的区别:
-
判别式AI最适合回答诸如“这张图片画的是鸟巢还是鸟?”这类问题。
-
生成式AI则会响应诸如“画一幅有三个蛋在里面的鸟巢图像”这样的提示。
如果说判别式AI模仿了我们的分析和预测能力,那么生成式AI则更进一步,模仿了我们的创造能力。正如《哈佛商业评论》的评论所言:“AI不仅可以提升我们的分析和决策能力,还能激发创造力。”生成式模型可以运用所学知识,基于信息创造出全新的内容。
生成式AI的技术基础
判别式模型和生成式模型都是使用深度学习技术创建的。深度学习涉及训练人工神经网络从海量数据中学习。
人工神经网络是由称为神经元的较小计算单元组成的集合,其建模方式类似于人脑处理信息的过程。
生成式AI的创造能力来源于特定的生成式AI模型,这些模型可以被视为生成式AI的构建模块。以下是几种关键模型:
-
生成对抗网络:
GANs -
变分自编码器:
VAEs -
Transformer模型
-
扩散模型
生成式AI的发展历程
生成式AI并非一个新概念,其根源可追溯到机器学习的起源。以下是其发展脉络:
-
20世纪50年代末:科学家提出机器学习时,就探索了使用算法创建新数据。
-
20世纪90年代:神经网络的兴起进一步推动了生成式AI的发展。
-
21世纪10年代初:在大规模数据集和增强计算能力的支持下,深度学习极大地促进了生成式AI的发展。
-
2014年:Ian Goodfellow及其同事引入了GANs,变革了生成式AI领域。
-
后续发展:GANs以及VAEs、Transformer等模型为生成式AI的增长以及基础模型和工具的开发奠定了基础。
基础模型是具有广泛能力的AI模型,可以被调整以创建更专业的模型或针对特定用例的工具。
其中一类特定的基础模型称为大语言模型,它们经过训练能够理解人类语言,并可以处理和生成文本。
-
2018年:OpenAI推出了基于Transformer的LLM——生成式预训练Transformer。
-
后续演进:GPT系列中的GPT-3和GPT-4、Google的PaLM、Meta的Llama等不同LLM显著增强了生成式AI生成连贯且相关文本的能力。
-
其他领域:在其他用例中也出现了类似的模型发展,例如用于图像生成的Stable Diffusion和DALL-E。
生成式AI的工具与应用
多种生成式模型的发展,催生了针对不同用例的生成式AI工具市场。以下是一些例子:
-
文本生成:
ChatGPT,Gemini -
图像生成:
DALL-E 2,Midjourney -
视频生成:
Synthesia -
代码生成:
GitHub Copilot,AlphaCode
快速涌现的模型和工具为生成式AI在各个领域的应用开辟了广阔前景。引用麦肯锡关于生成式AI经济潜力的报告:“生成式AI有潜力改变工作的结构,通过自动化部分个人活动来增强个体工作者的能力。”该报告还预测,生成式AI对生产力的影响可能为全球经济增加数万亿美元的价值。
总结
本节课中我们一起学习了生成式AI的核心知识。我们了解到,生成式AI模型能够根据其训练数据生成新的内容。其创造能力建立在如GANs、VAEs、Transformer和扩散模型等模型之上。基础模型可以被调整以创建针对特定用例的专门模型或工具。最后,我们认识到生成式AI模型和工具在不同领域和行业中拥有广泛的应用范围。
006:生成式AI的核心能力 🚀
在本节课中,我们将学习生成式人工智能(Generative AI)的核心能力。我们将探讨文本生成、图像生成、音频生成、视频生成、代码生成、数据生成与增强,以及虚拟世界创建等关键功能,并了解它们在现实世界中的应用。
文本生成能力 📝
上一节我们介绍了生成式AI的概览,本节中我们来看看其文本生成能力。生成式AI的文本生成能力核心在于先进的人工智能驱动的大型语言模型(LLMs)。这些模型在大型数据集上进行训练,能够在各种情境下生成类人文本。它们学习数据中的模式和结构,以生成连贯且与上下文相关的回应。
以下是文本生成能力的一些具体应用:
-
文本补全与摘要:模型可以续写文本或生成内容摘要。
-
问答与翻译:模型能够回答问题或将文本翻译成不同语言。
-
代码生成与图文配对:模型可以生成代码片段,或将图像与描述性文本进行配对。
-
对话交互:聊天机器人和虚拟助理的对话功能由LLMs驱动。
一些流行的LLMs包括OpenAI的生成式预训练变换器(GPT)和Google的PaLM语言模型。
图像生成能力 🎨
接下来,我们探讨生成式AI的图像生成能力。生成模型能够基于深度学习技术(如生成对抗网络和变分自编码器)生成高质量、逼真的图像。这些生成的图像展现出真实的纹理、自然的色彩和精细的细节,给人以真实拍摄的印象。
以下是图像生成能力的一些具体应用:
-
生成虚构内容:例如,StyleGAN可以生成高分辨率、高质量的虚构人脸、动物或自然景观的新图像。
-
艺术创作:DeepArt可以从简单的草图创建复杂的艺术作品。
-
按描述生成图像:DALL-E可以根据用户的文字描述生成全新的图像。
除了艺术、设计、娱乐和游戏领域,生成的图像还可用于增强训练数据集,并辅助医学成像和科学可视化。
音频生成能力 🔊
现在,让我们转向音频生成能力。生成模型可以创作新的音乐作品,使用文本转语音技术将文本转换为音频,并创建合成语音和自然音质的语音。这些模型还能转换、修改、清理人声,降噪并提升音频质量,甚至能以相当高的相似度模仿人声。
以下是音频生成能力的一些具体应用:
-
生成原始音频:例如,WaveGAN可以创建新的、逼真的原始音频波形,包括语音、音乐和自然声音。
-
音乐创作:OpenAI的MuseNet可以结合各种乐器、风格和流派来生成新颖的音乐作品。
-
合成语音:Google的Tacotron 2和Mozilla TTS使用先进的TTS系统来创建接近人类音调、音高、语调、发音、节奏和表达的合成语音。
生成的音频在媒体、创意、娱乐、培训、教育、游戏和虚拟现实等多个领域有广泛应用。
视频生成能力 🎬
上一节我们了解了静态图像的生成,本节中我们来看看动态视频的生成。生成式AI模型可以创建从基本动画到复杂场景的动态、清晰的视频。这些模型通过融入时间连贯性将图像转化为动态视频。在自然语言处理中,时间连贯性指的是意义或上下文随时间推移的一致性和连续性,这使得模型能在视频中展现流畅的运动和合理的过渡。
以下是视频生成能力的一些具体应用:
- 基于文本生成视频:例如,流行的AI模型VideoGPT可以根据用户提供的文本提示生成新视频。用户可以指定期望的内容来指导视频生成过程,包括补全、编辑、合成、预测和风格迁移。
生成的视频可用于艺术、娱乐、教育、游戏、医学和研究等领域。
代码生成能力 💻
生成式AI的另一项强大能力是代码生成。生成模型可以根据所需功能,生成新的代码片段、函数或完整程序。这些模型在现有代码库上进行训练,能够完成或创建代码、重构代码、识别并修复代码错误、测试软件以及创建文档(包括注释、函数描述和使用示例)。
以下是代码生成能力的一些具体应用:
- AI编程助手:例如,GitHub Copilot和IBM Watson Code Assistant是基于AI的编程助手,可帮助自动补全代码、加速困难任务并为给定输入生成代码。
AI生成的代码可用于软件和Web开发、机器学习和自然语言处理、数据科学与分析、机器人技术与自动化、视频游戏和AR/VR环境开发,以及音视频和语音处理。软件开发人员可以利用代码生成能力来编写、调试和测试代码。
数据生成与增强能力 📊
接下来,我们探索生成式AI的数据生成与增强能力。生成模型可以生成新数据并扩展现有数据集。生成合成数据集有助于增加数据的多样性和变化性,从而带来更稳健和有效的模型性能。
以下是数据生成与增强能力的一些具体应用:
- 生成多种数据类型:这些模型可以为图像、文本、语音、表格数据和统计分布、时间序列数据、金融数据等生成新样本并增强数据集。
生成式AI的数据生成与增强能力在医学、医疗保健、游戏、教育与培训、艺术与创意、自动驾驶汽车等众多领域有应用。
虚拟世界创建能力 🌐
生成式AI模型的另一项强大能力是创建高度逼真和复杂的虚拟世界。你可以创建模拟真实行为、表情、对话甚至决策的虚拟形象。你还可以创建具有真实纹理、声音和遵循物理世界原则的物体的复杂虚拟环境。元宇宙平台使用生成模型为个体用户创造独特和个性化的体验。
以下是虚拟世界创建能力的一些具体应用:
- 创建虚拟身份:生成式AI还能创建具有独特个性的虚拟身份,虚拟形象可以被赋予特定的个性特征,并反映在其行为和对话中。
生成式AI的虚拟世界能力在游戏、娱乐、教育、增强与虚拟现实、元宇宙平台以及虚拟影响者和数字人格等领域有应用。
总结 📚
本节课中,我们一起学习了生成式AI模型的一些核心能力及其在现实世界中的应用。我们了解到,生成式AI可以创建连贯且与上下文相关的内容,生成逼真的高质量图像、合成语音、新音频和动态视频。此外,生成式AI模型还能生成和补全代码,合成新数据以增强现有数据集,并创建高度逼真和复杂的虚拟世界,包括虚拟形象和数字人格。
007:生成式AI能力解析 🧠
在本节课中,我们将聆听AI专家对生成式AI核心能力的解析,了解它如何为企业和专业人士带来变革。
概述
本节内容汇集了多位专家的见解,系统性地介绍了生成式AI的常见能力及其在各行各业的应用价值。我们将从内容创作、任务自动化到行业解决方案,全面解析这项技术如何提升效率、激发创意并驱动个性化体验。
生成式AI的常见能力 🛠️
上一节我们了解了生成式AI的基本概念,本节中我们来看看专家们总结出的具体能力。
生成式AI为企业与专业人士提供了多种有益的能力。它尤其擅长内容创作,例如生成文本、图像、音乐甚至视频,从而简化和加速市场营销与创意流程。
以下是基于大语言模型的一些常见用例:
-
总结:快速归纳长文档或对话的核心内容。
-
提取:从复杂信息中精准抓取关键数据或要点。
-
生成:根据指令或上下文创造全新的文本、代码等内容。
-
分类:对信息进行自动归类和打标签。
-
代码生成:辅助编写和调试程序代码。
生成式人工智能的应用不仅限于生成原始数据,还包括生成模式、配置和设置等多种形式。具体到工业领域,合成数据能以多种方式帮助各行各业。
一个我们与客户合作中非常常见的用例是 RAG(检索增强生成)。这是一个当前非常流行和普遍的用例,因为我们的客户拥有许多私有文档,他们不希望将这些文档暴露在公有云或公开环境中,但他们又希望快速从这些文档中检索信息。
生成式AI不仅仅是一个花哨的玩具,它是一个游戏规则改变者。想象一下,拥有一个数字助手,它能激发你的创造力、理解你的需求并为你节省时间——这正是生成式AI所做的。所以,别再猜测了,拥抱未来吧。生成式AI的到来是为了让一切变得更快、更好、更个性化。
生成式AI如何使企业与专业人士受益 💡
了解了核心能力后,我们接下来看看这些能力具体能带来哪些商业价值和个人效率的提升。
生成式AI可以通过多种方式帮助我们。例如,在文本生成方面,GPT等模型可以帮助生成用于营销材料的文案。在图像生成方面,DALL-E等工具可以创建非常接近真实效果的图像和视频。它还能帮助进行音乐和音频生成、数据合成与增强。
AI驱动的内容生成节省了时间,并通过自动化撰写报告、创建社交媒体帖子和设计图形等任务来降低成本。此外,生成式AI通过个性化推荐和交互式聊天机器人增强了客户体验,从而提升了参与度和满意度。在设计和产品开发中,它有助于快速生成多种设计变体,实现快速原型设计和探索创新解决方案。
例如,在医疗保健行业,涉及合成数据生成和合成图像生成的操作可以保护患者隐私——即保护患有特定疾病的人的隐私。生成式AI也可用于金融分析中的欺诈检测。众所周知,它在制药行业被用于发现更多的药物模式。因此,这是一个应用范围非常广泛的结构,生成式AI正在不断提供巨大帮助。
它能绘制令人惊叹的图画,撰写引人入胜的故事,甚至像专业人士一样翻译语言。个性化推荐?没问题。这个AI伙伴能准确找到你想要的东西,无论是电影、产品,甚至是职业道路。在医疗保健和航空等领域,它创建用于培训的真实模拟,使学习变得安全高效。但这还不是全部,生成式AI自动化了任务,让你能腾出时间专注于最重要的事情。
因此,所有这些任务都有助于我们增强创造力、个性化体验并做出数据驱动的决策,从而最终提高效率、竞争力和客户满意度。
总结
本节课中,我们一起学习了专家视角下的生成式AI核心能力。我们了解到,它不仅是强大的内容创作工具,能完成总结、提取、生成和分类等任务,更是通过RAG(检索增强生成) 等技术处理私有信息的关键。更重要的是,生成式AI通过自动化流程、提供个性化解决方案和生成合成数据,为包括医疗、金融在内的各行各业带来了效率提升、成本节约和创新动力。它正成为一个不可或缺的数字助手,推动工作方式向更快、更好、更智能的方向发展。
008:生成式AI的演进历程 🤖
在本节课中,我们将聆听专家们的见解,共同探讨生成式人工智能的演进历程。我们将了解它是如何从早期的概念发展到如今成为行业焦点的,并理解它与传统人工智能方法的根本区别。
生成式AI的演进历程 📈
上一节我们介绍了本课程的主题,本节中我们来看看生成式AI是如何一步步发展至今的。
生成式AI与人工智能一同演进,但最近获得了更多关注。它在超过20年的时间里一直存在,但并未真正流行。最近,随着像生成对抗网络和变分自编码器这类技术的出现,它获得了更大的发展势头,几乎已成为行业的未来。
生成式AI的演进历程以其创造新颖原创内容能力的显著进步为标志。早期的生成式AI模型在连贯性和质量上略有不足。但自从GPT-3,以及随后的GPT-4和DALL-E等模型出现后,它们能够生成高度复杂的文本和图像,从而增强了各个领域的创造力和自动化水平。
简单来说,生成式AI已经到来,它是一个创意引擎。可以把它想象成一个超级聪明的艺术家,不仅能遵循指令,更能创造新事物。它能绘画、写故事,甚至能提出全新的想法。
以下是其演进过程中的几个关键阶段:
-
第一阶段:基于规则的机制与传统模型
系统仅在我们提供的上下文范围内工作,并严格遵循预设的规则。
-
第二阶段:机器学习与统计模型
这些模型能够从数据中发现模式。基于半监督学习、监督学习或强化学习,它们比基于规则的系统更智能,并能识别出一些规律。
-
第三阶段:深度学习与神经网络
它们能以更先进的方式在数据集中发现模式,并处理非结构化的数据。
-
第四阶段:生成对抗网络
这是一个生成式任务和生成新数据的新时代。GANs通过一个“生成器”和一个“判别器”的对抗过程来学习并创造内容,能生成非常逼真的图片和艺术作品。
-
第五阶段:Transformer模型
像LSTM和Transformer这类神经网络,帮助我们更先进地处理某些用例、非结构化数据和时间序列数据集。特别是2017年提出的Transformer架构,为生成式任务开启了新纪元。如今,许多类似GPT的模型在开源社区中可用,其核心思想是拥有一个在海量数据上预训练的模型,可以轻松针对特定任务进行微调。
生成式AI与传统AI的区别 🔄
了解了演进历程后,本节我们来探讨生成式AI与传统AI方法有何不同。
传统AI与生成式AI的区别在于:传统AI侧重于分析和预测现有数据,例如分类、回归、推荐等任务。相比之下,生成式AI,特别是随着生成对抗网络和Transformer模型的出现,能够创造出与训练数据相似的新数据。
人工智能在过去五六十年里,经历了从基础水平到应用和预测水平的发展。而生成式AI更侧重于利用人工智能技术生成类人的高质量输出。
本质区别在于:传统AI执行你告诉它的任务,而生成式AI则能自行构思和创造,就像一个酷炫的AI发明家,准备释放人工智能的创造力。
总结 ✨
本节课中,我们一起学习了生成式AI的演进历程及其与传统AI的核心区别。我们了解到,生成式AI已经从早期的、能力有限的模型,发展到如今能够创造高度复杂和原创内容的强大工具,这主要得益于生成对抗网络和Transformer架构等关键技术的突破。同时,我们也明确了生成式AI的核心在于“创造”新数据,这与传统AI专注于“分析”和“预测”现有数据的范式形成了鲜明对比。
009:生成式AI的应用场景 🚀
在本节课中,我们将学习生成式AI在不同领域的具体应用。我们将探讨它在IT与DevOps、娱乐、教育、银行与金融、医疗保健以及人力资源等领域的实际用例,了解这项技术如何改变各行各业的工作方式。
IT与DevOps领域的应用 💻
上一节我们介绍了生成式AI的基本概念,本节中我们来看看它在IT与DevOps领域的应用。生成式AI能够帮助改进软件交付流程和基础设施管理。
以下是生成式AI在IT与DevOps中的主要应用:
-
代码生成:生成式AI的代码生成能力减少了手动编码的工作量和在重复性任务上花费的时间。
-
代码审查:由生成式AI驱动的代码审查工具,如GitHub Copilot和Synk DeepCode,会检查代码库和编码标准,以提升代码质量和可维护性。
-
自动化测试:生成式模型可以生成模拟用户行为的合成测试用例和测试数据。测试用例的变化会影响软件的效率、可靠性和健壮性。像Applitools和Testim这样的工具通过增加数据集的深度和多样性来保证充分的测试覆盖率。
-
监控与异常检测:用于监控和检测代码中的异常。例如,IBM的Watson AIOps和Moogsoft AIOps会分析系统日志、指标和其他数据。这有助于进行主动维护和故障排除,减少停机时间并防止关键故障。
-
自动化文档与部署:GitLab Duo通过自动创建发布说明、变更日志以及更新部署模板和脚本来支持持续集成与部署(CI/CD)流程。
-
其他应用:其他应用包括自然语言界面、自动化基础设施管理和预测性维护。
娱乐领域的应用 🎬
现在,让我们看看生成式AI在娱乐领域的应用。生成式AI工具可以生成各种合成内容,如音乐、剧本、故事、视频、电影和电子游戏。它们还可以翻译、本地化和个性化内容。
以下是生成式AI在娱乐领域的主要应用:
-
游戏开发:像Side Effects Software的Houdini这样的游戏开发工具,利用生成式AI的力量来创建游戏、动画、增强现实和虚拟现实体验,以及具有独特行为的角色。
-
虚拟形象:最近,由生成式AI驱动的虚拟影响者和虚拟形象也日益流行,它们能与用户互动,创造引人入胜的体验。
教育领域的应用 📚
生成式AI产生重大影响的另一个领域是教育。从内容生成到个性化和自适应学习体验,再到模拟体验式学习,生成式AI的影响是巨大的。
以下是生成式AI在教育领域的主要应用:
-
语言翻译:凭借其语言能力,它们可以提供语言翻译,使内容能以不同语言访问。
-
个性化学习:它们可以生成作业以提供即时反馈,并创建支持个体学习者节奏和优势的学习路径与评估策略。
-
学习分析:可以根据学习者的表现和偏好生成分类法。
-
特殊需求识别:生成式算法可以检测特殊需求和学习障碍,以帮助学习者和教育者制定特定的课程计划。
-
知识追踪:生成式算法也被用于追踪学习者随时间推移的进度,即知识追踪。这有助于为个体需求提供合适的节奏和内容。
-
其他应用:辅导支持、虚拟和模拟环境以及包容性教育也从中受益。
-
工具示例:例如,Nolej能在几分钟内提供AI生成的电子学习内容,包括针对目标主题的互动视频、术语表、练习题和摘要。Duolingo是一个语言学习平台,它使用GPT-3来纠正法语语法并为英语创建测试项目。
银行与金融领域的应用 💰
银行和金融机构极大地受益于生成式AI自动检测风险、生成见解并提供具备金融知识的建议的能力。
以下是生成式AI在银行与金融领域的主要应用:
-
行业专用模型:Kore.ai KG是首个银行业专用的LLM,它帮助银行应用程序提供类人的、具备金融知识的响应。
-
风险评估:例如,DataRobot可以通过模拟潜在的欺诈场景来生成合成用例,以检测信用风险、欺诈风险和市场波动。
-
信用评分:Personetics和AIO Logic利用生成式模型来检测风险、确定利率并构建定制贷款。它们自动化评估客户信用度并设定信用额度或保险费率。
-
市场分析:像BloombergGPT这样的NLP驱动生成式AI可以分析新闻、文章、社交媒体和其他分类文本数据,以更有效地进行市场情绪分析和管理投资组合。
-
客户服务:生成式AI工具建立了对话系统,并使用机器人顾问、聊天机器人和虚拟助手来协助财务规划。
-
其他应用:监管合规与报告、财务预测、投资组合优化、反洗钱和算法交易是一些受益极大的领域。需要注意的是,其中一些应用和工具同时利用了生成式和判别式AI模型。
医疗保健领域的应用 🏥
现在,让我们讨论生成式AI在医学和医疗保健研究、药物发现、诊断和患者护理方面的一些应用。
以下是生成式AI在医疗保健领域的主要应用:
-
医学影像分析:凭借其生成类似于患者数据的合成图像的能力,生成式模型提高了用于医学影像分析的深度学习模型的健壮性。这些模型可以为数据非常有限的罕见医疗状况合成数据。这有助于促进研究、训练AI模型并为罕见病例开发新的诊断工具。
-
药物发现:在药物发现中,这些模型通过生成新分子、加速药物发现过程并降低开发成本来提供帮助。
-
远程医疗:远程医疗和远程监控也受益于生成式AI驱动的对话工具。例如,Rasa可以与患者建立具备医学知识的对话,以提供即时医疗建议、健康相关支持和个性化治疗计划。
-
其他应用:该领域的其他应用包括电子健康记录管理、医疗保健欺诈检测以及医学模拟和培训。
人力资源领域的应用 👥
让我们看看生成式AI如何赋能人力资源部门,使其自动化重复性任务、提供有价值的见解并简化HR流程。
以下是生成式AI在人力资源领域的主要应用:
-
任务自动化:例如,Watson X Orchestrate帮助自动化HR任务,如创建职位需求、筛选和入围相关简历、安排面试、候选人入职等。
-
人才招聘:Talenteria专注于人才招聘。
-
员工互动:Leena AI使用对话式AI系统来自动化HR任务和员工互动。
-
绩效管理:McCormick专注于工作场所和绩效管理,自动生成绩效文档和评估。
-
其他应用:生成式AI在HR中的其他应用包括培训与发展、分析与决策制定,以及合规与政策实施。
对工作方式的广泛影响 🌐
虽然我们今天只讨论了几个领域,但生成式AI最终被认为会对所有行业产生重大影响。另一个产生重大影响的领域是我们的工作方式。
根据麦肯锡关于生成式AI经济潜力的报告,当前的生成式AI和其他技术有潜力自动化目前占用员工60%至70%时间的工作活动。到2030年至2060年间,当今一半的工作活动可能被自动化。生成式AI日益增长的理解自然语言的能力,最终将影响甚至通常与高等教育和习得技能相关的知识型工作。
总结 📝
本节课中我们一起学习了生成式AI在各个领域的流行应用。然而,重要的是要注意,生成式AI的潜在应用在所有行业和生活的各个方面几乎是无限的。
-
在IT与DevOps中,应用包括代码生成、代码审查、自动化测试、监控与异常检测、自动化文档以及持续集成与部署流程。
-
在娱乐领域,生成式AI通过生成各种合成内容以及翻译、本地化和个性化内容,提供了令人兴奋的可能性。
-
在教育领域,生成式AI改变了教育的覆盖范围和质量,影响着学习者、教育者和教育技术。
-
在金融领域,应用领域包括风险评估、信用评分、情绪分析、投资组合管理、合规、预测、培训和客户服务。
-
在医疗保健领域,我们看到应用包括医学研究、诊断、药物发现、医学培训和患者护理。
-
在HR领域,应用涉及人才招聘、员工互动、绩效管理、培训与发展、HR分析和政策实施。
-
在工作场所,生成式AI的应用正在改变我们的工作方式,使我们更高效、更成功。
010:文本生成工具 📝
在本节课中,我们将要学习生成式AI中的文本生成工具。我们将了解其核心原理、主流模型的能力,并通过具体工具来探索如何生成各种类型的文本。
概述
文本生成是生成式AI的核心能力之一。本节将介绍其基础——大语言模型,并探讨以ChatGPT和Bard为代表的主流文本生成工具的关键功能与特点。
大语言模型(LLMs)基础
生成式AI文本生成能力的核心是大语言模型。这些模型基于训练期间学习到的模式和结构进行工作。
大语言模型能够解读上下文、语法和语义,从而生成连贯且符合语境的文本。它们通过分析词语与短语之间的统计关系,来适应不同语境下的创意写作风格。
其核心关系可以概括为:
输入文本 (Prompt) → LLM (基于统计模式) → 输出文本 (Generated Text)
许多文本生成模型都基于大语言模型构建,例如生成式预训练变换模型和Pathways语言模型。这些模型已发展为多模态模型,提供多种能力。
主流文本生成工具
接下来,我们通过两个流行的工具——ChatGPT和Bard,来了解这些模型的具体能力。
ChatGPT:基于GPT模型的对话引擎
ChatGPT基于GPT大语言模型,并采用了先进的自然语言处理技术。最初,ChatGPT仅接受文本提示来生成新内容;而在新版本中,它已能同时接受图像和文本输入。
ChatGPT为文本生成提供了多样化的能力,尤其擅长进行流畅且基于上下文的对话。
以下是ChatGPT的一些核心应用示例:
-
进行对话式学习:你可以像与人交谈一样,通过连续提问来深入学习一个概念。
-
例如,输入提示:“我听说过生成式AI,想了解更多。” ChatGPT会提供一些基本信息。
-
接着,你可以基于上下文进一步提问来细化研究,例如:“我如何利用生成式AI来提升我的讲故事技巧?” ChatGPT会根据你提供的上下文和问题给出相应回答。
-
-
协助创意任务:它可以帮助你完成各种创造性工作。
- 例如,输入提示:“帮我创建一个演示学习平台功能的幻灯片。” ChatGPT会为特定幻灯片提供标题、内容和视觉元素的建议。
-
多语言支持:虽然ChatGPT最精通英语,但它也能理解并响应多种其他语言。
- 例如,提示它“用法语和西班牙语写‘你好’”,它就能生成所需的输出。这使得它成为学习新语言或任何科目的有用工具。
Google Bard:基于PaLM模型的网络研究助手
另一个流行的文本生成工具是Google Bard。它基于谷歌的先进语言模型PaLM。
PaLM是Transformer模型与谷歌Pathways AI平台的结合体。Pathways AI基于专门的“路径”模块,每个模块负责特定任务,如自然语言处理或机器翻译。除了庞大的文本和代码训练数据集,Bard还能从互联网上的资源中提取信息来响应提示。
你可以尝试不同的提示来探索Bard的能力:
-
获取信息摘要:尝试使用提示来获取某个主题的最新新闻摘要。
- 例如:“提供关于乌克兰战争的最新新闻摘要。”它会为你提供多个回复草稿,你可以选择其中一个或重新生成。
-
生成创意或解决问题:尝试让它为某个问题提供策略。
- 例如,提示它:“为推广一个时尚品牌提供一个数字营销活动策略。”它会提供一个分步进行的营销活动方法。
工具对比与更多用例
与ChatGPT和Bard交互后,你会发现它们各有侧重:
-
ChatGPT 在生成动态响应和维持对话流方面更有效。
-
Bard 在研究某个主题的最新新闻或信息方面可能是更好的选择,因为它能通过谷歌搜索和谷歌学术访问网络资源。
需要认识到,包括GPT和PaLM在内的生成式AI模型仍在不断进化,其能力和特性可能会发生变化。
除了ChatGPT和Bard,它们还能胜任许多其他有价值的任务:
-
数学与问题解决:它们可以帮助你处理基础数学、统计和通过这些学科解决问题。
-
金融分析:它们也精通金融分析、投资研究、预算制定等。
-
代码生成:ChatGPT和Bard可以生成代码,并跨各种编程语言和框架执行与代码相关的任务。
其他文本生成工具简介
市场上还存在许多其他文本生成工具,它们各有专长:
-
Jasper:生成任何长度的高质量营销内容,并能贴合品牌声音。
-
Writesonic:为不同类型的文本(如文章、博客、广告和营销文案)提供特定模板。
-
Copy.ai:擅长为社交媒体、营销和产品描述创建内容。
此外,还有一些针对特定用例的工具:
-
摘要工具(如Resoomer):通过提取关键思想或概念来生成文本摘要。
-
分类工具(如YouClassifer):用于为一段文本分配一个或多个类别。
-
情感分析工具(如Brand24):生成能反映人类语言中所表达的基础情感的文本。
-
多语言翻译工具:例如Language Weaver和Yandex Translate。
隐私考量与开源替代方案
需要注意的是,许多开源的生成式AI工具会收集并审查与其共享的数据,以改进其系统。在与这些工具交互时,这是一个重要的考虑因素,应避免分享任何机密或敏感信息。
那么,我们是否有保护隐私的开源替代方案呢?答案是肯定的。
例如:
-
GPT4All:可以安装在你的机器上,作为具有隐私意识的聊天机器人运行,无需互联网或图形处理单元。
-
H2O AI 和 PrivateGPT:这类聊天机器人旨在通过在没有互联网连接的情况下在本地机器上运行,利用大语言模型的能力来保护用户隐私。
不仅如此,你还可以通过将这些工具链接到你组织的文档和数据库,来为特定组织内部使用进行定制。
文本生成工具的优势总结
基于生成式AI的文本生成工具提供了诸多好处:
-
优秀的学习助手:它们能提供分步解释。
-
提升效率:能快速生成不同形式的文本,为作者和创作者带来效率。
-
激发创造力:它们能增强创造力并激发新想法。
-
充当虚拟助手:通过实现引人入胜的交互式对话,它们可用作虚拟助理和聊天机器人。
-
提高生产力:通过自动化重复性写作任务,可以提高组织的生产力。
-
支持全球化:借助多语言支持,它们能够为全球受众实现沟通和内容本地化。
课程总结
本节课中,我们一起学习了文本生成工具的核心知识。
我们了解到,大语言模型通过解读上下文、语法和语义来生成连贯且符合语境的文本,它们是许多生成模型的基础。两个流行的生成工具是OpenAI的ChatGPT(基于GPT模型)和Google的Bard(基于PaLM模型)。ChatGPT和Bard都能生成不同类型的文本、翻译语言,并以交互式和信息丰富的方式回答你的问题。
我们还讨论了一些其他工具,包括Jasper、Copy.ai、Writesonic。在隐私保护方面,开源的文本生成器包括GPT4All、H2O AI和PrivateGPT。
011:图像生成工具 🖼️
在本节课中,我们将学习生成式AI在图像生成方面的基本能力,并介绍几种常见的图像生成模型与工具的核心功能。通过学习,你将能够描述这些模型如何工作,并了解如何利用它们来创建和修改图像。
概述
生成式AI图像生成模型能够根据文本描述创建全新的图像,并能对真实或生成的图像进行定制化修改,以获得期望的输出。例如,你可以生成一个“小女孩手拿一本书”的图像,随后还可以将书中封面的颜色进行更改。
上一节我们介绍了生成式AI的基本概念,本节中我们来看看它在图像生成领域的具体应用和工具。
图像生成的基本流程
让我们通过一个免费的AI图像生成工具来实际生成一张新图像。你需要输入一段描述你想要的图像的文本提示词。
例如,你可以输入以下提示词:“夕阳下,一艘小船在平静的湖面上航行,周围是郁郁葱葱的绿树和宁静的天空。”
提示词的质量直接决定了生成图像的准确性与质量。
选择好风格后,即可生成图像。工具通常会生成多张图像供你选择下载,你也可以通过修改提示词来生成其他图像。
图像生成模型的进阶能力
除了基础的文生图,图像生成模型还具备更多高级功能。
图像到图像转换
图像到图像转换指的是将一个领域的图像转换到另一个领域,同时保留原始图像的内容和风格。
以下是其常见应用场景:
-
将草图转换为逼真的图像。
-
将卫星图像转换为地图。
-
提升安防摄像头图像的分辨率与细节。
-
应用于医学影像增强。
风格迁移与融合
风格迁移与融合涉及提取一张图像的风格,并将其应用到另一张图像上,从而创建混合或融合图像。
例如,将一幅绘画作品的风格应用到一张照片上。
图像修复
图像修复指的是重建图像中缺失或损坏的部分,使其变得完整。
这项技术可用于:
-
艺术品修复。
-
法证分析。
-
移除图像中不需要的物体,同时保持画面的连续性和上下文。
-
在增强现实中,将虚拟物体无缝融合到真实场景中。
图像扩展
图像扩展是指通过生成与原始图像连贯的新部分来扩展原始图像。
这可以用于:
-
生成更大尺寸的图像。
-
提升图像分辨率。
-
创建全景视图。
核心图像生成模型
生成模型和工具的图像生成与修改能力,随着其底层模型的进化而不断发展。
DALL·E 🎨
OpenAI的DALL·E基于在大型图像及其文本描述数据集上训练的GPT模型。DALL·E能够生成多种风格的高分辨率图像,包括逼真的照片和绘画。其新版模型提供了生成多种图像变体,以及通过图像修复和扩展进行图像转换的能力。
Stable Diffusion 🌪️
Stable Diffusion是一个开源的文生图扩散模型。扩散模型是一种能够创建高分辨率图像的生成模型。Stable Diffusion主要用于基于文本提示生成图像,但也可用于图像到图像转换、修复和扩展。
其核心过程可以简化为一个逐步去噪的公式:x_{t-1} = f(x_t, prompt),其中模型根据提示词,一步步将随机噪声 x_T 转化为目标图像 x_0。
StyleGAN 🎭
StyleGAN模型将图像内容和图像风格的建模分离开,从而能够精确控制风格,并操纵特定特征(如姿势或面部表情)。StyleGAN已进化到能够生成具有更逼真细节的高分辨率图像。
常用图像生成工具
你可以使用一些免费工具来探索生成式AI的文生图能力。
以下是几款流行的免费在线工具:
-
Craiyon: 能够生成不同形式和风格的图像。
-
FreePik: 提供多种预训练风格,允许你创建自定义风格。
-
Pixlr: 一款在线图像编辑器,集成了AI生成功能。
风格化与社区平台
除了基础生成,还有一些专注于特定领域的工具。
DeepArt.io 是一个在线平台,可以将照片转化为不同艺术风格的作品。
MidJourney 是一个平台,它构建了一个图像生成社区,帮助艺术家和设计师使用AI创作图像,并探索彼此的作品。
API集成
许多生成式AI图像生成器也提供应用程序接口,允许将它们的功能嵌入到不同的软件程序和工具中。
一些提供API的流行图像生成器包括:
-
DALL·E
-
MidJourney
-
Craiyon
科技巨头的入场
微软和Adobe等科技巨头也已进入AI图像生成器领域。
微软 Bing Image Creator 🖥️
微软Bing图像生成器基于DALL·E模型。你可以通过访问Bing.com/create或通过Microsoft Edge浏览器来使用该工具。这使得Microsoft Edge成为首个集成AI图像生成器的浏览器。
Adobe Firefly 🔥
Adobe Firefly是专为与Adobe创意云应用程序(如Photoshop和Illustrator)集成而设计的一系列生成式AI工具。Firefly使用Adobe Stock图片、开放许可内容和公共领域内容进行训练。
Firefly支持超过100种语言的文本提示,并包含多种工具,允许你操控颜色、色调、光照、构图,以及进行生成式填充、文本效果、生成式重新着色、3D转图像和图像扩展等操作。
总结
本节课中我们一起学习了生成式AI在图像生成领域的应用。我们了解到,基于生成式AI的模型和工具可以通过文本或图像提示来生成新图像,并提供图像到图像转换、风格迁移、图像修复和扩展等能力。几种重要的图像生成模型包括DALL·E、Stable Diffusion和StyleGAN。市场上有多种图像生成工具可供选择,它们提供了多样化的图像生成和转换功能。部分图像生成器还能以API形式集成。此外,我们还了解到Adobe Firefly这类专为与创意软件深度集成而设计的生成式AI工具套件。
012:音视频生成工具 🎵🎬
在本节课中,我们将学习生成式AI在音频和视频创作领域的应用。你将了解这些工具如何生成富有影响力的媒体内容,掌握其主要功能,并探索生成式AI重塑虚拟世界的能力。
音频生成工具
上一节我们介绍了生成式AI的概况,本节中我们来看看它在音频生成方面的具体应用。生成式AI音频工具能够帮助公司和个人,无论其经验如何,简化流程,将复杂的创意变为现实。
以下是生成式AI音频工具的三个主要类别:
-
语音生成工具:这类工具主要是文本转语音工具,能将文本转换为音频。虽然朗读技术并非全新,但生成式AI架构升级了其工作方式。深度学习算法在大量人类语音数据集上反复训练,使其能够分解并高效复制发音、语速、情感和语调等声音特征。因此,生成式AI文本转语音工具能创造出更准确、更自然的语音。
-
音乐创作工具:这些工具允许你从广泛的音乐库中选择不同的音乐流派、乐器风格和旋律。你只需输入基于需求的文本提示,工具便能创作简短的旋律或即兴重复段、建议或添加乐器、创作新歌曲,或为你的视频制作配乐。
-
音频增强工具:这类工具经过预训练,能够识别特定声音,可以为你的音频添加有趣的声音效果,或去除不需要的噪音。例如,它们可以帮助去除背景噪音、增强低质量录音,并添加所需的音效。
许多音乐生成工具也具备音频编辑和增强功能。
视频生成工具
了解了音频工具后,我们转向视频生成。有些项目需要的不仅仅是精选的音效。生成式AI视频工具可以在日常生活中使用。
以下是使用生成式AI视频工具的几种方式:
-
你可以使用工具将现有视频片段转换为不同风格。
-
你可以使用文本、图像或视频输入来创建视频。
-
你可以上传照片,如果没有照片,可以使用文本提示生成所需图像。
-
你可以录制旁白、增强音频、转换视频文件格式并发布视频。
-
你甚至可以创建自定义虚拟形象以增强品牌辨识度。
虚拟世界增强
生成式AI不仅能创作音视频,还能增强你的虚拟世界体验。你可以创建具有混合特征和异域风情的独特虚拟世界。
以下是生成式AI在虚拟世界中的应用:
-
生成个性化体验:元宇宙平台利用生成式AI创造更个性化、更具吸引力的用户体验。
-
快速生成3D内容:游戏元宇宙允许你快速生成3D对象,甚至创建具有特定个性特征的虚拟形象,这些特征会体现在其表情、行为和决策中。
-
构建与连接:例如,有些平台是一个元宇宙,用户可以在其中即时构建、拥有并向全球推广他们的游戏。另一些工具则帮助创建和连接定制的移动游戏资产。
总结
本节课中,我们一起学习了生成式AI音视频工具如何产生影响。通过简单的文本提示,你可以生成多种语言的人声语音、录制歌曲、添加音效或去除噪音。你还可以制作视频和动画,构建增强版的和充满异域风情的虚拟世界。
013:代码生成工具 🛠️
在本节课中,我们将学习生成式AI在代码生成方面的基本能力,探讨相关工具的优势与局限,并介绍几种常见的代码生成模型和工具。
概述
生成式AI模型和工具能够基于自然语言输入生成代码。它们基于深度学习和自然语言处理技术,理解上下文并生成符合语境的代码。这些工具不仅能生成新代码片段,还能优化现有代码、进行跨语言转换,并协助调试和文档编写。
代码生成的核心能力
以下是生成式AI代码工具的主要功能:
-
生成新代码:根据文本提示生成全新的代码片段或程序。
-
代码补全:预测并补全部分编写的代码片段。
-
代码优化:生成现有代码的优化版本。
-
代码转换:将代码从一种编程语言转换为另一种。
-
生成文档:为代码生成摘要和注释,以改进文档。
-
提供解决方案:描述待解决的问题,工具会推荐算法、数据结构和合适的编程方法。
通用文本模型的代码生成能力
上一节我们介绍了代码生成的基本功能,本节中我们来看看像GPT这样的通用文本模型在代码生成方面的表现。
OpenAI的GPT模型在类人文本生成方面表现出色,在代码创建方面也展示了令人印象深刻的能力。
例如,通过基于GPT的ChatGPT工具生成简单的Python代码。当你输入提示:“写一段Python代码来生成问候某人的消息”,ChatGPT会生成相应的代码。有趣的是,它还会提供如何运行这段代码的指导。
重要提示:为了生成有效的代码,你需要提供清晰的提示,指定编程语言,并说明其他相关的要求和约束。
为了演示GPT如何帮助调试代码,可以在ChatGPT中输入错误的代码作为文本提示。ChatGPT会提供正确的代码,并解释所做的修正。
GPT还能够将代码从一种编程语言翻译到另一种,并生成代码文档和注释以提高可读性。
基于GPT的模型和工具已经发展到能够生成更长、更准确的代码。这使得开发者可以利用这些模型和工具来开发应用程序、网站和插件。此外,GPT的演进使其能够根据图像生成代码。例如,你可以输入课程大纲的图片,来生成一个功能完整的应用程序代码。
Google的Gemini也提供了代码生成和调试功能,支持超过20种编程语言。
ChatGPT和Gemini是学习新编程语言的宝贵工具,因为它们能提供逐步的详细解释以帮助理解。它们擅长生成具有基本逻辑和编程概念的代码。然而,它们可能无法从头开始生成大型或复杂的代码。虽然这些工具理解编程概念和语法,但可能无法完全理解语义。因此,生成的代码可能在技术上是准确的,但仍可能无法按预期运行。
需要注意:这些模型的知识受限于其训练数据。特定版本的GPT可能不了解其训练后发布的编程框架和库。例如,GPT-3.5的知识截止日期是2021年9月。因此,如果你需要生成更新版本的代码,可以考虑使用专门为代码生成设计的模型和工具。
专用代码生成工具
了解了通用模型的局限性后,我们来看看一些专门为代码生成设计的工具。
GitHub Copilot 🤖
GitHub Copilot是一个AI代码生成器,可以根据多种编程语言和框架生成代码。它由OpenAI Codex驱动,Codex是一个生成式预训练语言模型,帮助开发者生成基于解决方案的代码。Copilot在自然语言文本和公开来源(包括GitHub仓库)的源代码上进行训练。它可以作为扩展集成到流行的代码编辑器(如Visual Studio)中,并能生成遵循最佳实践和行业标准的代码片段。
Polycoder 💻
Polycoder是一个开源的AI代码生成器。它基于GPT模型,并在用12种编程语言编写的各种GitHub仓库数据上进行了训练。它在编写C语言代码方面特别准确。Polycoder提供了一个广泛的预定义模板库,可作为各种用例代码生成的蓝图。它可以帮助创建、审查和精确定制符合要求的代码片段。
IBM Watson Code Assistant ☁️
不同的代码生成器提供特定的功能和特性。然而,当需求是让混合云开发者编写满足多样化需求的代码时,IBM Watson Code Assistant是一个选择。它建立在IBM watsonx.ai的基础模型之上,适用于任何技能水平的开发者。
你可以将Watson Code Assistant与代码编辑器集成。它使开发者能够通过实时推荐、自动补全功能和代码重构辅助,准确高效地编写代码。此外,你可以将代码或项目文件输入Watson Code Assistant进行分析。它会识别模式、提出改进建议并生成代码片段或模板。开发者可以为特定项目需求定制生成的代码。
其他工具与优势
除了上述工具,还有许多其他AI驱动的代码生成器和代码助手工具可以帮助开发者更快地编写准确代码。
-
Amazon CodeWhisperer:可以集成到代码编辑器中,提供实时代码推荐。
-
Tabnine:有助于实现准确的代码补全。
-
Replit:一个为用户提供编码、学习和协作的交互式空间的平台。
优势与注意事项
具有自动代码编写和优化功能的基于AI的代码生成器,帮助开发者提高了生产力和代码质量。它们支持快速原型设计以迭代设计想法。这些工具还通过支持多语言代码翻译,有助于实现跨平台兼容性和迁移。基于AI的代码生成器遵循一致的模式和编码标准,可以建议重构模式以遵循最佳实践。
然而,使用这些工具时需要谨慎,以确保AI生成的代码不会导致伦理问题,例如安全漏洞,因为这些工具可能被用于生成恶意代码,或者其训练数据可能存在偏见。
总结
本节课中,我们一起学习了基于生成式AI的模型和工具可以根据文本和图像提示生成新代码、优化现有代码并生成基于解决方案的代码。ChatGPT和Gemini适用于简单的代码生成、调试和学习编程。而GitHub Copilot、Polycoder和IBM Watson Code Assistant等主流代码生成器则提供了实时推荐、代码重构和解决方案模板等多样化功能。总体而言,代码生成器提高了生产力,加速了开发周期,促进了编码最佳实践,并培养了统一的编码标准。
014:生成式AI工具的有效运用 🧠
在本节课中,我们将学习AI专家们分享的使用生成式AI工具(如文本、图像和代码生成工具)的个人经验,并探讨这些工具的优势与挑战。
专家经验分享 🗣️
上一节我们介绍了课程背景,本节中我们来听听AI专业人士的实际使用体验。
一位专家分享道,他尝试了多种生成式AI工具,涵盖文本、代码、图像、视频、音乐和3D文件生成等领域。他明确指出,就首次尝试即能获得满意结果而言,文本生成和代码生成是目前表现最好的领域。这不仅因为这些模型感觉上经过了更多优化,也因为市面上有更多关于如何设计提示词(prompt) 以获得优质输出的指导。
工具选择与模型多样性 🛠️
没有哪个单一的大型语言模型能够应对所有生成式AI用例。因此,针对任何特定任务,都可以考虑并使用多种大型语言模型。这些模型或由开源社区提供,或由具备训练能力的组织发布。此外,还存在微调(fine-tuning) 的概念,这意味着你可以考虑使用一个大型语言模型,并针对你的数据或客户数据进行微调,而无需巨大的计算资源或海量数据。
以下是不同生成任务的主流工具选择:
文本生成:基于GPT-3的ChatGPT模型和Google Bard是非常流行的平台,它们也具备代码生成能力。然而,在代码生成方面,GitHub Copilot表现更佳。其他常用工具还包括Copilot AI、Jasper、Phrasee IO和MS Copilot。
图像生成:视觉领域可分为图像生成、视频生成和设计生成三类。对于图像生成,DALL-E是最受欢迎的工具之一。从平台角度看,Midjourney也非常流行。值得注意的是,DALL-E可以与ChatGPT结合使用,且ChatGPT的高级版本正逐步集成DALL-E功能。
代码生成:除了上述提到的ChatGPT和GitHub Copilot,专门用于此用例的大型语言模型还包括Microsoft Copilot、IBM Watson Code Assistant、Ponicoder和OpenAI Codex。
这些是流行的选择,对于创建你所需的任何材料(特别是文本)来说,它们已经足够好。
优势与挑战 ⚖️
接下来,让我们探讨使用生成式AI工具的几点好处与挑战。
优势在于它们可以帮助你创建一个良好的基线,用于开发你的内容。当然,你不能完全依赖这些技术,因为所有生成的内容都存在局限性。
挑战则体现在更小众的领域,尤其是音乐或3D文件/模型生成。在这些领域,通常更难获得你想要的结果,生成过程耗时更长,并且目前需要更多的试错。专家明确预见,未来情况会变得更简单、更好,并且更重要的是走向多模态(multimodal),即通过单一界面无缝处理所有不同类型的生成任务。但就目前而言,他建议尽可能尝试所有工具,即使你现在不感兴趣,因为未来它们可能会变得非常有用。
总结 📝
本节课中,我们一起学习了AI专家使用各类生成式AI工具(文本、图像、代码)的实践经验,了解了针对不同任务应如何选择工具和模型,并分析了当前使用这些工具的优势与面临的挑战。关键要点是:文本和代码生成相对成熟,需善用提示词技巧;没有万能模型,可根据任务选择或微调;面对新兴领域需保持耐心并积极尝试。
015:跨领域生成式AI应用探索 🧠
在本节课中,我们将聆听专家们的见解,共同探索生成式AI在不同行业领域的潜在应用。我们将看到,这项技术远不止于文本生成,它正在深刻改变教育、金融、医疗等多个关键领域的工作方式。
概述:无处不在的生成式AI
生成式AI几乎在每一个行业都拥有潜在的应用前景。为了深入理解,我们将跟随专家的视角,聚焦几个特定领域进行探讨。
教育领域的应用 🎓
上一节我们提到了生成式AI的广泛潜力,本节中我们来看看它在教育领域的具体实践。
在Skill Network,我们已经开始在多个环节实施生成式AI。我们不仅开发了能够自动批改作业和测验的工具,更重要的是,它能在学习者答错时提供反馈。借助生成式AI,这几乎可以零成本实现。我们只需设计一个提示词,例如:“请根据以下评分标准批改此作业,如有错误,请生成一段文字帮助学习者从错误中学习。”
此外,我们还有一个名为“TI”的个人导师,它是一位AI助教,可以解答你遇到的几乎所有问题。例如,当你在实验中卡住、不知如何继续,或遇到错误信息时,只需将错误信息交给TI,它就会帮助你解决问题——无论是定位代码中的错误,还是提供修复思路。这创造了一种双向互动模式,让你能即时提问并获得帮助,无需在留言板上等待数天或数周。
更重要的是,有了这位全程陪伴的个人导师,你能够随时获得作业的批改和反馈。这对我们而言非常实用,因为有些课程拥有成千上万甚至更多的学习者,仅凭有限数量的讲师和助教,根本不可能批改如此多的作业。生成式AI有效地填补了这一空白。
以下是生成式AI在教育中的核心应用方式:
-
自动评分与反馈:使用提示词工程,让AI根据评分标准批改作业并提供个性化学习建议。
-
个人AI助教:构建一个能够实时回答技术问题、调试代码的对话式助手。
-
规模化教学支持:解决大规模在线课程中师资不足的问题,为每位学习者提供即时支持。
金融领域的变革 💹
了解了教育领域的创新后,我们转向金融世界,看看生成式AI如何改变游戏规则。
生成式AI正在改变金融世界。首先,它像一名侦探,能够识别交易中的可疑活动以防止欺诈。其次,它通过分析海量市场运作数据,帮助交易员做出更明智的决策。此外,它还驱动着你在网上看到的那些友好的聊天机器人,帮助客户处理咨询和交易。
像摩根大通和高盛这样的大型机构已经在使用生成式AI。摩根大通的“COIN”系统用于快速理解法律文件,节省了时间和金钱。高盛则用它来预测市场走势,为交易员提供优势。因此,生成式AI正在变革金融业,而这仅仅是个开始。准备好迎接未来吧,届时你的资金将更安全、投资更智能、银行体验比以往任何时候都更顺畅。
以下是生成式AI在金融领域的核心应用:
-
欺诈检测:分析交易模式,实时识别异常和潜在欺诈行为。
-
市场分析与预测:处理大量非结构化数据,生成市场洞察和预测报告。
-
智能客服与自动化:通过聊天机器人处理客户查询、账户管理甚至部分交易流程。
-
文档智能处理:快速解析、总结复杂的法律与合规文件。
医疗与生命科学的突破 🏥
看过了金融领域的效率提升,我们进入关乎人类健康的医疗领域,探索生成式AI如何推动生命科学的前沿研究。
生成式AI在医疗领域具有变革性潜力。课程中描述的一些应用包括但不限于IT与开发运维、医疗保健、工业、金融、人力资源、营销和娱乐。
具体到医疗健康行业,生成式AI带来了诸多进步,例如医学影像生成。通过创建合成影像数据,它使我们能够构建、训练和验证更强大的、用于医学影像的机器学习模型。它还能帮助药物发现。在制药行业,生成式AI一个流行的应用方向是生成个性化医疗方案。它被用于创建氨基酸序列、蛋白质模式和基因组模式,特别是利用这些信息为相关症状制定个性化医疗方案。其核心概念是,利用可用数据和信息创造更好、前所未有的模式,这一点因生成式AI而变得更容易。
生成式AI在健康领域具有变革潜力,它通过生成具有所需特性的分子结构来辅助药物发现,显著加快了研究进程。
以下是两个成功的项目案例:
-
DeepMind的AlphaFold:该项目使我们能够根据氨基酸序列预测蛋白质的3D结构。
-
AI赋能影像分析:利用生成对抗网络(GANs)生成合成数据,并用这些生成的图像构建更强大的卷积神经网络,从而更准确地检测乳腺癌,帮助诊断过程并造福患者。
此外,Insilico Medicine公司利用生成式AI识别新的候选药物,加速了早期发现阶段。同时,它通过增强图像分辨率和检测异常来辅助医学影像分析,从而提高诊断准确性。另一个值得注意的项目是英伟达与伦敦国王学院的合作,他们使用AI模型创建合成脑部MRI扫描图像,用于培训放射科医生,且无需担心隐私问题。
以下是生成式AI在医疗领域的核心应用与公式表示:
-
医学影像增强与生成:使用GANs等模型生成合成数据以扩充数据集。
- 核心概念公式:
GAN = Generator(生成器) + Discriminator(判别器),两者在对抗中学习,最终生成器能产生以假乱真的数据。
- 核心概念公式:
-
药物发现与分子设计:生成具有特定属性(如药效、低毒性)的新分子结构。
-
个性化医疗:分析患者基因组、蛋白质组等数据,生成定制化的治疗或健康管理方案。
-
辅助诊断:通过图像分析模型(如CNN)检测医学影像中的病变。
- 代码概念:
预测结果 = CNN_模型(输入影像),模型通过训练学习从影像中提取特征并做出分类。
- 代码概念:
总结
本节课中,我们一起学习了生成式AI在多个核心领域的跨界应用。我们看到:
-
在教育领域,它化身个人导师和自动评分系统,实现个性化、规模化的学习支持。
-
在金融领域,它作为分析引擎和自动化工具,提升风控、交易和客服的效率和智能。
-
在医疗领域,它成为科研加速器,在医学影像分析、新药研发和个性化医疗方面展现出巨大潜力。
这些案例表明,生成式AI的核心价值在于其创造(生成新内容、新方案) 和增强(提升效率、精度、体验) 的能力。它并非遥不可及的未来科技,而是正在各行各业落地生根,解决实际问题的强大工具。理解这些应用场景,将帮助我们更好地把握技术趋势,思考其在自身领域的可能性。
016:生成式AI与代理型AI对比 🤖
在本节课中,我们将要学习生成式人工智能与代理型人工智能之间的核心区别。我们将探讨它们各自的工作原理、典型应用场景,以及它们如何共同构建更强大的智能系统。
概述
生成式AI与代理型AI是人工智能的两种不同实现方式。生成式AI是我们熟悉的聊天机器人、图像生成器等,其本质是反应式系统。代理型AI则不同,它是主动式系统。两者虽然功能不同,但常常共享大型语言模型这一共同基础。
生成式AI:反应式的内容生成器 🎨
上一节我们介绍了两种AI的基本概念,本节中我们来看看生成式AI的具体特点。
生成式AI系统本质上是反应式的。它们等待用户执行特定操作,即等待用户输入提示。一旦收到提示,它们的任务就是基于提示内容生成某种形式的内容。它们利用在训练中学到的模式进行生成。
以下是生成式AI可以生成的内容类型:
-
文本
-
图像
-
代码
-
音频
生成式AI本质上是复杂的模式匹配机器。它们从海量数据集中学习了单词之间、像素之间、声波之间的统计关系。因此,当你提供一个提示时,生成式AI会根据其训练来预测接下来应该出现的内容。但其工作止步于生成内容。没有你的进一步输入,它不会采取额外步骤。
代理型AI:主动的目标追求者 🚀
与生成式AI不同,代理型AI系统不是反应式的,它们是主动式系统。
和生成式AI一样,代理型AI通常也始于用户提示。但这个提示随后被用来通过一系列行动来追求目标。代理系统基本上会经历一个生命周期。
以下是代理型AI工作周期的步骤:
-
感知:感知其环境。
-
决策:决定要采取的行动。
-
执行:执行所决定的行动。
-
学习:从行动输出中学习,然后循环往复,整个过程只需最少的人力干预。
共同的基础:大型语言模型 (LLM) 🧠
这两种AI方法通常共享一个共同的基础,即大型语言模型。
LLM是聊天机器人的核心支柱。虽然图像和音频生成通常使用扩散模型等其他工具,但聊天机器人使用的是LLM。同时,LLM也为代理系统提供了推理引擎的动力。
在深入探讨之前,我们先看看一些现实世界的应用案例。
现实应用与用例对比 🔍
也许这不能给我带来最好的形象,但我想我不是唯一一个使用生成式AI来协助内容创作任务的人,尤其是创意内容创作。
例如,一个视频博主可能使用生成式AI系统来审阅脚本、建议缩略图概念,甚至生成背景音乐。但在每一步中,都存在一个人类创作者。人类创作者审视生成的内容,审核它,检查是否符合要求,并对其进行优化。人类导演着整个过程:AI生成可能性,而人类对其进行筛选。
代理型AI则在需要持续管理和包含多步骤流程的场景中表现出色。考虑一个个人购物代理:给定一个要购买的产品作为输入,它会主动在各个平台上搜寻库存,监控价格波动,处理结账流程,甚至协调送货。它自主运行,仅在需要时才向你寻求输入。
代理的思维:思维链推理 ⚙️
它是如何做到这一点的?事实证明,支撑许多生成式AI的LLM,也可以用来为AI代理提供推理能力。
本质上,我们在这里利用了生成式AI“思考”问题的能力,这有一个名称,叫做思维链推理。这正是LLM非常擅长的。这是一个代理将复杂任务分解为更小逻辑步骤的过程,类似于人类解决难题的方式。
想象一下,我们想要一个代理来规划组织会议这样的复杂任务。它会使用生成式AI生成内部对话。对话可能是这样的:首先,我需要了解会议的需求、规模、会期、预算等。然后,我应该研究符合这些参数的可用场地。接着,对于符合要求的场地,我需要检查其可用性等等。这实际上是代理在采取行动前,通过自我对话来探索问题空间。生成式AI基本上是驱动代理决策的认知引擎。
展望未来:智能协作 🤝
展望未来,最强大的AI系统可能既不是纯粹的生成式,也不是纯粹的代理型。它们将成为智能协作者,能够理解何时通过生成来探索选项,何时通过代理行动来执行行动方案。
就像一个知道何时生成同人小说下一章的代理,以便在我完成视频拍摄后(或者也许现在)就能准备好。
总结
本节课中我们一起学习了生成式AI与代理型AI的核心区别。生成式AI是反应式的内容生成工具,擅长基于提示创造文本、图像等内容。代理型AI是主动式的系统,能够感知、决策、执行并学习,以自主完成多步骤目标。两者常以大型语言模型为基础,未来趋势是融合两者优势,形成能理解场景并智能协作的AI系统。
生成式AI用于人力资源:P17:课程介绍2 🎯
在本节课中,我们将学习提示工程的基础知识,了解其核心概念、课程目标以及你将掌握的具体技能。
专家知道所有答案,前提是你提出了正确的问题。有趣的是,这正是我们为生成式AI模型设计提示词所遵循的原则。我们使用提示词来查询和提问AI应用,例如聊天机器人、图像、音频或视频生成工具,甚至虚拟世界。提示词能够优化生成式AI模型的响应。其力量在于你所提出的问题。了解如何编写有效且直接的提示词,将使你能够生成更精确、更相关的内容。
现在,一个很好的问题是:完成本课程后,我能做什么?
本课程面向所有初学者,无论是专业人士、爱好者、从业者还是学生,只要对学习如何编写有效提示词抱有真诚的兴趣。这是一门面向所有人的课程,无论你的背景或经验如何。
在本课程结束时,你将能够:
-
解释提示工程和生成式AI模型的概念及其相关性。
-
应用创建提示词的最佳实践。
-
评估常用的提示工程工具。
-
应用常见的提示工程技术和方法来编写有效的提示词。
这是一门精炼的课程,包含三个模块,每个模块需要一到两个小时完成。
上一节我们介绍了课程的整体目标,本节中我们来看看课程的具体结构安排。
以下是本课程三个模块的详细内容:
-
模块1:你将学习提示工程的概念,从如何定义提示词及其构成要素开始。你将学习应用编写有效提示词的最佳实践,并评估常见的提示工程工具,例如IBM Watson X Prompt Lab、Spellbook和Dust。
-
模块2:你将研究各种提示工程方法,如面试模式、思维链和思维树。你将发现巧妙设计提示词的技术,例如零样本和少样本,以产生精确且相关的响应。
-
模块3:邀请你参与一个最终项目,并提供一个分级测验来测试你对课程概念的理解。
你还可以访问课程术语表,并获得关于后续学习步骤的指导。
本课程融合了概念讲解视频和辅助阅读材料。观看所有视频以充分掌握学习材料的潜力。你将通过实践实验室和一个最终项目来享受动手操作的乐趣,该项目演示了如何在IBM生成式AI教室中通过创建有效的提示词来优化结果。
课程包含练习测验,帮助你巩固学习。课程结束时,你还需要完成一个分级测验。课程还提供了讨论论坛,以便与课程工作人员联系并与同伴互动。
最有趣的是,通过专家观点视频,你将听到经验丰富的从业者分享他们对提示工程中使用的工具、方法以及编写有效提示词的艺术的见解。
你准备好学习关于编写提示词的一切,以释放生成式AI的全部潜力了吗?让我们开始吧。
本节课中,我们一起学习了本课程的核心目标、你将获得的能力以及详细的课程模块安排。我们了解到,掌握提示工程是有效利用生成式AI的关键,而本课程将通过理论、实践和专家见解,引导你从入门到应用。
018:1_提示词的定义
在本节课中,我们将要学习什么是提示词。通过本节内容,你将能够定义提示词及其构成要素,并解释编写有效提示词对于引导生成式AI模型产生预期结果的重要性。
什么是提示词?🤔
生成式AI模型的一项显著能力是其输出与人类创作的内容高度相似:相关、有语境、富有想象力、细致入微且语言准确。而生成这种输出的关键因素之一就是提示词。
那么,什么是提示词?提示词是你提供给生成式模型的任何输入,用以产生期望的输出。你可以将其视为你给模型的指令。
例如:
-
写一小段文字描述你最喜欢的度假胜地。 -
编写HTML代码,为在线表单生成一个城市下拉选择框。
这些都是用于产生特定输出的直接提示词。提示词也可以是一系列指令,用于逐步优化输出以达到预期结果。
例如:
-
写一个关于火星上学习生活的短篇故事。 -
他在研究期间面临了哪些挑战?
从这些例子可以看出,提示词包含问题、上下文文本、引导模式或示例,以及基于这些以自然语言形式提交的请求而提供给模型的部分输入。生成式AI模型收集信息、进行推断并提供创造性的解决方案。这些指令帮助模型基于提供的输入,产生相关且合乎逻辑的回应或输出。
从“朴素提示”到“有效提示”🛠️
让我们看更多例子来更好地理解这一点。
假设你想让模型写一个关于农民在10年内成为成功商人的奋斗与成就的短篇故事。如果你的提示词是“一个小镇富人的故事。他的奋斗与成就。”,模型会产生一个通用的输出,这就是我们所说的朴素提示。它意味着以最简单的方式向模型提问。
为了向模型准确传达你的意图,你可以进行简单的调整,从而显著改善结果。你的提示词需要有上下文、恰当的结构并且易于理解。
因此,你可以将提示词重写为:
写一个关于农民在10年内成为富有且有影响力的商人的奋斗与成就的短篇故事。
再看另一个例子,你想让模型生成你想象中的日落风景图像。将提示词写为“山间的日落图像”可能无法给出你想要的输出。这个提示词过于简短,缺乏对你脑海中图像的详细描述。
你可以将提示词重写为:
生成一幅描绘宁静日落的图像,场景是坐落在群山之间的河谷。
有效提示词的构成要素🧱
为了掌握编写有效提示词的艺术,让我们逐一理解一个结构良好的提示词的构成要素。
以下是构建有效提示词的四个关键部分:
-
指令
指令为模型提供关于你希望执行任务的明确指导,引导生成式AI模型的行为,以影响其回应的形成。
示例:
写一篇600字的文章,分析全球变暖对海洋生物的影响。 -
上下文
上下文有助于建立构成指令背景的环境,并为生成相关内容提供一个框架。
为了理解这一点,让我们为上一个例子中的提示词添加一些上下文。
示例:
近几十年来,全球变暖发生了显著变化,导致海平面上升、风暴强度增加和天气模式改变。这些变化对海洋生物产生了严重影响。写一篇600字的文章,分析全球变暖对海洋生物的影响。这个提示词将帮助模型生成与上下文一致的输出。
-
输入数据
输入数据是你作为提示词一部分提供的任何信息。这可以作为生成式模型的参考,以获得包含特定细节或想法的回应。
为了提供输入数据,同样的提示词可以按以下方式重构:
示例:
你已获得一个包含太平洋温度记录和海平面测量值的数据集。写一篇600字的文章,分析全球变暖对太平洋海洋生物的影响。 -
输出指示器
输出指示器为评估模型生成输出的属性提供了基准。它可以概述你期望输出具备的语气、风格、长度和其他品质。
示例:在提示词
写一篇600字的文章,分析全球变暖对海洋生物的影响。中,输出指示器指定生成的输出应为一篇600字的文章。它将根据分析的清晰度以及相关数据或案例研究的纳入情况进行评估。
这些要素中的每一个都在帮助生成式AI模型理解你的需求并给出期望的输出方面发挥着作用。
总结📝
本节课中,我们一起学习了提示词的定义。提示词是你提供给生成式模型以产生期望输出的任何输入或一系列指令。这些指令有助于引导模型的创造力,并协助产生相关且合乎逻辑的回应。一个结构良好的提示词的构成要素包括指令、上下文、输入数据和输出指示器。这些要素共同帮助模型理解我们的需求并生成相关的回应。
019:提示词工程解析 🧠
在本节课中,我们将要学习什么是提示词工程。我们将定义提示词工程,解释其在生成式AI模型中的相关性和重要性,并详细阐述通过提示词工程来制定有效提示词、以引导模型产生相关响应的过程。
什么是提示词工程?
设计有效的提示词以生成更好、更符合期望的响应的过程,被称为提示词工程。
尽管生成式AI模型有潜力辅助人类创造力,但如果你未能提供精确的提示词,这些模型可能会产生不充分的结果,甚至是虚假和误导性的信息。
提示词工程是批判性分析、创造力和技术敏锐度的结合。它不仅仅局限于提出正确的问题,还包括在正确的语境下构建问题,提供正确的信息,并明确你对期望结果的预期,从而引出最恰当的回应。
一个示例:天气预报 🌊
让我们通过一个例子来理解这一点。一艘船正在大西洋航行。为了规划航程,船长需要知道特定地点在特定时间的天气预报。
在这种情况下,向模型提供一个简单的提示词,例如“大西洋的天气预报”,可能无法获得期望的结果。为了得到最准确的结果,船长需要对提示词进行“工程化”设计。
在设计提示词时,船长需要定义上下文,包括诸如天气预报的目标位置(经纬度)和预测的时间范围等细节。
例如:
一艘船的船长正在计划大西洋的战略航行。为了帮助船长有效导航,请提供2023年8月28日至9月1日接下来一周的天气预报。目标位置的坐标在北纬20度到30度,西经40度到20度之间。
船长还必须指明是否需要特定的输出,例如模型是否应返回可能影响航程的其他天气要素信息。
例如:
为了帮助规划大西洋的有效航行,请提供关于指定时间和地点内预期风型、浪高、降水概率、云量以及任何可能影响航程的潜在风暴的详细信息。
提示词工程的迭代过程 🔄
重要的是要认识到,提示词工程是一个结构良好的迭代过程,涉及优化提示词并尝试可能影响模型输出的各种因素。
以下是创建有效提示词的逐步过程。
1. 定义目标
该过程的第一步是建立一个明确的目标。你必须确切知道你想要模型生成什么。
例如:
目标:形成一份关于人工智能在汽车领域应用的益处和风险的简要概述。
2. 创建初始提示词
明确了目标后,现在是时候创建初始提示词了。根据目标,这可能表现为一个问题、一个指令,甚至是一个情境。
例如:
初始提示词:撰写一篇文章,对人工智能融入汽车行业所带来的益处和弊端进行全面分析。
3. 测试提示词
你现在应该测试并分析你所创建提示词的响应。虽然响应可能是相关的,但它可能缺乏你所追求的独特视角。
例如:
对初始提示词的响应直接列出了人工智能融入汽车行业的益处和弊端。它没有强调可能出现的任何伦理问题。此外,也没有讨论其积极和消极的影响。
4. 分析响应
你必须仔细审查响应,并检查它是否符合你的目标。如果不符合,请记下不足之处。
例如:
所使用的初始提示词未能全面涵盖人工智能在汽车行业相关的益处和风险范围。
5. 优化提示词
利用通过测试和分析获得的知识,现在可以修改提示词了。这可能包括增强其特异性、融入更多上下文或重新措辞。
初始提示词可以优化如下:
优化后的提示词:
撰写一篇信息性文章,讨论人工智能在革新汽车行业中的作用。阐述关键方面,如益处、弊端、伦理考量以及积极和消极的影响。具体说明自动驾驶和实时交通分析等领域,同时探讨潜在挑战,如技术复杂性和网络安全问题。
6. 迭代过程
最后三个步骤(测试、分析、优化)会重复进行,直到你对响应感到满意为止。
因此,经过几轮优化后,最终的提示词可能呈现以下形式:
最终提示词:
撰写一篇文章,重点介绍人工智能如何重塑汽车行业。聚焦于积极进展,特别是在自动驾驶和实时交通分析方面,同时深入探讨与复杂技术方面相关的担忧,例如决策算法和潜在的网络安全漏洞。强调这些担忧可能对车辆安全产生的影响。确保分析透彻、有实例支持并鼓励批判性思考。
提示词工程的重要性与相关性 💡
上一节我们介绍了提示词工程的具体步骤,本节中我们来看看它在生成式AI模型中的核心价值。
以下是提示词工程的重要性和相关性:
-
优化模型效率:提示词工程有助于设计智能提示词,使用户能够充分利用这些模型的全部能力,而无需进行大量的重新训练。
-
提升特定任务性能:提示词工程使生成式AI模型能够提供细致入微且具有上下文的响应,使其对特定任务更加有效。
-
理解模型限制:通过每次迭代优化提示词并研究模型的相应响应,可以帮助我们理解其优势和弱点。这些知识可以进一步指导未来的功能增强或模型的完整开发。
-
增强模型安全性:熟练的提示词工程可以防止因提示词设计不当而导致有害内容生成的问题,从而增强模型的安全使用。
总结 📝
本节课中我们一起学习了提示词工程。你了解到,提示词工程是设计有效提示词以充分利用生成式AI模型能力、产生最佳响应的过程。你也学习了通过提示词工程优化提示词的迭代过程。最后,你掌握了提示词工程在优化模型效率、提升任务性能、理解模型限制以及增强其安全性方面的重要性。
020:提示词创建最佳实践 ✍️
在本节课中,我们将学习如何为生成式AI模型创建有效的提示词。通过应用最佳实践,你可以更好地控制AI输出的风格、语气和内容,从而获得更相关、更准确的回答。
概述
撰写有效的提示词对于充分发挥生成式AI模型的潜力至关重要。通过遵循清晰性、上下文、精确性和角色扮演这四个维度的最佳实践,你可以引导模型生成符合预期的输出。本节课程将通过具体示例,详细介绍如何起草和优化提示词。
清晰性:使用简单明确的语言
上一节我们介绍了创建有效提示词的四个核心维度。首先,我们来看看清晰性。清晰的提示词能确保模型准确理解你的意图。
为了保持清晰性,请牢记以下几点:
-
使用简单直接的语言:易于理解的指令能更好地传达给模型。因此,应撰写明确且易于理解的提示词。
-
避免专业术语:特殊术语可能会让模型或用户感到困惑。应使用能被广泛受众理解的简单词汇来撰写提示词。
-
避免模糊描述:模糊的提示词可能导致回答与你的意图不符。因此,必须清晰描述模型需要执行的任务。
让我们通过一个例子来理解:
原始提示(不清晰):
讨论在植物完全叶状托叶上借助阳光发生的烹饪过程。同时提及一个绿色物质,以及光、空气和水对植物地上部分的重要性。
这个提示词存在多处问题:
-
它没有明确提及想要讨论的过程(光合作用)。
-
包含了“完全叶状托叶”等复杂术语,难以理解。
-
描述模糊,没有清晰说明任务是什么。
优化后的提示(清晰):
解释植物光合作用的过程,详细说明叶绿素的作用,以及阳光、二氧化碳和水如何参与这一生物功能。
修订后的提示使用了简单、清晰、简洁的语言,并明确声明了要讨论植物光合作用的过程。
上下文:提供背景与相关信息
在理解了清晰性的重要性后,我们来看看第二个维度:上下文。上下文能帮助模型理解情境或主题。
这可以包括提供简短的介绍或对所需回答所处环境的解释。相关的信息或具体细节(如人物、地点、事件或概念)有助于引导模型的理解。因此,在撰写提示词时,融入这些细节非常重要。
以下是应用上下文的示例:
原始提示(缺乏上下文):
写一写1775年革命战争爆发期间发生了什么。
这个提示词没有包含足够的背景和具体细节来引导模型的理解。
优化后的提示(包含上下文):
描述导致美国革命战争的历史事件,重点关注波士顿倾茶事件、萨拉托加战役等关键事件。强调美洲殖民地与英国政府之间的紧张关系,并解释这些事件如何导致了1775年革命战争的爆发。
精确性:明确要求与提供示例
接下来,我们探讨创建有效提示词的第三个重要维度:精确性。精确性能帮助你勾勒出请求的轮廓。
如果你在寻找特定类型的回答,请清晰地表达出来。在提示词中融入示例,可以帮助模型理解你期望的回答类型,并引导其思考过程。
让我们看一个例子:
原始提示(不精确):
谈谈经济学中的供给与需求,以及它是如何受影响的。
这个提示没有精确勾勒出特定类型的回答轮廓,也没有提供示例。
优化后的提示(精确):
解释经济学中的供给与需求概念。描述需求增加如何影响价格,并借助一个说明性示例,例如智能手机市场。同样,通过类比石油生产中断等情况,解释供给减少对价格的影响。
这个提示清晰地表达了你想借助示例来解释一个概念。
角色扮演:设定视角与身份
最后,我们来讨论最后一个维度:角色扮演或人物模式。从特定角色或人物视角撰写的提示词,可以帮助模型生成与该视角一致的回答。
提供必要的上下文细节能使模型有效地扮演特定角色。因此,如果你要求模型从历史人物、虚构角色或特定职业的角度进行回答,请提供相应的上下文细节。
请看以下示例:
原始提示(无角色设定):
写一篇日志,描述一个未知外星星球上奇特的动植物。
这个提示只会给出关于外星星球的科学细节,而不会从专业人士的视角解释其答案。
优化后的提示(包含角色扮演):
假设你是一名刚刚降落在一个未知外星星球上的宇航员。写一篇日志,描述你遇到的奇特动植物,例如天空的颜色和在外星地貌中回荡的陌生声音。表达你在记录这段非凡旅程时的兴奋、好奇以及一丝忧虑。
在这个例子中,你明确提供了上下文细节,并假设自己是一名宇航员。因此,这个提示词将生成与宇航员视角一致的回答。😊
总结
本节课中,我们一起学习了为生成式AI模型撰写有效提示词的最佳实践。
我们了解到,撰写有效的提示词对于控制输出的风格、语气和内容至关重要。最佳实践主要体现在四个维度:
-
清晰性:包括使用简单、简洁的语言。
-
上下文:提供背景和所需细节。
-
精确性:意味着要具体,并提供示例。
-
角色扮演:通过假设一个身份并提供相关上下文,可以增强回答的针对性。
这些实践可以根据具体需求进行调整,以获得最佳结果。
021:常用提示词工程工具 🛠️
在本节课中,我们将要学习提示词工程工具的常见功能,并介绍几款常用的工具。提示词工程是设计精确且符合语境的提示词,以与生成式AI模型交互,从而获得相关且准确输出的过程。为了辅助这一过程,市面上有多种提示词工程工具可供选择。
概述
提示词工程工具提供了多种特性和功能,旨在优化提示词的创建,以获得期望的结果。这些工具对于不精通自然语言处理技术,但又希望在使用生成式AI模型时达成特定目标的用户尤为有用。
接下来,我们将探讨这些工具提供的常见功能。
提示词工程工具的常见功能
以下是提示词工程工具通常具备的核心功能:
-
提示词建议:许多工具能够根据给定的输入或期望的输出,为用户提供提示词建议。
-
结构优化:这些工具可以建议如何构建提示词,以实现更好的语境沟通,帮助用户构建能为模型提供必要上下文、以理解用户意图的提示词。
-
迭代优化:用户可以根据工具的初始响应,迭代地优化提示词,以找到最有效的版本。
-
偏见缓解:提示词工程工具可能提供功能,帮助减轻生成式AI模型响应中的偏见,指导用户如何构建提示词以降低产生偏见或不恰当输出的可能性。
-
领域特定支持:这些工具可以帮助创建针对特定领域(如法律、医疗或技术)的提示词。
-
预定义提示词库:一些工具提供了针对各种用例的预定义提示词库,用户可以根据具体需求进行定制。
上一节我们介绍了提示词工程工具的通用功能,本节中我们来看看几款具体的常用工具。
常用提示词工程工具介绍
1. IBM Watsonx.ai 提示词实验室 (Prompt Lab)
IBM Watsonx.ai 是一个集成的工具平台,用于轻松训练、调优、部署和管理基础模型。该平台包含 提示词实验室 工具,使用户能够基于不同的基础模型试验提示词,并根据需求构建提示词。
为了帮助用户入门,提示词实验室为不同用例(如摘要、分类、生成和提取)提供了示例提示词。要创建符合特定需求的提示词,用户可以通过添加指令和示例来训练模型,向模型展示应如何响应输入。
2. Spellbook (Scale AI)
Spellbook 是 Scale AI 提供的一个集成开发环境。借助 Spellbook,用户可以基于大型语言模型构建应用程序,并为各种用例(包括文本生成、文本提取、分类、问答、自动补全和摘要)试验提示词。
对于提示词工程,Spellbook 包含一个提示词编辑器,允许用户编辑和测试提示词。用户可以使用提示词模板来利用结构化提示词生成文本,也可以访问预构建的提示词作为示例。
3. Dust
Dust 提供了一个用于编写提示词并将其链接在一起的 Web 用户界面。用户可以管理链式提示词的不同版本。它还提供了一种自定义编码语言和一组用于处理LLM输出的标准模块。Dust 还支持 API 集成,以接入其他模型和服务。
4. PromptPerfect
PromptPerfect 是一款可用于为不同的大型语言模型或文生图模型优化提示词的工具。它支持常见的文本模型(如 GPT、Claude、Stable LM 和 LLaMA)以及图像模型(如 DALL-E 和 Stable Diffusion)。
要编写或优化提示词,首先需要选择要为其优化提示词的相关模型,因为不同模型有不同的优化策略。用户还可以选择与预览质量、语言和审核相关的附加功能。
在编写提示词时,可以尝试自动补全功能,该功能会在用户输入时提供建议。用户可以进一步优化已编写的提示词。例如,工具会展示用户编写的原始提示词和由 PromptPerfect 生成的相应优化提示词。为了进行更深层次的优化,用户可以在流线模式下逐步优化和完善提示词:编写提示词 -> 优化 -> 再次编辑 -> 再优化,直到对输出满意为止。
除了上述专门工具,还有一些其他流行的平台和接口为提示词工程提供资源或帮助用户试验提示词。
其他资源与平台
-
GitHub:拥有大量关于提示词工程和LLM的代码仓库。这些仓库中提供的指南、示例和工具有助于提升提示词工程技能。
-
OpenAI Playground:一个基于 Web 的工具,帮助用户使用 OpenAI 的各种模型(如 GPT 系列)试验和测试提示词。
-
Playground AI:该平台帮助用户使用文本提示词,通过 Stable Diffusion 模型生成图像进行实验。
-
LangChain:一个 Python 库,提供了构建和链接提示词的功能。
最后,有趣的是,提示词本身也可以进行买卖。PromptBase 就是一个提示词市场的例子。它支持为流行的生成式AI工具和模型(如 Midjourney、ChatGPT、DALL-E、Stable Diffusion 和 LLaMA)提供提示词。
通过 PromptBase,用户可以购买符合特定要求、且针对特定模型或工具的提示词。例如,可以购买一个用于通过 Midjourney 生成滑稽卡通角色的提示词。同时,如果你拥有出色的提示词构建技能,也可以通过 PromptBase 上传和出售提示词。该平台还支持直接在其平台上构建提示词,并在其市场上出售。
总结
本节课中,我们一起学习了提示词工程工具如何提供多种功能来优化提示词,这些功能包括提示词建议、语境理解、迭代优化、偏见缓解、领域特定支持和预定义提示词库。我们还介绍了几款常见的提示词工程工具和平台,包括 IBM Watsonx.ai 提示词实验室、Spellbook、Dust 和 PromptPerfect。了解这些工具将帮助您更高效地与生成式AI进行交互。
022:高效提示词设计原则 ✨
在本节课中,我们将学习由生成式AI专家分享的高效提示词设计原则。提示工程是与AI模型交互、获取理想结果的关键步骤。掌握这些原则,能帮助你更有效地利用AI工具。
概述 📋
提示词是与生成式AI模型沟通的桥梁。一个设计良好的提示词能显著提升模型输出的质量和相关性。本节将介绍一系列核心原则,帮助你从清晰度、语境、迭代等方面优化你的提示词。
核心设计原则
上一节我们概述了提示工程的重要性,本节中我们来看看具体的设计原则。以下是构建高效提示词的关键要点。
1. 清晰与具体
与人类交流时,我们常使用开放式问题以鼓励探索。但与AI模型交互时,需要更加具体和直接。清晰的请求能减少歧义,引导模型生成更符合预期的内容。
核心公式:清晰指令 = 明确动作 + 具体目标
例如,避免使用“写点关于招聘的东西”,而应使用“以人力资源专家的身份,撰写一份针对初级软件工程师的招聘职位描述,需包含职责、要求和公司文化介绍。”
2. 提供充分语境
为模型提供相关的背景信息,能帮助其更好地理解任务并生成更贴切的回复。这包括指定应用场景、目标受众或相关细节。
示例代码(伪指令):
背景:公司正在扩张技术团队,需要招聘前端开发人员。
角色:你是一名资深技术招聘专员。
任务:根据以上背景,起草一封邀请潜在候选人进行电话面试的邮件。
3. 利用示例进行引导(少样本学习)
通过提供输入-输出的示例,可以明确你期望的回复格式、风格或内容结构。这种方法被称为“少样本学习”(Few-shot Learning)。
以下是使用示例引导的格式:
-
示例输入:“为‘年度团队建设活动’构思三个创意主题。”
-
示例输出:“1. 主题:城市逃脱探险。描述:在市区进行解谜寻宝,促进团队协作。2. 主题:公益黑客松。描述:用技术为非营利组织解决实际问题,体现社会价值。3. 主题:国际美食工作坊。描述:分组学习并制作不同国家菜肴,体验多元文化。”
4. 使用专业角色与限定条件
通过指定角色(如“作为一位薪酬福利专家”)或领域,可以让模型聚焦于特定的知识库和表达方式。同时,可以设定约束,如避免使用某些术语、限制输出长度或规定文本格式。
实践示例:“作为一名培训与发展经理,用不超过200字,为公司新上线的内部学习平台起草一段简洁的推广文案,避免使用‘革命性’、‘颠覆性’这类夸张词汇。”
5. 迭代优化与平衡
首次提示可能无法得到完美结果。生成式AI是一个需要反复对话和调试的工具。你可以基于初始输出,要求模型进行补充、改写或调整。
此外,需要在模型的创造性和输出的相关性/准确性之间找到平衡。过于宽泛的指令可能导致天马行空的结果,而过于严格的限制则可能扼杀有用的创意。
进阶技巧与总结
在掌握了上述基本原则后,我们来看看一些能进一步提升效果的技巧。
如果对如何提问不确定,可以直接询问AI本身。例如,你可以输入:“为了从你这里获得一个关于员工入职流程的流程图,最佳的提问方式是什么?” AI模型通常会给出如何向它提问的建议。
记住,设计提示词是一门艺术,需要练习。不同的模型可能有不同的“特性”,尝试多种表达方式,并根据反馈进行调整是关键。
总结:本节课我们一起学习了高效提示词设计的核心原则。
-
清晰具体:给出明确指令。
-
提供语境:补充相关背景信息。
-
示例引导:通过例子展示期望的格式或风格。
-
角色限定:指定专业领域以聚焦输出。
-
迭代优化:基于结果不断 refining 你的提示词。
通过保持清晰、平衡以及不断的实践,你将能解锁生成式AI强大的创造潜力,让人力资源工作更高效。
023:探索生成式AI中的提示词工程 🧠
在本节课中,我们将学习提示词工程的核心概念、关键技术与常用工具。多位专家将分享他们的见解,帮助我们理解如何通过精心设计的提示词,从生成式AI模型中获得更准确、更符合预期的输出。
什么是提示词工程?🤔
上一节我们介绍了课程概述,本节中我们来看看提示词工程的基本定义。
提示词工程本质上是一种编写优质或高效提示词的技术。模型将利用这些提示词来生成一致且突出的有效输出。
提示词工程是随着生成式AI在过去几年兴起而出现的术语。它指的是理解如何向大型语言模型发出提示,以获得你想要的回应。
核心公式:优质输出 = 有效的提示词工程 + 强大的生成式AI模型
核心技术与方法 🔧
理解了基本概念后,我们来看看实现有效提示词工程的具体技术与方法。
以下是几种关键的提示词工程技术:
-
零样本提示:这是目前人们使用ChatGPT等工具的典型方式,即直接要求模型做某事,不提供任何示例。
零样本 = 无示例 -
单样本提示:在提出请求时,提供一个格式示例,让模型按照该格式输出信息。
单样本 = 提供一个示例 -
少样本提示:提供两到三个示例。有趣的是,这些示例不一定需要内容正确,只需格式正确即可。你甚至可以用生成式AI根据已有格式创建更多示例,并添加到提示词中。
少样本 = 提供多个示例 -
思维链提示:要求模型分步骤执行任务。你先提供一个计划步骤,让模型“逐步思考”并执行。这有助于大型语言模型保持逻辑连贯性,尤其适用于处理复杂任务。
-
角色扮演:明确要求模型扮演特定角色,例如JavaScript专家、产品经理或小企业CEO。赋予模型越具体的角色,输出的质量通常越高。
实践技巧与参数 📝
掌握了基本方法,我们还需要了解一些实践中的技巧和可调节的参数,以进一步优化输出。
与模型交互时,我们可以使用多种参数。首先,应明确指定任务,清晰告知模型我们的需求,并提供相关背景信息。有时,我们可以提供一些示例(即少样本学习的概念),让模型了解我们期望的输出形式。
我们可以通过迭代反馈,让模型基于不同的提示词进行学习。通过微调,我们可以观察哪种方式效果更好,从而获得我们寻找的回应。
我们还可以通过参数控制模型的生成“创造力”或限制性。例如,温度、Top-K、Top-P等参数能使模型更具生成性,我们可以调整这些参数来控制输出。
关键点:提示词生成对于从你的提示中获得正确输出至关重要。这很简单:如果你问错了问题,就会得到错误的答案。这一点对人类同样适用,而对当前阶段的生成式AI模型来说尤其如此。
常用工具与平台 🛠️
了解了理论和技巧,接下来我们探索专家们常用的提示词工程工具有哪些。
以下是专家们提到的一些常见提示词工程工具和平台:
-
Watsonx Studio 提示词工程实验室:这是一个用于练习和开发特定应用有效提示词的优秀工具。
-
OpenAI 等网站:提供关于如何编写优质提示词的指南。
-
Microsoft Copilot:包含帮助用户编写提示词的功能。
你可以利用这些工具来辅助编写提示词,并预览可能获得的回应类型。
专家经验与建议 💡
最后,让我们听听专家们在实际应用中的经验与重要建议。
例如,一位专家分享道,他曾与ChatGPT合作,希望理解如何向它解释一个工作流程。他直接询问模型:“分析这个工作流程,我以什么格式提供信息对你最有利?”模型回复了一个建议的结构。当他按照该结构提供信息后,模型就能完美地进行字段匹配,完成他期望的各种复杂任务。
需要注意的是,像Llama 2这样的模型有特定的语法要求必须遵循。如果不正确遵循,效果会大打折扣。虽然模型仍然会输出结果,但我们的目标是以最少的试错、时间和资源消耗,获得我们想要的输出。
因此,提示词工程在当前极具价值,它相对容易学习,绝对是值得投入时间掌握的技能。
总结 📚
本节课中,我们一起学习了提示词工程在生成式AI中的关键作用。我们探讨了其定义、从零样本到思维链等多种核心技术、调节模型行为的参数、以及Watsonx Studio等实用工具。专家经验表明,清晰的指令、合适的格式和角色设定能显著提升输出质量。掌握提示词工程,是高效利用生成式AI、获得理想结果的重要一步。
024:文本到文本提示技术 📝
在本节课中,我们将学习如何通过文本提示技术来提升大型语言模型的可靠性与输出质量。我们将探讨多种核心提示技巧,并了解有效使用文本提示所带来的好处。
概述
近年来,自然语言处理领域因大型语言模型的应用而取得了显著进步。然而,随着LLM规模和复杂性的增加,关于其可靠性、安全性和潜在偏见的疑问也随之浮现。有效使用文本提示是解决这些问题的可行方案。文本提示是精心设计的指令,用于引导LLM的行为以生成期望的输出。生成内容的质量和相关性取决于提示的有效性以及LLM本身的能力。接下来,我们将探讨使文本提示更有效、并能提升LLM输出可靠性的各种技术。
核心提示技术
上一节我们介绍了文本提示的基本概念,本节中我们来看看几种具体的技术。
任务明确化
任务明确化技术要求文本提示向LLM清晰地传达目标,以提高回答的准确性。例如,提示“将这句英文翻译成法语”就是一个实现任务的明确指令。
上下文引导
上下文引导是一种技术,通过文本提示为LLM提供具体指令,以生成相关输出。例如,如果你想让模型生成一篇关于纽约市地标的短文,一个像“写一段关于纽约市的短文”这样的提示可能会产生一个笼统的回应。而一个更具体的提示,如“写一段关于纽约市的短文,重点介绍其标志性地标”,由于包含了上下文,将能生成更合适的输出。
领域专业知识
领域专业知识对于提高LLM的可靠性也至关重要。当你需要LLM在医学、法律或工程等专业领域生成内容,且准确性和精确性至关重要时,文本提示可以使用领域特定术语。例如,如果你想获取关于甲状腺功能减退症的医学信息,你的提示可以这样写:“请解释甲状腺功能减退症的病因、症状和治疗方法,包括最新研究和医学指南。”
偏见缓解
更多推荐

所有评论(0)