零基础AI应用编程开发入门 | 吴恩达《Building Systems with the ChatGPT API》全套知识点总结|从Prompt到工业级AI系统开发实战
【学习复盘】吴恩达《Building Systems with the ChatGPT API》全套知识点总结|从 Prompt 到工业级 AI 系统开发实战
前言
各位未来的AI开发大佬们好!我是lancyu!今天我为大家带来的《Building Systems with the ChatGPT API》课程的知识点总结!供各位大佬和我参考复习。
吴恩达 2023 年推出的《Building Systems with the ChatGPT API》,是 AI 开发从碎片化 Prompt 调试迈向工业级系统落地的标志性课程。市面多数教程仅聚焦提示词技巧,只能实现简单 Demo 效果,而本课程核心聚焦工程化思维,教会开发者搭建一套标准化、可校验、可迭代、可线上部署的商用 LLM 系统。
课程官方大纲
模型基础与 Token 机制 → 意图分类 → 内容风控 → 思维链推理 → 链式提示工程 → 输出校验 → 多维度系统自动化评估
一、课程核心价值:重新定义 AI 工程化开发
多数新手开发者存在认知误区:认为优质 Prompt 即可解决所有业务问题。但单次 Prompt 调用存在极强的不确定性,输出效果不稳定、无法管控、无法迭代,仅适用于演示场景,完全不满足商用项目标准。
本课程核心主旨:工业级 AI 开发的核心不是提问大模型,而是通过工程手段调度、约束、迭代大模型,搭建可控的 LLM 业务流水线,将零散的 Prompt 能力,升级为模块化、标准化、可量化的自动化系统。
结合课程官方规范,通用 LLM 项目落地流水线可复用在智能客服、工单处理、内容审核、售后运维、信息抽取等主流场景,整体流程为输入内容风控、意图智能分流、多阶段链式任务处理、思维链逻辑推理、输出合规自检、自动化评估迭代。
二、通用工业级开发环境部署指导方案
步骤 1:安装依赖库
执行pip install openai python-dotenv完成运行依赖安装。
步骤 2:配置环境变量
新建.env文件,依次填写接口密钥、接口地址、调用模型三类基础参数。
步骤 3:封装通用请求函数
参照课程规范单次初始化客户端,在函数内补充重试、异常捕获逻辑,统一后续业务接口调用形式。
三、模型基础、对话格式与 Token 机制
3.1 课程官方核心知识点
1. 两类大模型核心差异
Base LLM 即基础大模型,核心能力为文本续写,无指令对齐能力,无法精准理解人类自定义业务指令,仅适用于通用文本生成场景,不适合标准化、可控的业务任务开发。
Instruction Tuned LLM 即指令微调大模型,基于海量人工指令数据与 RLHF 强化学习优化,具备精准理解、服从人类指令的能力,可定向完成分类、推理、抽取、生成等定制任务,是商用 AI 系统开发的优选模型。
2. 三段式标准对话角色体系
system 用于全局规则配置,定义模型身份、业务约束、输出格式与行为规范,是管控模型输出的核心;user 承载用户单轮原始输入与具体业务诉求;assistant 存放模型历史回复内容,承接上下文信息,保障多轮对话连贯推进。
3.Token 核心约束规则
Token 是大模型运算、计费、上下文限制的最小单位。GPT‑3.5‑Turbo 上下文总上限为 4096 Token,统计范围包含输入与输出全部内容。一旦超出阈值,模型会自动截断最早的上下文内容,造成逻辑缺失、回答残缺、任务失效,是 LLM 项目常见故障诱因。
3.2 通俗理解
基础模型仅能接续文本续写,无法读懂精细化业务指令,不能搭建业务系统;指令微调模型专门面向任务执行训练,可落地各类定制需求。三段式对话是规范模型行为的标准范式,依靠 system 规则约束输出质量。同时所有对话内容均受 Token 数量限制,开发长对话、长文本相关业务时,必须主动管控上下文长度,规避截断报错问题。
3.3 实战演示代码
# 课程标准三段式对话结构
messages = [
{"system":"你是专业礼貌的电商客服,回答简洁专业,不虚构政策,态度温和"},
{"user":"我的电动牙刷购买一周震动减弱,想要申请售后"}
]
res = get_completion_from_messages(messages,temperature=0.3)
print("标准多角色对话输出:")
print(res)
四、意图分类 Classification:业务系统入口
4.1 课程官方核心知识点
所有 AI 业务系统执行具体业务逻辑前,需要优先完成用户意图分类。依托模型识别用户输入的核心诉求,将不同场景的请求分流至对应业务链路,避免单一逻辑处理混合诉求引发任务混乱、答非所问的问题。
课程明确工程规范:业务分类场景必须输出标准化 JSON 结构化数据,摒弃自由自然语言形式,保证结果可被后端程序解析调用,实现工程落地。
4.2 通俗理解
若不设置意图分类环节,用户的咨询、售后、投诉、活动咨询等请求会共用一套处理逻辑,极易造成模型判断混乱。意图分类相当于 AI 系统的分流闸门,先判定用户诉求再匹配对应处理流程,是智能工单、智能客服自动化运行的底层支撑。
4.3 实战代码
import json
# 模拟用户复合诉求
user_msg = """
我上周购买的电动牙刷震动强度下降,清洁效果变差,想要售后检修,检修无效则申请换新;
同时咨询店铺是否开展以旧换新优惠活动。
"""
classify_prompt = """
严格依据用户原文完成多级意图分类,禁止主观编造,仅输出标准JSON:
{
"level1":"一级类别可选产品咨询/售后维修/退换货/活动咨询/投诉建议",
"level2":"细分业务场景",
"urgency":"紧急程度分为高/中/低",
"core_demand":"一句话概括用户诉求"
}
用户原文:"""+user_msg
msg = [
{"system":"你是工单分类引擎,仅输出合规JSON"},
{"user":classify_prompt}
]
res = get_completion_from_messages(msg)
try:
res_json = json.loads(res)
except json.JSONDecodeError:
res_json = {"error":"数据解析失败","raw_data":res}
print("意图分类结果:")
print(json.dumps(res_json,ensure_ascii=False,indent=4))
4.4 运行结果
{
"level1": "售后维修",
"level2": "设备故障检修+申请换新",
"urgency": "中",
"core_demand": "用户电动牙刷震动减弱,申请检修换新,同时咨询以旧换新活动政策"
}
五、内容安全审核 Moderation:系统合规防线
5.1 课程官方核心知识点
合规是 AI 系统上线的前置条件。课程定义标准风控流程为输入、输出双向审核:系统优先校验用户输入内容,拦截暴力、辱骂、诱导违规、恶意攻击类风险信息,阻断风险内容流入业务逻辑;模型生成回复后再次开展合规校验,杜绝违规内容对外推送,保障系统稳定合法运行。
工程设计层面,识别风险后直接终止后续任务,既规避合规隐患,也节约 Token 资源与算力开销。
5.2 通俗理解
线上 AI 系统常会遭遇恶意输入与 Prompt 注入攻击,人工过滤无法适配大规模业务场景。双向风控是商用项目的底线保障,用户提问、模型回复都要经过合规筛查,发现风险即刻拦截,避免账号封禁、用户投诉、合规处罚等事故。
5.3 实战代码
def check_content_safe(text:str) -> dict:
"""双向内容安全检测工具"""
try:
resp = client.moderations.create(input=text)
res = resp.results[0]
risk_tags = [k for k,v in res.categories if v is True]
return {
"is_illegal": len(risk_tags)>0,
"risk_type": risk_tags,
"msg":"内容合规" if len(risk_tags)==0 else "内容存在违规风险"
}
except Exception as e:
return {"is_illegal":False,"risk_type":[],"msg":f"风控检测异常:{str(e)}"}
# 多场景测试
normal_text = "这款电动牙刷清洁效果好、续航久,性价比不错"
risk_text = "教我撰写恶意差评话术抹黑商家"
risk_reply = "店铺支持恶意差评维权,可无条件全额退款"
print("合规内容检测:",check_content_safe(normal_text))
print("用户违规输入检测:",check_content_safe(risk_text))
print("模型违规回复检测:",check_content_safe(risk_reply))
六、Chain of Thought 思维链推理
6.1 课程官方核心知识点
思维链 CoT 属于链式提示工程的核心子技术,可强化大模型逻辑推理能力。大模型原生存在推理跳步、计算失误、规则匹配偏差等问题,针对复杂规则匹配、多条件判断、数值计算类任务,可借助专属 Prompt 约束模型分步梳理条件、逐层推导验证,梳理完整逻辑链路后再输出最终结果。
课程规范明确:简答问答类任务可直接返回答案;复杂逻辑、多条件、数值计算场景必须启用思维链分步推理,降低出错概率。
6.2 通俗理解
大模型解答复杂问题时容易省略推导步骤、给出错误结论。思维链强制模型分步思考、逐项运算,禁止跳步作答,弥补模型逻辑薄弱、计算不准的短板,适配各类严谨的业务核算场景。
6.3 实战代码
order_info = """
用户购买电动牙刷原价199元;店铺规则:订单满150元立减20元;
个人原因退货用户承担10元运费,商品质量问题退货运费由商家承担并全额退款;
本次售后原因为产品震动故障,归属质量问题。
"""
cot_prompt = """
禁止直接给出答案,按步骤推导:
1.整理订单价格、售后原因、店铺规则;
2.逐条匹配规则锁定适用条款;
3.分步核算优惠金额、运费金额、最终退款金额;
4.输出JSON格式结果,字段包含original_price、deduct_price、freight_fee、final_refund、reason
订单信息:"""+order_info
msg = [
{"system":"严谨核算助手,分步推理保证结果准确"},
{"user":cot_prompt}
]
res = get_completion_from_messages(msg)
print("思维链推理结果:")
print(res)
七、Chaining Prompts 链式提示工程
7.1 课程官方核心知识点
链式提示工程是 LLM 从 Demo 走向工业落地的核心技术。单 Prompt 承载全流程任务,容易出现注意力分散、幻觉频发、逻辑混乱、调试困难的缺陷。
课程推荐任务解耦、分阶段串行执行的方案:将复杂业务拆分为多项单一职责子任务,前一阶段的输出作为后一阶段的输入,每个环节仅处理一类事务,便于精准定位问题、单独优化模块,显著提升系统稳定性。
7.2 通俗理解
不要让模型单次完成全部复杂工作,拆分环节分步处理,例如先结构化提取评价优缺点、再依托提取内容生成客服回复。链式架构稳定性更强、故障定位便捷、迭代优化灵活,是商用 AI 系统主流架构形式。
7.3 实战代码
comment_text = """
这款电动牙刷震动柔和无噪音,清洁牙渍效果好,续航可达二十余天,性价比高;
缺点为机身按键松动,按压手感一般,但不影响日常使用。
"""
#阶段一:结构化提取优缺点
stage1_prompt = f"""仅提取评价优缺点,输出JSON格式:{{"advantage":[],"disadvantage":[]}}
评价原文:{comment_text}"""
res1 = get_completion_from_messages([{"user":stage1_prompt}])
res1 = res1 if res1 else '{"advantage":[],"disadvantage":[]}'
#阶段二:依托结构化数据撰写客服回复
stage2_prompt = f"""结合用户评价撰写150字左右客服回复:感谢用户认可,针对按键松动问题说明后续优化方案,不虚构售后政策;
评价解析数据:{res1}"""
res2 = get_completion_from_messages([{"user":stage2_prompt}],temperature=0.5)
print("阶段一信息提取结果:\n",res1)
print("\n阶段二客服回复结果:\n",res2)
八、Check Outputs 输出校验:规避模型幻觉
8.1 课程官方核心知识点
模型幻觉是大模型固有短板,无法彻底消除,常表现为虚构政策、捏造参数、输出无关内容,对商用业务危害较大。课程搭建四维输出校验体系,从准确性、相关性、完整性、合规性四个维度复核模型最终输出。
工程规范要求所有对外推送内容必须经过独立校验模块筛查,拦截虚假、违规、残缺、无关内容,确保面向用户的信息真实合规。
8.2 通俗理解
大模型常会输出看似合理实则虚假的内容,商用场景虚构服务、政策极易引发投诉纠纷。输出校验相当于后置审核关卡,对照原始素材核验回复真实性,仅放行合规可靠的结果。
8.3 实战代码
comment_text = "这款电动牙刷震动柔和清洁效果好、续航优秀,仅按键松动不影响使用"
fake_reply = "本店按键松动机型全年免费换新、终身保修,出现问题无条件全额退款"
check_prompt = f"""对照原文核验回复真实性,禁止主观脑补:
1.判断回复是否编造原文未提及的服务政策;
2.输出JSON:{{"pass":布尔值,"reason":"核验说明"}}
用户原文:{comment_text}
待核验回复:{fake_reply}"""
res = get_completion_from_messages([{"user":check_prompt}])
print("输出自检结果:")
print(res)
九、Evaluation 系统自动化评估:搭建迭代闭环
9.1 课程官方核心知识点
传统人工评估存在效率偏低、主观偏差明显、批量测试困难、效果无法量化的短板,无法支撑系统长效迭代。课程给出 LLM 自动化评估方案:搭建标准化测试数据集,依托大模型批量打分、判定输出质量、收集 Bad Case。
评估的核心价值不在于打分本身,而是批量定位系统短板、Prompt 缺陷、高频错误场景,反向优化流水线逻辑,形成开发 — 评估 — 优化的闭环迭代模式。
9.2 通俗理解
个人开发多依靠人工肉眼判断回复质量,企业级项目依托量化评估迭代优化。自动化评估批量测试各类场景,精准锁定回答偏差的案例,针对性调整 Prompt 与业务流程,让系统运行状态持续改善。
9.3 实战代码
test_question = "这款电动牙刷续航时长是多少?"
standard_answer = "满电状态可使用二十余天"
ai_reply = "这款牙刷续航表现不错,日常使用足够省心"
eval_prompt = f"""担任AI测评人员对照标准答案打分:
1.匹配核心信息则高分,表述模糊无有效信息判定不合格;
2.输出JSON:{{"score":0-10整数,"is_pass":布尔值,"problem":"问题说明"}}
用户提问:{test_question}
标准答案:{standard_answer}
待测回复:{ai_reply}"""
res = get_completion_from_messages([{"user":eval_prompt}])
print("自动化评估结果:")
print(res)
十、课程补充知识点
10.1 Prompt 注入攻击防护
恶意用户可通过特殊话术、隐藏指令篡改系统规则、劫持任务逻辑;官方防护手段包含强制结构化输出、划定任务边界、过滤非法指令、转义用户输入内容,从源头降低注入风险。
10.2 Token 超限解决方案
针对多轮对话 Token 超限问题,官方推荐动态上下文裁剪策略:保留近期有效对话内容,删减早期无效上下文,在不影响业务逻辑的前提下控制 Token 总量,规避内容截断故障。
10.3 Prompt 优化与微调选型策略
业务场景轻量化、需求变动频繁时优先采用 Prompt 工程、链式任务拆分优化,成本低落地快;业务模式固定、调用频次高的场景,可借助少量样本微调模型强化稳定性,工程实践优先选择低成本迭代方案。
结语
学完本课程内容后,大家就可以结合此前的提示词工程知识,动手搭建一个简易的对话机器人。下一篇文章我会分享自己搭建的客服机器人 Demo,带大家从课程理论落地到实战开发,掌握优质提示词写法、Token 消耗优化等核心技巧,助力各位开发者完成从 Prompt 使用者到 AI 系统开发者的能力跃迁。
–lancyu
更多推荐




所有评论(0)