阅读主题
核心知识点:解释、练习与验收
优先级
- P0:主线必需,第一轮必须能解释并应用。
- P1:按场景学习,理解作用,项目需要时动手。
- P2:后续深入,不作为本轮完成条件。
1. 模型调用与能力边界|P0
大模型根据输入上下文生成输出,不是一个自动核实事实的数据库。流畅、自信的回答不代表正确。
应用开发要区分训练和推理:训练调整模型参数,日常接口调用主要是在使用已有模型进行推理。应用团队的许多优化发生在数据、上下文、工具和流程层面。
模型选型要基于自己的任务样例,比较质量、延迟、费用、上下文限制和工具支持,而不是只看通用排名。
练习:同一批提取任务使用两个不同配置,记录字段正确率、耗时和失败;若只可用一个模型,就比较不同提示词。
验收:能解释选择依据,并指出至少一种模型不适合独立判断的情形。
2. Token、上下文与生成参数|P0
Token 是模型处理文本的分片单位,与汉字或英文单词没有固定的一比一关系。上下文包括任务指令、用户输入、历史、检索资料和工具结果;具体可用输入与输出额度以接口规则为准。
长上下文不是无限记忆。内容变多可能增加费用和延迟,也可能让关键内容更难被利用。temperature 等参数会影响采样,但降低它不等于保证真实或让所有调用完全一致;有些模型不支持某些参数。
练习:在多轮任务中统计发送内容,移除无关历史,比较费用和效果。
验收:能回答“模型这次看到了什么”,并知道超过限制时怎样处理。
3. 提示词与上下文设计|P0
提示词应包含任务目标、必要背景、约束、输出要求和适量示例。上下文设计进一步决定哪些数据进入请求、顺序如何、如何保留来源以及什么时候更新。
把系统规则与用户资料分开组织。引用资料是待处理的数据,其中出现的“忽略规则”等文本不应成为授权。结构化包装能帮助区分,但不能单独构成安全保障。
练习:为模糊需求生成澄清问题,比较无示例和有示例的版本。
验收:能说明新增某段上下文的目的,并通过测试判断它是否有效。
4. 结构化输出与校验|P0
模型返回 JSON 或符合 schema,只说明结构满足一定要求,不代表字段内容真实或业务合法。TypeScript 类型在运行时不能自动验证外部数据。
需要分三层检查:格式是否可解析、类型和枚举是否符合约定、业务内容是否合理。例如日期是字符串,不代表该日期存在;商品编号有值,不代表数据库存在该商品。
练习:提取需求的目标、范围、待确认项和验收条件,加入缺字段、非法枚举、空数组的处理。
验收:不能把校验失败的结果静默传入下一步;能够向用户说明并允许修正。
5. Embedding 与检索|P1,知识库项目为 P0
Embedding 把内容转换成向量,便于比较语义相似程度。相似不等于事实一致,也不等于具备访问权限。
关键词检索适合精确词、编号和名称等匹配;向量检索有助于找语义相关内容。BM25 是一种常见的词项相关性排序方法,因此不应被笼统归为“没用”。前期理解作用即可,不必先推导公式。
混合检索结合不同召回方式;重排对候选结果进一步排序。是否加入,要由失败案例决定。
练习:分别查询一个精确错误码和一个口语化问题,比较关键词与语义检索的结果。
验收:能够解释哪种查询为什么失败,避免只靠增大返回条数解决所有问题。
6. RAG 完整链路|P1,知识库项目为 P0
典型流程:导入 → 清洗 → 切分 → 建索引 → 检索 → 可选重排 → 生成 → 展示来源。
切分需兼顾内容完整性和检索粒度。每段应保留文档标识、标题、位置、版本和权限信息。更新或删除原文时,要同步处理相关索引和缓存。
RAG 不能消除幻觉。错误可能来自原文、解析、切分、检索、过期内容,也可能来自模型未按证据回答。
访问控制要在返回内容给模型之前完成,不能先把无权限内容交给模型,再要求它不要透露。
练习:准备可回答、无答案、版本冲突、多段综合和越权查询。
验收:引用必须实际支持对应结论;无依据时不能把猜测包装成文档事实。
7. Workflow 与状态机|P0
Workflow 用明确的顺序、条件和分支组织任务,模型可以承担其中的一步。状态机用有限状态及转换规则描述任务进度,例如待处理、生成中、待确认、完成、失败和取消。
固定流程也可以包含动态数据、条件分支和重试。关键在于控制逻辑由应用明确管理。
练习:实现需求输入 → 校验 → 生成草稿 → 用户修改 → 确认导出的流程。
验收:刷新页面、重复点击和失败重试都不会让状态混乱或重复产生副作用。
8. 工具调用|P0
模型通常提出工具名和参数,应用验证后执行工具,再把结果返回给模型。模型本身不应获得任意接口调用权限。
工具设计要明确输入、输出、错误类型和副作用。工具返回“请求成功”不一定代表业务完成;需要明确的业务结果。
练习:提供一个只读查询工具和一个保存待办草稿的工具,服务端检查参数和用户权限。
验收:模型即使要求操作别人的资源,服务端仍然拒绝;重复调用不会产生重复记录。
9. Agent 与自主程度|P1
Agent 在反馈循环中选择行动:观察任务与结果 → 选择工具或下一步 → 执行 → 读取反馈 → 继续或结束。
适用于步骤难以事先确定的任务,但会增加不确定性、运行时间和错误传播。需要最大步骤数、时间或费用上限、停止条件和人工接管方式。
练习:让助手根据查询结果选择是否继续查另一个资料源,并设置明确上限。
验收:能解释为什么固定流程不够用;如果没有理由,就保留 Workflow。
多 Agent 不是默认必修。先验证一个助手的能力,只有明确需要角色隔离或并行工作且能评估收益时再研究。
10. MCP|P1
MCP 是连接 AI 应用与外部工具、资源等能力的一种协议。它有助于复用连接方式,但不替你完成授权、业务设计和效果验证。
需要区分调用方、服务器、暴露的工具以及它们的权限边界。了解基本工具调用后再学 MCP,更容易理解它解决的集成问题。
练习:画出一个外部工具连接的调用链,标注凭据、权限和用户数据经过的位置。
验收:能说明接入协议与允许执行某个业务操作是两件事。
11. 记忆与持久化|P1
会话历史、任务状态、用户偏好、文档知识是不同类型的数据,不应全部拼进提示词。长期保存的数据需要来源、作用范围、更新和删除规则。
练习:区分本次任务上下文与跨任务偏好,模拟用户更正旧偏好。
验收:不同用户不会串数据,旧信息能被更新,重要状态不只存在于聊天文本中。
12. 评测基础|P0
评测要从具体任务定义正确性,不能只有“感觉不错”。拆成格式、内容、来源、任务完成和交互等维度。
将日常开发样例和最终验收样例分开,防止只对熟悉问题优化。机器评分可以辅助,但也会犯错,需要人工抽检和明确评分标准。
练习:为一个任务写 0/1/2 分评分规则,两个人分别评同一批输出,讨论不一致的原因。
验收:能够复现一次对比,说明样本数、通过规则、错误分布和结论局限。
13. AI Coding|P0
工作链路:明确验收 → 收集代码上下文 → 分步修改 → 审查差异 → 运行验证 → 总结。
适合练习的任务包括理解陌生模块、实现小功能、定位错误、补必要测试、做受控重构。评价指标包括总耗时、返工和缺陷,而不仅是生成速度。
验收:能解释关键代码,知道验证覆盖了什么,出现错误能回退或修复。
14. 暂缓但不否定的知识|P2
- 数学与训练:线性代数、概率统计、梯度、优化、PyTorch、微调、训练基础设施。
- 模型原理:Transformer、注意力机制、分词与训练目标。
- 专项技术:传统 NLP、图像、语音、排序算法等,按业务需要深入。
先知道它们解决什么问题。若未来负责模型优化或相关专项,再单独制定路线。RAG 与微调也不是非此即彼:前者主要引入检索到的资料,后者调整模型行为;是否使用都需要实验依据。