阅读主题
学习与验收记录
所有复选框初始为空,表示尚未完成。复制模板记录真实证据,不把计划写成成果。
1. 周进度
- [ ] 第 1 周:三张拆解卡与一次 AI 辅助代码改动。
- [ ] 第 2 周:六张拆解卡,以及 Workflow、RAG、只读 Agent 三项工具小实验。
- [ ] 第 3 周:需求说明、目标用户、20 条样例与业务拆解表。
- [ ] 第 4 周:四张设计卡、简单基线与模型方案对比,作出继续或调整决定。
- [ ] 第 5 周:完整可操作的第一版。
- [ ] 第 6 周:上下文、取消、失败与任务保存。
- [ ] 第 7 周:外部知识实验与来源验证。
- [ ] 第 8 周:约 50 条样例及独立验收记录。
- [ ] 第 9 周:工具调用、参数、授权与流程。
- [ ] 第 10 周:幂等、失败恢复与是否需要 Agent 的判断。
- [ ] 第 11 周:日志、费用、部署与关键测试。
- [ ] 第 12 周:用户试用、修复、演示和复盘。
2. 每周复盘模板
markdown
### 第 __ 周:____
- 日期:
- 本周目标:
- 实际投入时间:
- 可检查的成果链接或文件:
- 我现在能独立解释/完成什么:
- 遇到的关键失败:
- 原因与验证证据:
- 验收是否通过,未通过部分:
- 下周保留、删除和新增的任务:3. 产品拆解卡模板
markdown
### 功能名称:____
- 目标用户与使用时机:
- 当前处理流程:
- AI 承担的具体步骤:
- 输入与输出:
- 资料来源、权限与所需接口:
- 最简单的非 AI 方案:
- 候选 AI 方案及选择理由:
- 常见错误与人工处理:
- 价值指标与验证办法:
- 仍未验证的假设:4. 实验记录模板
markdown
### 实验:____
- 问题与假设:
- 日期、模型和配置:
- 提示词、代码及资料版本:
- 样例数量与来源:
- 对照方案:
- 本次只改变的因素:
- 评分标准与评分人/工具:
- 通过情况与失败分类:
- 耗时、用量与费用:
- 结论与不确定性:
- 下一步:尽量一次改变一个主要因素;需要组合修改时明确记录,避免把改进错误归因给某一项技术。
5. 评测样例模板
| 字段 | 内容 |
|---|---|
| 样例 ID | 唯一编号 |
| 类别 | 正常、模糊、缺信息、冲突、越权等 |
| 输入 | 真实或标明模拟的输入 |
| 可用资料 | 来源与版本 |
| 必须满足 | 明确的正确性条件 |
| 不得出现 | 编造事实、越权或其他失败 |
| 实际输出 | 原始结果或受控保存位置 |
| 评分与理由 | 按既定规则记录 |
| 失败归因 | 数据、检索、生成、校验、工具或交互 |
6. 方案决策模板
markdown
### 决策:是否引入 ____
- 当前问题和证据:
- 最简单的替代方案:
- 候选方案:
- 对质量、耗时、费用和维护的影响:
- 小规模验证结果:
- 决定与理由:
- 什么情况下重新评估:7. 自测问题
- [ ] 我能解释一个 AI 功能为什么值得做,以及什么时候不值得做。
- [ ] 我能区分 RAG、Workflow、Agent 和 AI Coding。
- [ ] 我能区分应用方法与具体工具,并用现成工具完成小实验。
- [ ] 我能把业务步骤映射到规则、模型、检索、工具调用或人工处理。
- [ ] 我能分别写出 Prompt、Context、Workflow 和 Agent 的设计约定。
- [ ] 我能说明模型每次调用看到了什么上下文。
- [ ] 我知道结构化输出为什么仍然需要业务校验。
- [ ] 我能定位回答错误来自资料、检索还是生成。
- [ ] 我能画出工具调用链并指出权限在哪里检查。
- [ ] 我能处理超时后可能已经执行成功的情况。
- [ ] 我能说明评测样本、规则、结果与局限。
- [ ] 我能估算一次完整任务的费用并限制无限执行。
- [ ] 我能解释所有关键代码,独立验证 AI 生成的改动。
- [ ] 别人可以按文档运行我的项目。
- [ ] 我有真实反馈,并据此修改过产品。
- [ ] 我能把经审核的失败案例加入评测,再验证修改没有破坏原有能力。
8. 面向长期能力的月度复盘
每月只回答三件事:我现在能接住哪种以前接不住的需求;哪些结果有证据;下个月最值得补的一个短板是什么。
是否“跟上 AI”不以收藏了多少课程、安装了多少工具衡量。以判断、实现、验证和交付能力的实际变化衡量。