第 3 课:让结果变好
本节目标:能诊断常见翻车原因,建立迭代习惯
一、六类翻车,对症下药
结果不理想时,先判断是哪一类问题,再针对性修。乱改一通往往越改越偏。
1. 回答太空泛
原因:提示词里缺你这个具体场景的信息,Claude 只能给通用答案。
修法:补受众、角色、约束。
✗ 写一封邮件说明项目延期。
✓ 给我们的企业客户写一封邮件,说明软件集成要延期两周。
他们此前一直很配合,但这已经是第二次延期了。
语气专业,同时要表达歉意。2. 太长或太短
原因:你没说长度,它只能猜。
修法:直接给量。「两段话总结」「控制在 100 字内」「我要详尽分析,长度不限」。
3. 格式不对
原因:它明白你要什么,但不知道你要怎么呈现。
修法:给范例,或明确描述结构。「每个部分用加粗小标题加要点列表」比 「格式清晰一点」有效得多。
4. 说得很有底气,但内容是错的
原因:模型偶尔会生成听起来合理但实际错误的内容,越是具体事实、越是冷门领域 越容易发生。
修法:
- 重要工作独立核实关键事实,不能只靠它的语气判断可信度
- 让它标注来源、或明确说出不确定的地方
- 打开联网搜索,让回答落在可查证的当前资料上
这条最值得记
「语气自信」和「内容正确」是两件毫不相干的事。把它当成一个知识渊博但偶尔记错的 同事——你会核对他给的关键数字,同样的标准用在这里。
5. 语气不对
原因:默认是「有帮助、专业」,未必匹配你的场景。
修法:用日常话描述。「说得更口语一点」「这段要显得权威、正式」。有你想要的 风格样本,直接贴进去。
6. 对话跑偏了,怎么拉都拉不回来
原因:前面的错误上下文一直在影响后续回答。
修法:开新对话,用更清晰的提示词重来。有时候重开比纠偏快。
二、迭代心态
第一版提示词很少产出完美结果,这不是你水平问题,是这类工作的固有形态。用得好的人 有三个共同点:
把初稿当起点。 看产出,明确指出哪里成立、哪里不成立,再改。不要指望一发命中。
反馈要具体。 「短一点」可以用,但「删掉前两段,结尾改成行动导向」好得多。 反馈越具体,第二版的命中率越高。
知道什么时候该重开。 见上面第 6 类。
三、AI Fluency 的 4D 框架
AI Fluency(AI 素养) 指的是有效协作的能力——不只是会点按钮,而是形成 「在什么情况下该怎么用」的判断力。
Ringling 艺术设计学院的 Rick Dakan 教授与科克大学的 Joseph Feller 教授合作提出了 4D 框架,四项能力组合起来决定你用 AI 的上限:
| 能力 | 含义 | 你在本课程哪里练到 |
|---|---|---|
| Delegation(委派) | 判断哪些活该人做、哪些该 AI 做、怎么分工 | 第 4 课的三种工作形态 |
| Description(描述) | 把需求准确传达给 AI | 第 2 课的三段式 |
| Discernment(辨识) | 批判性评估产出的质量、准确性、适用性 | 本课的六类诊断 |
| Diligence(尽责) | 负责任地用:保持透明、对 AI 协助的成果担责 | 本课的事实核实原则 |
四项里最容易被忽略的是 Diligence。用 AI 写的东西署你的名,出问题是你的责任—— 这不是道德说教,是实际后果。
Anthropic 有一门免费的 AI Fluency 课程深入讲这四项。
四、给自己的工作流做个评估
想知道 Claude 在你的工作里到底值多少,比读评测更靠谱的办法是自己测一遍。
为什么值得做:
- 找出 Claude 在你工作流里增益最大的环节,把精力投在那儿
- 对于重复性任务,建立起「它的输出能不能直接用」的信心边界
一个够用的做法:
- 找有标准答案的历史任务——你亲手做过、知道正确结果的那种
- 让 Claude 做同一件事,用你平时的提示词水平,不要刻意优化
- 对比差异:哪些它做得和你一样好?哪些差在细节?哪些完全不行?
- 记下来,形成你自己的「能放手 / 要复核 / 别用」三档清单
举个例子:数据分析
找一份你手工分析过的数据集,把原始文件给 Claude,让它做同样的分析。然后对比:
- 结论方向是否一致
- 它有没有发现你漏掉的模式
- 它有没有编造数据里不存在的东西(这条最关键)
跑三五个数据集,你对它在这类任务上的可靠度就有实感了,比任何人的推荐都准。
五、自查
- 上次结果不满意,属于六类里的哪一类?当时改对了吗?
- 我的工作里,哪件重复性任务值得做一次评估?
- 4D 里我最弱的是哪一项?
上一课 ← 第 2 课:你的第一次对话下一课 → 第 4 课:桌面端的三种工作形态
官方原文
本节对应 Anthropic 官方课程 Getting better results