Do as Pro:当外行借助 AI 进入陌生领域

一个做得很漂亮、却明显做错了的眼球

我曾看到一个借助 AI 制作的交互式解剖网站:Anatomy Atelier

An image to describe post

从产品完成度看,它相当吸引人:柔和的视觉风格、精致的卡片布局、可以旋转和缩放的三维器官,还有显微结构、疾病列表和功能动画。只看界面,它已经很像一款正式上线的解剖学习产品。

但网站里的眼球模型存在一个非常明显的问题:正常的虹膜和瞳孔之外,眼球侧面又出现了一个黑色圆形结构,看起来像长出了第二个瞳孔;眼外肌、眼球后部组织和视神经之间的关系也存在明显异常。

这不是某个有争议的医学细节,也不是为了视觉效果进行的合理简化,而是对象的基本解剖结构出了问题。

奇怪之处也正在这里。

现代 AI 通常能够正确说明瞳孔、虹膜、角膜、巩膜、视网膜、视神经和眼外肌之间的基本关系。只要直接问它“正常眼球的外部结构是什么”“瞳孔是否可能出现在巩膜侧面”,它大概率不会给出网站中的错误答案。

AI似乎知道正确知识,却仍然帮助人做出了明显错误的成果。

问题出在哪里?

一个可能的解释是:制作者擅长使用 AI 做设计和开发,却并不熟悉解剖学。他不知道眼球模型还需要哪些专业检查,也不知道什么地方最容易错。面对一个完成度很高、视觉上相当顺眼的结果,他没有足够的知识判断它是否正确。

这是一种典型的处境:

用户不知道自己不知道什么,也不知道什么才算正确。

Do as Pro 这个 skill,就是从这个问题开始的。


一、AI让外行获得了前所未有的执行能力

过去,要做出这样一个解剖学网站,通常需要多个角色协作:

  • 产品设计;
  • 视觉设计;
  • 前端开发;
  • 三维建模;
  • 动画制作;
  • 医学内容编写;
  • 专业审核。

AI大幅降低了这些能力的获取成本。一个人可以在很短时间内跨越多个专业边界,完成过去需要一个小团队才能完成的作品。

这当然是一种进步。

但它也制造了一种新的不对称:

一个人获得了远超自身专业判断能力的执行能力。

他可以制作一个医学网站,却未必能判断医学内容是否正确;可以生成一份财务模型,却不知道哪些数字关系必须成立;可以写出一份合同,却不清楚某个条款在现实中会造成什么后果;可以设计一座建筑的概念方案,却不知道哪些结构和安全条件不能靠视觉合理性判断。

AI缩短了“不会做”到“做出来”的距离,却没有自动缩短“做出来”到“做正确”的距离。

而且,成果越完整、越流畅、越漂亮,使用者越容易误以为它已经接近专业质量。


二、问题不只是 AI 会犯错

面对这种情况,人们通常会说:

AI不可靠,必须由人检查。

这句话没有错,但很快就会遇到另一个问题:

由谁检查?

如果使用者自己就是外行,他可能同时面临三种困难:

  1. 我不知道这件事专业上应该怎样做;
  2. 我不知道结果可能错在哪里;
  3. 我不知道 AI 的判断是否可靠。

要求外行“仔细检查 AI 输出”,有时就像要求一个不懂解剖的人检查眼球模型的解剖准确性。认真并不能自动补上缺失的知识。

找真人专家当然是一个办法,但并非每项任务都值得、能够或需要在全过程中聘请专家。很多低风险或中等风险任务,用户真正需要的,是一种更系统的 AI 使用方式:

  • 让 AI 主动调用相关专业知识;
  • 让专业标准在执行前变得可见;
  • 让 AI 主动寻找外行难以发现的错误;
  • 让关键判断能够被外部事实、对照或实验检验;
  • 在超出可靠边界时及时停止。

这就是 Do as Pro 想解决的问题。


三、许多“未知”,其实只是用户未知

陌生领域中确实存在真正未知的事情,例如尚未发生的结果、未公开数据、现场条件或需要实验才能确认的效果。

但还有一大类情况是:

用户不知道,AI可能知道。

例如,一个外行准备制作眼球解剖模型时,可能不知道应该检查:

  • 瞳孔与虹膜的位置关系;
  • 角膜和巩膜怎样连接;
  • 视神经从眼球什么位置离开;
  • 六条眼外肌分别怎样附着;
  • 外部模型、剖面模型与文字说明是否一致;
  • 教学模型可以省略什么,又绝不能省略什么;
  • 哪些权威图谱可以用作参照。

这些问题并非没有答案。用户只是没有意识到需要提出它们。

AI通常掌握这些领域中的概念、方法、常见结构和典型错误。但当用户只说“帮我做一个漂亮的解剖网站”时,AI往往会优先满足表面的生成目标:

  • 页面是否美观;
  • 模型是否有吸引力;
  • 交互是否流畅;
  • 功能是否丰富;
  • 作品是否完整。

它未必主动把任务提升为:

制作一个具有基本解剖准确性、可以用于学习的医学教育产品。

前一种任务主要受设计和开发标准约束,后一种任务则必须首先受解剖学事实约束。

如果没有完成这个转换,AI就可能返回一种模糊的“平均解”:既像产品设计,又像网页开发,也带有一些科普内容,却没有任何一个专业领域的核心标准真正成为硬约束。


四、AI辅助的专业重构

因此,Do as Pro 的第一个核心概念不是“生成”,而是:

需求发现与专业重构

所谓专业重构,是让 AI 把用户用日常语言描述的现实目标,转换成专业领域中可以执行、检查和验收的任务。

它大致包含以下转换:

自然目标
→ 专业任务类型
→ 核心问题与支持问题
→ 适用方法
→ 必需证据
→ 质量标准
→ 风险与停止条件

例如,用户说:

我想做一个可以旋转查看人体器官的网站。

经过专业重构后,任务可能被改写为:

制作一款面向普通学习者的交互式人体解剖教学产品。核心要求是:简化后的模型仍应保持基本解剖准确性;主要结构需要依据可靠图谱进行对照;视觉效果和交互体验属于支持要求,不得以牺牲结构正确性为代价。

这一步看似只是换了一种说法,实际上改变了整个任务的优先级。

如果目标只是艺术化展示,模型外形有一定自由度。

如果目标是解剖教学,那么结构错误属于阻断级缺陷:即使页面已经很漂亮,也不能被视为完成。

专业重构还需要主动区分相邻但不同的任务。例如:

  • 是艺术创作,还是教学演示?
  • 是面向儿童的启蒙模型,还是面向医学生的学习工具?
  • 是只表现器官外形,还是支持内部剖面和层次关系?
  • 是概念性示意,还是要求用于正式课程?
  • 是产品原型,还是准备公开发布的教育内容?

AI不能简单地把所有可能性列出来,让外行自己判断。它应根据现有情境提出当前最可能的专业模型,说明理由,再询问少数真正会改变方案的问题。


五、为什么这最终会成为一个科学哲学问题

做到这里,仍然没有解决最困难的问题:

当我进入一个自己不熟悉的领域时,我怎样判断最终结果是正确的?

如果我知道正确答案,自然可以直接检查。

如果我不知道答案,但知道应该去查什么,也可以查阅资料。

真正困难的是:

  • 我不知道自己遗漏了什么;
  • 我不知道 AI 给出的专业框架是否选对;
  • 我知道自己不懂,却无法独立判断哪个解释更可信;
  • 多个答案看起来都合理,我不知道应该相信哪一个。

这时,问题已经不只是工作流程设计,而进入了一个更基础的认识论问题:

人在缺乏直接知识时,凭什么接受一个判断为真,或者至少认为它足够可靠?

这正是科学哲学长期处理的问题。

科学家研究人类尚未充分理解的领域时,也面临类似处境。他们并没有一本已经写好答案的教材,可以在实验结束后逐项对照。科学研究的对象,恰恰是尚未确定的东西。

科学家无法依靠“我知道正确答案”来检查结果,只能建立一套减少错误、暴露假设、接受反驳和持续修正的方法。

当普通用户借助 AI 进入自己的未知领域时,他与科学家进入人类未知领域之间,存在一种结构上的相似:

科学研究 外行借助 AI 做专业任务
人类尚不知道答案 用户个人不知道答案
需要提出问题模型 需要完成专业重构
需要构造解释或假设 需要形成方案和关键假设
需要寻找可观察证据 需要外部事实、样本或测试
需要排除替代解释 需要反方审查和对照
结果随新证据更新 规格和成果随验证修订
结论始终可能被修正 AI输出不能被视为最终权威

两者的知识边界不同:科学家面对的是人类整体的未知,用户面对的只是自己的未知。但在“我不知道答案时,怎样形成可靠判断”这个层面,它们面对的是同一类认识论困难。

因此,把科学研究方法引入 AI 辅助专业工作,并不是一种修辞上的类比,而是一种合理的方法迁移。


六、科学方法提供的不是标准答案,而是纠错机制

科学方法的价值,不在于它能保证第一次就得到正确答案。

它提供的是一种更可靠的纠错结构:

  1. 明确当前观察到了什么;
  2. 提出一个可以说明现象的解释;
  3. 说明这个解释依赖哪些假设;
  4. 推导如果解释成立,应观察到什么结果;
  5. 寻找可能推翻解释的证据;
  6. 与其他解释进行比较;
  7. 根据新证据修改可信程度。

这可以直接用于 AI 输出。

例如,AI提出:

增加眼球剖面模式,能够提高普通学习者对内部结构的理解。

如果停在这里,它只是一个听起来合理的设计建议。

按照科学方法,可以继续改写:

假设

带有剖面模式的三维眼球模型,比只展示外观的模型更有助于学习者理解晶状体、视网膜和视神经之间的位置关系。

当前依据

  • 这些结构无法从完整外观模型直接观察;
  • 剖面图是解剖教学中常见的表现形式;
  • 空间关系需要同时看到外部方向与内部结构。

可观察预测

使用剖面模型的学习者,应在结构定位测试中表现出:

  • 更高的正确率;
  • 更少的位置混淆;
  • 更准确的前后方向判断。

最小验证

让少量目标用户分别使用普通模型和带剖面的模型,完成相同的结构定位任务。

反驳条件

如果剖面模式没有改善定位结果,或者明显增加理解负担,那么原有设计假设就需要修改。

此时,AI不只是给出一个答案,还给出了:

  • 为什么这样判断;
  • 什么证据支持它;
  • 怎样检验它;
  • 什么结果会使它失效。

这才是科学方法在 Do as Pro 中的真正作用。


七、从“证明正确”转向“尽量排除错误”

当人不熟悉一个领域时,很难直接证明一个复杂成果完全正确。

但通常可以逐步排除明显错误。

以眼球模型为例,用户未必能从头重建完整的眼球解剖知识,却可以执行以下检查:

  • 与多份可靠解剖图谱并排比较;
  • 检查不同来源是否对主要结构关系一致;
  • 让 AI 列出正常眼球必须满足的结构约束;
  • 要求另一个独立检查过程主动寻找异常;
  • 检查模型的外观、剖面和文字是否自洽;
  • 对异常结构要求给出解剖名称和来源;
  • 无法解释的结构不得默认为正确。

这个过程不能证明模型绝无错误,但能大幅降低“第二个瞳孔”这类明显错误通过的概率。

这与科学研究中的可错论很接近:

结论可以暂时被接受,但始终保留被新证据修正的可能。

因此,Do as Pro 不把结果简单分成“绝对正确”和“错误”,而更关注:

  • 当前结论由什么证据支持;
  • 哪些部分已经可靠确认;
  • 哪些只是合理推断;
  • 哪些依赖未经验证的假设;
  • 哪些反例尚未排除;
  • 什么新信息会改变结论。

八、不是所有问题都用实验解决

科学方法并不意味着每件事都要设计随机对照实验。

不同问题有不同的验证方式。

问题类型 适合的验证方式
解剖结构是否正确 权威图谱、教材和多来源对照
数学计算是否正确 推导、复算、程序测试
是否符合规范 法规、标准、合同或专业规则
某项设计是否更好用 用户测试、对照和行为数据
某种工程方案能否运行 原型、仿真、压力测试
某项历史判断是否成立 原始史料、时间线和来源分析
某项策略是否值得采用 情景分析、小规模执行和反馈
价值上应选择什么 明确目标、偏好、代价和责任

“眼球侧面能否再有一个瞳孔”不需要做实验,可靠的解剖知识已经足以否定它。

“哪种交互方式更能帮助学习者理解眼球结构”则不能只靠教材回答,需要测试实际使用效果。

“产品应该追求更高准确性,还是更低学习门槛”还包含价值取舍,证据可以帮助说明后果,却不能替用户决定目标。

专业重构的一项重要工作,就是先识别当前问题属于哪一种类型,再选择相应的验证方法。


九、从软件工程借鉴,但不照搬软件工程

Do as Pro 的形成也受到软件工程启发。

如果把 program 还原为“为了达到一个结果而安排的一组行动”,那么借助 AI 完成专业任务,本身就像是在设计和执行一个程序:

  • 需求可能不完整;
  • 执行者可能误解要求;
  • 局部修改可能破坏其他部分;
  • 外部依赖可能失效;
  • 输出需要测试;
  • 错误需要定位;
  • 最终成果需要经过交付判断。

因此,Do as Pro 借鉴了软件工程中的一些方法:

  • 需求和实现分离;
  • 明确输入、输出与权限;
  • 单一职责;
  • 依赖与影响分析;
  • 版本管理;
  • 缺陷记录;
  • 分层测试;
  • 回归检查;
  • 故障隔离;
  • 最小范围修改。

但它不能直接照搬传统软件开发流程,因为在陌生领域中,用户往往无法预先写出完整而正确的需求。

用户甚至不知道解剖模型应当通过哪些检查,也不知道哪些结构不可省略。若要求用户在一开始完成一份完整需求说明,只会把他最初的不完整理解形式化。

因此,Do as Pro 采用渐进明确的方式:

形成当前最合理的任务模型
→ 完成一个小而真实的增量
→ 检查和接触现实
→ 暴露新的未知
→ 更新任务模型
→ 继续下一轮

迭代的不只是成果,也包括对问题本身的理解。


十、用奥卡姆剃刀避免 AI 防御性膨胀

让 AI 更谨慎,很容易导致另一种问题:流程无限增长。

AI可能不断增加:

  • 更多专家角色;
  • 更多检查层;
  • 更多风险分支;
  • 更多候选方案;
  • 更多免责声明;
  • 更多“以防万一”的步骤。

最后得到的流程看起来严谨,却很难真正执行。

Do as Pro 因此引入奥卡姆剃刀:

在满足目标、约束和实质风险的条件下,不增加没有明确必要性的步骤、角色和检查。

任何新增步骤都需要回答:

  1. 它要防止什么具体错误?
  2. 现有步骤为什么不能发现它?
  3. 这个错误的概率或后果是否值得增加复杂度?
  4. 怎样判断新增步骤已经完成?
  5. 它减少的风险是否大于带来的成本?

复杂度应由已经发现的风险和知识缺口触发,而不是由 AI 能够想象出的所有危险触发。

科学方法本身也需要遵守这一点。不是收集的数据越多越科学,也不是实验越复杂越可信。

一个好的最小验证,应当集中处理:

哪一个未知一旦得到答案,最可能改变当前决定?


十一、用公理化设计减少阶段耦合

任务定义、执行、检查和修订如果混在一个步骤中,很容易发生自我确认:

  • AI先生成结果;
  • 发现结果不符合标准;
  • 于是悄悄调整标准;
  • 再按照新标准宣布结果合格。

因此,Do as Pro 尽量让不同阶段承担独立职责:

  • 专业重构负责定义问题;
  • 规格形成负责明确方法和验收标准;
  • 执行负责制作成果;
  • 内部检查负责发现缺陷;
  • 外部校准负责与现实比较;
  • 科学检验负责处理经验性未知;
  • 修订负责修复已经确认的问题;
  • 交付判断负责决定剩余风险是否可接受。

检查阶段不能直接重写成果,修订阶段不能自行修改任务目标,执行阶段也不能宣布自己的结果已经通过。

发现上游问题时,应明确返回上游,而不是在下游不断打补丁。


十二、Do as Pro 的完整过程

目前,这个方法被整理成以下步骤。

1. 自然目标输入

用户只需说明:

  • 想完成什么;
  • 为什么做;
  • 给谁使用;
  • 有哪些现实限制;
  • 哪些后果不可接受。

不要求用户先掌握专业术语。

2. AI辅助专业重构

AI主动识别:

  • 所属领域和子领域;
  • 当前最可能的专业任务类型;
  • 核心问题和支持问题;
  • 适用方法;
  • 不可省略的专业维度;
  • 外行容易忽略的风险。

3. 高信息量交互

AI只询问那些会实质改变任务类型、方法、风险或交付方式的问题。

低影响缺口采用明确的暂定值,并说明影响。

4. 形成当前专业规格

规格包括:

  • 现实目标;
  • 专业任务类型;
  • 方法;
  • 必需内容;
  • 质量标准;
  • 证据要求;
  • 假设;
  • 未知;
  • 风险;
  • 验收与停止条件。

5. 选择最小可验证增量

不立即生成完整成果,而是先完成最容易暴露专业错误的部分。

对于解剖网站,可以先制作并验证一个眼球模型,而不是一次生成所有器官。

6. 分解与执行

每一步明确:

  • 输入;
  • 输出;
  • 前置条件;
  • 验收标准;
  • 可修改范围;
  • 失败处理方式。

事实、假设、推断、估计、偏好和未知需要分开表达。

7. 内部检查

检查:

  • 事实;
  • 计算;
  • 引用;
  • 逻辑;
  • 跨部分一致性;
  • 是否满足当前规格;
  • 结论是否超过证据范围。

8. 外部现实校准

将成果与以下内容比较:

  • 客观事实;
  • 强制规则;
  • 权威资料;
  • 同类公开成果;
  • 常见范围;
  • 基本常识;
  • 实际使用结果。

显著偏离必须有解释和证据。

9. 假设与科学检验

对仍不能确定的重要判断:

  • 明确假设;
  • 列出当前依据;
  • 推导可观察预测;
  • 设计最小验证;
  • 规定反驳条件;
  • 根据结果更新判断。

10. 专业模型复查

检查的不只是成果有没有按规格做对,还要检查:

规格本身是否选对了专业任务。

如果模型错误,应返回专业重构,而不是继续局部修补。

11. 定向修订与交付

只修改受影响部分,并进行必要的回归检查。

最终说明:

  • 哪些内容已经确认;
  • 哪些仍是假设;
  • 哪些未知尚未解决;
  • 结论适用于什么范围;
  • 什么条件会使它失效;
  • 是否需要真人专家接管。

十三、它是怎样实现的

Do as Pro 被实现为一个独立、自包含的 AI skill。

它不依赖其他 skill,也不要求某个固定的外部工作流。核心文件本身包含完整的运行规则、状态和最小模板。

内部主要使用以下状态:

INTAKE
→ PROFESSIONAL_REFRAMING
→ CONTEXT_RESOLUTION
→ SPECIFICATION
→ MODEL_VALIDATION
→ INCREMENT_PLANNING
→ EXECUTION
→ INTERNAL_REVIEW
→ EXTERNAL_CALIBRATION
→ HYPOTHESIS_TESTING
→ MODEL_REVIEW
→ REVISION
→ DELIVERY

每个状态都规定:

  • 可以读取什么;
  • 可以修改什么;
  • 必须输出什么;
  • 什么时候进入;
  • 什么时候退出;
  • 什么情况下返回上游;
  • 什么情况下必须停止。

它还区分多种信息类型:

  • Fact:可验证事实;
  • Source:事实依据;
  • Assumption:暂定前提;
  • Hypothesis:需要检验的解释或预测;
  • Inference:从证据得出的推断;
  • Estimate:带方法和范围的估计;
  • Preference:用户的价值选择;
  • Risk:可能造成不良后果的条件;
  • Unknown:当前无法确认的事项。

不同错误采用不同处理方式:

执行错误
→ 局部修订

规格遗漏
→ 更新规格并重做受影响部分

专业模型错误
→ 返回专业重构

经验性未知
→ 设计检验并根据结果更新

它还提供规格表、假设表、缺陷表、偏离表、实验记录和修订记录,但这些模板不是必须全部使用。是否启用取决于任务规模和风险。

目标始终是最小充分,而不是流程完整本身。


十四、它不承诺让外行变成专家

Do as Pro 并不试图让使用者假装成专家,也不能替代医学、法律、工程等领域的执业责任。

它追求的是:

让外行在 AI 帮助下,按照更接近专业工作和科学研究的方式处理未知。

这意味着:

  • 让 AI 先帮助选对问题;
  • 把专业标准变成可见的要求;
  • 把隐含判断变成明确假设;
  • 主动寻找可能的反例和失败条件;
  • 根据问题类型选择验证方式;
  • 让结论能够随证据修正;
  • 在超出可靠边界时停止。

专家工作的价值,不只在于知道很多答案,也在于知道:

  • 问题应该怎样描述;
  • 哪些因素真正重要;
  • 什么证据足以支持当前判断;
  • 什么结果会推翻这个判断;
  • 什么时候可以行动;
  • 什么时候还不能下结论。

科学家的价值也不在于面对未知时从不犯错,而在于建立了一套能够持续发现错误、修正错误的方法。

Do as Pro 希望把这两类能力的一部分,转化成普通用户也可以借助 AI 执行的过程。


结语

那个错误的眼球模型给我的启发,并不是“不要用 AI 做专业内容”。

恰恰相反,AI已经让一个人能够完成过去需要设计、开发、建模和内容团队共同完成的作品。真正的问题是,我们经常只使用了 AI 的生成能力,却没有充分使用它的专业知识、批判能力和验证设计能力。

AI可以帮我们画出一个眼球,也可以告诉我们一个正常眼球必须满足哪些结构约束;可以帮我们生成一个完整网站,也可以提前指出一个解剖教学产品必须经过哪些检查;可以给出一个专业判断,也可以说明这个判断依赖什么假设、怎样验证、什么证据会推翻它。

当一个人进入自己的未知领域时,他与科学家进入人类未知领域的处境并不完全相同,却面临相似的认识论问题:

在我不知道答案时,怎样避免把一个流畅、漂亮、似乎合理的结果误认为正确?

Do as Pro 给出的回答,不是寻找一个永远正确的 AI,而是建立一个更可靠的过程:

让 AI 帮助用户重构专业问题,显性化标准与假设,主动寻找错误,再通过事实、对照、计算、实验和现实反馈持续校正结果。

它追求的不是让成果看起来像专家完成的。

而是让事情尽可能按照专业方式和科学精神,被提出、被执行、被检验,也被修正。