本文来自微信公众号: 穆宁Morning ,作者:穆宁
你可能正在经历这种场景。
一个任务丢给AI。
帮我把这份材料整理成方案。
几秒钟之后,一份结构完整、语气专业、甚至还带着风险提示的东西出现了。
然后你开始改。
改标题,改口径,改那些不符合业务的细节,补上AI没看见的背景,再重新解释一遍你到底想要什么。
改到最后,你突然发现,自己不是省了时间。
只是把原来一次做完的工作,拆成了三次返工。
这就很烦。
导读
01 AI不是平均分配的,强也会翻车
02任务不是一类,别把一整件事一次性丢给AI
03给自己做一张人机分工表,再跑一周试点

大家好,我是穆宁。
现在我们用AI,和以前的模式不一样了。
我们以前担心AI不够强,什么都做不了。
现在很多人遇到的麻烦刚好反过来,AI已经足够强,强到你如果不先分清楚任务,整条工作流都会变得乱七八糟。
这篇不讲怎么写一条神奇的skill。
我想聊的是更基础、也更有用的一件事,什么活交给AI,什么活必须人来做,什么活要人和AI来回几轮才能做成。
AI确实能提效,但它不是平均分配的
先把一个常见误会拿掉。
人机分工不是因为AI没用,恰恰是因为AI在很多场景里真的有用。
NBER的一项研究跟踪了5,179名客服坐席。使用生成式AI助手之后,他们每小时解决的问题数量平均提高了14%。其中,新手和低技能坐席的提升达到34%,而经验丰富的坐席变化相对小得多。
这个结果很有价值。
它说明AI不只是替人打字,也不只是帮人润色。它可以把一部分优秀员工的处理方法,快速传给经验不足的人。
对于一个团队来说,这可能是培训、交接和标准化的一次提速。
但你再看另一项研究,感觉就不一样了。
哈佛商学院和波士顿咨询集团找了758名顾问,让他们完成创意、分析、写作和说服类任务。处在AI能力边界之内的任务,使用AI的顾问完成速度、任务数量和质量都有明显提升。
问题在后半句。
这条边界不是一堵清清楚楚的墙,而是一条锯齿线。
某个任务AI做得特别好,旁边另一个看上去差不多的任务,AI可能就开始漏掉关键条件。研究总结中提到,在能力边界之外,使用AI的参与者表现比不用AI的对照组低了19个百分点。
也就是说,AI不是一个稳定的初级员工。
它更像一个能力分布很奇怪的同事,写得像专家的地方,可能真的很强;
看起来很简单的地方,也可能突然把最重要的一步省掉。

还有一个更麻烦的事实。
OpenAI发布的SimpleQA是一个专门测试短答案事实性的基准,包含4,326道只有一个明确答案的问题。公开结果里,GPT-4o在这套题上的正确率低于40%。这个测试不能代表所有长文任务,但它提醒了我们,模型说话的自信程度,和答案的准确程度不是一回事。
一段话写得很像答案,不等于它已经通过了事实检查。
这也是为什么Air Canada的聊天机器人案例到现在还值得被反复提起。
2022年11月,一位加拿大乘客因为家人去世,向Air Canada官网聊天机器人询问丧亲票政策。机器人告诉他可以先按全价买票,之后在90天内申请差价退款。
这条政策信息是错的。
2024年2月,英属哥伦比亚民事解决仲裁庭认定Air Canada对网站聊天机器人给出的错误信息承担责任。
事情走到法律层面以后,没有人会关心这句话写得是不是流畅,也不会问当时的模型是不是“只是概率生成”。最后只剩下一个问题,这个承诺是谁让它出现在客户面前的。
AI能把很多事情做得更快,但它不会自动替你判断,这件事是否适合交给它。
任务不是一类,别把一整件事一次性丢给AI
我觉得很多人把AI用乱,问题不在Prompt写得不够长。
而在于,他们把一整件工作,当成了一个动作。
写一份市场分析,听起来是一个任务,实际上里面至少有四层东西。
你到底想做什么,这是目标。
什么样的结果才算做好,这是判断标准。
哪些材料可以整理,哪些步骤可以执行,这是过程。
最后谁来检查,谁来承担结果,这是验收和责任。
如果这四层没有拆开,AI很容易替你完成最容易完成的那一层,生成一份看起来完整的东西,然后把真正困难的部分留给你自己收拾。

微软关于AI工作方式的研究,把人和AI的协作概括成几种不同模式,委托、协作、提问和探索。
这个分类我觉得挺实用,但不要把它理解成四个功能按钮。
它其实是在提醒你,AI在不同任务里扮演的角色不一样。
委托,适合目标清楚、输入稳定、错了可以回滚的活。
比如会议纪要、格式转换、重复分类、固定模板的初稿。
这时候你要做的是把要求写清楚,然后检查输出有没有漏项。
协作,适合目标重要、过程复杂、你希望保留判断的活。
比如产品方案、招聘画像、研究提纲、重要文章。
这时候不要让AI一次性交付最终答案,而是让它先给几版路径,你来选方向,它再补执行细节。
提问,适合你已经有一个问题,但还没看见盲区的时候。
让AI给你反方、列出前提、指出最可能失败的地方。它不一定知道正确答案,但很适合帮你把问题照亮一点。
探索,适合一开始还不知道自己要什么。
让AI先扩大选项,找不同角度、不同用户、不同解释,再由人把范围收窄。
很多人一上来就让AI直接做最终稿,其实是跳过了探索和判断,直接冲进了执行。
然后就会出现那种特别熟悉的场面。
不是模型没听懂。
是你把目标、标准、过程和验收,全都塞进了一个模糊的“帮我做好一点”里。

再往深一点说,AI会让工作变乱,还有一个原因。
它把很多原本会暴露无知的过程,提前填满了。
以前你不会做一份分析,可能会卡在资料、结构或者第一句话那里。这个卡住其实很有用,因为它会逼你承认,目标还没想清楚,数据还不够,或者你根本不知道用户是谁。
现在AI可以先替你填出一版。
白纸没有了,尴尬也没有了。
但问题没有因此消失,只是从屏幕上消失,转移到了交付以后。
所以我们看到很多“效率提升”,最后变成了“返工提前发生”。

给自己做一张人机分工表
说到这里,最容易出现另一种问题。
大家听懂了,然后什么也没改变。
所以我不想把结尾写成“我们要提升AI素养”。这句话没有错,但对今天下午要交方案的人没什么用。
我现在更愿意先做一张很小的人机分工表。
不复杂,五列就够。

| 工作步骤 | 这一格要解决什么 | 更适合谁做 | 交付标准 | 谁验收 |
|---|---|---|---|---|
| 定目标 | 这次到底要改变什么 | 人 | 能用一句话说清 | 负责人 |
| 找材料 | 需要哪些事实和输入 | 人加AI | 来源可追溯,缺口写明 | 负责人 |
| 出方案 | 有哪些可行路径 | AI先发散,人来选择 | 至少三种路径,写出代价 | 负责人 |
| 做执行 | 把选定方案变成成品 | AI协作 | 格式正确,覆盖清单 | 执行者 |
| 做验收 | 能不能真的交出去 | 人 | 事实、边界、风险都过一遍 | 最终负责人 |
这张表最重要的不是五列,而是它强迫你把“帮我做一下”拆开。

接下来是我会建议你直接复制使用的版本。
把任务交给AI之前,先填这五句话。
这次任务要改变的是:可使用的材料包括:不能假设或不能触碰的是:我判断做好了的标准是:请先给出方案和风险,不要直接假设你拥有最终决定权。

它看上去很朴素,甚至有点笨。
但这五句话把最容易丢失的东西捞了回来,目标、输入、限制、标准和责任。
因为它要求你在最想偷懒的时候,先把目标写清楚,把标准说出来,再把最后一遍检查留给自己。
但奇怪的地方也在这里。
你越愿意做这些看起来慢的小动作,后面真正返工的时间越少。
你不是在限制AI。
你是在限制自己被一份顺滑的初稿带着走。

最后给一个很具体的落地办法。
别试图把全部工作都重新设计一遍,先挑一条重复、频繁、容易复盘的链路。
周一,找出一件每周都会重复的工作。
周二,记录你现在是怎么做的,别急着优化。
周三,让AI跑一版,记下它哪里帮到了你。
周四,把所有返工点圈出来。
周五,把真正有效的部分写成团队模板。
你最后积累下来的,不应该只是一堆Prompt。
而是一条越来越顺的人机工作流。
AI用得越多,越要把工作分清楚。
能交给机器的执行,交出去。
需要人的目标、取舍、验收和责任,留在人手里。
这不是保守。
这是你在答案越来越多以后,仍然保留选择权的方式。
如对本稿件有异议或投诉,请联系 tougao@huxiu.com。