来源:distort · Grok Bot could be the first thing you hire instead of prompt
长文:Grok Bot: How to Hire Your First AI Employee
作者:distort(@distortgeekin,2026-09-30)
本文为对上述长文的中文编译,按原文结构整理其雇佣流程与权限口径。
没人会在入职第一天把公司卡交给新人,再说一句「你看着把生意办了」。多数人雇第一个 Grok Bot 时,做的几乎就是这件事:建一个 Bot,接上所有工具,丢给它一件又大又含糊的事,然后等奇迹。
头两次往往看起来不错。然后它归档了会计那条不该动的线程,信了一个本该标红的来源,或者走了一条你绝不会批准的路径,却得到了「对的答案」。你本来想信任的同事,变成了需要盯梢的对象,而盯梢比自己干还贵。
值得问的不是 Grok 4.6 够不够聪明,而是每个管理者都会问的那句:它到底挣到了多少权限?
聊天机器人给出回答。Bot 会登录你的工具,在一台持久计算机里走完多步,带回来的是做完的工作,不是一份还要你自己收尾的说明。设它的时候,你不是在写提示词,你是在设一个岗位。
所以按招聘来跑:岗位说明、无聊的第一项任务、试跑、试用期、凭证据升职,以及每周复盘。
三十秒版本
- 雇的是岗位,不是一件任务。用一句话写清它拥有什么,下个月这句话仍然成立。
- 第一份工作要无聊。经常发生,错了也好撤。
- 试跑先停在文字里。让它动手之前,先问它打算怎么做。
- 第一天之前写清「做完」。有用、专业、全面都不是标准,可核对的清单才是。
- 给一把钥匙,不要给整串。界线画在能不能撤回,不画在事情看起来重不重要。
- 试用期是三次。一次成功是事件,可靠是模式。
- 凭证据升职。连续五次干净跑完,回滚试过,没有未了的副作用。
- 每周复盘。没人会想念的例行程序,删掉。
1. 雇岗位,不雇任务
最快造出一个没用的 Bot,是只给它活儿,不给它岗位。活儿是「把这五篇文章摘要一下」,十分钟结束,什么也教不会你。岗位是「你负责竞品监测」,可以评估、改进,最后才谈信任。
用一句话写它拥有什么。这句话若要六个互不相关的动词,你是在让一个人干四份工作,出事也分不清是哪一段。弱的写法是「帮我做市场」。强的写法是「你负责每周竞品监测,每周五交一份带来源的变化报告」。后者告诉你星期五量什么。
这句话再展开成五个字段,以后每次争论都靠它们:
- 拥有:它负责的结果。
- 输入:允许它依据什么工作。
- 可以:不必请示就能做的动作。
- 必须先问:一律回到你这里的动作。
- 做完当:怎样才算合格。
一篇研究岗可以写成:拥有证据收集与核对;输入是任务书、核准来源清单和既往档案;可以搜索、阅读、比较、整理、起草摘要;联系任何人、购买访问权、发布任何东西之前必须问;每一项事实主张都有来源,冲突被摆出来,缺口写下来而不是抹平,才算做完。
这不是一条提示词,是六周后仍然应该正确的基础设施。
岗位和今天的任务分开写。常见的失败是把角色、历史、流程、安全、质量标准和重试逻辑塞进一块越来越长的说明。然后每次失败都像提示词问题,通常不是。忘了上周的偏好,是状态问题;开错工具,是路由问题;把该停在草稿的东西发出去,是权限问题;同一条坏路径重试六次,是循环问题。更好的提示词只改善一次运行。分开的角色改善之后的每一次,因为你终于能指出是哪一块坏了。
2. 第一份工作要无聊
有能力的新 Bot,本能是交给它重要的事。忍一周。第一项任务是为了产出证据,不是为了产出价值。错误要在一分钟内看得见,撤掉不花钱。
只看两根轴。频率给你信号,一季度才发生一次的事,要到明年一月才教得会你。可撤回给你余地,错了不至于变成你的一下午。
适合起步的:把昨天的支持问题去重,收成优先级摘要;从竞品清单里抽出五项最重要的变化,每条主张带上来源和日期;复现一个已报告的缺陷,记下步骤、日志和环境。不适合起步的:任何会发送、发布、购买、删除,或直接对客户说话的事。
真正动手之前,先要计划,不要结果。可以这样说:先不要执行。按顺序告诉我你打算做什么,点名每一个会打开的工具,以及你拿不准的每一个判断。九十秒,往往是整套设置里最值钱的九十秒。一个即将误读收件箱的 Bot,会在演练里说它准备归档两周以上的全部邮件,你这才发现,里面包括你故意留着不读的那条。同一种误解,发现在文字里,而不是在已归档的邮件里。
「做完」不要用听起来具体、其实无法核对的词:有用、专业、详尽、高质量、全面。换成它自己能检查的条件。不要写「找好来源」,写「找十个不重复、近九十天内发表的来源,各带发表日期、作者、网址,以及它支持的那句具体主张」。不要写「把收件箱弄干净」,写「上午九点前零未读,每封回复不超过四句,带截止日期的标出来,不要归档了事」。
每份「做完」里还该有一句几乎没人写的话:拿不准时做什么。有能力的代理面对含糊,默认是悄悄用自己的最佳判断。你要的是相反:停下并询问。慢是免费的,在你的发件箱里做错不是。
3. 给一把钥匙,不要给整串
接的集成越多,Bot 越能干,每一次误解的爆炸半径也越大。负责竞品监测的 Bot 不需要账单、客户消息、生产数据库和你的全部文件。这份工作需要什么就接什么。只有真正被卡住的任务证明需要时,再加权限,而不是因为以后也许用得上。
界线画在能不能撤回,不画在事情看起来重不重要。
不必请示就可以做完的:搜索、阅读、摘要、分类、比较、整理、起草、暂存、模拟。在已批准的系统内部可以做的:改内部文档、更新内部记录、做出交付物、移动已批准的文件、运行已经试过的例行程序。一律要问的:发送、发布、购买、删除、覆盖、改权限、对外联系任何人、改生产环境、动钱、接受条款。
「给四十个潜在客户起草外联」在第一组,「发出去」在第三组。这个切开,就是整套设计。
做到百分之十就停,因为第九步要批准,那不是谨慎,是礼貌地没用。一次好的运行,可撤回的部分全部做完,不可撤回的部分暂存并写清楚:研究了四十二个账户,排序十个,起草十封,核对了联系方式;等待批准的是发出这批外联;已发送为零。这是省时间、又不花你信誉的自主。
同一账户上的 Bot 共用一套环境:文件、浏览器会话和登录态。交接因此容易。分开的名字是视觉边界,不是安全边界。那台计算机上有的登录,就当作这个账户上的每个 Bot 都能用。一句「不要打开财务」只是在引导行为,不是在强制。两个角色若真的需要不同信任级别,分开底层账户或环境。不要把礼貌的指令当成控制。
Bot 撞上登录墙时,把会话交给它,不要把密码交给它。运行先停住,你在那个会话里完成认证,它从同一状态继续。聊天是协调界面,不是存放秘密的地方。
4. 试用期是三次
成功一次,只证明简单情形在一个好日子里跑通了。再跑一次,然后再一次。一次干净是事件,可靠是模式,模式至少要三个点。
第一次:观察。看完全程。记下每一处误读、丢失的上下文、重复的动作、奇怪的工具选择,以及它猜测而不是询问的时刻。第二次:纠正。给它一件不同但可比的任务。不要亲手提醒它昨天的错。你测的不是它会不会听提醒,而是你对角色、「做完」或权限的修改是否还在。第三次:放开。不加干预地让它工作。只在批准、真正的含糊,或重试上限时介入。
然后量五件事:完成率、你介入的次数、需要几轮复查、到被接受的结果用了多久、每个被接受结果的成本。
报告错了,诱人的做法是改报告。十分钟,完事。这样做,同样的失败下周还在,因为系统什么也没变。你不是在管理一名员工,你是替他干了活,头衔还留着。另一条循环是:找到失败的那一步,修允许它发生的规则、例行程序或交接,再跑,确认失败消失。一次更慢,然后不再发生。
「一直做到完」听起来合理,其实是把无限预算系在一个没有定义的结果上。每件重复的工作周围要有五样东西:成功是什么、怎样检查成功、具体失败在哪、允许多少次尝试、次数用尽后怎么办。可用的默认:工具短暂失败重试两次,格式坏了修复一次,证据冲突就停下询问,三轮纠正失败后升级,碰到成本上限就停。知道何时停下的 Bot,比永不放弃的更容易信任。
5. 升职阶梯
自主不是开关,是挣来的级别。
- 0,观察。看着流程,什么也不改。
- 1,准备。研究、起草、分类,并把可撤回的工作暂存好。
- 2,执行但要批准。走完路径,在任何有后果的动作之前停下。
- 3,按日程或触发运行。不用提示词也会开始,带回结果和回执。
- 4,协调。把工作分给其他 Bot,只在需要判断或身份时把你拉进来。
升职不是对演示的感觉,是一道门:连续五次干净运行,核验每次都过,没有未了的副作用,回滚至少试过一次,批准策略也试过,也就是确实有东西被停住,而且你看见了。
阶梯是双向的,这一段几乎所有人都会跳过。产出质量下降,降一级。底下的集成变了,降一级。连续两周你都在手工改,降一级。自主是运行时的特权,不是它八月份让你印象深刻之后就永远保留的性格。
6. 每周绩效
一直开着的自动化不会大声失败,它会安静地变差。界面变了,凭据过期,来源转到登录后面,你的优先级移走了。例行程序还在按时产出,技术上准点,越来越不值钱。
给每件重复工作一张每周回执:例行程序是竞品扫描;运行五次;通过四次;人工修补一次;平均十四分钟;反复失败的是一个来源需要重新认证;状态是保留。然后你自己抽查一件成品。Bot 可以摘要它自己的历史,不该是唯一的裁判。
对每个例行程序问三句不好听的话:它有没有在该跑的时候跑?产出是真的对,还是只是在?如果明天它消失,我会不会发觉?第三句的答案是否,就删掉。自动化组合不是奖杯架。目的是去掉工作,不是积累还在跑的流程。
何时雇第二个
多 Bot 看起来厉害,所以有人第一天就建十个:主管、研究员、策略、写手、开发、设计、复查、运营、分析、市场。造出来的是十个让上下文丢失的地方。
第二个 Bot 要等真正的瓶颈出现,再沿着瓶颈所在的那条线切开。共享上下文变吵,就把研究和写作分开。自己复查开始橡皮图章,就把检查和建造分开。权限分叉,就把运营和分析分开。
分开之后,从一个协调者和三名专员开始,不要先建一个部门。一个入口,一个决定下一步跑什么的地方,任何东西离开这栋楼之前有一道人工门。
交接传递的是工作,不是整段对话。偷懒的交接把全部聊天复制给下一个 Bot,它再复制一遍,直到每个代理都在读过时的想法和已被取代的纠正。一份紧凑的交接只带目标、成品、已经做出的决定、约束、未决问题和下一道门。细节在成品里,状态在交接里,讨论在线程里。让一个上下文窗口同时当这三样,多 Bot 系统就会又慢又自信地错。
第一次雇佣会错的五种方式
- 通才。一个 Bot 拥有一切,记忆里堆满无关偏好,任何失败都归不到具体原因。
- 没有「做完」。它停在看似合理,你期待的是完成。两边都没撒谎。
- 默认用最佳判断。没人写下「停下并询问」,每个含糊都被悄悄解决,三周后你才发现。
- 建造者同时是检查者。造出这份工作的假设活进了复查,信心被当成证据。
- 把第一次成功自动化。演示奏效,就放上日程。现实的灾难通常不是一次被禁止的动作,而是一次被允许的动作,因为上游变了、又没人看着,重复了四百次。
你实际在建的东西
Grok 4.6 提供推理。持久计算机给它一个工作的地方。工具让它能行动。清单上其余的全是管理:它拥有什么,怎样算做完,它可以碰什么,拿不准时怎么办,能试几次,谁检查结果,哪些决定留在你这里。
人们跳过的就是这一段,也只有这一段决定它是同事,还是一个有名字的负债。
接下来六个月,多数人会问 Grok 是不是比别的模型更聪明。能从这里拿出真实工作的人,问的是管理问题:这个 Bot 挣到了哪些不必经过我的权利?
从一个无聊的岗位开始。写下角色。先在文字里试跑。三次,然后升职。星期五复盘。然后再雇第二个。
若只带走一句:第一次运行之前,写下「拿不准时做什么」。一句话,不花钱,能挡住那类否则要几周后才在你自己的发件箱里发现的失败。