最近在网上刷到大量夸赞 GPT-6 Astra 在 Computer Use 方面能力的帖子,各种操控 Blender 做出 3D 模型的案例确实令人惊叹。但现阶段要解决白领办公问题,除了 coding 能力,最关键的还有搞定电脑和浏览器操控的能力——绝大多数白领任务都是在电脑上完成的,而很多网站、软件的开放性还不够强。让 Agent 可以操控电脑去获取更广泛的上下文信息,帮助完成任务处理最后的操作环节,是走完 Agent 办公的最后一公里闭环。

过去半个月一直在尝试迭代让 Agent 操控电脑的能力。比如让 Claude Code 操控 Blender 制作邮轮模型:

给 Claude Code 的任务只有一句话:帮我调用 Codex 生成多张高清、细节丰富的 10 万吨级邮轮照片,然后用 skill 操控 Blender 去生成渲染出和照片几乎一致的模型。
它先出了一张正侧视的照片,再拿这张当参考图串行出右前 45°、左后 45° 和航拍俯视三张,保证四张是同一艘船。然后照着照片量尺寸,在 Blender 里写了一个 400 行左右的参数化建模脚本。从收到任务到并排对比图交付,33 分钟。

左边是生成的照片,右边是渲染。中间迭代了 8 轮,每轮预览只要 3 到 30 秒。差距也很明显:驾驶台前端流线型外壳没做、船艉阶梯露台的栏杆没做、顶层泳池区没做,航迹只有一圈薄片没有浪花。这些都是它自己在收工汇报里列出来的。
再看甜甜圈——面团上的气孔、油炸时浮在油面留下的浅色腰线、只淋了上半截的巧克力和往下淌的垂滴、三百颗随机颜色平躺贴在淋面上的糖针,全是 Claude Code 自己建的。

这套东西今天正式开源,叫 huashu-mac-use。任何能读 skill 的 Agent 都能装——Claude Code、Codex、Kimi Code、Cursor、OpenClaw,包括国内那几个办公客户端。装法也就一句话,把仓库链接丢给你的 Agent 说「帮我装这个 skill」就行。
它怎么工作
一张图,就三件事。

第一件事:先探,再决定从哪下手
Mac 上一个 App 能下手的地方有四层:它自己有没有命令行或脚本接口;有没有辅助功能树(Accessibility Tree);窗口里的坐标能不能点;最后才是看截图。越往上越省事越稳,越往下越像人在瞎点。Skill 动手前先跑一个探测脚本,30 秒把这个 App 摸一遍。
最大的发现是:不同内核的 App,能操控它的方式完全不一样。套了 Chromium 壳的国内 AI 办公客户端,可以带个调试端口重启,Agent 就能像操网页一样操它,不抢焦点、不切桌面、几个 Agent 一起用都不打架。
第二件事:读随便读,写尽量别碰用户的焦点
截图、列窗口、读界面这些全是读,一律不激活窗口、不切桌面、不动鼠标,被挡住的窗口照样能截。

写就麻烦了,后台窗口收不到键鼠。所以它先把事件直接投给那个进程试试,截图对比有没有生效,实在不行才借焦点。借之前要过四道闸:前台是不是目标;落点有没有被别的窗口压着;你 2 秒内动过键鼠它就等你停手(最多等 15 秒,等不到就不干,不抢);全机同时只许一个进程借焦点。
真借到焦点那半秒,屏幕四角会闪一圈取景框告诉你是 Agent 在动,而且这个框对截图是隐身的。
第三件事:工具说成功不算数
有一轮 4 次写入工具全报成功,截图一看前 3 次输入框是空的。所以每一步都要回读,而且回读要看 App 自己的状态——发送键亮没亮、任务进没进列表、文件落没落盘,光看见字不算。现在动作之后内核自动做前后对比,判不出来就标一个「回去重看」,不算失败也不算成功。
进化机制
这个 skill 的价值不在哪一条命令,在它怎么把坑变成工具。
第一版是三天写成的,正文近两万字符,全是踩坑日记。写完第二天让 Claude Code 以产品负责人加架构师的视角评审自己,结论不太好听:核心资产是对的,但形态是一本日记而不是一个接口。评审定了四个指标:
- 每张有效截图的模型往返从 8 次压到 2 次以内
- 三个旗舰 App 首次截图成功率从 1/3 到 3/3
- 读任务焦点占用恒为 0
- 正文从 19.8k 字符压到 6k 以内
之后的规矩就一条:每次收工先问「这条教训能不能变成工具行为」。能,就改代码不改文档;不能,才进 references。
坐标、端口、窗口 ID、界面文案这些是易腐信息,产品一改版就废,永远不许作为结论写进正文。证伪旧结论的优先级高于新增,一条错记录会让下一轮直接走错层,比没记录更贵。

邮轮那一场的收工汇报就是这个规矩在跑。四条踩到的坑当场写进了 App 档案:后台模式新建材质没有默认节点要显式建;海面整片变白的根因是 Ocean 修改器的 foam 属性不是反射;天空模型太阳方位角的约定它拿不准,渲了 4 张小图 30 秒测出来;还有一条直接推翻了档案正文里的旧结论。
8 轮迭代每轮只修一个根因,而根因经常不是看上去那个——v1 一片黑是曝光不是灯光,v2 海面像镜子是 Ocean 修改器上叠了 6000 倍的物体缩放不是材质。每轮 3 到 30 秒的预览让猜错的成本几乎为零,这是走接口这条路相对 GUI 点击最大的隐性收益:可以像写代码一样迭代。

写在最后
这批帖子中 Theo 那条"GPT-6 Astra is world class at Blender and 3 dimensional reasoning"一万两千多个赞,Tom Krcha 拿一张老蒸汽火车的图纸让 Astra 在 Blender 里重建,几分钟出了 3295 个可编辑的物件。这些我都信。
这个 skill 终有一天会被模型自己的能力完全碾压覆盖,可能就是几个月之后的事。但在那之前,短期内先给大家一个有用的工具。而且看图点鼠标这条路在 Mac 上到底有多稳
macOSWorld 那篇论文测过顶级模型纯视觉在 macOS 上的成功率只有四成多,是 Ubuntu 的一半。所以「按 App 内核选通道」「不打扰用户」「留证据」这三件事,估计在模型层解决之前还得靠 skill 层顶一阵。
也欢迎大家通过国内的办公类应用去尝试测试,不管是 WorkBuddy、豆包工作、千问办公还是 ZCode、Kimi Work,它们都能读 skill。跑出问题直接来仓库提 issue。