01 它是干嘛的
Computer Use 让模型直接操作一台电脑的图形界面:它能看屏幕截图,判断该点哪里、输入什么,然后真的把鼠标键盘动作执行出去。它解决的是「有些软件根本没有供程序调用的接口,只能靠人在界面上点」这个死结。
02 为什么会有它
为什么自动化软件里的操作,过去总是碰壁
很多软件压根没提供供程序调用的接口,你只能打开它的窗口,用鼠标一步步点。想把这种操作自动化,过去得靠一套叫 RPA 的技术:先录下人的点击操作,再照着重放。
问题是界面一旦变化,脚本就崩。按钮挪了个位置、字号调了一下、弹出一个新的确认框,脚本点空,任务失败,还得人来修。系统升级一次,一堆脚本要跟着重写,维护成本高得吓人。
Computer Use 换了个思路:不预先写死「点第几个像素」,而是让模型每次看图、临场判断。就像教一个人做事,而不是给机器人编一段固定轨迹——界面变了,人看看就知道新按钮在哪,模型也能。代价是它必须反复截图看图,动作自然比人慢,而且判断错了也可能点错东西。
03 它怎么工作
Computer Use 不依赖软件的接口,而是模拟人的眼睛和手:截一张屏幕的图交给模型,模型给出「点哪里、按什么键」的指令,程序执行这些动作,再截一张新图看结果,如此往复。
截图—决策—动作—再截图:一个视觉闭环
- 1① 截取当前屏幕
把屏幕画面采集下来,作为模型看世界的「眼睛」,这是唯一的信息来源。
- 2② 模型识别画面内容
模型分析图上有哪些窗口、按钮、输入框,以及任务现在进行到哪一步。
- 3③ 给出鼠标坐标与按键
模型不再输出文字答案,而是给出具体动作指令,例如「点击坐标(x, y)」「输入这段文字」。
- 4④ 程序执行动作
执行器把模型的指令翻译成真实的鼠标移动、点击、键盘输入,作用在操作系统上。
- 5⑤ 再截屏观察结果
动作做完立刻再截一张图,看界面有没有按预期变化,据此决定下一步还是纠正。
- 6⑥ 循环直至任务完成
这个「看—想—动—再看」的过程一步步重复,直到目标达成或模型确认无法完成。
04 谁在用它
那些只提供图形界面、无法编程调用的系统,也能通过看屏幕点点点来跑流程。
在一个系统里导出数据,再到另一个系统里录入,这类跨软件搬运适合交给它。
重复性的资料录入、信息核对,让它照着屏幕一项项完成。
在真实界面上走一遍操作路径,观察软件表现是否符合预期。
05 怎么用
这是偏实验性质的能力,通常由开发者在受控环境里搭建;官方也明确提示它仍可能出错,不建议直接放到生产系统上撒手不管。
- 01准备一台隔离的虚拟机或容器作为「操作台」,避免它直接碰到你的主力电脑与真实数据。
- 02按官方文档,用支持该能力的模型与工具搭建运行环境。
- 03给它一个具体、可验证的任务,例如「打开某页面,把表格里第一行抄下来」。
- 04运行过程中全程盯着它的每一步截图,随时准备打断。
- 05遇到敏感操作(删除、付款、发消息)设置人为确认,不要让它自行执行。
- 06把小任务跑通、稳定之后,再考虑拼成更长的流程。
避坑提示
- !它慢且可能点错,别指望它比人手快,价值在于把人从枯燥操作里解放出来。
- !一定要放在沙箱里跑,并给它单独的账号与最小权限,降低误操作与信息泄露的风险。
- !涉及资金、删除、对外发送的动作必须加人工确认,模型判断失误的代价可能很大。
06 关键概念
- 截图识别
- 让模型「看」屏幕图片来判断界面状态,而不是依赖软件的接口。
- 坐标点击
- 模型给出的动作是屏幕上的具体位置与按键,程序照此模拟人的操作。
- 闭环
- 每做一步就重新看一次结果再决定下一步,因此能应对界面变化,但也因此更慢。
- RPA
- 传统「录下点击再重放」的自动化技术,界面一变就容易失效,正是它想改进的对象。