我自己在做一个支持后台、不抢占鼠标的工具(通过任务编排来自动操作Windows应用)。
目前已经有基础的功能了,但不知道现在是不是已经有相关的工具了。
因为之前做私有化AI网关浪费了很多时间精力
(自己做了个私有化部署的AI网关,目前免费闭源,本来想靠这个赚点外快,结果发现越来越搞不下去了),
所以想在深入做这个工具之前做个调研。
有佬知道的吗?
我自己在做一个支持后台、不抢占鼠标的工具(通过任务编排来自动操作Windows应用)。
目前已经有基础的功能了,但不知道现在是不是已经有相关的工具了。
因为之前做私有化AI网关浪费了很多时间精力
(自己做了个私有化部署的AI网关,目前免费闭源,本来想靠这个赚点外快,结果发现越来越搞不下去了),
所以想在深入做这个工具之前做个调研。
有佬知道的吗?
影刀我觉得不太行了吧,现在这年头RPA直接转SKILL好了,微软有一个SKILL录制工具,录制你的操作转换为SKILL,GitHub - microsoft/skill-recorder: Desktop app that records your on-screen work session and uses the GitHub Copilot CLI to reconstruct it as an intent + ordered steps, then builds a reusable Skill or Automation for Microsoft Scout, Microsoft Copilot Cowork, or Copilot Studio. · GitHub,然后SKILL扔给AI执行不就行了
(帖子已被作者删除)
这种每次运行都要用AI啊,这成本太大了。
我考虑做的是,可以利用AI来自动录制生成脚本,后续执行的时候不让AI介入。
它也只能是操作浏览器吧,我说的是Windows应用。
之前我自己的RPA也想做成这种方式,但是感觉太难了,网站交互性技术栈太多样化了
(帖子已被作者删除)
我其实不太了解的是,为啥这种自动化工具全部依赖于html元素识别。
为啥不采用“人眼看”的这种方式?
人的操作都是先看到某个地方有某个按钮,就去点击它。那为何不采用截图去定位呢?这种方式理论上可以使用在任何的窗口上,包含非浏览器的窗口。
元素识别准确率交出错概率要比屏幕识图强太多了,截图定位屏幕尺寸,滚动条,字体,不同操作系统任何一项都会影响识别成功率.除非运行时融合ai还好一些.
而且影刀在操作紫鸟这种指纹浏览器的时候,只能一个个浏览器操作,没法打开多个浏览器运行同一套流程
弊端也是有的,采用元素识别只能用在标准的Windows程序或者web上,如果是使用一些非标Windows控件做的程序,就没办法识别。
你说的精度和滚动条的这种,其实不算是问题:图片识别的算法可以解决精度的问题(不一定要像素的精准对比),滚动条是通过编排解决的,比如:
while 出现滚动条
拖动滚动条;
识别可视化区域是否存在某个截图;
if 存在
点击截图的位置
那我可以理解,目前没有很好的工具可以解决后台操作、不抢占键鼠的工具么?
咱不说影刀,我个人也是认为它有局限性的。
像跨境常用的紫鸟浏览器,不知道后续紫鸟官方会不会推出Ai自动执行脚本操作多个浏览器后台,目前来看,我是没找到。我们公司已经花了两年的钱购买影刀企业版了,像上面所说,我们经常需要多个店铺来执行同一套流程,影刀也只能抢占鼠标并且一个个店铺运行下去
也可以让AI提炼SKILL然后编制一个RPA试试,至于RPA的脚本怎么要求就看你用哪个了,我用Macro Recorder
操作浏览器,后台、不抢占键鼠的应该有很多方式,这个没啥技术壁垒。
我其实是在调研有没有支持任意Windows程序的这种自动化操作工具。
这种应该也是不能支持后台,需要抢占鼠标的吧
那我们直接vibe coding一个不抢前台的RPA吧~
目前就在做呢~
但不知道现在是不是已经有现成的了,只是我不知道,所以我在做调研呢
我现在就在做这个,用 ziniao-cli的能力,让 ai 把固定的流程固化下来,做跨境店铺运营
我是自己的软件调用playwright 实现自动化,但是店铺操作中上品就让人头痛,因为不同类目不同上品属性是变化的,同时有一些交互流程不是固定化的.