尝试了几种AI代理,都是在各种实现方式里面循环尝试和打转,api、UI、com等等,每到一个新的场景或新的软件,就需要各种新任务拆分和路径尝试,有没有可能,仅用截图+OCR文字识别+图片理解+模拟键鼠,自建一个电脑端的通用AI代理?
你是不是在找gui agent这种方式
你是在说gpt的电脑使用功能?现在很多这种项目 很多家都支持 各种claw都可以
是的,就是模拟键鼠。在这里问是了解下这种方式有没有什么瓶颈
是的。因为自己的工作太垂直,真正的护城河是垂直领域的工作流,想自己通过视觉流组建工作流程。
模拟键鼠速度慢
我认为也许需要依赖脚本、按键精灵那种作为辅助
不然单纯 OCR 或截图交互可能达不到好的效果