文章目录
- 概要
- 主要问题
- 解决过程
- 总结
概要
使用 AI Agent 生成了系统的用户使用手册
用户使用手册的大致内容就是逐个介绍每个目录下的每个菜单的功能并附上截图
主要问题
刚开始的时候我直接给了目标系统的地址和用户密码,告诉agent要截取每个菜单的截图并编写用户手册。
不过并不顺利,给我配置的那个agent的速度非常慢,花费了数分钟才打开浏览器进行了登录,此后的每一步截图都花费数分钟,这还不是关键,更重要的是他截取的图片当中目录仍然是在左半边展开的,挡住了菜单的一部分内容(如图)。
在第13个菜单之后(这个目录比较的长),ai能识别到还有后续的菜单,但是后面的每一个截图都和第13个菜单的截图一模一样了。后来发现原因是目录里的第13个菜单刚好显示在屏幕的底部,而ai傻傻的不会往下翻,就只是一遍一遍的在点击着屏幕底部。
解决过程
后来让 AI 做了一些调整。
首先是采用无头模式进行浏览器的操作,无需打开电脑上的浏览器程序,不和我的工作互相打扰,同时我也发现这样也让之前动不动就发生的断开连接/连接超时的情况消失了
并且我告诉 AI 在截图的时候要先将目录折叠起来,然后当截图之后要滚动目录以便截取到更多的菜单而不是反复截图同一个菜单。
在多次调整之后,我决定让他采用语义定位器,通过文本(菜单名)让 JS 定位到菜单的点击地址并且进行点击。同时在点击以后检查是否真的切换了页面。
在漫长的截图过程之后,任务终于完成了大半。
截图完成之后,接下来的工作就比较轻松了,AI 生成了一个 MD 文档,在我的要求下,中途还调整了几次文档结构,也生成了一份可以直接阅读的 Word 文档。
总结
我目前的那款 AI Agent 主要的问题是非常慢,慢到让我觉得几乎没有什么实用价值了。
总的来说,在编写关于某个系统的文档的时候,如果需要访问某个网址,则最好使用无头模式进行浏览,对于截图操作,需要根据情况调整具体行为,例如主动折叠正在展开的目录,点击行为最好通过 JS 来定位并完成。