EPISODE · Aug 15, 2025 · 6 MIN
Vol.0123:Fellou和Manus自动填问卷能力测试,你猜谁赢了?
from 幸运喜欢藏在努力里
今天又是很舒服的一天,上班做了一天自己的事情,包括昨天说的让Fellou填问卷、学习Eko框架记忆机制的源码,还增加测试了Manus填问卷。今天有种说不出的奇妙感觉,昨天说要找个问卷让Fellou填一下,结果还没等我去小红书上去找,早上上班,问卷直接送到手里。周三老板搞了个企业文化培训,今天以问卷的形式发了考试试题。我直接就是让Fellou开干,当然我自己也填了一份。客观题,我们获得了一样的分数,都错了一道题;他错的情有可原,我完全没有给他上下文,不知道公司十年后的收入目标;我错在了粗心,没看清楚题是选对的还是选错的。(想吐槽一句,搞出一个不需要学习资料上下文的试卷,不知道意义何在?)说说Fellou使用体验,Fellou在浏览器的基础上加上了一部分的Agent的能力,给我的体验感还不错。好的地方就不说了,比上半年用manus填问卷的效果好很多,基本可填,只存在一些细节问题。下面说说我在使用的时候,觉得体验有些问题的地方。第一个问题:在给他发布任务后,偶尔不会触发Agent,需要自己手动点击Deep Action按钮,才能触发。第二个问题:规划的操作方式不是最优的,并且可能是由于上下文长度的问题,开始偷懒。在我让他修改错误答案时,明明上下文有对应问题的元素信息,他自己也输出了问题和选项,但是他非要通过识别截图和模拟鼠标滚轮滑动的方式去找对应的题目,效率巨低;他自己也在滑动5次之后,说效率太低了;开始换ctrl+F的方式寻找,但依旧没有找到;又开始换了一种方式用JavaScript来定位,但是这一次还是没找到,最后让人来接管完成任务。接着我中断任务,让他重新操作;在之前滑动的基础上,这次滑动了4次之后,定位到了题目,重新选择了正确的选项。还有一次情况也类似:我让他提交问卷,他找不到提交按钮,明明从截图上可以很容易找到按钮位置;他就是找不到,他自己在尝试两次之后,他放弃了,让人接管;我中断了任务,让他重试,结果他就是罢工,不干了,点击Deep Action按钮才开始勉强营业;而且依旧找不到,让人接管,但是这次我没有中断任务,而是跳过这个操作,他开始用其他方式,结果没有找到,还把其他填好的答案改成了“提交”。让我哭笑不得。也许提交按钮被问卷星特殊处理了,使得他定位不到,但是从截图上定位应该是比较简单的。主要就上述两点吧,其他的像操作时间长、积分用的比较多都不是核心问题。(48个题目填了16分钟21秒;填问卷调用了7次Agent工作流,消耗了2152个积分)。操作时间长,实际上可以让他自己操作,自己去干别的。总结下来,算是超出了我的预期,和上半年用manus填问卷的效果比好很多了。不过感觉这种通用的Agent还有很长度的路要走,现在只能说是从不可用的状态变为基本能用的状态,还需要优化。另外,看到一篇文章说不看好AI浏览器,文章中说到:浏览器并不是问题的答案,也许,它本身就是那个问题。浏览器本身就意味着用户主动去“找信息”点链接、看页面。这是一种用户驱动的交互范式。而真正的Al-native工具,不应该只是“在旧的行为上叠加AI”。应该以一种对话式调度为核心:用户只需表达目标,系统即可组织资源、归档信息,甚至主动推理和提出建议。我非常认同浏览器是一个限制住AI的载体。现在的AI浏览器就好像是在设计扇动翅膀的飞机。这种方式是非常限制想象力的。下午看了Eko框架记忆机制的源码:主要是包含两部分的内容,记忆管理和记忆压缩。实际上和我理解的记忆还不完全一样,他这里说的记忆可以说就是上下文。而我理解的记忆像是RAG,把数据存起来,在需要的时候,取出相关的数据来。Eko的记忆管理包含两方面:剪切AI输出的内容和工具输出的内容、修复不连续的消息。剪切AI输出的内容和工具输出的内容是剪切掉超出给定字符长度的消息中超出的字符,并且在消息之后加上"...",如果所有的消息剪切完之后,消息长度还是超出了最大的token数,去掉第一条消息,再进行循环判断,直到小于最大token数。修复不连续的消息是找到前面处理后的消息列表中的第一个用户消息,把前面的消息都去掉。然后再遍历消息,去掉重复的用户消息(两条消息内容一致,角色是用户),处理丢失的工具调用结果(前一个消息是AI助手调用工具消息,但这一条消息角色不是工具)。Eko的记忆压缩则是当消息数量大于80条时,触发压缩:先创建任务快照(将工具信息、消息等合并),通过LLM生成压缩摘要,保留关键任务信息和节点完成状态,并且用LLM总结的信息代替消息列表中中间过程的工具调用信息。代码不难,还是比较好读懂的。前面吐槽了Fellou填问卷,下面来聊一聊用Manus填问卷的情况。Manus 填问卷还是和上半年情况一致——不太行,执行一次问卷填写花费610积分,每天只有免费的300积分,一个任务都执行不完。问卷填的大多都不对,还有漏填的,不过他填得快一些,只花了10分钟。发现他在填的时候不是按顺序填的,他是看到了没填的就填上,然后他下滑的多了,就漏了。而且答案应该是随机填的,大多数都是错的,不像Fellou是先分析问卷,得到所有答案再一个一个填。Manus 填的毫无章法,而且由于网络原因,在接管manus 虚拟机时,体验也不很好,存有画面刷新的问题。这一波Fellou胜出!晚上请一个同组的同事去吃了个“霸王别姬”(甲鱼烧鸡),期间,从对公司一些事情的看法聊到之前的经历等等,发现我们其实有很多相像的地方,都是做事的人。今天就不细聊这个了,下次看情况再聊!早点休息,晚安!
Embed this episode
NOW PLAYING
Vol.0123:Fellou和Manus自动填问卷能力测试,你猜谁赢了?
No transcript for this episode yet
Similar Episodes
No similar episodes found.
Similar Podcasts
No similar podcasts found.