说一个反常识的真相,Agent如今在真实工作场景的成功率依然很低。
说一个反常识的真相,Agent如今在真实工作场景的成功率依然很低。上周一,我发了自己做的AIHOT大模型排行榜。
来自主题: AI产品测评
6079 点击 2026-08-17 10:54
搜索
上周一,我发了自己做的AIHOT大模型排行榜。
希望能做一个各个模型评分排行的汇总,方便实时了解和对比各种模型的性能。这个是一个非常有趣、且对我自己非常刚需的需求。因为现在的模型评测排行榜、评测集等等,实在是太多太多了,人人其实都可以做一份自己的评测集,然后来跑一份模型排行榜,有的测的全一些,有的就是个垂直场景的特定任务,这个量级真的特别大。
这个周末,可能是我最戏剧性的周末了。 周五发完Claude Fable 5的文章之后,看的人还是蛮多的,大家反馈也都不错。但是呢,我也不知道触动了谁,也有可能是某些大佬,可能想让我长长教训,或者想让我知道,Vibe Coding的网站就是狗屎,是有无数的安全隐患的。
今天,我决定把我自己做的,帮助我自己监控AI热点、辅助找选题的网站,向所有人免费开放了。