说一个反常识的真相,Agent如今在真实工作场景的成功率依然很低。
说一个反常识的真相,Agent如今在真实工作场景的成功率依然很低。上周一,我发了自己做的AIHOT大模型排行榜。
搜索
上周一,我发了自己做的AIHOT大模型排行榜。
OpenAI接连放大招!今天,一条OpenAI内部Slack消息爆出,ChatGPT将迎来一次「史诗级」的性能大换血。从硬核测试数据来看,这次ChatGPT前端性能的优化幅度,夸张到近乎「不真实」:应用加载速度直接飙升94%,堆内存增长减少87.8%,整体内存占用砍掉41.2%。
背后由清华大学、北京大学等一众机构支持的 Agent Memory Leaderboard(中文名「记忆之巅排行榜」)放出了首期成绩,目前该项目上榜 Huggingface Spaces Trending 首屏。
刚刚,在百度AI Day开放日上,百度文库网盘联合官宣通用智能体GenFlow的中文名——库库AI,并推出了该智能体的全新独立入口,与百度系列办公产品完成了深度融合。库库AI(原GenFlow)自2025年4月上线以来,经过不断迭代,已然在文库、网盘等产品中全端通用,可一站式完成Office三件套等复杂办公任务
就在刚刚,智谱发布了其最新一代旗舰模型GLM-5.3,并宣布模型将在两周内开源。这是一个拥有7430亿个参数的模型,和此前的GLM模型一样主打编程。在多项主流基准测试中,GLM-5.3位居所有已开源或即将开源模型中的第一;其在编程与智能体任务上的能力,已逼近Claude Fable 5、GPT-5.6 Sol等海外顶尖模型。
A社刚发了一项新研究,讲了件很有意思的事:Agent其实和丧尸一样,可以互相传播一种“思维病毒(Mind Viruses)”,而且过程中有些病毒还会发生变异。研究人员先给一个Agent植入某种想法,随即它开始私信队友、发展“下线”;新感染的Agent又会修改自己的长期记忆,把同一套想法继续传给下一位。
视频模型这个月很热闹。7 月 31 日,MiniMax H3 和字节跳动 Seedance 2.5 同日发布。3 天后,MiniMax H3 正式开源;8 月 7 日,Seedance 2.5 开放 api。模型越来越好了,但产品能把它用好吗?
MiniMax 过去一年的 agent 实践,从一个内部飞书 bot 开始,演化成了桌面应用 MiniMax Code,最终形成了一个训练-服务的闭环:模型在自己的 harness 里训练,通过 harness 服务用户,用户行为变成训练信号反哺下一个模型。这个闭环是模型公司设计 Agent 的核心逻辑。
对 Agent 来说,这种长期记忆能力,正逐渐成为影响实际可用性的一项基础能力。今天,Agent Memory Leaderboard(AML,记忆之巅排行榜)正式发布首期结果。
AI智能体训练平台Bespoke Labs宣布已完成4000万美元融资,其中A轮由Wing VC领投,Mayfield、The House Fund、dbt Labs CEO Tristan Handy,以及来自Anthropic、OpenAI和Meta的其他天使投资人参与