闭源RSI的严父来了:18个Agent自主科研,Kimi K3靠Harness逼近Opus 5
闭源RSI的严父来了:18个Agent自主科研,Kimi K3靠Harness逼近Opus 5刚刚,闭源RSI的钦点严父来了!
搜索
刚刚,闭源RSI的钦点严父来了!
过去几年,大模型的发展主线很清晰,比如更大的模型、更多的数据,以及更多的计算。但当模型从回答问题的Chatbot走向能够调用工具、执行任务的Agent,发展主线也开始发生变化。模型不仅要知道,还要在环境中行动,从反馈中判断结果,并在长时间运行中不断调整策略。
前两天,看到小米澎湃OS 4 Beta版开启招募,没有发布会,直接上。
上回说到,Seedance 2.5上线后,我们第一时间做了模型更新的能力测试。结果很惊艳,AI的指令遵循、运动效果、表演张力、人物一致性和全模态参考都有了大进步。
上周我去参加了 WorkOS 在旧金山 Regency Ballroom 举办的 Agent Night Live。说实话,这类活动我参加过不少,很多时候走进去,走出来,脑子里留下的东西并不多。
随着Agent走向真实工作,后训练和数据正在成为提升智能的关键。
上周一,我发了自己做的AIHOT大模型排行榜。
太猛了,DeepSeek Harness 截至当前已经 112 k 的 Star 了,而这距发布仅仅过去三天。而且还在以惊人的速度增长...DeepSeek Harness 的核心就是:一切皆插件。说个不确切的比喻,有点 Agent 时代的 Obsidian 感觉了,自由度太高了。
DeepSeek-v4-pro-0813 正式上线,两极分化的口碑却让人摸不着头脑。一边,是疯狂刷屏的评测夯爆了:多项 Agent 测试逼近 Fable 5,被认为是又一次前沿模型的“核弹级”更新;另一边,却是不少深夜忠实开发者直摇头:吐槽涨价、模型能力不及预期,实测体感甚至不如之前的小模型……
DeepSeek Harness这下真快被网友「插成万物」了。小黑鲸上线还没多久,单单在GitHub上打着dsh-plugin标签的公开仓库,就已经冲到了700+个???有人给它装浏览器、长期记忆、数据库和任务管理;有人嫌DeepSeek不会看图,现场接了个视觉模型进去。