深度|10人团队登顶视觉推理榜,Chance AI 超过GPT、Gemini和人类专家

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
深度|10人团队登顶视觉推理榜,Chance AI 超过GPT、Gemini和人类专家
9924点击    2026-07-30 11:34

深度|10人团队登顶视觉推理榜,超过GPT、Gemini和人类专家


推荐语


过去两年,多模态模型的竞争看起来像一场“造眼睛”的竞赛:更高的图像分辨率、更多的视觉 token、更大的模型,以及更昂贵的训练。行业似乎默认,只要第一次看得足够清楚,AI 就能从“看见”抵达“洞见”。


但最新一次公开榜单变化,给出了一个不同答案。


MMMU-Pro 是 AI 行业公认最权威的视觉推理评测之一,相当于多模态模型的“世界统考”。在最新官方榜单上,一支约 10 人的创业团队超过了 OpenAI、Google 等基础模型巨头。


深度|10人团队登顶视觉推理榜,超过GPT、Gemini和人类专家


10 人。86.9%。Chance Vision 1.5 超过 GPT 和 Gemini,也超过了榜单中的高水平人类专家基线。


Chance AI 把摄像头当作 AI 进入现实世界的第一入口,打造了行业首个 Visual Agent:用户拍下一件物体、一个场景或一张自拍,系统会从画面中寻找线索,补足功能、文化与使用语境,再把结果推进到判断、搜索和下一步行动。Chance AI 让 AI 真正从“被动地停留在输入框里”推进到“主动和你一起看世界”。


据公开资料披露,Chance AI 已服务全球约 30 万用户,曾进入 App Store 下载榜 Top 3;次月留存率为 49.2%。产品发布当日登顶 Product Hunt 日榜,随后又将 Visual Agent 带进现实:成为纽约时装周和香港巴塞尔艺术周的合作伙伴。


用户增长与公开榜单共同说明:视觉智能一旦从“看见”继续走向“洞见”,就能形成一种新的 AI 使用习惯。


深度|10人团队登顶视觉推理榜,超过GPT、Gemini和人类专家


Chance AI 的产品路径最早在美国大学校园中得到验证


公开榜第一的背后,Chance AI 把答案指向了一个新机制:模型需要一套能够持续寻找、核对视觉证据的推理机制。


“AI 已经有了强大的眼睛,下一步需要的是视觉皮层。”


过去的主流路线,常把第一次视觉编码当成了完整理解。但人类的眼睛只负责接收和初步处理信号,真正负责选择、解释、核对与更新判断的,是视觉皮层及相关脑区。Chance AI 做的,是把这种分工迁移进 AI:视觉模块负责不断取得证据,推理回路决定下一眼看哪里;证据不足,系统就回到原图重新核对。


Z Highlights


  • 10 人团队,在视觉推理榜上超过了基础模型巨头。Chance Vision 1.5 在 MMMU-Pro 官方公开榜取得 86.9%,高于 GPT、Gemini 和高水平人类专家基线。这意味着,视觉推理的领先不只取决于模型规模,也可能来自更有效的观察与推理方法。


  • AI 已经可以“看见”,但还不能“洞见”。通用模型已经能识别出画面里的东西,真正的难题是推理过程中无法形成可以思考的“视觉皮层”。Chance AI 将这种失误称为“视觉脱锚”,并用视觉推理回路 VIC(Visual Inference Circuits)把模型一次次送回证据现场。


  • 视觉推理回路 VIC 让 AI 像人一样看:先猜,再找证据,最后改答案。它根据当前疑点决定下一步该看哪里、调用什么工具;证据不足就回到原图重新核对,把“看见”推进到“洞见”。


  • 相机既是产品入口,也是视觉推理的真实考场。反光、遮挡、模糊目标和不完整提问会持续暴露系统缺口;这些交互可以转化为回看、路由与核验机制的改进信号,形成产品与技术互相推动的飞轮。


  • Visual Agent 的竞争,最终是“能否理解眼前的事物”。Chance AI 的受控实验显示,移除三层个人视觉记忆后,工具查询相关性下降 11.2%,端到端效用下降 9.7%。模型能力之外,个人记忆正在成为下一代视觉智能的新变量。


01 行业把“看见”误当成了“洞见”


今天的通用多模态模型已经可以识别物体、读取文字、解释图表。常见流程是先把图片编码成一组视觉 token,再交给语言模型推理。对于画面简单、问题明确的任务,这条路线已经相当有效。


问题出现在推理变长、图像变复杂之后。图片经过第一次编码,后续推理往往依赖被压缩过的视觉表征或文字描述。模型看似仍在分析图片,实际上可能早已离开了原始画面。最初漏掉一处细节、看错一个结构,后面即使推理完全自洽,也可能只是在把错误解释得越来越完整。


Chance AI 把这种现象称为“视觉脱锚”(Visual Grounding Drift,VGD):图片仍在输入中,推理却不再持续核对原始视觉证据。


联合创始人兼 CTO 吴晓凡此前在巴黎 Google 实验室从事视觉人工智能工程实践。过去六个月主导搭建 Chance AI 的视觉语言模型循环工程(VLM Loop Engineering)架构。他把问题压缩成一句话:“给 AI 配了眼睛,但它能否从‘看见’走向‘洞见’?”


第一个难点,是确认“它究竟是谁”。在一组对比测试中,两边看到同一台正在装配零件的人形机器人。ChatGPT 5.6 Pro 给出的首要候选是日本 Kawada Robotics 的 NEXTAGE 系列,并说明仅凭单张图片无法完全确认;Chance AI 则判断为宇树 G1,并进一步从手部结构、零件分拣动作与生产线语境,解释它为什么正从运动展示走向精细生产任务。


深度|10人团队登顶视觉推理榜,超过GPT、Gemini和人类专家


同一张工业机器人照片:Chance AI 识别为宇树 G1;ChatGPT 5.6 Pro 给出的首要候选是 Kawada Robotics NEXTAGE 系列


这里的风险不只是“型号猜错”。通用模型同样能列出双机械臂、作业场景等一套完整理由,错误因而显得更可信。视觉推理真正要解决的,是在答案变得流畅之前,先确认每一条判断是否仍有原图证据支撑。


02 看似合理的答案,恰恰是视觉脱锚陷阱


视觉脱锚最难发现的状态,是模型给出了一个足够合理、甚至自洽的答案。模型一旦过早锁定候选,后续搜索与解释就会围绕这个候选展开,原图中不相符的细节反而被忽略。


一辆黄色跑车,就是典型例子。在这组测试截图中,ChatGPT 5.6 Pro 根据跑车比例、剪刀门和改装尾翼等特征,将车辆判断为改装 MG Cyberster。Chance AI 则继续核对前灯、车身比例、空气动力学套件与拍摄语境,判断其为小米 SU7 Ultra,并解释性能设计如何转化为视觉语言。


深度|10人团队登顶视觉推理榜,超过GPT、Gemini和人类专家


同一辆黄色跑车:Chance AI 判断为小米 SU7 Ultra;ChatGPT 5.6 Pro 判断为改装 MG Cyberster


两边都已经“看见”了目标对象;真正拉开差距的,是系统能否在一个合理答案出现后继续寻找反证。如果模型不知道何时该怀疑第一眼,它越会解释,错误就越像真的。


03 VIC(Visual Inference Circuits,视觉推理回路):让 AI 像人一样寻找视觉证据


Chance AI 的技术起点,来自人类观察世界时的一种基本机制:视觉是由目标驱动的主动采样。Chance AI 创始人曾熙在博士研究期间,专攻认知科学与人类视觉认知;此后曾任字节跳动 Flow 高级总监,参与豆包视觉语言模型的应用落地。学术研究与产品实践的交汇,促使他从人类大脑观察世界的机制中寻找启发,并据此提出 VIC(Visual Inference Circuits,视觉推理回路),将这套生物认知逻辑转化为 AI 的视觉推理机制。


人看到一个陌生设备时,不会把所有像素平均看一遍。大脑会先形成初步假设,再把注意力转向最可能补足证据的位置。新的视觉输入支持或推翻原来的判断,下一次观察也随之改变。看见、预测、核对和修正,本来就是一条循环。


Chance AI 将这套“主动采样、预测校正、动态路由”的机制抽象为 VIC(Visual Inference Circuits,视觉推理回路)


深度|10人团队登顶视觉推理榜,超过GPT、Gemini和人类专家


形成初步假设 → 找到证据缺口 → 回到原图 → 激活对应回路与 Visual Skill(视觉技能) → 交叉核对 → 更新结论


荣耀 Robot Phone 的案例展示了 VIC 为什么必须在“局部”与“整体”之间来回切换。只看顶部机械结构,它确实像一个双轴云台相机模块,ChatGPT 5.6 Pro 也沿着这个局部形态给出答案。Chance AI 则把局部结构放回整机形态与世界移动通信大会(MWC)2026 的发布语境,识别为荣耀 Robot Phone,并进一步解释这种机械视觉部件如何让手机从平面设备走向具备物理交互能力的新形态。


深度|10人团队登顶视觉推理榜,超过GPT、Gemini和人类专家


同一处顶部机械结构:Chance AI 将其放回荣耀 Robot Phone 整机与 MWC 2026 语境;ChatGPT 5.6 Pro 判断为双轴云台相机模块


VIC 在这里先保留多个候选,再逐一检查“云台模块”能否解释其连接方式、整机形态与展会语境。证据不足时,系统重新回看关键区域并调用相关视觉能力与外部知识,直到结论收敛。


VIC 并非一条预先写死的工作流。不同任务会激活不同回路:有的负责确认具体对象,有的读取小字与空间关系,有的推断部件功能,有的调用搜索与专业知识,还有的专门回到原图验证前一步是否站得住。系统根据“现在还缺什么”,决定“下一步调用什么”。


如果说混合专家模型(MoE)路由的是专家,VIC 路由的就是视觉证据。


吴晓凡将团队希望沉淀的能力概括为三件事:下一眼看哪里、下一步调用什么,以及何时停止观察并开始行动。模型可以替换,工具可以增加,但这套决定如何获取和核验证据的回路会持续保留。


这条路线与认知科学中的“主动视觉”和“预测编码”相呼应,也与近期视觉研究重新把注意力放回视觉本身的趋势形成交叉。Google DeepMind 的 GenCeption 研究显示,视频生成预训练可以形成跨深度、姿态和分割任务的通用视觉能力;斯坦福大学、马里兰大学与哈佛大学的 Masked Visual Actions则尝试直接在视觉空间预测行动后果。VIC 的不同之处,在于把主动回看与证据路由放进 Agent 的推理过程,让系统根据尚未解决的问题决定下一眼看哪里。


04 相机不只是入口,也是 VIC 的训练场


过去的 AI 交互从问题开始:用户先组织语言,再把问题输入聊天框。camera-first Visual Agent 把交互继续向现实世界推进:用户先举起相机,AI 再判断眼前是什么、还缺少什么信息,以及下一步应该去哪里寻找证据。


基准测试会明确告诉模型需要回答什么,现实世界不会。真实用户通常不会先想好一个完整问题。比如面对几枚装在透明容器里的红色圆形物体,ChatGPT 5.6 Pro 根据形态将其判断为火漆蜡粒;Chance AI 则结合质地、包装与当下美妆语境,识别为 Armani Dolci 系列腮红,并继续解释“从霜到粉”的触感、色彩与社交热度。用户只是举起相机,系统需要同时判断对象、语境,以及什么信息对用户有用。


深度|10人团队登顶视觉推理榜,超过GPT、Gemini和人类专家


同一组红色圆形物体:Chance AI 识别为 Armani Dolci 系列腮红并补充趋势语境;ChatGPT 5.6 Pro 判断为火漆蜡粒


这也是 Chance AI 将相机置于产品入口的原因。输入框要求用户先把眼前所见翻译成语言,AI 接收到的往往已经是被压缩过的二手描述;camera-first 交互则让 AI 直接面对原始视觉证据。吴晓凡将这一路径概括为:“人类先看见世界,再形成洞见。相机让 AI 从同一个起点出发:先接触现实,再由 VIC 决定下一眼看哪里,把‘看见’推进到‘洞见’。


深度|10人团队登顶视觉推理榜,超过GPT、Gemini和人类专家


在世界人工智能大会(WAIC)现场,吴晓凡曾带着记者边走边拍。镜头遇到的是真实展会里的反光、遮挡和不完整信息,系统需要判断展商是谁、设备如何工作,并承接记者接下来的追问。同期,大量现场观众也用 Chance AI 了解展位、整理参观记录。此前,Chance AI 还曾进入纽约时装周与香港巴塞尔艺术周等视觉信息高度密集的场景。


这些真实使用会形成基准测试无法提供的连续反馈:用户为什么拍摄,接着追问了什么,是否保存或分享结果,以及结果不够好时有没有重新拍摄。据悉,Chance AI 已服务全球约 30 万用户,并积累超过 300 万张经授权和脱敏处理、可用于模型增强的有效视觉数据。


这让 App 同时承担产品界面和真实场景训练场的角色:高频失败场景进入评测,用户后续行为帮助 Chance AI 判断答案是否真正有用,新的基础模型和 Visual Skill 再被接入合适的回路。


这条飞轮还有一条更个人化的路径。看到同一件衣服,设计师可能关心剪裁与面料,普通消费者更想知道价格和搭配。“看见这是一件衣服”只是起点;要形成洞见,Visual Agent 还必须判断:对眼前这个人,什么信息最值得继续查。


Chance AI 最近发布的论文 《Memory-Conditioned Tool Calling for Camera-First Visual Agents》,测量的正是这一步。研究将个人视觉记忆分为三层:相对稳定的用户画像(Profile)、近期关注主题(Short-Term Focus),以及从过往互动中提取的具体观察(Observations)。每次用户举起相机,这三层记忆会与当前图片一起进入工具调用回路,影响 Agent 选择什么工具、使用什么查询词,以及何时停止搜索并组织答案。


在 800 张真实世界图片与合成记忆块构成的受控实验中,移除完整的三层记忆后,工具查询相关性从 4.21 分降至 3.74 分,相对下降 11.2%;端到端效用从 0.842 降至 0.760,相对下降 9.7%。换句话说,记忆并不替代视觉识别,它改变的是 AI 认出对象以后,接下来决定查什么。


深度|10人团队登顶视觉推理榜,超过GPT、Gemini和人类专家


论文《Memory-Conditioned Tool Calling for Camera-First Visual Agents》主图


论文并非证明“AI 用得越多就会自动变聪明”,而是说明:系统越了解你,越知道下一步该查什么。


这套机制包含两个时间尺度:在单次使用的内环中,记忆帮助 Agent 调整工具与查询,并根据检索结果继续收紧问题;在跨次使用的外环中,本次互动可以写回用户记忆,供下一次拍摄调用。论文此次测量的是前者,后者是系统已经设计、但仍需真实多会话数据继续验证的路径。


深度|10人团队登顶视觉推理榜,超过GPT、Gemini和人类专家


论文核心机制:个人视觉记忆影响当前图片之后的工具选择与查询;虚线写回表示跨次更新的设计路径,论文此次评估的是单次使用的内环


因此,“越用越好用”在这里并非一句泛化口号,而是一条可以被拆开检验的技术路径:先证明记忆能改善本轮工具调用,再检验记忆在真实使用中持续写回后,是否带来跨次复利。


更多真实场景 → 暴露更多证据缺口 → 改进回看与路由 → 提高任务完成质量 → 进入更多真实场景


基础模型会越来越强,也会越来越便宜。Chance AI 希望在模型能力之上,继续沉淀基础模型不会自动带来的部分:怎样持续访问原始视觉证据,哪条回路应该在何时被激活,真实用户究竟想完成什么,以及什么结果最终对他有用。


05 86.9%,让 Visual Agent 第一次有了公开坐标


MMMU-Pro 可以理解为多模态模型的“大学专业综合考试”。题目来自大学考试、测验和教材,覆盖图表、地图、工程图、医学影像、化学结构与艺术作品等多种图像。模型不仅要看见画面内容,还要调用专业知识,把分散的视觉线索串联成可信结论。


现实中的跨学科画面,也有类似难度。同一张 WAIC 场馆外的建筑照片,ChatGPT 5.6 Pro 将它概括为机器人纤维缠绕的参数化遮阳结构;Chance AI 进一步确认它是 2018 年 WAIC 落户上海西岸时的 Elytra Filament Pavilion,并将圆形开孔、树状支撑与机器人编织工艺连接到仿生设计和数字制造的背景。前者说明“这类结构是什么”,后者回答“它具体是哪座建筑、为何出现在这里”。


深度|10人团队登顶视觉推理榜,超过GPT、Gemini和人类专家


同一座建筑:Chance AI 识别为 2018 年 WAIC 上海西岸的 Elytra Filament Pavilion;ChatGPT 5.6 Pro 停留在通用结构类型


截至发稿,MMMU-Pro 官方公开榜的主要结果如下:


深度|10人团队登顶视觉推理榜,超过GPT、Gemini和人类专家


这个成绩的意义超出了榜单名次本身。视觉推理长期被视为基础模型巨头的游戏:更大的模型、更多的算力和数据,似乎缺一不可。一支约 10 人的团队进入榜首,至少推翻了其中一条默认前提:复杂视觉推理的进步,不一定只来自继续放大模型,也可能来自重新设计 AI 如何观察、如何寻找证据。


86.9% 来自采用 VIC 的完整系统,为 VIC 的有效性提供了公开验证:动态能力调度与重复核验已经在高难度视觉推理任务中取得领先结果。这个成绩同时标志着视觉智能从“看见”走向“洞见”,但并不意味着视觉问题已经被彻底解决。


这也构成了 Chance AI 对 Visual Agent 的定义:Visual Agent 不只看见你拍到了什么,还会进一步洞见它为什么重要,以及你接下来能做什么。


WAIC 后,多家具身智能与 AI 眼镜公司主动寻求与 Chance AI 合作。Chance AI 表示,消费级 App 是技术落地的第一阶段;未来,将会持续探索与机器人、智能眼镜等硬件的结合,成为具身智能“视觉与空间大脑”的能力提供方。


下一代视觉智能的分水岭,已经从“看见”走向“洞见”。


文章来自于"Z Potentials",作者 "Z Potentials"。

AI转型,免费服务,就找AITNT
AITNT资源拓展
根据文章内容,系统为您匹配了更有价值的资源信息。内容由AI生成,仅供参考
1
AI工作流

【开源免费】字节工作流产品扣子两大核心业务:Coze Studio(扣子开发平台)和 Coze Loop(扣子罗盘)全面开源,而且采用的是 Apache 2.0 许可证,支持商用!

项目地址:https://github.com/coze-dev/coze-studio


【开源免费】n8n是一个可以自定义工作流的AI项目,它提供了200个工作节点来帮助用户实现工作流的编排。

项目地址:https://github.com/n8n-io/n8n

在线使用:https://n8n.io/(付费


【开源免费】DB-GPT是一个AI原生数据应用开发框架,它提供开发多模型管理(SMMF)、Text2SQL效果优化、RAG框架以及优化、Multi-Agents框架协作、AWEL(智能体工作流编排)等多种技术能力,让围绕数据库构建大模型应用更简单、更方便。

项目地址:https://github.com/eosphoros-ai/DB-GPT?tab=readme-ov-file



【开源免费】VectorVein是一个不需要任何编程基础,任何人都能用的AI工作流编辑工具。你可以将复杂的工作分解成多个步骤,并通过VectorVein固定并让AI依次完成。VectorVein是字节coze的平替产品。

项目地址:https://github.com/AndersonBY/vector-vein?tab=readme-ov-file

在线使用:https://vectorvein.ai/付费

2
智能体

【开源免费】AutoGPT是一个允许用户创建和运行智能体的(AI Agents)项目。用户创建的智能体能够自动执行各种任务,从而让AI有步骤的去解决实际问题。

项目地址:https://github.com/Significant-Gravitas/AutoGPT


【开源免费】MetaGPT是一个“软件开发公司”的智能体项目,只需要输入一句话的老板需求,MetaGPT即可输出用户故事 / 竞品分析 / 需求 / 数据结构 / APIs / 文件等软件开发的相关内容。MetaGPT内置了各种AI角色,包括产品经理 / 架构师 / 项目经理 / 工程师,MetaGPT提供了一个精心调配的软件公司研发全过程的SOP。

项目地址:https://github.com/geekan/MetaGPT/blob/main/docs/README_CN.md