阿里 Qwen3.8 正式发布:2.4T 规模,自主编程 16 天搓出一个 Hermes Agent

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
阿里 Qwen3.8 正式发布:2.4T 规模,自主编程 16 天搓出一个 Hermes Agent
8644点击    2026-08-03 12:28

阿里 Qwen3.8 正式发布,2.4T 规模,自主编程 16 天搓出另一个“Hermes Agent”!


8 月 3 日,阿里巴巴正式发布新一代基座大模型 Qwen3.8,总参数量 2.4 万亿,在编程(Coding)和专业办公(Cowork)方面能力大幅提升。今日放榜的权威三方榜单 Arena 中,阿里 Qwen 模型仅次于 Anthropic 的 Claude 系列,整体性能处于全球大模型第一梯队。目前,Qwen3.8 的 API 已上线千问 AI 平台,并接入阿里今日同步推出的 Agent 产品“千问办公”。Qwen3.8-Max 预计下周开源,同时还将开源 Qwen3.8-27B。


阿里 Qwen3.8 正式发布:2.4T 规模,自主编程 16 天搓出一个 Hermes Agent

今日起,全球开发者都可通过千问 AI 平台获得 Qwen3.8 的 API 服务,国内每百万 Tokens 输入 12 元、输出 36 元,隐式缓存命中仅 1.5 元,而输入与输出的国际价格仅分别为 Opus5 的 40% 与 24%,实现相近智能更高性价比。


阿里 Qwen3.8 正式发布:2.4T 规模,自主编程 16 天搓出一个 Hermes Agent


同时,阿里旗下企业级 Agent 产品“千问办公”(QwenWork)开启公测。个人和企业用户均可通过“千问办公”官网(qwenwork.cn)体验,目前网页版和独立 PC 客户端已开放,钉钉 PC 端和手机端内置入口近期也将开放。用户可在“千问办公”体验阿里最新旗舰模型 Qwen3.8。


2.4T 大模型,“Qwen3.8 就像个资深的工程师”


此次发布的是千问大模型系列中尺寸最大、性能最强的旗舰模型 Qwen3.8-Max,它支持视觉理解,上下文长度达 1M Tokens。


在模型架构上,Qwen3.8 通过稀疏 MoE 架构与混合注意力机制的联合优化,首次将千问大模型的总参数量拓展至 2.4T,激活 95B,获得了更高的推理效率、更快的推理速度,整体性能也迎来新突破:


  • 在科研复现评测 PaperBench 等编程智能体评测中,Qwen3.8-Max 较上代模型大幅提升 28.2 分,以 93.0 分录得评测新高;
  • 在 WideSearch、Agent's Last Exam 等通用智能体评测中,新模型分别取得 81.9 分和 52.4 分,位居前沿。
  • 同时,Qwen3.8 在指令遵循 IF Bench 评测中斩获 82.8 分,科学推理 GPQA Diamond 取得 92.6 分,系列通用能力均位居前列;
  • 在视觉推理 BabyVision 评测中,Qwen3.8-Max 在无工具条件下取得 82.0 分,超出部分主流模型近两倍,在评估智能体电脑操作能力的 OSWorld-Verified 评测中,Qwen3.8-Max 以 86.1 分位居主流模型首位。


编程能力(Coding)是前沿大模型的核心能力之一,Qwen3.8 实现了自主编程的新突破。在权威 CodeArena 榜中,Qwen3.8 位居全球第四。据介绍,Qwen3.8 可以从一个空文件夹出发,自主完成一个十数天的真实项目交付,全程无需人干预。


官方表示,只需一句“创建一个自进化的智能体 Harness”,Qwen3.8 就像个资深的工程师,从零开始,自主搭建循环工程(Loop Engineering)框架,编排智能体自动领取和执行任务,人类工程师还可通过钉钉给 Qwen3.8 提出新要求。Qwen3.8 独立编程运行约 16 天后,做出了一个 Hermes Agent 级别的、真实可用的自进化智能体框架“oh-my-cli”,目前该项目现已完全开源,完整过程公开保存在 GitHub 仓库里,可供所有人查看。


另外,官方表示,Qwen3.8 可胜任广泛的、真实的专业工作任务(Cowork)。面对完全不同的专业任务、评判标准和计算需求,Qwen3.8 通过真实环境和算力的联合强化学习(RL)扩展,实现了数百种高价值、高频专业任务的真实表现提升,在主流的智能体框架中均可稳定可靠地交付生产级成果:


  • 一支法务助理团队在数百份法律文档中标注千余个相关条款,需要一周时间,Qwen3.8 一小时内就能做完;
  • 一个篮球数据分析团队逐帧标注 160 个小时以上的比赛录像,Qwen3.8 数十分钟就可精准拆解这 8400 多个攻防回合,并一次性输出球员战术画像和教练报告;
  • 一个金融研究团队基于数年的专业知识积累,搜集资本市场全面、实时的变动,才能依次完成的量化策略研究,Qwen3.8 自主调动并行的智能体,连续工作数小时后交付完整的 ETF 轮动策略,并持续分析回测、动态修正、最后实现规模化盈利。


在长周期任务中,Qwen3.8 涌现出系统级自主规划与全栈闭环自适应学习能力。无论是在高精密、强物理约束的数字芯片设计,还是在高度动态、博弈激烈的商业模拟运营中,Qwen3.8 均能通过“执行 - 反馈 - 迭代”的自适应闭环,在数千轮的超长程交互中实现算法与策略的深度重构。


Qwen3.8 除了拥有强大的文本和推理能力,还提高了 AI 视觉理解能力的极限。在权威 Vision Arena 榜单中,Qwen3.8-Max 排名全球第二。


据介绍,Qwen3.8 能读懂 200 页的财报 PDF、看懂超 100 小时的长视频,还能将这些“看到”的知识和信息反馈到工作全流程去,帮助模型思考得更周全。在千问团队构建的“应用复刻”基准 RecreationBench 长程任务中,模型没有源代码也无法联网,只通过交互与反馈去理解这个应用,却能从零复刻出整个应用。


此外,阿里真武 M890 超节点也已成功适配 Qwen3.8,通过芯片、云平台与千问大模型的全链路优化,显著提升推理效率、降低推理成本,在 Agentic 推理场景中最多可实现 1.5 倍性能提升。



文章来自于微信公众号 “AI前线”,作者 “AI前线”

AI转型,免费服务,就找AITNT
AITNT资源拓展
根据文章内容,系统为您匹配了更有价值的资源信息。内容由AI生成,仅供参考
1
AI代理

【开源免费】Browser-use 是一个用户AI代理直接可以控制浏览器的工具。它能够让AI 自动执行浏览器中的各种任务,如比较价格、添加购物车、回复各种社交媒体等。

项目地址:https://github.com/browser-use/browser-use


2
智能体

【开源免费】AutoGPT是一个允许用户创建和运行智能体的(AI Agents)项目。用户创建的智能体能够自动执行各种任务,从而让AI有步骤的去解决实际问题。

项目地址:https://github.com/Significant-Gravitas/AutoGPT


【开源免费】MetaGPT是一个“软件开发公司”的智能体项目,只需要输入一句话的老板需求,MetaGPT即可输出用户故事 / 竞品分析 / 需求 / 数据结构 / APIs / 文件等软件开发的相关内容。MetaGPT内置了各种AI角色,包括产品经理 / 架构师 / 项目经理 / 工程师,MetaGPT提供了一个精心调配的软件公司研发全过程的SOP。

项目地址:https://github.com/geekan/MetaGPT/blob/main/docs/README_CN.md