NeurIPS'26 | 港科大:从CPU到GPU,AI能否真正加速全流程?
NeurIPS'26 | 港科大:从CPU到GPU,AI能否真正加速全流程?港科大团队在NeurIPS 2026上提出AccelEval基准,覆盖6个领域42项任务和43类CUDA优化策略,评测大模型能否从可信CPU程序生成端到端更快的GPU实现,其中Gemini 3.1 Pro在中规模通过正确性验证的任务上取得71.2倍几何平均加速比。
搜索
港科大团队在NeurIPS 2026上提出AccelEval基准,覆盖6个领域42项任务和43类CUDA优化策略,评测大模型能否从可信CPU程序生成端到端更快的GPU实现,其中Gemini 3.1 Pro在中规模通过正确性验证的任务上取得71.2倍几何平均加速比。
英伟达死守的推理性价比神话,碎了。
就在刚刚,OpenAI工程师承认,已经看不懂AI写的代码了。
就在刚刚,OpenAI首颗自研芯片Jalapeño「墨西哥辣椒」,交出了首批实测成绩单——AI推理性能,全面反超英伟达GB200和GB300。实测速度直接起飞!Jalapeño一秒能狂吐1459个Token,英伟达GB200只有535个,连一半都不到。
今天,一条前两天的推文开始热传,内容只有 5 个词:Scott Gray 已离开 OpenAI。
CUDA又双叒叕被创了…
一句话,一个周末,Claude直接把自家最前沿的模型跑在了一台全新的AMD MI355X机架上!
AMD 有机会打破英伟达 CUDA 的护城河吗?
一段原本为英伟达 CUDA 设计的计算程序,几乎无需修改内核代码,就直接跑在了一台搭载 M3 Pro 的苹果设备上。
AI竟写出了,史上最快内核!在全新一轮GPU算子基准测试KernelBench-Mega中,Fable 5表现一骑绝尘。它在RTX PRO 6000,全程「纯手搓」CUDA,速度狂飙18.7倍。相比之下,强如Claude Opus 4.8也只跑出14.4倍,而GPT-5.5只有4.34倍。