李飞飞团队年度报告揭底大模型训练成本:Gemini Ultra是GPT-4的2.5倍
李飞飞团队年度报告揭底大模型训练成本:Gemini Ultra是GPT-4的2.5倍如何复盘大模型技术爆发的这一年?除了直观的感受,你还需要一份系统的总结
搜索
如何复盘大模型技术爆发的这一年?除了直观的感受,你还需要一份系统的总结
现今,机器学习(ML),更具体地说,深度学习已经改变了从金融到医疗等广泛的行业。在当前的 ML 范式中,训练数据首先被收集和策划,然后通过最小化训练数据上的某些损失标准来优化 ML 模型
从国际顶流 GPT-4 128K、Claude 200K 到国内「当红炸子鸡」支持 200 万字上下文的 Kimi Chat,大语言模型(LLM)在长上下文技术上不约而同地卷起来了
提出图像生成新范式,从预测下一个token变成预测下一级分辨率,效果超越Sora核心组件Diffusion Transformer(DiT
以神经网络为基础的深度学习技术已经在诸多应用领域取得了有效成果
通过这项技术,能使transformer大模型在有限的计算资源 条件下,处理无限长度的输入。
风格化图像生成,也常称为风格迁移,其目标是生成与参考图像风格一致的图像。
自 2020 年神经辐射场 (Neural Radiance Field, NeRF) 提出以来,将隐式表达推上了一个新的高度。作为当前最前沿的技术之一
近,来自澳大利亚蒙纳士大学、蚂蚁集团、IBM 研究院等机构的研究人员探索了模型重编程 (model reprogramming) 在大语言模型 (LLMs) 上应用,并提出了一个全新的视角
为解决大模型(LLMs)在处理超长输入序列时遇到的内存限制问题,本文作者提出了一种新型架构:Infini-Transformer,它可以在有限内存条件下,让基于Transformer的大语言模型(LLMs)高效处理无限长的输入序列。实验结果表明:Infini-Transformer在长上下文语言建模任务上超越了基线模型,内存最高可节约114倍。