谷歌爆改Transformer,“无限注意力”让1B小模型读完10部小说,114倍信息压缩
谷歌爆改Transformer,“无限注意力”让1B小模型读完10部小说,114倍信息压缩它通过将压缩记忆(compressive memory)整合到线性注意力机制中,用来处理无限长上下文
搜索
它通过将压缩记忆(compressive memory)整合到线性注意力机制中,用来处理无限长上下文
不走Transformer寻常路,魔改RNN的国产新架构RWKV,有了新进展: 提出了两种新的RWKV架构,即Eagle (RWKV-5) 和Finch(RWKV-6)。
随着大模型的参数量日益增长,微调整个模型的开销逐渐变得难以接受。 为此,北京大学的研究团队提出了一种名为 PiSSA 的参数高效微调方法,在主流数据集上都超过了目前广泛使用的 LoRA 的微调效果。
谷歌又放大招了,发布下一代 Transformer 模型 Infini-Transformer。
在实践中,人类预测的准确性依赖于「群体智慧」(wisdom of the crowd)效应,即通过聚集一群个体预测者,对未来事件的预测准确率会显著提高
大语言模型(LLM),通过在海量数据集上的训练,展现了超强的多任务学习、通用世界知识目标规划以及推理能力
大语言模型潜力被激发—— 无需训练大语言模型就能实现高精度时序预测,超越一切传统时序模型。
谁能想到,只是让大模型讲笑话,论文竟入选了顶会CVPR!
技术阿甘在不停奔跑。
纯C语言训练GPT,1000行代码搞定!,不用现成的深度学习框架,纯手搓。 发布仅几个小时,已经揽星2.3k。