北大联合阶跃星辰提出TensorCast:统一可编程管理大模型张量,推理「首字延迟」最高降低93.2%
北大联合阶跃星辰提出TensorCast:统一可编程管理大模型张量,推理「首字延迟」最高降低93.2%过去几年,大模型推理系统优化的核心目标一直围绕一个问题展开:如何让 GPU 更高效地计算权重、激活、KV Cache 等高维张量?从并行策略、请求调度、显存管理到算子优化,学界业界大量优化技术不断提升模型推理效率。
搜索
过去几年,大模型推理系统优化的核心目标一直围绕一个问题展开:如何让 GPU 更高效地计算权重、激活、KV Cache 等高维张量?从并行策略、请求调度、显存管理到算子优化,学界业界大量优化技术不断提升模型推理效率。
今日零时起,DeepSeek正式执行新版API价格,DeepSeek-V4-Flash和DeepSeek-V4-Pro两款主力模型首次采用峰谷定价,闲时价格统一为高峰时段的一半。此次调整同步抬高了两款模型的基础价格。DeepSeek-V4-Flash高峰时段每百万Tokens缓存命中输入、缓存未命中输入和输出价格分别为0.1元、3元和9元,闲时分别降至0.05元、1.5元和4.5元。
DeepSeek-v4-pro-0813 正式上线,两极分化的口碑却让人摸不着头脑。一边,是疯狂刷屏的评测夯爆了:多项 Agent 测试逼近 Fable 5,被认为是又一次前沿模型的“核弹级”更新;另一边,却是不少深夜忠实开发者直摇头:吐槽涨价、模型能力不及预期,实测体感甚至不如之前的小模型……
DeepSeek Harness这下真快被网友「插成万物」了。小黑鲸上线还没多久,单单在GitHub上打着dsh-plugin标签的公开仓库,就已经冲到了700+个???有人给它装浏览器、长期记忆、数据库和任务管理;有人嫌DeepSeek不会看图,现场接了个视觉模型进去。
只做AI代码审美国AI代码审查与管理工具商CodeRabbit宣布完成1.43亿美元(约合人民币10.3亿元)C轮融资。Crunchbase显示,截至发稿,CodeRabbit一共完成了6轮融资,累计融资额达2.31亿美元(约合人民币16.6亿元)。查赛道,也能跑出一个独角兽! CodeRabbit,估值已超15亿美元(约合人民币108亿元)。 美国AI代码审查与管理工具商Cod
Anthropic 的增长速度,又一次超过了自己的预测。据彭博看到的投资者文件,Anthropic 今年第二季度初步营收超过 115 亿美元,较去年同期的 7.87 亿美元增长超过 14 倍;相比今年第一季度的 47.3 亿美元,也增长了一倍以上。
2020 年,他去 MIT 面试教授岗位,做了一场关于用 GPT 做推理的报告。结果,面试委员会大部分教授把这个方向斥为「无稽之谈」(nonsense)。这哥们直接贴脸开大,将这段经历写进了个人主页,并附上了当年的报告介绍和幻灯片链接。
此刻,DeepSeek Harness 的 GitHub 仓库显示 10.50 万个 Star、10033 次 Fork。距离发布仅 45 小时。当然,热度不意味着胜利。值得关注的是开发者具体在拿它做什么。人们开始拿 DSH 做完全相反的事——有人跑实测,有人报 Bug,有人造插件,也有人质疑“为什么还要再做一个 Harness”。
刚刚,阿里千问正式开源Qwen3.8-27B模型权重。Qwen3.8-27B是一款270亿参数的原生多模态稠密模型,支持图像、视频理解,原生上下文长度达到262K,并可通过YaRN扩展至100万Tokens。
昨晚,瑞典AI编程创企Lovable宣布完成4亿美元(约合人民币26.97亿元)C轮融资,估值达133亿美元(约合人民币896.71亿元),7个月时间估值翻倍。本轮融资由美国老牌风投Menlo Ventures领投,腾讯以及Balderton Capital、Carmignac等投资机构参投。