大模型长文本卡在“状态读写”:8比特量化把内核提速3.7倍
加州大学伯克利分校、华盛顿大学、麻省理工学院、英伟达等机构提出LeapQuant,专门压缩线性注意力反复读写的状态。它无需重新训练,在接近FP32精度时把相关内核平均加速2.05至3.70倍,并在多款GPU上获得1.47倍端到端加速。
加州大学伯克利分校、华盛顿大学、麻省理工学院、英伟达等机构提出LeapQuant,专门压缩线性注意力反复读写的状态。它无需重新训练,在接近FP32精度时把相关内核平均加速2.05至3.70倍,并在多款GPU上获得1.47倍端到端加速。
香港中文大学(深圳)、小鹏汽车、西安电子科技大学等机构提出RoXDrive,让自动驾驶策略只从“听指令”的世界模型片段中学习。它在nuScenes上把DiffusionDrive的安全违规减少27.6%,并在超过13万段场景的内部数据上持续
Scale AI、Hugging Face、南加州大学、斯坦福大学等机构联合提出新方法,把双臂机器人的长任务拆成可预测的下一步,并公开4万多段密集标注轨迹。新策略在论文设定的空间消歧任务中把成功率从32%提高到100%,还把未见长任务的成功
当地时间2026年9月28日,Anthropic发布Claude Sonnet 5.5,即日起上线Claude应用、Claude Code、API及主流云平台。新模型主打日常编码与文档表格制作,输出提速30%以上,单任务开销较上代最多降30
香港大学、新加坡国立大学、香港中文大学(深圳)等机构推出ORCA,专门测试大模型能否把数据科学代码从一个软件库迁移到另一个库,同时保持结果正确。论文不仅测短代码片段,还测完整项目。在项目级任务中,受测的Claude-Opus-4.6成功率为
上海交通大学与阿里巴巴通义实验室等机构提出GUI-Hopper,让手机AI助手在适合时使用应用的深层链接,直接打开目标页面,而不必每次都从首页逐层点击。团队先从应用中找出可能的入口,再用真机核验链接会落到哪里,并保留普通点屏操作作为兜底。在
加州大学伯克利分校、上海科技大学、Google DeepMind等机构提出HuGo,让大语言模型为人形机器人编写能反复根据观察调整动作的任务代码。机器人底层走路与平衡能力保持不变,上层代码负责决定何时走、伸手和搬物。在论文的低门穿行模拟任务
香港科技大学、地平线、香港中文大学、南开大学等机构提出WALT,让自动驾驶规划器更好地利用视觉世界模型已经学到的道路信息。它先把行车轨迹转成紧凑的内部表示,再与路况画面的表示对齐,而不是直接让模型吐出一串坐标。在NAVSIM评测中,规划计算
清华大学、京东、东南大学等机构提出Routed Forcing,想解决实时数字人常见的“嘴在动,身体却像木头”的问题。团队发现,压缩视频生成模型时,动作丰富度主要在人物身体区域流失,于是只在需要的位置和训练阶段加入真实视频示范。在两套实验数
上海交通大学、清华大学、上海人工智能实验室、北京邮电大学等机构提出ManiVid,让视频取证从“判断真假”进一步走向“标出哪里被改、说明为什么可疑”。研究团队构建约3.8万段带标注的篡改视频,并在专门测试中提升篡改区域定位和异常解释成绩。面
北京大学、百度、清华大学等机构提出H2S,让模型读长材料时先找出与问题有关的证据,再把证据压缩成一份短摘要后作答。在论文的长文本测试中,14B模型平均得分32.60,比受测的27B基线高10.17分;把输出预算从16K缩到4K时,仍保留97
南京大学联合蚂蚁集团、浙江大学提出KnowBody,在不改动视觉语言模型权重的前提下,让机器人拥有一份可查询、可修订的身体关系说明书。四个真机任务、32次固定预算试验中,完成率从原生工具的25%提升到75%。脑子很聪明的VLM终于补上了身体
香港科技大学联合上海人工智能实验室、清华大学、南洋理工大学提出SciWalker,让AI按算子链自动出科学编程题,并用真实执行反馈筛选修复。他们造出8178道高质量题目,用GSPO训练后,Qwen3.5-9B在SciCode上的准确率从29
MIT联合英伟达、新加坡国立大学、宾夕法尼亚大学提出RAPID。机器人只需看一遍人类的视觉演示,就能自动生成、验证并精化自己的控制程序,8项接触丰富的真机任务平均成功率达75.9%。机器人新技能的部署有望不再依赖工程师逐行写代码。
圣母大学联合IBM研究院、微软研究院、MIT对17个语言模型做了一次受控审计。在允许钻空子的条件下,74.6%的尝试被确认为奖励黑客,而且评审反馈越详细,模型越会学着逃逸。这给“把科研交给AI”敲响了实打实的警钟。
阿里巴巴万相团队联合南京大学、复旦大学、清华大学做出一个397B参数的提示增强模型WanPE。它把用户的简单一句话扩写成导演级分镜计划再驱动视频生成,30秒视频的人类好评率相对原始提示暴涨50.86个点。长视频终于不再靠写提示碰运气。
DP Technology、中国科学院理论物理研究所、北京大学、兰州大学等机构提出Large Knowledge Model(LKM),把论文拆成问题、推理步骤、结论与证据,再跨论文连成可检索地图。固定回答模型时,LKM检索将ChemBen
明尼苏达大学提出PointCast,用同一种3D点集表示预测刚体、布料、绳索和多关节柜体在机器人动作后的变化。架构只有19.8M参数,在仿真四类体系中三类排名第一、刚体排名第二,并能冻结后放进模型预测控制器中规划动作。
论文公开页面未披露作者机构。StudentBench让2383名参与者接受AI辅导、专家人类辅导或无辅导,再直接比较GRE前后测学习增益。实验报告AI辅导与专家人类辅导统计等效,其中一个AI辅导器的单位学习增益成本低918倍。
香港大学、香港科技大学、普林斯顿大学、加州大学圣迭戈分校提出NowWAM:不再让生成模型预测未来画面,而是在当前画面的去噪过程中直接学动作。它把训练视觉token从784减至392,单步耗时从2.85秒降至1.63秒,同时在LIBERO-P