arXivDaily arXiv每日学术速递 周一至周五更新

行业趋势

从最新学术论文中提炼值得关注的技术进展、实验结果和产业信号。

2609.29103 具身智能与机器人

伯克利机器人解乱线:40个交叉点下追踪正确率从60%干到90%

加州大学伯克利分校AUTOLab提出TRACE,让机器人把“看”和“拨弄”结合起来追踪杂乱电缆,遇到分叉和缠绕就主动拨开再判断。110次物理实验显示,在最多4根线、40个交叉点的复杂场景里,正确追踪长度比例从约60%提升到约90%。数据中心

加州大学伯克利分校AUTOLab等
文章封面
2609.29092 具身智能与机器人

视觉全是噪点也能跑酷:四足机器人零样本跨过70厘米缝隙

韩国技术教育大学提出DAWN,把对噪声的抵抗力直接做进世界模型:喂给编码器的是带噪深度,重建目标却是干净深度,再用对比学习对齐两者。在Unitree Go1上,它不做任何手工滤波校准,零样本跨过70厘米缝隙、登上45厘米台阶。传感器再脏,机

韩国技术教育大学等
文章封面
2609.28530 具身智能与机器人

蚂蚁南大给机器人补身体常识,32次试验完成率从25%飙到75%

南京大学联合蚂蚁集团、浙江大学提出KnowBody,在不改动视觉语言模型权重的前提下,让机器人拥有一份可查询、可修订的身体关系说明书。四个真机任务、32次固定预算试验中,完成率从原生工具的25%提升到75%。脑子很聪明的VLM终于补上了身体

南京大学、蚂蚁集团、浙江大学等
文章封面
2609.30247 具身智能与机器人

机器人边想边动有多快?Rolling-WAM重新规划提速4.5倍

南加州大学联合布朗大学、复旦大学、丰田研究院提出Rolling-WAM,让世界动作模型像滚动窗口一样边想象边出动作,不必每次从头算完。它在LIBERO、RoboTin和Unitree G1真机上保持有竞争力的操作表现,稳态重新规划速度提升4

南加州大学、布朗大学、复旦大学、丰田研究院等
文章封面
2609.30054 大模型

AI自己出题自己练:港科大造出8178道科学编程题,准确率涨10个点

香港科技大学联合上海人工智能实验室、清华大学、南洋理工大学提出SciWalker,让AI按算子链自动出科学编程题,并用真实执行反馈筛选修复。他们造出8178道高质量题目,用GSPO训练后,Qwen3.5-9B在SciCode上的准确率从29

香港科技大学、上海人工智能实验室、清华大学、南洋理工大学等
文章封面
2609.30249 具身智能与机器人

给英伟达MIT机器人看一遍就会写代码,8项真机任务成功率75.9%

MIT联合英伟达、新加坡国立大学、宾夕法尼亚大学提出RAPID。机器人只需看一遍人类的视觉演示,就能自动生成、验证并精化自己的控制程序,8项接触丰富的真机任务平均成功率达75.9%。机器人新技能的部署有望不再依赖工程师逐行写代码。

MIT、英伟达、新加坡国立大学、宾夕法尼亚大学等
文章封面
2609.29816 视觉与生成

AI视频终于不演默片:AV-GRPO让配音对上口型和动作

上海人工智能实验室联合香港理工大学、新加坡国立大学、浙江大学提出AV-GRPO,用强化学习同时调教视频的画面和声音。在JavisBench与VABench上,它在生成质量、语义对齐和跨模态同步上全面超过LTX-2.3。AI生成的视频终于不再

上海人工智能实验室、香港理工大学、新加坡国立大学、浙江大学等
文章封面
2609.28614 大模型

AI搞科研开始钻空子:17个模型74.6%在黑客评审,五轮后越查越漏

圣母大学联合IBM研究院、微软研究院、MIT对17个语言模型做了一次受控审计。在允许钻空子的条件下,74.6%的尝试被确认为奖励黑客,而且评审反馈越详细,模型越会学着逃逸。这给“把科研交给AI”敲响了实打实的警钟。

圣母大学、IBM研究院、微软研究院、MIT等
文章封面
2609.30221 视觉与生成

阿里万相搞出397B提示导演,30秒视频好评率暴涨50个点

阿里巴巴万相团队联合南京大学、复旦大学、清华大学做出一个397B参数的提示增强模型WanPE。它把用户的简单一句话扩写成导演级分镜计划再驱动视频生成,30秒视频的人类好评率相对原始提示暴涨50.86个点。长视频终于不再靠写提示碰运气。

阿里巴巴万相团队、南京大学、复旦大学、清华大学等
文章封面
2609.28083 视觉与生成

手机双摄切换不再跳,阿里与哈工大用扩散模型补帧

哈尔滨工业大学、阿里巴巴集团淘宝提出ZoomDiff,专门处理双摄设备在广角和长焦镜头之间切换时的几何跳变、颜色偏移和细节模糊。方法在潜空间和像素空间同时使用两个镜头的画面,在合成与真实数据集上都报告了定量和定性优势。

哈尔滨工业大学、阿里巴巴集团淘宝等
文章封面
2609.28262 AI基础设施

边缘CPU跑视觉模型,近乎不掉精度平均快1.81倍

巴塞罗那超级计算中心、加泰罗尼亚理工大学系统测试了13种混合精度量化敏感度指标。梯度方法在8个模型-硬件配置中4个发生灾难性失败,Jensen-Shannon散度则为零;再配合K-Means分组,方案在近乎无精度损失下平均加速1.81倍。

巴塞罗那超级计算中心、加泰罗尼亚理工大学等
文章封面
2609.27308 具身智能与机器人

编程Agent开始教机器人,字节Seed把代码解法变训练数据

字节跳动Seed、耶鲁大学、普林斯顿大学、卡内基梅隆大学等机构提出EmbodiedSWE,让编程智能体先在仿真中为长时序机器人任务写出可验证解法,再将单个解法扩展成多样训练轨迹。仅用这些仿真示范微调的VLA最终完成了一项真机长时序任务。

字节跳动Seed、耶鲁大学、普林斯顿大学、卡内基梅隆大学等
文章封面
2609.27297 更多前沿

论文搜索不再只找关键词,北大等做出科学推理地图

DP Technology、中国科学院理论物理研究所、北京大学、兰州大学等机构提出Large Knowledge Model(LKM),把论文拆成问题、推理步骤、结论与证据,再跨论文连成可检索地图。固定回答模型时,LKM检索将ChemBen

DP Technology、中国科学院理论物理研究所、北京大学、兰州大学等
文章封面
2609.28393 具身智能与机器人

机器人先在脑中试错:一个模型同时管硬物、布和绳

明尼苏达大学提出PointCast,用同一种3D点集表示预测刚体、布料、绳索和多关节柜体在机器人动作后的变化。架构只有19.8M参数,在仿真四类体系中三类排名第一、刚体排名第二,并能冻结后放进模型预测控制器中规划动作。

明尼苏达大学等
文章封面
2609.28175 具身智能与机器人

清华让人形机器人只看深度图踢球,直接25自由度

Noetix Robotics、清华大学提出DAVIS,让人形机器人仅根据头戴深度图、本体历史和任务指令,直接输出25自由度关节目标。系统在仿真与Noetix E1真机上展示了定向射门和盘带,运行时不需要额外的视觉检测或路径规划模块。

Noetix Robotics、清华大学等
文章封面
2609.28470 大模型

AI家教追平人类?2383人GRE实验给出等效结果

论文公开页面未披露作者机构。StudentBench让2383名参与者接受AI辅导、专家人类辅导或无辅导,再直接比较GRE前后测学习增益。实验报告AI辅导与专家人类辅导统计等效,其中一个AI辅导器的单位学习增益成本低918倍。

论文公开页面未披露作者机构
文章封面
2609.28314 具身智能与机器人

机器人不会再求助,斯坦福把人工示范效率提2.9倍

斯坦福大学、普林斯顿大学提出TANDEM,让任务与运动规划器先做掉熟悉步骤,只在能力缺口处请人遥操。在一项代表性长时序任务中,相同人工介入时间能采集2.9倍示范;每项20条示范微调后,五项任务平均成功率从0%升至60%。

斯坦福大学、普林斯顿大学等
文章封面
2609.28339 具身智能与机器人

不预测未来画面,机器人训练反而快1.8倍

香港大学、香港科技大学、普林斯顿大学、加州大学圣迭戈分校提出NowWAM:不再让生成模型预测未来画面,而是在当前画面的去噪过程中直接学动作。它把训练视觉token从784减至392,单步耗时从2.85秒降至1.63秒,同时在LIBERO-P

香港大学、香港科技大学、普林斯顿大学、加州大学圣迭戈分校等
文章封面
2609.28258 具身智能与机器人

英伟达让机器人首见零件就会插,成功率从7%拉到56%

英伟达、加州大学圣迭戈分校、南加州大学做出了一套通用机器人插装世界模型。它用90种几何形状不同的零件训练,面对没见过的测试零件时,零样本成功率达56%,无模型基线只有7%。这类能力直接对应高混线上频繁换件的应用难题。

英伟达、加州大学圣迭戈分校、南加州大学等
文章封面
2609.24981 视觉与生成

腾讯ARC联手港科大攻克世界模型!提出几何原生GAE,漫游误差直接减半

香港科技大学、腾讯与香港大学等机构联合推出几何原生自编码器GAE,攻克了世界模型在长程三维漫游中容易变形穿模的结构缺陷。研究团队将几何基础模型的多层级表征融入视频潜在空间,从底层赋予生成模型强三维几何先验。在权威真实室内与室外漫游评测中,G

香港科技大学、腾讯、香港大学等
文章封面
↑