arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

行业趋势

从最新学术论文中提炼值得关注的技术进展、实验结果和产业信号。

2609.03889 具身智能与机器人

浙大等让轮腿机器人不用力传感器也会擦白板、开带闭门器的门

浙江大学、上海人工智能实验室、清华大学、云深处科技等机构提出FWBC-VLA,让轮腿机器人无需加装力传感器,也能估计接触强度并调整全身动作。系统用5000余条数据训练,在实机上完成擦白板和开启带闭门器的门;验证只覆盖这两类接触任务。

浙江大学、上海人工智能实验室、清华大学、云深处科技等
文章封面
2609.04190 视觉与生成

一个模型免训练完成多种视频编辑,FiVE准确率从58.95升到78.16

伊利诺伊大学厄巴纳-香槟分校团队提出EditVid,用一个免训练框架兼容指令驱动和参考主体驱动的视频编辑。它在FiVE上取得78.16 FiVE-Acc,对比免训练基线为58.95,用户研究总体偏好51.8%;优势来自论文选定任务和模型,不

伊利诺伊大学厄巴纳-香槟分校等
文章封面
2609.04193 具身智能与机器人

清华、中科院等给机器人视觉补上物理结构,零样本成功率最高87.8%

中国科学院自动化研究所、清华大学、复旦大学、新加坡国立大学等机构提出GIFT,训练机器人策略时强制中间视觉特征保留几何、可操作区域和目标位置。三种配置在LIBERO-Plus零样本迁移中最高达到87.8%;实机结果覆盖论文设置的单臂、双臂操

中国科学院自动化研究所、清华大学、复旦大学、新加坡国立大学等
文章封面
2609.03742 更多前沿

港城大等把视频课改成知识地图,125段课程生成1079份视觉摘要

香港城市大学、苏黎世联邦理工学院提出KnowVis,把线性视频课程改排成概念图、知识单元和视觉摘要。团队整理10个学科的125段视频并生成1079份摘要,人体研究报告认知负担下降、学习与保持改善;样本规模有限,不能外推到所有课程和长期学习。

香港城市大学、苏黎世联邦理工学院等
文章封面
2609.04201 视觉与生成

英伟达只加约1%参数改造3D重建,单卡8小时收敛、轨迹误差降逾60%

英伟达、阳明交通大学提出Scal3R,专门修复长视频在线三维重建的累计位姿漂移。它冻结原有主干,只增加约1%可学习参数,单张GPU训练8小时,并把KITTI相对在线基线的平均轨迹误差降低超过60%;这个比例只对应论文比较设置。

英伟达、阳明交通大学等
文章封面
2609.03919 视觉与生成

微软亚研院等让一张图变成长镜头世界,绕一圈回来场景仍对得上

微软亚洲研究院、中国科学技术大学、清华大学等机构提出OctWorld,从一张图沿指定相机路线持续生成可探索视频。系统用动态八叉树保存三维记忆,重点处理长路径后重新看见旧区域时的空间一致性;论文展示的是离线作者实验,不能据此认定已经达到实时交

微软亚洲研究院、中国科学技术大学、清华大学等
文章封面
2609.03153 视觉与生成

Adobe等让AI给生成视频查物理错误,304条缺陷解释了228条

Adobe Research、卡内基梅隆大学、佐治亚理工学院、东北大学等机构提出VeriPhy,逐条检查生成视频违反了哪项物理要求、错误出现在何时。149段核心视频含304条人工缺陷,它解释了228条,对比评测器为164条;同骨干直接提示也

Adobe Research、卡内基梅隆大学、佐治亚理工学院、东北大学等
文章封面
2609.04120 视觉与生成

美团等做出无掩码视频试衣,大动作遮挡也能保持衣服细节

美团、中国科学技术大学、南京理工大学、新加坡国立大学等机构提出BooM-VVT,让视频虚拟试衣不再需要用户提供试衣区域掩码。方法用图像级伪数据学习定位,并在大动作、遮挡和多视角条件下保持服装细节;成绩来自论文数据集与作者比较,尚不代表任意自

美团、中国科学技术大学、南京理工大学、新加坡国立大学等
文章封面
2609.03952 视觉与生成

腾讯混元给世界模型装上双重裁判,三项指标超过GPT-5.5

腾讯混元、复旦大学、上海人工智能实验室等机构提出WorldReward,把世界模型的镜头动作执行和画面质量交给同一个奖励模型判断。它在760对人工标注视频上,三项偏好一致性分别比GPT-5.5高3.42、1.45和3.56个百分点;结果来自

腾讯混元、复旦大学、上海人工智能实验室等
文章封面
2609.02108 大模型

Meta等让扩散模型先猜长度再补代码:快1.82倍,通过率升4.8点

伊利诺伊大学厄巴纳-香槟分校、Meta联合提出PILL,让扩散语言模型补代码或文本时先预测缺口长度,再并行尝试附近候选。它在5种模型、8个基准上比最强基线快1.82倍,代码平均通过率提高4.8点、文本BLEU-2提高6.0点;结果不代表所有

伊利诺伊大学厄巴纳-香槟分校、Meta等
文章封面
2609.01683 AI基础设施

ESP32视觉模型也能现场适应:只多花8.3毫焦,恢复93%收益

巴基斯坦国立科技大学、FAST-NUCES大学联合提出FORGE,让已经量化并部署到微控制器的视觉模型只靠前向计算适应模糊、噪声和光照变化。适配21层中的3层即可恢复93%的收益,在ESP32-S3上额外耗能8.3毫焦、耗时21.9毫秒;数

巴基斯坦国立科技大学、FAST-NUCES大学等
文章封面
2609.01823 视觉与生成

斯坦福等让野外动物视频变3D动作:一张图也能驱动可渲染动画

伊利诺伊大学厄巴纳-香槟分校、宾夕法尼亚大学、斯坦福大学、剑桥大学等机构联合提出Kirin,从野外视频重建四足动物3D动作,再按文字和图片生成可直接驱动网格的动画。项目展示了多物种动作和基线对比,降低动物动作采集门槛;效果仍受视频遮挡、重建

伊利诺伊大学厄巴纳-香槟分校、宾夕法尼亚大学、斯坦福大学、剑桥大学等
文章封面
2609.02653 具身智能与机器人

浙大让机器人少想多做:只在关键节点推理,也能守住长流程意图

浙江大学、上海交通大学、诺埃马特里斯、无尽人工智能等机构联合提出HINT,让机器人只在操作阶段切换时重新理解指令,随后用多视角定位和跟踪维持目标。框架在3项长流程任务、2种基础策略及多类未见变化中提高任务进展和端到端成功率;证据仍来自指定分

浙江大学、上海交通大学、诺埃马特里斯、无尽人工智能等
文章封面
2609.02546 具身智能与机器人

智元机器人等测14种机型:只加5%目标数据,迁移进展升13.4点

智元机器人、北京大学、中国人民大学、香港大学等机构联合提出ZETA,用14种保留机型研究视觉语言动作模型能否跨机器人迁移。仅在预训练中加入5%目标机型数据,平均任务进展就提高13.4个百分点,说明“完全没见过”和“预训练见过少量”必须分开报

智元机器人、北京大学、中国人民大学、香港大学等
文章封面
2609.01899 视觉与生成

DeepMind测了11万条3D轨迹:相机更多,跟踪却不一定更准

谷歌DeepMind、伦敦大学学院、牛津大学、苏黎世联邦理工学院等机构联合构建TAPVid-MV,收录284段序列、1142路标定相机流和109769条3D点轨迹。30多种基线仍远未解决任务,多视图跟踪器也不稳定优于单目方法;结论针对该基准

谷歌DeepMind、伦敦大学学院、牛津大学、苏黎世联邦理工学院等
文章封面
2609.01961 具身智能与机器人

伯克利让达芬奇机器人双臂清创:成功率92%,每小时处理473个碎片

加州大学伯克利分校、直觉外科公司等机构联合提出MACAW,让达芬奇研究机器人用视觉伺服对准碎片,再以单目图像控制抓取深度。双臂设置在物理实验中达到92%成功率,平均7秒处理一个碎片、折合每小时473个;实验使用研究平台和仿真组织碎片,不能视

加州大学伯克利分校、直觉外科公司等
文章封面
2609.02291 视觉与生成

清华等把生成式视频压缩做到实时:码率少58%,720p跑到13帧

清华大学、哈尔滨工业大学(深圳)、北京大学等机构联合提出VoRTeC,用Wan2.1流模型的生成先验做超低码率视频压缩。论文报告其相对既有扩散式方案减少58%比特消耗,720p解码达到13 FPS、480p达到32 FPS;速度与画质结论来

清华大学、哈尔滨工业大学(深圳)、北京大学等
文章封面