arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

行业趋势

图像、视频、三维重建与视觉内容生成。

2609.12658 视觉与生成

视频AI太爱抢答:6个系统里4个提前响应多过漏报

北京航空航天大学、阿里巴巴提出ProactiveBench,专门测试视频AI什么时候该开口。六个系统中有四个“提前响应”比“错过事件”更常见,比例从2.1倍到28倍;基准揭示的是受控视频任务中的时间判断,不等同于真实产品已造成同等风险。

北京航空航天大学、阿里巴巴等
文章封面
2609.12081 具身智能与机器人

清华等让机器人边走边拿,四项实机任务成功率76.3%

清华大学、Xspark AI、香港科技大学(广州)、香港大学提出MoPA,让移动机器人不必停稳后再伸手,而是在行进中持续观察和操作。四项真机任务平均完整成功率76.3%,比最强基线高12.5个百分点;实验仍是室内受控任务,尚未证明在人群和开

清华大学、Xspark AI、香港科技大学(广州)、香港大学等
文章封面
2609.12433 具身智能与机器人

北大&银河通用让机器人学叠衣,纯合成训练实机成功率超90%

北大前沿计算研究中心、银河通用机器人提出FoldNet++,让双臂机器人只看合成演示就学会展开和折叠T恤,真机端到端成功率超过90%。这意味着难采、慢采的真实机器人数据有机会被大规模仿真替代;不过实验集中在T恤和受控桌面,不能直接外推到所有

北大前沿计算研究中心、银河通用机器人等
文章封面
2609.11499 视觉与生成

一张图让AI递归搭世界,乔治亚理工把3D场景直接写成代码

乔治亚理工学院提出Recursive Code World Models,让视觉语言编程智能体从一张参考图生成可执行3D场景代码。它先搭整体,再递归进入局部补建筑和关系,最后回到全局修边界;中世纪村落实验的PSNR从16.8升到19.0,但

乔治亚理工学院等
文章封面
2609.10943 视觉与生成

Adobe给AI导演补了近10万镜头课,生视频前先把运镜写清楚

Adobe Research、伍斯特理工学院提出CamPilot,让多个智能体先规划故事、镜头角度、相机运动和焦点,再按拍摄脚本生成多镜头视频。团队从14,581部视频整理99,975个镜头用于训练和评测;成绩来自自建CamEval与自动指

Adobe Research、伍斯特理工学院等
文章封面
2609.11507 视觉与生成

视频里多个主角总串脸?阿里、北大把身份相似度拉高31.2%

阿里巴巴、北京大学提出DIAL,从视频扩散模型内部找出能定位参考主体的注意力图,用它在推理时调节保真强度,并在训练时自动构造偏好样本。Kaleido骨干上的FaceSim从43.80%升至57.46%,相对提高31.2%;评测基于180条提

阿里巴巴、北京大学等
文章封面
2609.10811 视觉与生成

Adobe给AI修图画了三种线:白色必改,灰色可改,黑色别动

Adobe Research、威廉与玛丽学院提出Overpainting,用白、灰、黑三值蒙版告诉AI哪些像素必须修改、可以修改和绝对不能动。它既能保护背景,又允许模型在物体边缘补足上下文;结果来自研究原型和用户实验,并非Adobe商业软件

Adobe Research、威廉与玛丽学院等
文章封面
2609.11929 大模型

8B模型直出4K图,SenseNova-U1.5把看图和生图塞进一套架构

论文公开页面未披露作者机构。SenseNova-U1.5是一款8B混合专家统一视觉模型,把图像理解、生成、编辑、多图参考和图文交错输出放进同一套端到端架构,并增加512到4096像素的高分辨率训练阶段;4K是论文报告的原生能力,不代表所有公

论文公开页面未披露作者机构
文章封面
2609.09396 视觉与生成

英伟达测17个视觉模型:固定摄像头最难看懂时间

英伟达、克莱姆森大学研究团队发布VANTAGE-Bench,用3346个媒体素材零样本评测17个视觉语言模型,场景覆盖仓库、交通和智慧空间。结果不是“工业视频全面更难”:视频问答和二维指点差距较小,缺口集中在事件验证、指代表达与时间定位;其

英伟达、克莱姆森大学等
文章封面
2609.09394 视觉与生成

DeepMind一套模型吃遍普通、鱼眼和360度相机

Google DeepMind、苏黎世联邦理工学院联合提出OmniPoint,用一套权重处理普通透视、鱼眼和360度全景图,从单张图片恢复带真实尺度的三维点云。方法在多个基准上做零样本评测,还能接收相机内参或稀疏深度;这些成绩不等于所有镜头

Google DeepMind、苏黎世联邦理工学院等
文章封面
2609.10050 具身智能与机器人

伯克利把1500段AI视频变成灵巧手训练动作

加州大学伯克利分校、Sharpa Robotics、香港大学等机构提出GALATEA:先让视频模型生成手与物体的动作,再把画面重建成仿真可执行轨迹。团队落地超过1500段生成视频,仿真训练成功率较基线高出25个百分点以上,并做了真机闭环演示

加州大学伯克利分校、Sharpa Robotics、香港大学等
文章封面
2609.06099 视觉与生成

镜头没拍到的地方也能补:复旦PASTEL把4D场景再推高0.9 dB

复旦大学、华为中央媒体技术研究院联合提出PASTEL,把单目视频已拍到的区域做4D重建,再用生成先验补出相机视野之外的合理内容。它把复杂的新视角搜索压到全景空间中的二维方向规划,并在DyCheck iPhone数据集上把全图PSNR比此前最

复旦大学、华为中央媒体技术研究院等
文章封面
2609.05981 AI基础设施

扩散模型少算19.3%画质还更稳,阿里云等用不确定性管缓存

上海交通大学、阿里云终端智能计算部、复旦大学联合提出GP-Refiner,为扩散Transformer缓存增加在线误差校正和不确定性开关。它与TaylorSeer组合后,在论文设置中减少19.3%计算量,PSNR提高0.9 dB,LPIPS

上海交通大学、阿里云终端智能计算部、复旦大学等
文章封面
2609.08365 视觉与生成

动作生成砍掉一整个阶段,北大等ReMoMask-2反而更快更准

悉尼大学、北京大学、中国科学院大学联合提出ReMoMask-2,让文本生成动作时直接检索模型内部的动作表示,省掉旧版完整两阶段流程。单个掩码Transformer阶段就在HumanML3D、KIT-ML和SnapMoGen实验中超过旧版,并

悉尼大学、北京大学、中国科学院大学等
文章封面
2609.09020 AI基础设施

神经压缩跑过JPEG?PIC做到20 FPS编码、2000 FPS解码

清华大学、鹏城实验室、哈尔滨工业大学(深圳)、京东集团探索研究院联合提出实用隐式神经图像编解码器PIC,用一次前向计算准备全部网络信息,把编码速度做到20 FPS,并用优化解码器达到2000 FPS。论文称其在相近率失真表现下超过JPEG解

清华大学、鹏城实验室、哈尔滨工业大学(深圳)、京东集团探索研究院等
文章封面
2609.08084 视觉与生成

一张照片也能看清发丝深度,Marigold V2误差再降16%—26%

洛桑联邦理工学院、华为Bayer实验室、博洛尼亚大学联合提出Marigold V2,把现代图像生成模型改造成一次前向计算即可输出深度图的估计器。它在KITTI和ETH3D上把AbsRel误差相对此前最佳结果改善16%—26%,并能保留毛发、

洛桑联邦理工学院、华为Bayer实验室、博洛尼亚大学等
文章封面
2609.08117 自动驾驶

斯坦福等做出393小时驾驶员动作库,转向前手臂运动多3.4倍

南佛罗里达大学、普渡大学、斯坦福大学、中佛罗里达大学联合建立DriveMotion,把360位驾驶员的393小时座舱视频整理成133关键点连续动作序列。论文发现,车辆机动前窗口的手臂运动幅度是同路线稳定驾驶对照的3.4倍。它提供的是数据集与

南佛罗里达大学、普渡大学、斯坦福大学、中佛罗里达大学等
文章封面
2609.05416 视觉与生成

一段视频拆出数百个3D物体,阿里等团队提出WorldSculpt

阿里达摩院Alaya实验室与东京大学团队提出WorldSculpt,从一段多视角视频恢复可组合的3D场景,并为其中每个物体输出独立网格。它面向含数百个物体、遮挡严重的场景,却主要用单物体数据微调。结果显示组合式重建可扩展,但真实场景质量仍依

阿里达摩院Alaya实验室、东京大学等
文章封面
2609.04250 视觉与生成

数字人边说边动快5.4倍,北大等团队做出Motion-Omni

北京大学与香港中文大学(深圳)团队提出Motion-Omni,让数字人在生成语音的同时生成面部表情和全身动作。Motion-Omni-Q7相对“语音模型再接动作模型”的级联系统响应快5.4倍,实时因子为0.78。实验说明联合生成能降低等待,

北京大学、香港中文大学(深圳)等
文章封面
2609.05415 视觉与生成

一套模型让万种骨架动起来,普林斯顿等团队提出UniMate

普林斯顿大学、加州大学伯克利分校、麻省理工学院和南洋理工大学团队提出UniMate:输入文字和一副目标骨架,同一个模型就能为人、四足动物、鸟、鱼、昆虫乃至机械结构生成动作。配套UniML3D汇集13006段动作;论文证明的是零样本跨拓扑迁移

普林斯顿大学、加州大学伯克利分校、麻省理工学院、南洋理工大学等
文章封面
↑