arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

行业趋势

图像、视频、三维重建与视觉内容生成。

2608.30241 Agent

谷歌等让AI反复改论文图,质量提升最高18.6分

谷歌、北京大学、加州大学洛杉矶分校和伊利诺伊大学厄巴纳-香槟分校联合提出PaperBanana-Interact,让AI像设计协作者一样根据作者反馈反复修改论文图。与多轮基线相比,系统的质量分提高11.9至18.6分,遗忘旧要求的分数下降3

谷歌、北京大学、加州大学洛杉矶分校、伊利诺伊大学厄巴纳-香槟分校等
AI按照反馈多轮修改科学图表
2608.29910 视觉与生成

黎曼动力学让AI世界连续玩到分钟级,还能实时转动镜头

黎曼动力学发布Matrix-Game 3.5,把交互式世界模型的连续生成拉到分钟级,并支持用户实时控制镜头。系统在Matrix-Game 3.0基础上加入几何感知记忆、静态与动态分离表示,以及两阶段实时蒸馏,目标是让生成世界转身后还能记得来

黎曼动力学等
分钟级实时交互的生成式世界
2608.30821 视觉与生成

字节Seed把真实房间变成可编辑仿真场景,F-Score升至0.924

字节跳动Seed、北京大学和浙江大学联合提出Lucida,把一段真实室内视频转成仿真可用的场景副本:房间里的物体不仅被重建,还能作为独立3D资产移动和编辑。论文报告其场景F-Score由SAM3D的0.794提高到0.924。

字节跳动Seed、北京大学、浙江大学等
真实室内空间被还原成可编辑仿真场景
2608.29242 具身智能与机器人

小鹏机器人把一段人类视频变成多种机器人训练经验

南洋理工大学、新加坡科技研究局、小鹏机器人和浙江大学等机构提出AnyWorld:不用成对拍摄人类与机器人示范,就能把一段第一视角人类交互重组为不同机器人本体、相机视角和场景下的机器人原生视频。生成数据随后用于RoboCasa GR1桌面基准

南洋理工大学、新加坡科技研究局、小鹏机器人、浙江大学等
人类交互视频被重组为机器人训练经验
2608.28383 AI基础设施

小米北大把视觉注意力计算砍到约六分之一,效果只差0.52分

视觉Transformer处理高分辨率图片时,全注意力要让每个图像Token与所有Token交互,计算量增长很快。北京大学、小米、香港大学等机构发现,全注意力中的不同注意力头会分别关注前景物体和背景,并据此设计Ariadne混合注意力。

北京大学、小米、香港大学等
文章封面
2608.28549 视觉与生成

视频生成模型还会看懂三维?把图像与深度当成连续帧

输入一张普通RGB照片,模型同时输出单目深度和表面法线。萨里大学、帝国理工学院等机构提出GeoNeXt,把预训练视频生成模型改造成统一几何学习器:原图是第一帧,深度与法线成为后续“几何帧”,三者沿同一去噪过程生成。

萨里大学、帝国理工学院等
文章封面
2608.27893 视觉与生成

阿里让AI直接写出可编辑电商广告,设计图变成可执行代码

输入商品图、卖点文案和尺寸要求,模型不再输出一张难修改的扁平图片,而是直接写出可渲染的HTML/CSS广告。阿里巴巴、同济大学等机构提出CommerceVibe,让商品图片保持原样引用,文字以原生元素存在,运营人员可以继续换图、改字和调整布

同济大学、阿里巴巴等
文章封面
2608.27529 视觉与生成

只记前11帧,阿里高德把长视频三维重建误差降约40%

长视频做三维重建,最直接的办法是让模型不断回看过去所有画面,代价是内存和计算随视频长度增长。阿里巴巴高德视觉团队提出ABot-Recon,只固定保留第一帧和最近10帧,就能连续估计相机轨迹、深度与场景点云。

阿里巴巴等
文章封面
2608.28174 视觉与生成

一段旧视频也能换机位重拍,Manifold4D把平移误差最多降32%

拍好的一段单目视频,输入一条新的六自由度相机轨迹,模型就沿新机位重新生成画面。浙江大学、Manifold Tech、上海科技大学、剑桥大学等机构提出Manifold4D,处理视频换机位重拍时最容易出现的几何漂移和相机控制误差。

浙江大学、Manifold Tech、上海科技大学、剑桥大学等
文章封面
2608.28404 自动驾驶

5500小时驾驶视频告诉法雷奥:先多训练,未必先堆大模型

同一笔训练预算,是把驾驶视频模型做得更大,还是让现有模型多看几遍数据?法雷奥AI与索邦大学的研究团队提出VATIX缩放研究,覆盖从100万到约90亿参数的视频扩散模型,并在最高5500小时驾驶数据上改变训练曝光量,得到一组面向固定数据池的缩

法雷奥AI、索邦大学等
文章封面
2608.26794 视觉与生成

字节&斯坦福等提出Ring Forcing:视频模型能记住分钟级历史

自回归视频模型按片段向后生成,人物或物体离开镜头几十秒后再出现,颜色、形状和位置很容易变化。斯坦福大学、北京大学、字节跳动等机构提出Ring Forcing,通过环形训练、历史压缩和稀疏位置编码,让模型使用分钟级远距离信息。

斯坦福大学、北京大学、字节跳动等
文章封面
2608.26517 视觉与生成

华为&清华等发布HUG-VIS:8400段视频同时测情绪、生成、克隆与抠像

同一个人物视频,既可以用来识别情绪,也可以测试视频生成、声音克隆和人物抠像。深圳大学、中科院自动化所、清华大学、华为等机构推出HUG-VIS,用8400段同步视频、音频、文本和透明度蒙版,把四类任务放在同一套受控素材上比较。

深圳大学、中科院自动化所、清华大学、华为等
文章封面
2608.27328 视觉与生成

阿里等提出R2M-Bench:慢镜头不再冒充世界模型“记住了”

视频世界模型离开一个场景再返回时,如果新画面与第一次访问高度相似,常被解释为“记住了”。阿里巴巴、同济大学、上海交通大学提出R2M-Bench,指出模型只要几乎不移动,也能得到漂亮的绝对相似度。

阿里巴巴、同济大学、上海交通大学等
文章封面
2608.26737 自动驾驶

复旦&CMU让激光雷达补全街景:只看1%体积也能生成稠密语义

车载激光雷达的一次扫描只占目标三维体积约1%,其余位置既没有几何信息,也没有类别标签。复旦大学、卡内基梅隆大学提出生成式语义场景补全GSSC,用一套离散扩散框架同时合成训练数据、从噪声生成完整场景,并修正已有模型的输出。

复旦大学、卡内基梅隆大学等
文章封面
2608.25659 具身智能与机器人

图灵智新、中科院自动化所等让机器人训练时学3D世界,实机成功率升至52.5%

机器人只模仿动作,可能学会在训练画面里伸手,却没有形成稳定的三维结构与物体运动表示。图灵智新、中科院自动化所、清华大学等机构提出GaussianDream++,训练时要求视觉语言动作模型重建当前3D世界并预测未来,部署时再移除重建头。

图灵智新、中科院自动化所、清华大学等
文章封面
2608.25334 视觉与生成

阿里淘天、中科院大学提出GraftSR,用同款照片把超分纹理误差降低20.2%

低清商品图里的针织花纹已经糊成一片,生成式超分常会补出看似清晰、实际不存在的纹理。阿里淘天集团、中国科学院大学提出GraftSR,不让模型凭经验猜细节,而是读取同一件商品的另一张高清照片,把可确认的纹理移到目标位置。

阿里淘天集团、中国科学院大学等
文章封面
2608.25622 Agent

vivo、港中大(深圳)等让8B模型规划视频剪辑,得分从0.620升至0.924

“把开场压到3秒、第二段踩音乐重拍、总时长不超过30秒”不是一句文字建议,而是一组必须能落到时间线的操作。港中大(深圳)、vivo AI Lab、北京大学等机构提出RefineCut,训练8B开源权重模型输出剪辑补丁,再由确定性验证器检查每

港中大(深圳)、vivo AI Lab、北京大学等
文章封面
2608.25417 Agent

北大、清华、商汤让AI拿工具精细画图,25个模型相似度最高仅0.54

模型能说出苹果在画面左侧,不代表它能用绘图工具准确圈住苹果。北京大学、清华大学、商汤研究院提出EASEL,要求多模态智能体不断观察参考图和当前画布,再输出笔刷位置、颜色、粗细等参数,直到重建目标。

北京大学、清华大学、商汤研究院等
文章封面
2608.25479 视觉与生成

北大、腾讯混元提出4DStreamCtrl,单卡20 FPS实时控制视频镜头和物体

拖动一个物体的三维轨迹、改变相机运动,再让视频继续往后生成,过去通常要分给不同模型处理。北京大学、腾讯混元提出4DStreamCtrl,把相机、物体和深度都编码成三维点轨迹,在一次前向计算中完成联合控制。

北京大学、腾讯混元等
文章封面
2608.24020 Agent

复旦、字节让AI边看工程图边修CAD代码,可执行率做到99.33%

从带尺寸标注的正交工程图生成CAD代码,早期一个工作平面、孔径或拉伸深度出错,后面所有操作都会跟着偏。复旦大学、字节跳动提出IterCAD,让模型在生成中间CAD后重新查看几何结果,决定继续修改还是停止。

复旦大学、字节跳动等
文章封面
↑