arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

行业趋势

图像、视频、三维重建与视觉内容生成。

2608.06009 视觉与生成

阿里Wan-Animate-2把角色动画跑到24 FPS,还能用文字改机位

上传一张角色图和一段驱动视频,系统可以让新角色复现动作,并用文字改变输出镜头。阿里巴巴通义实验室公布的Wan-Animate-2还提供轻量版,在400×720分辨率、4张NVIDIA H100上达到24 FPS。

阿里巴巴通义实验室等
阿里Wan-Animate-2把角色动画跑到24 FPS,还能用文字改机位文章封面
2608.04737 视觉与生成

低分辨率深度传感器也能生成密集3D:合成训练跨过3款真实设备

韩国科学技术院、中国科学技术大学和微软亚洲研究院提出一种稀疏dToF深度补全模型。它只用合成数据训练,却在六个数据集和三款真实直接飞行时间传感器上做零样本测试,把低分辨率、带噪的测距点补成密集度量深度图。

韩国科学技术院、中国科学技术大学、微软亚洲研究院等
低分辨率深度传感器也能生成密集3D:合成训练跨过3款真实设备文章封面
2608.04224 视觉与生成

老电影不再分开修画面和声音:22B模型一次处理噪点、闪烁与嘶声

中国科学技术大学和京东探索研究院提出OmniVR,用一个22B参数音视频生成模型同时修复历史影片。输入里的模糊、噪点、闪烁、低曝光、嘶声、削波和声音缺失,会在统一扩散过程中处理,而不是先修画面、再接独立音频工具。

中国科学技术大学、京东探索研究院等
老电影不再分开修画面和声音:22B模型一次处理噪点、闪烁与嘶声文章封面
2608.04587 Agent

让视频智能体自己改代码:四轮进化后准确率从38.44%升至51.47%

阿里巴巴、浙江大学、北京航空航天大学和字节跳动团队发布MetaVideoAgent,让长视频问答智能体根据目标视频类型自动修改自己的处理流程。四轮进化后,八类视频的宏平均准确率从38.44%升到51.47%。

浙江大学、北京航空航天大学、字节跳动等
让视频智能体自己改代码:四轮进化后准确率从38.44%升至51.47%文章封面
2608.04956 视觉与生成

可灵团队把生成、参考和编辑串成多镜头工作流,单卡做到16 FPS

清华大学、南京大学、快手可灵团队、上海科技大学和香港科技大学提出ContextMaster。它把文字生成、参考图生成和视频编辑放进同一个多轮工作流,每次接受的新镜头都会加入历史,供后续镜头继续使用。

清华大学、南京大学、上海科技大学、香港科技大学等
可灵团队把生成、参考和编辑串成多镜头工作流,单卡做到16 FPS文章封面
2608.05149 视觉与生成

搜图也能连续追问:CoCo-IR四轮检索命中率做到44.1%

伊利诺伊大学厄巴纳-香槟分校、Google DeepMind和OpenAI研究者提出CoCo-IR,把“拿一张参考图加一句修改要求”的图像检索,扩展为可连续追问的多轮搜索。用户可以先换颜色,再改背景,随后引用前面某一轮的视角或物体继续筛选。

伊利诺伊大学厄巴纳-香槟分校、OpenAI等
搜图也能连续追问:CoCo-IR四轮检索命中率做到44.1%文章封面
2608.02694 Agent

视频剪完才知道好不好,阿里等把偏好反馈拆回每个编辑片段

长视频编辑智能体要连续做素材选择、剪切、排序、字幕和导出,最终成片出炉后才得到好坏评价。阿里巴巴、中国科学技术大学等机构提出GRPB,把同一任务多版成片的相对排名,重新分配给中间编辑片段,用于训练9B参数的Crayotter。

中国科学技术大学等
视频剪完才知道好不好,阿里等把偏好反馈拆回每个编辑片段文章封面
2608.03979 Agent

让深度研究智能体先看完视频再搜索,200道多跳题做到64%

论文公开页面未披露作者机构。Video-DeepResearch团队研究的任务要求模型先在连续画面里找到人物或物体,再去网页补充外部知识;团队发现,现有智能体常跳过视觉工具直接搜索文字,或凭模型记忆作答。新系统因此分阶段开放工具,强制先完成

让深度研究智能体先看完视频再搜索,200道多跳题做到64%文章封面
2608.03691 大模型

AI看见了异常像素,仍照着重复模板写错代码

网页里连续出现几张相同卡片,其中一张明显更宽。多模态模型先算出它接近120%,最后却把代码填成和其他卡片一样的100%。一项由威廉与玛丽学院团队完成的研究,把这种错误称为“视觉模式补全偏差”。

威廉与玛丽学院等
AI看见了异常像素,仍照着重复模板写错代码文章封面
2608.02603 视觉与生成

20个世界模型参加反应力考试,视频逼真不代表世界会回应

中国科学院自动化研究所、香港中文大学、清华大学等团队发布WorldExam,用1474个案例评测20个可控视频与世界模型。没有一款模型同时覆盖大量任务并保持稳定高表现,画质好、指令完成度高,也不保证场景会作出合理反应。

中国科学院自动化研究所、香港中文大学、清华大学等
20个世界模型参加反应力考试,视频逼真不代表世界会回应文章封面
2608.01942 视觉与生成

剑桥南洋理工给7款视频模型出文化考题,漂亮不等于懂

南洋理工大学、剑桥大学、新加坡管理大学和CentraleSupélec团队发布CultureVidBench,用1000条提示测试7款文本生成视频模型。结果显示,模型能生成语义相符、画质不错的视频,却常把服饰、文字、仪式步骤和声音线索做错。

南洋理工大学、新加坡管理大学、剑桥大学等
剑桥南洋理工给7款视频模型出文化考题,漂亮不等于懂文章封面
2608.02580 具身智能与机器人

阿里通义把人类视频变成18561小时机器人训练数据

阿里巴巴通义千问、中国人民大学、上海科技大学、北京通用人工智能研究院和北京航空航天大学团队发布Ego2Robot,把人类佩戴相机拍下的第一视角操作视频转换为机器人训练数据。整套数据达到18561小时,覆盖15种机器人形态。

上海科技大学、北京通用人工智能研究院、北京航空航天大学等
阿里通义把人类视频变成18561小时机器人训练数据文章封面
2607.29581 视觉与生成

AI图片检测器拿到0.9999高分,实际可能只认出了文件格式

俄罗斯Sirius教育中心和高等经济大学团队用186527张电商评价图片训练AI生成检测器。产品完全隔离的测试集上,最强模型PR-AUC达到0.9999;把合成图重新编码成真实图片常见的格式后,成绩跌到0.7254。

高等经济大学等
AI图片检测器拿到0.9999高分,实际可能只认出了文件格式文章封面
2607.29627 视觉与生成

一张产品图塞进视频还能跟着路线跑,FlexComposer公布结果

香港科技大学、浙江大学、香港中文大学和斯坦福大学团队发布FlexComposer。用户提供背景视频、前景图片或视频,再画一条移动轨迹,模型会把素材放进场景,同时生成遮挡、光照、阴影和反射变化。

香港科技大学、浙江大学、香港中文大学、斯坦福大学等
一张产品图塞进视频还能跟着路线跑,FlexComposer公布结果文章封面
2607.28627 大模型

微软与DeepMind团队只加一个Token,视觉检索提高13.4分

伊利诺伊大学厄巴纳-香槟分校、微软研究院和Google DeepMind研究人员提出ReToken,通过一个可学习的检索Token,从大量图片或长视频帧中筛选与问题相关的视觉信息。

伊利诺伊大学厄巴纳-香槟分校、微软研究院等
微软与DeepMind团队只加一个Token,视觉检索提高13.4分文章封面
2607.28627 大模型

UIUC、微软、DeepMind提出ReToken:一个可学习token让视觉检索大涨13个点

把上百张图片或一小时长的视频塞给视觉语言模型,答案明明就在某一帧里,模型却常常答不对。上下文越长,干扰画面越多,成绩掉得越厉害;而把整段视觉序列全量处理,显存又先撑不住,全量微调的成本更是高昂。伊利诺伊大学厄巴纳-香槟分校(UIUC)联合微

伊利诺伊大学厄巴纳-香槟分校、微软研究院、谷歌DeepMind等
文章封面
↑