arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

行业趋势

图像、视频、三维重建与视觉内容生成。

2609.04190 视觉与生成

一个模型免训练完成多种视频编辑,FiVE准确率从58.95升到78.16

伊利诺伊大学厄巴纳-香槟分校团队提出EditVid,用一个免训练框架兼容指令驱动和参考主体驱动的视频编辑。它在FiVE上取得78.16 FiVE-Acc,对比免训练基线为58.95,用户研究总体偏好51.8%;优势来自论文选定任务和模型,不

伊利诺伊大学厄巴纳-香槟分校等
文章封面
2609.04201 视觉与生成

英伟达只加约1%参数改造3D重建,单卡8小时收敛、轨迹误差降逾60%

英伟达、阳明交通大学提出Scal3R,专门修复长视频在线三维重建的累计位姿漂移。它冻结原有主干,只增加约1%可学习参数,单张GPU训练8小时,并把KITTI相对在线基线的平均轨迹误差降低超过60%;这个比例只对应论文比较设置。

英伟达、阳明交通大学等
文章封面
2609.03919 视觉与生成

微软亚研院等让一张图变成长镜头世界,绕一圈回来场景仍对得上

微软亚洲研究院、中国科学技术大学、清华大学等机构提出OctWorld,从一张图沿指定相机路线持续生成可探索视频。系统用动态八叉树保存三维记忆,重点处理长路径后重新看见旧区域时的空间一致性;论文展示的是离线作者实验,不能据此认定已经达到实时交

微软亚洲研究院、中国科学技术大学、清华大学等
文章封面
2609.03153 视觉与生成

Adobe等让AI给生成视频查物理错误,304条缺陷解释了228条

Adobe Research、卡内基梅隆大学、佐治亚理工学院、东北大学等机构提出VeriPhy,逐条检查生成视频违反了哪项物理要求、错误出现在何时。149段核心视频含304条人工缺陷,它解释了228条,对比评测器为164条;同骨干直接提示也

Adobe Research、卡内基梅隆大学、佐治亚理工学院、东北大学等
文章封面
2609.04120 视觉与生成

美团等做出无掩码视频试衣,大动作遮挡也能保持衣服细节

美团、中国科学技术大学、南京理工大学、新加坡国立大学等机构提出BooM-VVT,让视频虚拟试衣不再需要用户提供试衣区域掩码。方法用图像级伪数据学习定位,并在大动作、遮挡和多视角条件下保持服装细节;成绩来自论文数据集与作者比较,尚不代表任意自

美团、中国科学技术大学、南京理工大学、新加坡国立大学等
文章封面
2609.03952 视觉与生成

腾讯混元给世界模型装上双重裁判,三项指标超过GPT-5.5

腾讯混元、复旦大学、上海人工智能实验室等机构提出WorldReward,把世界模型的镜头动作执行和画面质量交给同一个奖励模型判断。它在760对人工标注视频上,三项偏好一致性分别比GPT-5.5高3.42、1.45和3.56个百分点;结果来自

腾讯混元、复旦大学、上海人工智能实验室等
文章封面
2609.01683 AI基础设施

ESP32视觉模型也能现场适应:只多花8.3毫焦,恢复93%收益

巴基斯坦国立科技大学、FAST-NUCES大学联合提出FORGE,让已经量化并部署到微控制器的视觉模型只靠前向计算适应模糊、噪声和光照变化。适配21层中的3层即可恢复93%的收益,在ESP32-S3上额外耗能8.3毫焦、耗时21.9毫秒;数

巴基斯坦国立科技大学、FAST-NUCES大学等
文章封面
2609.01823 视觉与生成

斯坦福等让野外动物视频变3D动作:一张图也能驱动可渲染动画

伊利诺伊大学厄巴纳-香槟分校、宾夕法尼亚大学、斯坦福大学、剑桥大学等机构联合提出Kirin,从野外视频重建四足动物3D动作,再按文字和图片生成可直接驱动网格的动画。项目展示了多物种动作和基线对比,降低动物动作采集门槛;效果仍受视频遮挡、重建

伊利诺伊大学厄巴纳-香槟分校、宾夕法尼亚大学、斯坦福大学、剑桥大学等
文章封面
2609.01899 视觉与生成

DeepMind测了11万条3D轨迹:相机更多,跟踪却不一定更准

谷歌DeepMind、伦敦大学学院、牛津大学、苏黎世联邦理工学院等机构联合构建TAPVid-MV,收录284段序列、1142路标定相机流和109769条3D点轨迹。30多种基线仍远未解决任务,多视图跟踪器也不稳定优于单目方法;结论针对该基准

谷歌DeepMind、伦敦大学学院、牛津大学、苏黎世联邦理工学院等
文章封面
2609.02291 视觉与生成

清华等把生成式视频压缩做到实时:码率少58%,720p跑到13帧

清华大学、哈尔滨工业大学(深圳)、北京大学等机构联合提出VoRTeC,用Wan2.1流模型的生成先验做超低码率视频压缩。论文报告其相对既有扩散式方案减少58%比特消耗,720p解码达到13 FPS、480p达到32 FPS;速度与画质结论来

清华大学、哈尔滨工业大学(深圳)、北京大学等
文章封面
2609.02886 视觉与生成

英伟达等做出SolarWM:只看5秒训练片段,也能实时推演数小时

香港中文大学(深圳)、新加坡国立大学、英伟达、微软亚洲研究院等机构联合提出SolarWM,把10个数据集的143万段视频整理成统一训练流水线。模型只用5秒序列训练,却能连续生成分钟到小时级实时轨迹,方便研究者比较不同视频骨干;这些轨迹仍是固

香港中文大学(深圳)、新加坡国立大学、英伟达、微软亚洲研究院等
文章封面
2609.01551 视觉与生成

Meta研究发现:视频模型懂镜头运动,直觉物理却接近随机

约克大学、Vector研究院、Meta FAIR、麦吉尔大学联合逐层分析V-JEPA 2和VideoMAE-v2。两种视频模型的镜头运动探针ROC AUC超过90%,异常检测超过60%,直觉物理任务却接近随机水平。

约克大学、Vector研究院、Meta FAIR、麦吉尔大学等
文章封面
2609.00956 视觉与生成

删掉物体还不够,港大方法连掩码外的阴影一起清理

香港大学、中山大学提出PredErase,用冻结的FLUX.2和I-JEPA同时移除物体及其掩码外光影残留。方法不做额外训练,重点处理传统填充模型删掉主体后仍留下的投影、接触阴影和支撑面痕迹。

香港大学、中山大学等
文章封面
2609.01423 视觉与生成

腾讯整理800万张风格图:15万种风格身份、100万条描述

同济大学、腾讯、南洋理工大学、香港科技大学联合提出MegaStyle++。团队用分层定义整理15万种整体风格身份、100万条细粒度风格提示和800万张风格化图像,希望把“风格”从模糊标签变成可解释结构。

同济大学、腾讯、南洋理工大学、香港科技大学等
文章封面
2609.00646 视觉与生成

腾讯拆开AI短剧流水线:5785项样本追踪缺陷如何传到成片

腾讯混元、北京电影学院、北京大学、深圳大学联合提出DramaChain Bench,把AI短剧从剧本、分镜、关键帧、镜头视频到成片的完整链路纳入评测。5785个条目产生17488个有效评分和255925条可追溯归因记录。

腾讯混元、北京电影学院、北京大学、深圳大学等
文章封面
2609.00377 Agent

AI看一遍折纸视频,生成可执行程序,完整序列完成率100%

魏茨曼科学研究所、麻省理工学院提出FoldingAgent,让视觉语言模型从折纸演示视频反推出可执行的参数化折叠程序。在PurelandFold基准上,完整序列完成率为100%,已完成步骤的编译成功率为96%。

魏茨曼科学研究所、麻省理工学院等
文章封面
2609.01560 视觉与生成

腾讯把视频模型变成交互世界,只训练0.199%参数

腾讯、新加坡国立大学、香港理工大学联合提出H3-World,把330亿参数的MiniMax-H3视频生成器改造成可交互世界模型。团队使用8000个游戏样本、10000步LoRA优化,只训练0.199%的参数,就获得角色动作和镜头运动的分段控

腾讯、新加坡国立大学、香港理工大学等
文章封面
2608.29621 Agent

快手等让长视频智能体从制作记录里自我改进,复审调用降37%

同济大学、快手科技和复旦大学提出CineForge,让长视频制作智能体从一次次完整制作记录中提炼可复用策略。经过跨故事演化后,CineScope-Metric由4.024提高到4.380,在新故事上的复审大模型调用减少37.0%。

同济大学、快手科技、复旦大学等
长视频制作智能体从完整轨迹中积累经验
2608.29607 视觉与生成

腾讯元宝测了53种拍照损坏:图片一糊,比问题写错字更伤检索

香港科技大学(广州)、腾讯元宝、清华大学和腾讯ARC实验室联合发布SnapBench,系统测试手机“拍照再提问”检索遇到的脏输入。基准包含1145个查询、9085个图库候选和53种受控损坏,并评估16种多模态检索器。

香港科技大学(广州)、腾讯元宝、清华大学、腾讯ARC实验室等
同一张照片在不同损坏程度下的对比
↑