一个模型免训练完成多种视频编辑,FiVE准确率从58.95升到78.16
伊利诺伊大学厄巴纳-香槟分校团队提出EditVid,用一个免训练框架兼容指令驱动和参考主体驱动的视频编辑。它在FiVE上取得78.16 FiVE-Acc,对比免训练基线为58.95,用户研究总体偏好51.8%;优势来自论文选定任务和模型,不
伊利诺伊大学厄巴纳-香槟分校团队提出EditVid,用一个免训练框架兼容指令驱动和参考主体驱动的视频编辑。它在FiVE上取得78.16 FiVE-Acc,对比免训练基线为58.95,用户研究总体偏好51.8%;优势来自论文选定任务和模型,不
英伟达、阳明交通大学提出Scal3R,专门修复长视频在线三维重建的累计位姿漂移。它冻结原有主干,只增加约1%可学习参数,单张GPU训练8小时,并把KITTI相对在线基线的平均轨迹误差降低超过60%;这个比例只对应论文比较设置。
微软亚洲研究院、中国科学技术大学、清华大学等机构提出OctWorld,从一张图沿指定相机路线持续生成可探索视频。系统用动态八叉树保存三维记忆,重点处理长路径后重新看见旧区域时的空间一致性;论文展示的是离线作者实验,不能据此认定已经达到实时交
Adobe Research、卡内基梅隆大学、佐治亚理工学院、东北大学等机构提出VeriPhy,逐条检查生成视频违反了哪项物理要求、错误出现在何时。149段核心视频含304条人工缺陷,它解释了228条,对比评测器为164条;同骨干直接提示也
美团、中国科学技术大学、南京理工大学、新加坡国立大学等机构提出BooM-VVT,让视频虚拟试衣不再需要用户提供试衣区域掩码。方法用图像级伪数据学习定位,并在大动作、遮挡和多视角条件下保持服装细节;成绩来自论文数据集与作者比较,尚不代表任意自
腾讯混元、复旦大学、上海人工智能实验室等机构提出WorldReward,把世界模型的镜头动作执行和画面质量交给同一个奖励模型判断。它在760对人工标注视频上,三项偏好一致性分别比GPT-5.5高3.42、1.45和3.56个百分点;结果来自
DocIQ 的价值不只在于提出了一个新的文档图像质量评估模型,更在于它明确了文档智能系统中的一个关键问题:文档图像不是普通自然图像,文档质量也不是单纯的视觉美学问题。
巴基斯坦国立科技大学、FAST-NUCES大学联合提出FORGE,让已经量化并部署到微控制器的视觉模型只靠前向计算适应模糊、噪声和光照变化。适配21层中的3层即可恢复93%的收益,在ESP32-S3上额外耗能8.3毫焦、耗时21.9毫秒;数
伊利诺伊大学厄巴纳-香槟分校、宾夕法尼亚大学、斯坦福大学、剑桥大学等机构联合提出Kirin,从野外视频重建四足动物3D动作,再按文字和图片生成可直接驱动网格的动画。项目展示了多物种动作和基线对比,降低动物动作采集门槛;效果仍受视频遮挡、重建
谷歌DeepMind、伦敦大学学院、牛津大学、苏黎世联邦理工学院等机构联合构建TAPVid-MV,收录284段序列、1142路标定相机流和109769条3D点轨迹。30多种基线仍远未解决任务,多视图跟踪器也不稳定优于单目方法;结论针对该基准
清华大学、哈尔滨工业大学(深圳)、北京大学等机构联合提出VoRTeC,用Wan2.1流模型的生成先验做超低码率视频压缩。论文报告其相对既有扩散式方案减少58%比特消耗,720p解码达到13 FPS、480p达到32 FPS;速度与画质结论来
香港中文大学(深圳)、新加坡国立大学、英伟达、微软亚洲研究院等机构联合提出SolarWM,把10个数据集的143万段视频整理成统一训练流水线。模型只用5秒序列训练,却能连续生成分钟到小时级实时轨迹,方便研究者比较不同视频骨干;这些轨迹仍是固
约克大学、Vector研究院、Meta FAIR、麦吉尔大学联合逐层分析V-JEPA 2和VideoMAE-v2。两种视频模型的镜头运动探针ROC AUC超过90%,异常检测超过60%,直觉物理任务却接近随机水平。
香港大学、中山大学提出PredErase,用冻结的FLUX.2和I-JEPA同时移除物体及其掩码外光影残留。方法不做额外训练,重点处理传统填充模型删掉主体后仍留下的投影、接触阴影和支撑面痕迹。
同济大学、腾讯、南洋理工大学、香港科技大学联合提出MegaStyle++。团队用分层定义整理15万种整体风格身份、100万条细粒度风格提示和800万张风格化图像,希望把“风格”从模糊标签变成可解释结构。
腾讯混元、北京电影学院、北京大学、深圳大学联合提出DramaChain Bench,把AI短剧从剧本、分镜、关键帧、镜头视频到成片的完整链路纳入评测。5785个条目产生17488个有效评分和255925条可追溯归因记录。
魏茨曼科学研究所、麻省理工学院提出FoldingAgent,让视觉语言模型从折纸演示视频反推出可执行的参数化折叠程序。在PurelandFold基准上,完整序列完成率为100%,已完成步骤的编译成功率为96%。
腾讯、新加坡国立大学、香港理工大学联合提出H3-World,把330亿参数的MiniMax-H3视频生成器改造成可交互世界模型。团队使用8000个游戏样本、10000步LoRA优化,只训练0.199%的参数,就获得角色动作和镜头运动的分段控
同济大学、快手科技和复旦大学提出CineForge,让长视频制作智能体从一次次完整制作记录中提炼可复用策略。经过跨故事演化后,CineScope-Metric由4.024提高到4.380,在新故事上的复审大模型调用减少37.0%。
香港科技大学(广州)、腾讯元宝、清华大学和腾讯ARC实验室联合发布SnapBench,系统测试手机“拍照再提问”检索遇到的脏输入。基准包含1145个查询、9085个图库候选和53种受控损坏,并评估16种多模态检索器。